Safetensors
qwen3
TaH-plus-0.6B / trainer_state.json
youyc22's picture
Upload folder using huggingface_hub
4146573 verified
Raw
History Blame Contribute Delete
424 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 30,
"global_step": 2346,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0012801024081926554,
"grad_norm": 92.7056884765625,
"learning_rate": 0.0,
"loss": 1.697,
"step": 1
},
{
"epoch": 0.002560204816385311,
"grad_norm": 97.21253204345703,
"learning_rate": 1.408450704225352e-08,
"loss": 1.752,
"step": 2
},
{
"epoch": 0.0038403072245779663,
"grad_norm": 90.0287857055664,
"learning_rate": 2.816901408450704e-08,
"loss": 1.655,
"step": 3
},
{
"epoch": 0.005120409632770622,
"grad_norm": 95.35676574707031,
"learning_rate": 4.2253521126760564e-08,
"loss": 1.716,
"step": 4
},
{
"epoch": 0.006400512040963277,
"grad_norm": 102.2269515991211,
"learning_rate": 5.633802816901408e-08,
"loss": 1.821,
"step": 5
},
{
"epoch": 0.007680614449155933,
"grad_norm": 99.38582611083984,
"learning_rate": 7.042253521126761e-08,
"loss": 1.782,
"step": 6
},
{
"epoch": 0.008960716857348588,
"grad_norm": 96.41349029541016,
"learning_rate": 8.450704225352113e-08,
"loss": 1.745,
"step": 7
},
{
"epoch": 0.010240819265541243,
"grad_norm": 95.18534851074219,
"learning_rate": 9.859154929577463e-08,
"loss": 1.726,
"step": 8
},
{
"epoch": 0.011520921673733898,
"grad_norm": 95.86149597167969,
"learning_rate": 1.1267605633802817e-07,
"loss": 1.728,
"step": 9
},
{
"epoch": 0.012801024081926553,
"grad_norm": 95.08584594726562,
"learning_rate": 1.2676056338028167e-07,
"loss": 1.722,
"step": 10
},
{
"epoch": 0.01408112649011921,
"grad_norm": 98.77447509765625,
"learning_rate": 1.4084507042253522e-07,
"loss": 1.777,
"step": 11
},
{
"epoch": 0.015361228898311865,
"grad_norm": 96.22913360595703,
"learning_rate": 1.549295774647887e-07,
"loss": 1.738,
"step": 12
},
{
"epoch": 0.016641331306504522,
"grad_norm": 95.02128601074219,
"learning_rate": 1.6901408450704225e-07,
"loss": 1.731,
"step": 13
},
{
"epoch": 0.017921433714697177,
"grad_norm": 93.63664245605469,
"learning_rate": 1.8309859154929577e-07,
"loss": 1.698,
"step": 14
},
{
"epoch": 0.019201536122889832,
"grad_norm": 94.87774658203125,
"learning_rate": 1.9718309859154927e-07,
"loss": 1.72,
"step": 15
},
{
"epoch": 0.020481638531082487,
"grad_norm": 96.28085327148438,
"learning_rate": 2.112676056338028e-07,
"loss": 1.739,
"step": 16
},
{
"epoch": 0.021761740939275142,
"grad_norm": 89.48104858398438,
"learning_rate": 2.2535211267605633e-07,
"loss": 1.656,
"step": 17
},
{
"epoch": 0.023041843347467797,
"grad_norm": 94.04985809326172,
"learning_rate": 2.394366197183098e-07,
"loss": 1.702,
"step": 18
},
{
"epoch": 0.024321945755660452,
"grad_norm": 99.77753448486328,
"learning_rate": 2.5352112676056334e-07,
"loss": 1.776,
"step": 19
},
{
"epoch": 0.025602048163853107,
"grad_norm": 94.89751434326172,
"learning_rate": 2.6760563380281686e-07,
"loss": 1.714,
"step": 20
},
{
"epoch": 0.026882150572045762,
"grad_norm": 97.38967895507812,
"learning_rate": 2.8169014084507043e-07,
"loss": 1.755,
"step": 21
},
{
"epoch": 0.02816225298023842,
"grad_norm": 96.78072357177734,
"learning_rate": 2.957746478873239e-07,
"loss": 1.748,
"step": 22
},
{
"epoch": 0.029442355388431075,
"grad_norm": 96.18782806396484,
"learning_rate": 3.098591549295774e-07,
"loss": 1.73,
"step": 23
},
{
"epoch": 0.03072245779662373,
"grad_norm": 92.47620391845703,
"learning_rate": 3.23943661971831e-07,
"loss": 1.687,
"step": 24
},
{
"epoch": 0.032002560204816385,
"grad_norm": 90.51629638671875,
"learning_rate": 3.380281690140845e-07,
"loss": 1.665,
"step": 25
},
{
"epoch": 0.033282662613009044,
"grad_norm": 102.45218658447266,
"learning_rate": 3.52112676056338e-07,
"loss": 1.807,
"step": 26
},
{
"epoch": 0.034562765021201695,
"grad_norm": 100.599853515625,
"learning_rate": 3.6619718309859155e-07,
"loss": 1.79,
"step": 27
},
{
"epoch": 0.035842867429394354,
"grad_norm": 99.5367202758789,
"learning_rate": 3.8028169014084507e-07,
"loss": 1.771,
"step": 28
},
{
"epoch": 0.037122969837587005,
"grad_norm": 94.69949340820312,
"learning_rate": 3.9436619718309853e-07,
"loss": 1.71,
"step": 29
},
{
"epoch": 0.038403072245779664,
"grad_norm": 96.85765838623047,
"learning_rate": 4.084507042253521e-07,
"loss": 1.735,
"step": 30
},
{
"epoch": 0.038403072245779664,
"eval_loss": 0.018103886395692825,
"eval_runtime": 30.1216,
"eval_samples_per_second": 16.467,
"eval_steps_per_second": 2.058,
"step": 30
},
{
"epoch": 0.039683174653972315,
"grad_norm": 93.37199401855469,
"learning_rate": 4.225352112676056e-07,
"loss": 1.685,
"step": 31
},
{
"epoch": 0.040963277062164974,
"grad_norm": 93.5723648071289,
"learning_rate": 4.366197183098591e-07,
"loss": 1.682,
"step": 32
},
{
"epoch": 0.042243379470357625,
"grad_norm": 91.97074890136719,
"learning_rate": 4.5070422535211266e-07,
"loss": 1.673,
"step": 33
},
{
"epoch": 0.043523481878550284,
"grad_norm": 94.24687194824219,
"learning_rate": 4.647887323943662e-07,
"loss": 1.707,
"step": 34
},
{
"epoch": 0.04480358428674294,
"grad_norm": 91.87054443359375,
"learning_rate": 4.788732394366196e-07,
"loss": 1.651,
"step": 35
},
{
"epoch": 0.046083686694935594,
"grad_norm": 87.93646240234375,
"learning_rate": 4.929577464788733e-07,
"loss": 1.609,
"step": 36
},
{
"epoch": 0.04736378910312825,
"grad_norm": 93.40409851074219,
"learning_rate": 5.070422535211267e-07,
"loss": 1.671,
"step": 37
},
{
"epoch": 0.048643891511320904,
"grad_norm": 88.72947692871094,
"learning_rate": 5.211267605633802e-07,
"loss": 1.604,
"step": 38
},
{
"epoch": 0.04992399391951356,
"grad_norm": 87.67916870117188,
"learning_rate": 5.352112676056337e-07,
"loss": 1.601,
"step": 39
},
{
"epoch": 0.051204096327706214,
"grad_norm": 89.75273132324219,
"learning_rate": 5.492957746478873e-07,
"loss": 1.63,
"step": 40
},
{
"epoch": 0.05248419873589887,
"grad_norm": 87.74675750732422,
"learning_rate": 5.633802816901409e-07,
"loss": 1.594,
"step": 41
},
{
"epoch": 0.053764301144091524,
"grad_norm": 88.40725708007812,
"learning_rate": 5.774647887323944e-07,
"loss": 1.592,
"step": 42
},
{
"epoch": 0.05504440355228418,
"grad_norm": 89.701171875,
"learning_rate": 5.915492957746478e-07,
"loss": 1.612,
"step": 43
},
{
"epoch": 0.05632450596047684,
"grad_norm": 88.04122161865234,
"learning_rate": 6.056338028169013e-07,
"loss": 1.598,
"step": 44
},
{
"epoch": 0.05760460836866949,
"grad_norm": 94.17707061767578,
"learning_rate": 6.197183098591548e-07,
"loss": 1.676,
"step": 45
},
{
"epoch": 0.05888471077686215,
"grad_norm": 88.97752380371094,
"learning_rate": 6.338028169014085e-07,
"loss": 1.604,
"step": 46
},
{
"epoch": 0.0601648131850548,
"grad_norm": 91.09588623046875,
"learning_rate": 6.47887323943662e-07,
"loss": 1.631,
"step": 47
},
{
"epoch": 0.06144491559324746,
"grad_norm": 82.6801986694336,
"learning_rate": 6.619718309859155e-07,
"loss": 1.515,
"step": 48
},
{
"epoch": 0.06272501800144012,
"grad_norm": 73.98797607421875,
"learning_rate": 6.76056338028169e-07,
"loss": 1.399,
"step": 49
},
{
"epoch": 0.06400512040963277,
"grad_norm": 72.6869888305664,
"learning_rate": 6.901408450704224e-07,
"loss": 1.376,
"step": 50
},
{
"epoch": 0.06528522281782542,
"grad_norm": 73.36976623535156,
"learning_rate": 7.04225352112676e-07,
"loss": 1.39,
"step": 51
},
{
"epoch": 0.06656532522601809,
"grad_norm": 77.68911743164062,
"learning_rate": 7.183098591549296e-07,
"loss": 1.432,
"step": 52
},
{
"epoch": 0.06784542763421074,
"grad_norm": 73.26194763183594,
"learning_rate": 7.323943661971831e-07,
"loss": 1.385,
"step": 53
},
{
"epoch": 0.06912553004240339,
"grad_norm": 72.94297790527344,
"learning_rate": 7.464788732394366e-07,
"loss": 1.383,
"step": 54
},
{
"epoch": 0.07040563245059604,
"grad_norm": 72.09347534179688,
"learning_rate": 7.605633802816901e-07,
"loss": 1.381,
"step": 55
},
{
"epoch": 0.07168573485878871,
"grad_norm": 70.44213104248047,
"learning_rate": 7.746478873239435e-07,
"loss": 1.354,
"step": 56
},
{
"epoch": 0.07296583726698136,
"grad_norm": 73.74153900146484,
"learning_rate": 7.887323943661971e-07,
"loss": 1.399,
"step": 57
},
{
"epoch": 0.07424593967517401,
"grad_norm": 68.37332153320312,
"learning_rate": 8.028169014084507e-07,
"loss": 1.334,
"step": 58
},
{
"epoch": 0.07552604208336668,
"grad_norm": 63.48308181762695,
"learning_rate": 8.169014084507042e-07,
"loss": 1.285,
"step": 59
},
{
"epoch": 0.07680614449155933,
"grad_norm": 62.710479736328125,
"learning_rate": 8.309859154929577e-07,
"loss": 1.28,
"step": 60
},
{
"epoch": 0.07680614449155933,
"eval_loss": 0.018979454413056374,
"eval_runtime": 30.4098,
"eval_samples_per_second": 16.311,
"eval_steps_per_second": 2.039,
"step": 60
},
{
"epoch": 0.07808624689975198,
"grad_norm": 66.81524658203125,
"learning_rate": 8.450704225352112e-07,
"loss": 1.322,
"step": 61
},
{
"epoch": 0.07936634930794463,
"grad_norm": 67.27582550048828,
"learning_rate": 8.591549295774648e-07,
"loss": 1.332,
"step": 62
},
{
"epoch": 0.0806464517161373,
"grad_norm": 64.89141845703125,
"learning_rate": 8.732394366197182e-07,
"loss": 1.314,
"step": 63
},
{
"epoch": 0.08192655412432995,
"grad_norm": 68.0136947631836,
"learning_rate": 8.873239436619718e-07,
"loss": 1.337,
"step": 64
},
{
"epoch": 0.0832066565325226,
"grad_norm": 60.67420959472656,
"learning_rate": 9.014084507042253e-07,
"loss": 1.253,
"step": 65
},
{
"epoch": 0.08448675894071525,
"grad_norm": 62.739723205566406,
"learning_rate": 9.154929577464788e-07,
"loss": 1.279,
"step": 66
},
{
"epoch": 0.08576686134890792,
"grad_norm": 53.43498992919922,
"learning_rate": 9.295774647887324e-07,
"loss": 1.193,
"step": 67
},
{
"epoch": 0.08704696375710057,
"grad_norm": 8.628366470336914,
"learning_rate": 9.436619718309859e-07,
"loss": 1.039,
"step": 68
},
{
"epoch": 0.08832706616529322,
"grad_norm": 5.244144916534424,
"learning_rate": 9.577464788732393e-07,
"loss": 1.04,
"step": 69
},
{
"epoch": 0.08960716857348588,
"grad_norm": 5.3148040771484375,
"learning_rate": 9.71830985915493e-07,
"loss": 1.031,
"step": 70
},
{
"epoch": 0.09088727098167854,
"grad_norm": 5.043527126312256,
"learning_rate": 9.859154929577465e-07,
"loss": 1.028,
"step": 71
},
{
"epoch": 0.09216737338987119,
"grad_norm": 5.8993706703186035,
"learning_rate": 1e-06,
"loss": 1.051,
"step": 72
},
{
"epoch": 0.09344747579806384,
"grad_norm": 6.306154727935791,
"learning_rate": 9.999995709386524e-07,
"loss": 1.035,
"step": 73
},
{
"epoch": 0.0947275782062565,
"grad_norm": 5.04118013381958,
"learning_rate": 9.999982837554276e-07,
"loss": 1.021,
"step": 74
},
{
"epoch": 0.09600768061444916,
"grad_norm": 4.97289514541626,
"learning_rate": 9.999961384527803e-07,
"loss": 1.011,
"step": 75
},
{
"epoch": 0.09728778302264181,
"grad_norm": 5.3327155113220215,
"learning_rate": 9.999931350348016e-07,
"loss": 1.02,
"step": 76
},
{
"epoch": 0.09856788543083447,
"grad_norm": 5.503681182861328,
"learning_rate": 9.999892735072187e-07,
"loss": 1.003,
"step": 77
},
{
"epoch": 0.09984798783902712,
"grad_norm": 4.701115608215332,
"learning_rate": 9.999845538773952e-07,
"loss": 1.02,
"step": 78
},
{
"epoch": 0.10112809024721978,
"grad_norm": 5.238461494445801,
"learning_rate": 9.999789761543314e-07,
"loss": 1.027,
"step": 79
},
{
"epoch": 0.10240819265541243,
"grad_norm": 4.521968841552734,
"learning_rate": 9.999725403486634e-07,
"loss": 1.023,
"step": 80
},
{
"epoch": 0.1036882950636051,
"grad_norm": 5.6925950050354,
"learning_rate": 9.99965246472664e-07,
"loss": 1.01,
"step": 81
},
{
"epoch": 0.10496839747179774,
"grad_norm": 5.630208969116211,
"learning_rate": 9.999570945402424e-07,
"loss": 1.019,
"step": 82
},
{
"epoch": 0.1062484998799904,
"grad_norm": 6.6519880294799805,
"learning_rate": 9.999480845669434e-07,
"loss": 1.001,
"step": 83
},
{
"epoch": 0.10752860228818305,
"grad_norm": 6.040116310119629,
"learning_rate": 9.999382165699487e-07,
"loss": 0.9951,
"step": 84
},
{
"epoch": 0.10880870469637571,
"grad_norm": 4.266111850738525,
"learning_rate": 9.999274905680761e-07,
"loss": 1.017,
"step": 85
},
{
"epoch": 0.11008880710456836,
"grad_norm": 6.286097049713135,
"learning_rate": 9.999159065817793e-07,
"loss": 0.9917,
"step": 86
},
{
"epoch": 0.11136890951276102,
"grad_norm": 5.067218780517578,
"learning_rate": 9.999034646331483e-07,
"loss": 1.005,
"step": 87
},
{
"epoch": 0.11264901192095368,
"grad_norm": 4.550882816314697,
"learning_rate": 9.998901647459091e-07,
"loss": 1.018,
"step": 88
},
{
"epoch": 0.11392911432914633,
"grad_norm": 4.814333915710449,
"learning_rate": 9.998760069454238e-07,
"loss": 0.9745,
"step": 89
},
{
"epoch": 0.11520921673733898,
"grad_norm": 4.380150318145752,
"learning_rate": 9.998609912586904e-07,
"loss": 0.9911,
"step": 90
},
{
"epoch": 0.11520921673733898,
"eval_loss": 0.023207776248455048,
"eval_runtime": 44.8047,
"eval_samples_per_second": 11.07,
"eval_steps_per_second": 1.384,
"step": 90
},
{
"epoch": 0.11648931914553164,
"grad_norm": 4.401810169219971,
"learning_rate": 9.99845117714343e-07,
"loss": 0.9839,
"step": 91
},
{
"epoch": 0.1177694215537243,
"grad_norm": 3.8451356887817383,
"learning_rate": 9.998283863426515e-07,
"loss": 0.9846,
"step": 92
},
{
"epoch": 0.11904952396191695,
"grad_norm": 3.8628361225128174,
"learning_rate": 9.998107971755216e-07,
"loss": 0.9863,
"step": 93
},
{
"epoch": 0.1203296263701096,
"grad_norm": 7.448349952697754,
"learning_rate": 9.997923502464944e-07,
"loss": 1.02,
"step": 94
},
{
"epoch": 0.12160972877830227,
"grad_norm": 3.927415609359741,
"learning_rate": 9.997730455907478e-07,
"loss": 0.9812,
"step": 95
},
{
"epoch": 0.12288983118649492,
"grad_norm": 3.574800729751587,
"learning_rate": 9.99752883245094e-07,
"loss": 0.9837,
"step": 96
},
{
"epoch": 0.12416993359468757,
"grad_norm": 4.026058673858643,
"learning_rate": 9.997318632479816e-07,
"loss": 0.9789,
"step": 97
},
{
"epoch": 0.12545003600288024,
"grad_norm": 3.540062427520752,
"learning_rate": 9.997099856394947e-07,
"loss": 0.9664,
"step": 98
},
{
"epoch": 0.1267301384110729,
"grad_norm": 3.4833474159240723,
"learning_rate": 9.99687250461352e-07,
"loss": 0.9657,
"step": 99
},
{
"epoch": 0.12801024081926554,
"grad_norm": 3.66798734664917,
"learning_rate": 9.996636577569086e-07,
"loss": 0.9824,
"step": 100
},
{
"epoch": 0.1292903432274582,
"grad_norm": 3.3922672271728516,
"learning_rate": 9.99639207571154e-07,
"loss": 0.984,
"step": 101
},
{
"epoch": 0.13057044563565084,
"grad_norm": 3.4070188999176025,
"learning_rate": 9.996138999507136e-07,
"loss": 0.9753,
"step": 102
},
{
"epoch": 0.1318505480438435,
"grad_norm": 3.329225778579712,
"learning_rate": 9.995877349438472e-07,
"loss": 0.9587,
"step": 103
},
{
"epoch": 0.13313065045203618,
"grad_norm": 4.1257781982421875,
"learning_rate": 9.9956071260045e-07,
"loss": 0.9525,
"step": 104
},
{
"epoch": 0.13441075286022883,
"grad_norm": 3.2900748252868652,
"learning_rate": 9.995328329720518e-07,
"loss": 0.9854,
"step": 105
},
{
"epoch": 0.13569085526842148,
"grad_norm": 3.2690210342407227,
"learning_rate": 9.995040961118178e-07,
"loss": 0.9569,
"step": 106
},
{
"epoch": 0.13697095767661413,
"grad_norm": 3.5365443229675293,
"learning_rate": 9.99474502074547e-07,
"loss": 0.9702,
"step": 107
},
{
"epoch": 0.13825106008480678,
"grad_norm": 4.516208171844482,
"learning_rate": 9.994440509166735e-07,
"loss": 0.9345,
"step": 108
},
{
"epoch": 0.13953116249299943,
"grad_norm": 4.867084503173828,
"learning_rate": 9.99412742696266e-07,
"loss": 0.9318,
"step": 109
},
{
"epoch": 0.14081126490119208,
"grad_norm": 4.094684600830078,
"learning_rate": 9.993805774730273e-07,
"loss": 0.9321,
"step": 110
},
{
"epoch": 0.14209136730938476,
"grad_norm": 4.318435192108154,
"learning_rate": 9.993475553082943e-07,
"loss": 0.933,
"step": 111
},
{
"epoch": 0.14337146971757742,
"grad_norm": 3.1860666275024414,
"learning_rate": 9.993136762650387e-07,
"loss": 0.9377,
"step": 112
},
{
"epoch": 0.14465157212577007,
"grad_norm": 3.622283458709717,
"learning_rate": 9.992789404078654e-07,
"loss": 0.9233,
"step": 113
},
{
"epoch": 0.14593167453396272,
"grad_norm": 3.158676862716675,
"learning_rate": 9.992433478030138e-07,
"loss": 0.966,
"step": 114
},
{
"epoch": 0.14721177694215537,
"grad_norm": 4.1204376220703125,
"learning_rate": 9.992068985183568e-07,
"loss": 0.9125,
"step": 115
},
{
"epoch": 0.14849187935034802,
"grad_norm": 2.7736542224884033,
"learning_rate": 9.99169592623401e-07,
"loss": 0.9196,
"step": 116
},
{
"epoch": 0.14977198175854067,
"grad_norm": 3.1565606594085693,
"learning_rate": 9.991314301892862e-07,
"loss": 0.9093,
"step": 117
},
{
"epoch": 0.15105208416673335,
"grad_norm": 2.656991720199585,
"learning_rate": 9.990924112887861e-07,
"loss": 0.9267,
"step": 118
},
{
"epoch": 0.152332186574926,
"grad_norm": 2.6313891410827637,
"learning_rate": 9.990525359963074e-07,
"loss": 0.9298,
"step": 119
},
{
"epoch": 0.15361228898311866,
"grad_norm": 2.6163902282714844,
"learning_rate": 9.990118043878898e-07,
"loss": 0.918,
"step": 120
},
{
"epoch": 0.15361228898311866,
"eval_loss": 0.022782953456044197,
"eval_runtime": 43.9978,
"eval_samples_per_second": 11.273,
"eval_steps_per_second": 1.409,
"step": 120
},
{
"epoch": 0.1548923913913113,
"grad_norm": 2.709054946899414,
"learning_rate": 9.98970216541206e-07,
"loss": 0.9157,
"step": 121
},
{
"epoch": 0.15617249379950396,
"grad_norm": 2.9031691551208496,
"learning_rate": 9.989277725355614e-07,
"loss": 0.9187,
"step": 122
},
{
"epoch": 0.1574525962076966,
"grad_norm": 3.7096519470214844,
"learning_rate": 9.988844724518943e-07,
"loss": 0.9463,
"step": 123
},
{
"epoch": 0.15873269861588926,
"grad_norm": 3.543902635574341,
"learning_rate": 9.988403163727754e-07,
"loss": 0.9359,
"step": 124
},
{
"epoch": 0.1600128010240819,
"grad_norm": 2.7904775142669678,
"learning_rate": 9.987953043824074e-07,
"loss": 0.9117,
"step": 125
},
{
"epoch": 0.1612929034322746,
"grad_norm": 2.669631004333496,
"learning_rate": 9.987494365666255e-07,
"loss": 0.9388,
"step": 126
},
{
"epoch": 0.16257300584046724,
"grad_norm": 2.4496877193450928,
"learning_rate": 9.98702713012897e-07,
"loss": 0.9322,
"step": 127
},
{
"epoch": 0.1638531082486599,
"grad_norm": 3.281552314758301,
"learning_rate": 9.986551338103207e-07,
"loss": 0.9036,
"step": 128
},
{
"epoch": 0.16513321065685255,
"grad_norm": 2.8566553592681885,
"learning_rate": 9.986066990496276e-07,
"loss": 0.917,
"step": 129
},
{
"epoch": 0.1664133130650452,
"grad_norm": 2.7793703079223633,
"learning_rate": 9.985574088231794e-07,
"loss": 0.9322,
"step": 130
},
{
"epoch": 0.16769341547323785,
"grad_norm": 2.7909038066864014,
"learning_rate": 9.985072632249699e-07,
"loss": 0.9331,
"step": 131
},
{
"epoch": 0.1689735178814305,
"grad_norm": 2.245703935623169,
"learning_rate": 9.984562623506234e-07,
"loss": 0.9109,
"step": 132
},
{
"epoch": 0.17025362028962318,
"grad_norm": 2.405684232711792,
"learning_rate": 9.98404406297396e-07,
"loss": 0.9503,
"step": 133
},
{
"epoch": 0.17153372269781583,
"grad_norm": 2.4132938385009766,
"learning_rate": 9.983516951641735e-07,
"loss": 0.911,
"step": 134
},
{
"epoch": 0.17281382510600848,
"grad_norm": 3.6359527111053467,
"learning_rate": 9.982981290514728e-07,
"loss": 0.876,
"step": 135
},
{
"epoch": 0.17409392751420114,
"grad_norm": 2.5113465785980225,
"learning_rate": 9.982437080614418e-07,
"loss": 0.9094,
"step": 136
},
{
"epoch": 0.1753740299223938,
"grad_norm": 3.1003623008728027,
"learning_rate": 9.981884322978574e-07,
"loss": 0.8854,
"step": 137
},
{
"epoch": 0.17665413233058644,
"grad_norm": 2.6631550788879395,
"learning_rate": 9.981323018661278e-07,
"loss": 0.8892,
"step": 138
},
{
"epoch": 0.1779342347387791,
"grad_norm": 2.3237149715423584,
"learning_rate": 9.980753168732895e-07,
"loss": 0.9148,
"step": 139
},
{
"epoch": 0.17921433714697177,
"grad_norm": 2.307526111602783,
"learning_rate": 9.980174774280102e-07,
"loss": 0.8995,
"step": 140
},
{
"epoch": 0.18049443955516442,
"grad_norm": 2.005488157272339,
"learning_rate": 9.97958783640586e-07,
"loss": 0.9026,
"step": 141
},
{
"epoch": 0.18177454196335707,
"grad_norm": 2.0227253437042236,
"learning_rate": 9.978992356229418e-07,
"loss": 0.9003,
"step": 142
},
{
"epoch": 0.18305464437154972,
"grad_norm": 2.1933484077453613,
"learning_rate": 9.978388334886327e-07,
"loss": 0.8969,
"step": 143
},
{
"epoch": 0.18433474677974238,
"grad_norm": 2.384446144104004,
"learning_rate": 9.97777577352842e-07,
"loss": 0.926,
"step": 144
},
{
"epoch": 0.18561484918793503,
"grad_norm": 1.8911229372024536,
"learning_rate": 9.97715467332381e-07,
"loss": 0.9025,
"step": 145
},
{
"epoch": 0.18689495159612768,
"grad_norm": 2.0518460273742676,
"learning_rate": 9.976525035456897e-07,
"loss": 0.8883,
"step": 146
},
{
"epoch": 0.18817505400432036,
"grad_norm": 2.1592671871185303,
"learning_rate": 9.975886861128367e-07,
"loss": 0.9198,
"step": 147
},
{
"epoch": 0.189455156412513,
"grad_norm": 1.8952604532241821,
"learning_rate": 9.975240151555175e-07,
"loss": 0.9002,
"step": 148
},
{
"epoch": 0.19073525882070566,
"grad_norm": 1.8142304420471191,
"learning_rate": 9.97458490797056e-07,
"loss": 0.9084,
"step": 149
},
{
"epoch": 0.1920153612288983,
"grad_norm": 2.0199060440063477,
"learning_rate": 9.973921131624032e-07,
"loss": 0.8805,
"step": 150
},
{
"epoch": 0.1920153612288983,
"eval_loss": 0.022802669554948807,
"eval_runtime": 44.4671,
"eval_samples_per_second": 11.154,
"eval_steps_per_second": 1.394,
"step": 150
},
{
"epoch": 0.19329546363709096,
"grad_norm": 3.749702215194702,
"learning_rate": 9.97324882378137e-07,
"loss": 0.8618,
"step": 151
},
{
"epoch": 0.19457556604528362,
"grad_norm": 2.697976589202881,
"learning_rate": 9.972567985724623e-07,
"loss": 0.8912,
"step": 152
},
{
"epoch": 0.19585566845347627,
"grad_norm": 3.2838237285614014,
"learning_rate": 9.971878618752113e-07,
"loss": 0.8968,
"step": 153
},
{
"epoch": 0.19713577086166895,
"grad_norm": 3.5656795501708984,
"learning_rate": 9.971180724178416e-07,
"loss": 0.8815,
"step": 154
},
{
"epoch": 0.1984158732698616,
"grad_norm": 2.693096399307251,
"learning_rate": 9.970474303334375e-07,
"loss": 0.8763,
"step": 155
},
{
"epoch": 0.19969597567805425,
"grad_norm": 3.017617702484131,
"learning_rate": 9.969759357567098e-07,
"loss": 0.8765,
"step": 156
},
{
"epoch": 0.2009760780862469,
"grad_norm": 2.185084104537964,
"learning_rate": 9.969035888239937e-07,
"loss": 0.8537,
"step": 157
},
{
"epoch": 0.20225618049443955,
"grad_norm": 1.771836519241333,
"learning_rate": 9.968303896732503e-07,
"loss": 0.8778,
"step": 158
},
{
"epoch": 0.2035362829026322,
"grad_norm": 1.7935428619384766,
"learning_rate": 9.967563384440665e-07,
"loss": 0.8734,
"step": 159
},
{
"epoch": 0.20481638531082486,
"grad_norm": 1.6056727170944214,
"learning_rate": 9.96681435277653e-07,
"loss": 0.9014,
"step": 160
},
{
"epoch": 0.20609648771901753,
"grad_norm": 1.964891791343689,
"learning_rate": 9.96605680316846e-07,
"loss": 0.8811,
"step": 161
},
{
"epoch": 0.2073765901272102,
"grad_norm": 1.5828536748886108,
"learning_rate": 9.96529073706105e-07,
"loss": 0.8827,
"step": 162
},
{
"epoch": 0.20865669253540284,
"grad_norm": 2.222461223602295,
"learning_rate": 9.964516155915151e-07,
"loss": 0.8871,
"step": 163
},
{
"epoch": 0.2099367949435955,
"grad_norm": 1.9525026082992554,
"learning_rate": 9.963733061207833e-07,
"loss": 0.8649,
"step": 164
},
{
"epoch": 0.21121689735178814,
"grad_norm": 1.738632082939148,
"learning_rate": 9.962941454432415e-07,
"loss": 0.886,
"step": 165
},
{
"epoch": 0.2124969997599808,
"grad_norm": 1.4754188060760498,
"learning_rate": 9.962141337098443e-07,
"loss": 0.8786,
"step": 166
},
{
"epoch": 0.21377710216817344,
"grad_norm": 1.4280140399932861,
"learning_rate": 9.96133271073169e-07,
"loss": 0.8735,
"step": 167
},
{
"epoch": 0.2150572045763661,
"grad_norm": 2.2600882053375244,
"learning_rate": 9.96051557687416e-07,
"loss": 0.8606,
"step": 168
},
{
"epoch": 0.21633730698455877,
"grad_norm": 1.6246693134307861,
"learning_rate": 9.959689937084075e-07,
"loss": 0.8666,
"step": 169
},
{
"epoch": 0.21761740939275143,
"grad_norm": 1.8838411569595337,
"learning_rate": 9.958855792935884e-07,
"loss": 0.8508,
"step": 170
},
{
"epoch": 0.21889751180094408,
"grad_norm": 2.526960849761963,
"learning_rate": 9.958013146020242e-07,
"loss": 0.884,
"step": 171
},
{
"epoch": 0.22017761420913673,
"grad_norm": 1.6891247034072876,
"learning_rate": 9.957161997944035e-07,
"loss": 0.867,
"step": 172
},
{
"epoch": 0.22145771661732938,
"grad_norm": 2.235750436782837,
"learning_rate": 9.956302350330344e-07,
"loss": 0.852,
"step": 173
},
{
"epoch": 0.22273781902552203,
"grad_norm": 1.4422881603240967,
"learning_rate": 9.955434204818465e-07,
"loss": 0.8877,
"step": 174
},
{
"epoch": 0.22401792143371468,
"grad_norm": 1.4766193628311157,
"learning_rate": 9.954557563063903e-07,
"loss": 0.8456,
"step": 175
},
{
"epoch": 0.22529802384190736,
"grad_norm": 1.5677717924118042,
"learning_rate": 9.953672426738357e-07,
"loss": 0.8629,
"step": 176
},
{
"epoch": 0.22657812625010001,
"grad_norm": 1.9499273300170898,
"learning_rate": 9.95277879752973e-07,
"loss": 0.8362,
"step": 177
},
{
"epoch": 0.22785822865829267,
"grad_norm": 1.612680196762085,
"learning_rate": 9.951876677142117e-07,
"loss": 0.8564,
"step": 178
},
{
"epoch": 0.22913833106648532,
"grad_norm": 1.945848822593689,
"learning_rate": 9.95096606729581e-07,
"loss": 0.8738,
"step": 179
},
{
"epoch": 0.23041843347467797,
"grad_norm": 1.3156284093856812,
"learning_rate": 9.950046969727283e-07,
"loss": 0.8584,
"step": 180
},
{
"epoch": 0.23041843347467797,
"eval_loss": 0.02226248010993004,
"eval_runtime": 43.2299,
"eval_samples_per_second": 11.474,
"eval_steps_per_second": 1.434,
"step": 180
},
{
"epoch": 0.23169853588287062,
"grad_norm": 1.4407130479812622,
"learning_rate": 9.949119386189203e-07,
"loss": 0.8723,
"step": 181
},
{
"epoch": 0.23297863829106327,
"grad_norm": 1.2906721830368042,
"learning_rate": 9.948183318450412e-07,
"loss": 0.844,
"step": 182
},
{
"epoch": 0.23425874069925595,
"grad_norm": 1.3693578243255615,
"learning_rate": 9.947238768295934e-07,
"loss": 0.856,
"step": 183
},
{
"epoch": 0.2355388431074486,
"grad_norm": 1.3708984851837158,
"learning_rate": 9.946285737526974e-07,
"loss": 0.8513,
"step": 184
},
{
"epoch": 0.23681894551564125,
"grad_norm": 2.781414270401001,
"learning_rate": 9.9453242279609e-07,
"loss": 0.8731,
"step": 185
},
{
"epoch": 0.2380990479238339,
"grad_norm": 1.645175814628601,
"learning_rate": 9.944354241431252e-07,
"loss": 0.8577,
"step": 186
},
{
"epoch": 0.23937915033202656,
"grad_norm": 1.4217957258224487,
"learning_rate": 9.943375779787737e-07,
"loss": 0.8696,
"step": 187
},
{
"epoch": 0.2406592527402192,
"grad_norm": 1.3828089237213135,
"learning_rate": 9.94238884489622e-07,
"loss": 0.8511,
"step": 188
},
{
"epoch": 0.24193935514841186,
"grad_norm": 1.4441511631011963,
"learning_rate": 9.94139343863873e-07,
"loss": 0.844,
"step": 189
},
{
"epoch": 0.24321945755660454,
"grad_norm": 2.011765241622925,
"learning_rate": 9.940389562913442e-07,
"loss": 0.8429,
"step": 190
},
{
"epoch": 0.2444995599647972,
"grad_norm": 1.425309181213379,
"learning_rate": 9.93937721963469e-07,
"loss": 0.8518,
"step": 191
},
{
"epoch": 0.24577966237298984,
"grad_norm": 1.5233925580978394,
"learning_rate": 9.938356410732945e-07,
"loss": 0.8603,
"step": 192
},
{
"epoch": 0.2470597647811825,
"grad_norm": 1.31742262840271,
"learning_rate": 9.937327138154836e-07,
"loss": 0.8558,
"step": 193
},
{
"epoch": 0.24833986718937515,
"grad_norm": 1.62467360496521,
"learning_rate": 9.936289403863117e-07,
"loss": 0.8551,
"step": 194
},
{
"epoch": 0.2496199695975678,
"grad_norm": 1.1902610063552856,
"learning_rate": 9.935243209836685e-07,
"loss": 0.8392,
"step": 195
},
{
"epoch": 0.2509000720057605,
"grad_norm": 1.1721690893173218,
"learning_rate": 9.934188558070572e-07,
"loss": 0.8341,
"step": 196
},
{
"epoch": 0.25218017441395313,
"grad_norm": 1.3493763208389282,
"learning_rate": 9.933125450575931e-07,
"loss": 0.8459,
"step": 197
},
{
"epoch": 0.2534602768221458,
"grad_norm": 1.5009081363677979,
"learning_rate": 9.932053889380046e-07,
"loss": 0.8492,
"step": 198
},
{
"epoch": 0.25474037923033843,
"grad_norm": 1.1350021362304688,
"learning_rate": 9.93097387652632e-07,
"loss": 0.8464,
"step": 199
},
{
"epoch": 0.2560204816385311,
"grad_norm": 1.274184226989746,
"learning_rate": 9.929885414074268e-07,
"loss": 0.8418,
"step": 200
},
{
"epoch": 0.25730058404672373,
"grad_norm": 1.0790811777114868,
"learning_rate": 9.928788504099527e-07,
"loss": 0.8523,
"step": 201
},
{
"epoch": 0.2585806864549164,
"grad_norm": 1.09686279296875,
"learning_rate": 9.927683148693833e-07,
"loss": 0.8256,
"step": 202
},
{
"epoch": 0.25986078886310904,
"grad_norm": 1.0662562847137451,
"learning_rate": 9.926569349965034e-07,
"loss": 0.8581,
"step": 203
},
{
"epoch": 0.2611408912713017,
"grad_norm": 2.0700156688690186,
"learning_rate": 9.925447110037076e-07,
"loss": 0.8281,
"step": 204
},
{
"epoch": 0.26242099367949434,
"grad_norm": 1.5738226175308228,
"learning_rate": 9.924316431050005e-07,
"loss": 0.8492,
"step": 205
},
{
"epoch": 0.263701096087687,
"grad_norm": 1.041562795639038,
"learning_rate": 9.923177315159954e-07,
"loss": 0.8355,
"step": 206
},
{
"epoch": 0.26498119849587964,
"grad_norm": 1.1305402517318726,
"learning_rate": 9.922029764539148e-07,
"loss": 0.8445,
"step": 207
},
{
"epoch": 0.26626130090407235,
"grad_norm": 1.1217234134674072,
"learning_rate": 9.920873781375897e-07,
"loss": 0.8365,
"step": 208
},
{
"epoch": 0.267541403312265,
"grad_norm": 1.102113127708435,
"learning_rate": 9.919709367874592e-07,
"loss": 0.8488,
"step": 209
},
{
"epoch": 0.26882150572045765,
"grad_norm": 1.2842427492141724,
"learning_rate": 9.918536526255698e-07,
"loss": 0.8346,
"step": 210
},
{
"epoch": 0.26882150572045765,
"eval_loss": 0.02212940901517868,
"eval_runtime": 43.1862,
"eval_samples_per_second": 11.485,
"eval_steps_per_second": 1.436,
"step": 210
},
{
"epoch": 0.2701016081286503,
"grad_norm": 1.0993727445602417,
"learning_rate": 9.917355258755752e-07,
"loss": 0.855,
"step": 211
},
{
"epoch": 0.27138171053684296,
"grad_norm": 1.1041290760040283,
"learning_rate": 9.91616556762736e-07,
"loss": 0.8203,
"step": 212
},
{
"epoch": 0.2726618129450356,
"grad_norm": 0.9839292168617249,
"learning_rate": 9.914967455139191e-07,
"loss": 0.8394,
"step": 213
},
{
"epoch": 0.27394191535322826,
"grad_norm": 1.0422465801239014,
"learning_rate": 9.913760923575972e-07,
"loss": 0.8442,
"step": 214
},
{
"epoch": 0.2752220177614209,
"grad_norm": 0.9453950524330139,
"learning_rate": 9.912545975238489e-07,
"loss": 0.8531,
"step": 215
},
{
"epoch": 0.27650212016961356,
"grad_norm": 1.6943658590316772,
"learning_rate": 9.91132261244357e-07,
"loss": 0.8321,
"step": 216
},
{
"epoch": 0.2777822225778062,
"grad_norm": 0.9965325593948364,
"learning_rate": 9.910090837524098e-07,
"loss": 0.8365,
"step": 217
},
{
"epoch": 0.27906232498599887,
"grad_norm": 1.3208179473876953,
"learning_rate": 9.908850652828989e-07,
"loss": 0.8595,
"step": 218
},
{
"epoch": 0.2803424273941915,
"grad_norm": 1.077359914779663,
"learning_rate": 9.9076020607232e-07,
"loss": 0.8092,
"step": 219
},
{
"epoch": 0.28162252980238417,
"grad_norm": 1.236102819442749,
"learning_rate": 9.906345063587724e-07,
"loss": 0.8491,
"step": 220
},
{
"epoch": 0.2829026322105768,
"grad_norm": 1.269243597984314,
"learning_rate": 9.905079663819578e-07,
"loss": 0.8419,
"step": 221
},
{
"epoch": 0.28418273461876953,
"grad_norm": 1.7856619358062744,
"learning_rate": 9.903805863831799e-07,
"loss": 0.852,
"step": 222
},
{
"epoch": 0.2854628370269622,
"grad_norm": 0.9859713315963745,
"learning_rate": 9.902523666053447e-07,
"loss": 0.8456,
"step": 223
},
{
"epoch": 0.28674293943515483,
"grad_norm": 1.4276418685913086,
"learning_rate": 9.901233072929597e-07,
"loss": 0.8618,
"step": 224
},
{
"epoch": 0.2880230418433475,
"grad_norm": 0.991123616695404,
"learning_rate": 9.899934086921333e-07,
"loss": 0.8162,
"step": 225
},
{
"epoch": 0.28930314425154013,
"grad_norm": 0.9088144302368164,
"learning_rate": 9.89862671050574e-07,
"loss": 0.8294,
"step": 226
},
{
"epoch": 0.2905832466597328,
"grad_norm": 1.0244677066802979,
"learning_rate": 9.897310946175907e-07,
"loss": 0.8146,
"step": 227
},
{
"epoch": 0.29186334906792544,
"grad_norm": 1.0561277866363525,
"learning_rate": 9.895986796440915e-07,
"loss": 0.8001,
"step": 228
},
{
"epoch": 0.2931434514761181,
"grad_norm": 0.9377354979515076,
"learning_rate": 9.894654263825838e-07,
"loss": 0.8254,
"step": 229
},
{
"epoch": 0.29442355388431074,
"grad_norm": 1.2209163904190063,
"learning_rate": 9.893313350871735e-07,
"loss": 0.8287,
"step": 230
},
{
"epoch": 0.2957036562925034,
"grad_norm": 0.9214802980422974,
"learning_rate": 9.891964060135647e-07,
"loss": 0.8068,
"step": 231
},
{
"epoch": 0.29698375870069604,
"grad_norm": 1.857720136642456,
"learning_rate": 9.890606394190588e-07,
"loss": 0.8217,
"step": 232
},
{
"epoch": 0.2982638611088887,
"grad_norm": 1.1422715187072754,
"learning_rate": 9.889240355625542e-07,
"loss": 0.8256,
"step": 233
},
{
"epoch": 0.29954396351708135,
"grad_norm": 0.864855170249939,
"learning_rate": 9.887865947045468e-07,
"loss": 0.8423,
"step": 234
},
{
"epoch": 0.300824065925274,
"grad_norm": 1.054294228553772,
"learning_rate": 9.886483171071274e-07,
"loss": 0.8068,
"step": 235
},
{
"epoch": 0.3021041683334667,
"grad_norm": 1.5990568399429321,
"learning_rate": 9.885092030339834e-07,
"loss": 0.8285,
"step": 236
},
{
"epoch": 0.30338427074165936,
"grad_norm": 0.8439202904701233,
"learning_rate": 9.883692527503966e-07,
"loss": 0.7954,
"step": 237
},
{
"epoch": 0.304664373149852,
"grad_norm": 0.9036396741867065,
"learning_rate": 9.88228466523244e-07,
"loss": 0.7987,
"step": 238
},
{
"epoch": 0.30594447555804466,
"grad_norm": 0.9020777344703674,
"learning_rate": 9.880868446209961e-07,
"loss": 0.8339,
"step": 239
},
{
"epoch": 0.3072245779662373,
"grad_norm": 1.1989668607711792,
"learning_rate": 9.879443873137174e-07,
"loss": 0.812,
"step": 240
},
{
"epoch": 0.3072245779662373,
"eval_loss": 0.021917186677455902,
"eval_runtime": 42.9449,
"eval_samples_per_second": 11.55,
"eval_steps_per_second": 1.444,
"step": 240
},
{
"epoch": 0.30850468037442996,
"grad_norm": 0.8450129628181458,
"learning_rate": 9.878010948730653e-07,
"loss": 0.8076,
"step": 241
},
{
"epoch": 0.3097847827826226,
"grad_norm": 0.961158812046051,
"learning_rate": 9.876569675722897e-07,
"loss": 0.8249,
"step": 242
},
{
"epoch": 0.31106488519081527,
"grad_norm": 1.1414752006530762,
"learning_rate": 9.875120056862327e-07,
"loss": 0.8211,
"step": 243
},
{
"epoch": 0.3123449875990079,
"grad_norm": 1.155081033706665,
"learning_rate": 9.87366209491328e-07,
"loss": 0.7911,
"step": 244
},
{
"epoch": 0.31362509000720057,
"grad_norm": 0.8352901339530945,
"learning_rate": 9.872195792656e-07,
"loss": 0.8327,
"step": 245
},
{
"epoch": 0.3149051924153932,
"grad_norm": 0.8369143009185791,
"learning_rate": 9.870721152886633e-07,
"loss": 0.8295,
"step": 246
},
{
"epoch": 0.31618529482358587,
"grad_norm": 0.8059689402580261,
"learning_rate": 9.869238178417235e-07,
"loss": 0.8028,
"step": 247
},
{
"epoch": 0.3174653972317785,
"grad_norm": 1.0145469903945923,
"learning_rate": 9.867746872075739e-07,
"loss": 0.7888,
"step": 248
},
{
"epoch": 0.3187454996399712,
"grad_norm": 0.8502800464630127,
"learning_rate": 9.866247236705983e-07,
"loss": 0.8306,
"step": 249
},
{
"epoch": 0.3200256020481638,
"grad_norm": 1.2448238134384155,
"learning_rate": 9.864739275167678e-07,
"loss": 0.8362,
"step": 250
},
{
"epoch": 0.32130570445635653,
"grad_norm": 0.8307976722717285,
"learning_rate": 9.863222990336415e-07,
"loss": 0.8268,
"step": 251
},
{
"epoch": 0.3225858068645492,
"grad_norm": 1.115708351135254,
"learning_rate": 9.861698385103658e-07,
"loss": 0.7881,
"step": 252
},
{
"epoch": 0.32386590927274184,
"grad_norm": 0.83074951171875,
"learning_rate": 9.860165462376737e-07,
"loss": 0.8163,
"step": 253
},
{
"epoch": 0.3251460116809345,
"grad_norm": 0.8235610723495483,
"learning_rate": 9.85862422507884e-07,
"loss": 0.7756,
"step": 254
},
{
"epoch": 0.32642611408912714,
"grad_norm": 0.8696281313896179,
"learning_rate": 9.857074676149015e-07,
"loss": 0.7932,
"step": 255
},
{
"epoch": 0.3277062164973198,
"grad_norm": 1.2079825401306152,
"learning_rate": 9.855516818542157e-07,
"loss": 0.8088,
"step": 256
},
{
"epoch": 0.32898631890551244,
"grad_norm": 1.0331051349639893,
"learning_rate": 9.853950655229007e-07,
"loss": 0.8166,
"step": 257
},
{
"epoch": 0.3302664213137051,
"grad_norm": 0.8544551730155945,
"learning_rate": 9.852376189196146e-07,
"loss": 0.796,
"step": 258
},
{
"epoch": 0.33154652372189775,
"grad_norm": 1.7888301610946655,
"learning_rate": 9.850793423445977e-07,
"loss": 0.7844,
"step": 259
},
{
"epoch": 0.3328266261300904,
"grad_norm": 0.9609640836715698,
"learning_rate": 9.849202360996746e-07,
"loss": 0.8223,
"step": 260
},
{
"epoch": 0.33410672853828305,
"grad_norm": 0.7650641798973083,
"learning_rate": 9.84760300488251e-07,
"loss": 0.798,
"step": 261
},
{
"epoch": 0.3353868309464757,
"grad_norm": 1.247570514678955,
"learning_rate": 9.845995358153145e-07,
"loss": 0.8259,
"step": 262
},
{
"epoch": 0.33666693335466835,
"grad_norm": 0.9482812285423279,
"learning_rate": 9.844379423874331e-07,
"loss": 0.79,
"step": 263
},
{
"epoch": 0.337947035762861,
"grad_norm": 1.0385113954544067,
"learning_rate": 9.842755205127562e-07,
"loss": 0.7929,
"step": 264
},
{
"epoch": 0.3392271381710537,
"grad_norm": 1.2172261476516724,
"learning_rate": 9.841122705010124e-07,
"loss": 0.7765,
"step": 265
},
{
"epoch": 0.34050724057924636,
"grad_norm": 1.7421001195907593,
"learning_rate": 9.839481926635096e-07,
"loss": 0.8047,
"step": 266
},
{
"epoch": 0.341787342987439,
"grad_norm": 1.3985625505447388,
"learning_rate": 9.83783287313134e-07,
"loss": 0.81,
"step": 267
},
{
"epoch": 0.34306744539563166,
"grad_norm": 1.1961512565612793,
"learning_rate": 9.836175547643502e-07,
"loss": 0.8171,
"step": 268
},
{
"epoch": 0.3443475478038243,
"grad_norm": 0.818731427192688,
"learning_rate": 9.834509953332e-07,
"loss": 0.796,
"step": 269
},
{
"epoch": 0.34562765021201697,
"grad_norm": 1.7126835584640503,
"learning_rate": 9.832836093373026e-07,
"loss": 0.7969,
"step": 270
},
{
"epoch": 0.34562765021201697,
"eval_loss": 0.02190336398780346,
"eval_runtime": 43.1177,
"eval_samples_per_second": 11.503,
"eval_steps_per_second": 1.438,
"step": 270
},
{
"epoch": 0.3469077526202096,
"grad_norm": 1.235481858253479,
"learning_rate": 9.831153970958524e-07,
"loss": 0.7915,
"step": 271
},
{
"epoch": 0.34818785502840227,
"grad_norm": 0.7385391592979431,
"learning_rate": 9.829463589296201e-07,
"loss": 0.7921,
"step": 272
},
{
"epoch": 0.3494679574365949,
"grad_norm": 1.6542584896087646,
"learning_rate": 9.827764951609514e-07,
"loss": 0.8093,
"step": 273
},
{
"epoch": 0.3507480598447876,
"grad_norm": 1.8457363843917847,
"learning_rate": 9.826058061137663e-07,
"loss": 0.7709,
"step": 274
},
{
"epoch": 0.3520281622529802,
"grad_norm": 1.2398396730422974,
"learning_rate": 9.824342921135579e-07,
"loss": 0.8227,
"step": 275
},
{
"epoch": 0.3533082646611729,
"grad_norm": 0.7551895380020142,
"learning_rate": 9.822619534873934e-07,
"loss": 0.7772,
"step": 276
},
{
"epoch": 0.35458836706936553,
"grad_norm": 0.8885154724121094,
"learning_rate": 9.82088790563912e-07,
"loss": 0.8015,
"step": 277
},
{
"epoch": 0.3558684694775582,
"grad_norm": 0.9509640336036682,
"learning_rate": 9.81914803673325e-07,
"loss": 0.7934,
"step": 278
},
{
"epoch": 0.3571485718857509,
"grad_norm": 0.9045248627662659,
"learning_rate": 9.81739993147415e-07,
"loss": 0.7939,
"step": 279
},
{
"epoch": 0.35842867429394354,
"grad_norm": 2.870340585708618,
"learning_rate": 9.815643593195345e-07,
"loss": 0.7724,
"step": 280
},
{
"epoch": 0.3597087767021362,
"grad_norm": 1.8291690349578857,
"learning_rate": 9.81387902524607e-07,
"loss": 0.782,
"step": 281
},
{
"epoch": 0.36098887911032884,
"grad_norm": 1.435534119606018,
"learning_rate": 9.812106230991248e-07,
"loss": 0.8073,
"step": 282
},
{
"epoch": 0.3622689815185215,
"grad_norm": 1.8294379711151123,
"learning_rate": 9.810325213811489e-07,
"loss": 0.7954,
"step": 283
},
{
"epoch": 0.36354908392671414,
"grad_norm": 1.1028311252593994,
"learning_rate": 9.808535977103086e-07,
"loss": 0.7871,
"step": 284
},
{
"epoch": 0.3648291863349068,
"grad_norm": 0.843399703502655,
"learning_rate": 9.806738524278003e-07,
"loss": 0.8058,
"step": 285
},
{
"epoch": 0.36610928874309945,
"grad_norm": 1.9043854475021362,
"learning_rate": 9.804932858763878e-07,
"loss": 0.7937,
"step": 286
},
{
"epoch": 0.3673893911512921,
"grad_norm": 2.0889906883239746,
"learning_rate": 9.803118984004002e-07,
"loss": 0.8011,
"step": 287
},
{
"epoch": 0.36866949355948475,
"grad_norm": 2.2988035678863525,
"learning_rate": 9.801296903457322e-07,
"loss": 0.8157,
"step": 288
},
{
"epoch": 0.3699495959676774,
"grad_norm": 0.9738537073135376,
"learning_rate": 9.799466620598441e-07,
"loss": 0.806,
"step": 289
},
{
"epoch": 0.37122969837587005,
"grad_norm": 1.3052942752838135,
"learning_rate": 9.797628138917593e-07,
"loss": 0.7804,
"step": 290
},
{
"epoch": 0.3725098007840627,
"grad_norm": 1.2379125356674194,
"learning_rate": 9.795781461920652e-07,
"loss": 0.799,
"step": 291
},
{
"epoch": 0.37378990319225536,
"grad_norm": 1.0885727405548096,
"learning_rate": 9.793926593129118e-07,
"loss": 0.8097,
"step": 292
},
{
"epoch": 0.375070005600448,
"grad_norm": 1.2893867492675781,
"learning_rate": 9.792063536080114e-07,
"loss": 0.7896,
"step": 293
},
{
"epoch": 0.3763501080086407,
"grad_norm": 0.8981683850288391,
"learning_rate": 9.790192294326378e-07,
"loss": 0.7912,
"step": 294
},
{
"epoch": 0.37763021041683337,
"grad_norm": 0.9252378940582275,
"learning_rate": 9.788312871436254e-07,
"loss": 0.7948,
"step": 295
},
{
"epoch": 0.378910312825026,
"grad_norm": 0.6900148391723633,
"learning_rate": 9.786425270993684e-07,
"loss": 0.7845,
"step": 296
},
{
"epoch": 0.38019041523321867,
"grad_norm": 0.7811844944953918,
"learning_rate": 9.784529496598212e-07,
"loss": 0.773,
"step": 297
},
{
"epoch": 0.3814705176414113,
"grad_norm": 0.7559629082679749,
"learning_rate": 9.782625551864964e-07,
"loss": 0.7855,
"step": 298
},
{
"epoch": 0.382750620049604,
"grad_norm": 0.7708130478858948,
"learning_rate": 9.780713440424648e-07,
"loss": 0.803,
"step": 299
},
{
"epoch": 0.3840307224577966,
"grad_norm": 0.7201048135757446,
"learning_rate": 9.77879316592354e-07,
"loss": 0.7868,
"step": 300
},
{
"epoch": 0.3840307224577966,
"eval_loss": 0.021626591682434082,
"eval_runtime": 42.5137,
"eval_samples_per_second": 11.667,
"eval_steps_per_second": 1.458,
"step": 300
},
{
"epoch": 0.3853108248659893,
"grad_norm": 1.1081997156143188,
"learning_rate": 9.77686473202349e-07,
"loss": 0.7901,
"step": 301
},
{
"epoch": 0.38659092727418193,
"grad_norm": 0.6676652431488037,
"learning_rate": 9.774928142401903e-07,
"loss": 0.7949,
"step": 302
},
{
"epoch": 0.3878710296823746,
"grad_norm": 1.385185718536377,
"learning_rate": 9.77298340075174e-07,
"loss": 0.7835,
"step": 303
},
{
"epoch": 0.38915113209056723,
"grad_norm": 0.8051367998123169,
"learning_rate": 9.771030510781505e-07,
"loss": 0.7927,
"step": 304
},
{
"epoch": 0.3904312344987599,
"grad_norm": 1.444473385810852,
"learning_rate": 9.76906947621524e-07,
"loss": 0.7737,
"step": 305
},
{
"epoch": 0.39171133690695253,
"grad_norm": 1.1056404113769531,
"learning_rate": 9.767100300792519e-07,
"loss": 0.7812,
"step": 306
},
{
"epoch": 0.3929914393151452,
"grad_norm": 0.6941848993301392,
"learning_rate": 9.765122988268437e-07,
"loss": 0.8061,
"step": 307
},
{
"epoch": 0.3942715417233379,
"grad_norm": 0.6535438895225525,
"learning_rate": 9.763137542413616e-07,
"loss": 0.7977,
"step": 308
},
{
"epoch": 0.39555164413153054,
"grad_norm": 0.7749496102333069,
"learning_rate": 9.761143967014176e-07,
"loss": 0.8036,
"step": 309
},
{
"epoch": 0.3968317465397232,
"grad_norm": 0.9956401586532593,
"learning_rate": 9.759142265871744e-07,
"loss": 0.7839,
"step": 310
},
{
"epoch": 0.39811184894791585,
"grad_norm": 0.7070454955101013,
"learning_rate": 9.757132442803444e-07,
"loss": 0.793,
"step": 311
},
{
"epoch": 0.3993919513561085,
"grad_norm": 0.6864356398582458,
"learning_rate": 9.755114501641885e-07,
"loss": 0.7849,
"step": 312
},
{
"epoch": 0.40067205376430115,
"grad_norm": 1.5150302648544312,
"learning_rate": 9.75308844623516e-07,
"loss": 0.7624,
"step": 313
},
{
"epoch": 0.4019521561724938,
"grad_norm": 0.8884550333023071,
"learning_rate": 9.751054280446837e-07,
"loss": 0.7866,
"step": 314
},
{
"epoch": 0.40323225858068645,
"grad_norm": 1.077107310295105,
"learning_rate": 9.74901200815594e-07,
"loss": 0.7832,
"step": 315
},
{
"epoch": 0.4045123609888791,
"grad_norm": 0.7195938229560852,
"learning_rate": 9.746961633256964e-07,
"loss": 0.772,
"step": 316
},
{
"epoch": 0.40579246339707176,
"grad_norm": 1.1745284795761108,
"learning_rate": 9.744903159659844e-07,
"loss": 0.8035,
"step": 317
},
{
"epoch": 0.4070725658052644,
"grad_norm": 1.100885033607483,
"learning_rate": 9.742836591289966e-07,
"loss": 0.7717,
"step": 318
},
{
"epoch": 0.40835266821345706,
"grad_norm": 1.1299428939819336,
"learning_rate": 9.740761932088157e-07,
"loss": 0.7961,
"step": 319
},
{
"epoch": 0.4096327706216497,
"grad_norm": 0.8672587275505066,
"learning_rate": 9.738679186010658e-07,
"loss": 0.7548,
"step": 320
},
{
"epoch": 0.41091287302984236,
"grad_norm": 1.502167820930481,
"learning_rate": 9.73658835702914e-07,
"loss": 0.7726,
"step": 321
},
{
"epoch": 0.41219297543803507,
"grad_norm": 0.8918670415878296,
"learning_rate": 9.734489449130695e-07,
"loss": 0.779,
"step": 322
},
{
"epoch": 0.4134730778462277,
"grad_norm": 1.2873344421386719,
"learning_rate": 9.732382466317804e-07,
"loss": 0.7835,
"step": 323
},
{
"epoch": 0.4147531802544204,
"grad_norm": 0.8522046208381653,
"learning_rate": 9.73026741260836e-07,
"loss": 0.7738,
"step": 324
},
{
"epoch": 0.416033282662613,
"grad_norm": 1.5762598514556885,
"learning_rate": 9.728144292035638e-07,
"loss": 0.7851,
"step": 325
},
{
"epoch": 0.4173133850708057,
"grad_norm": 0.79217928647995,
"learning_rate": 9.726013108648305e-07,
"loss": 0.7734,
"step": 326
},
{
"epoch": 0.4185934874789983,
"grad_norm": 0.7395232915878296,
"learning_rate": 9.723873866510395e-07,
"loss": 0.7549,
"step": 327
},
{
"epoch": 0.419873589887191,
"grad_norm": 1.761189579963684,
"learning_rate": 9.721726569701317e-07,
"loss": 0.7734,
"step": 328
},
{
"epoch": 0.42115369229538363,
"grad_norm": 1.9896551370620728,
"learning_rate": 9.71957122231583e-07,
"loss": 0.8012,
"step": 329
},
{
"epoch": 0.4224337947035763,
"grad_norm": 0.8608530163764954,
"learning_rate": 9.717407828464056e-07,
"loss": 0.7853,
"step": 330
},
{
"epoch": 0.4224337947035763,
"eval_loss": 0.021434079855680466,
"eval_runtime": 42.2381,
"eval_samples_per_second": 11.743,
"eval_steps_per_second": 1.468,
"step": 330
},
{
"epoch": 0.42371389711176893,
"grad_norm": 0.985016405582428,
"learning_rate": 9.715236392271453e-07,
"loss": 0.7786,
"step": 331
},
{
"epoch": 0.4249939995199616,
"grad_norm": 0.6312138438224792,
"learning_rate": 9.713056917878816e-07,
"loss": 0.7997,
"step": 332
},
{
"epoch": 0.42627410192815424,
"grad_norm": 0.6067633032798767,
"learning_rate": 9.710869409442276e-07,
"loss": 0.7969,
"step": 333
},
{
"epoch": 0.4275542043363469,
"grad_norm": 0.6223033666610718,
"learning_rate": 9.708673871133276e-07,
"loss": 0.7992,
"step": 334
},
{
"epoch": 0.42883430674453954,
"grad_norm": 0.9319964051246643,
"learning_rate": 9.706470307138571e-07,
"loss": 0.7687,
"step": 335
},
{
"epoch": 0.4301144091527322,
"grad_norm": 0.7885686755180359,
"learning_rate": 9.70425872166023e-07,
"loss": 0.7844,
"step": 336
},
{
"epoch": 0.4313945115609249,
"grad_norm": 0.7727945446968079,
"learning_rate": 9.70203911891561e-07,
"loss": 0.7455,
"step": 337
},
{
"epoch": 0.43267461396911755,
"grad_norm": 0.9676743149757385,
"learning_rate": 9.699811503137355e-07,
"loss": 0.775,
"step": 338
},
{
"epoch": 0.4339547163773102,
"grad_norm": 0.6573967337608337,
"learning_rate": 9.697575878573399e-07,
"loss": 0.7616,
"step": 339
},
{
"epoch": 0.43523481878550285,
"grad_norm": 1.2237255573272705,
"learning_rate": 9.695332249486939e-07,
"loss": 0.7902,
"step": 340
},
{
"epoch": 0.4365149211936955,
"grad_norm": 0.8275060057640076,
"learning_rate": 9.69308062015644e-07,
"loss": 0.7744,
"step": 341
},
{
"epoch": 0.43779502360188816,
"grad_norm": 0.5850309133529663,
"learning_rate": 9.69082099487562e-07,
"loss": 0.7652,
"step": 342
},
{
"epoch": 0.4390751260100808,
"grad_norm": 1.9193520545959473,
"learning_rate": 9.688553377953453e-07,
"loss": 0.7937,
"step": 343
},
{
"epoch": 0.44035522841827346,
"grad_norm": 1.537428617477417,
"learning_rate": 9.686277773714144e-07,
"loss": 0.784,
"step": 344
},
{
"epoch": 0.4416353308264661,
"grad_norm": 1.4273813962936401,
"learning_rate": 9.683994186497132e-07,
"loss": 0.7641,
"step": 345
},
{
"epoch": 0.44291543323465876,
"grad_norm": 0.7208697199821472,
"learning_rate": 9.681702620657078e-07,
"loss": 0.7848,
"step": 346
},
{
"epoch": 0.4441955356428514,
"grad_norm": 1.4960705041885376,
"learning_rate": 9.67940308056386e-07,
"loss": 0.7761,
"step": 347
},
{
"epoch": 0.44547563805104406,
"grad_norm": 0.6143835186958313,
"learning_rate": 9.677095570602563e-07,
"loss": 0.7697,
"step": 348
},
{
"epoch": 0.4467557404592367,
"grad_norm": 0.9813094735145569,
"learning_rate": 9.674780095173466e-07,
"loss": 0.7847,
"step": 349
},
{
"epoch": 0.44803584286742937,
"grad_norm": 0.6809216737747192,
"learning_rate": 9.672456658692042e-07,
"loss": 0.7744,
"step": 350
},
{
"epoch": 0.4493159452756221,
"grad_norm": 1.2698214054107666,
"learning_rate": 9.670125265588943e-07,
"loss": 0.7591,
"step": 351
},
{
"epoch": 0.4505960476838147,
"grad_norm": 0.8428552746772766,
"learning_rate": 9.667785920309993e-07,
"loss": 0.7729,
"step": 352
},
{
"epoch": 0.4518761500920074,
"grad_norm": 0.6046946048736572,
"learning_rate": 9.665438627316184e-07,
"loss": 0.7718,
"step": 353
},
{
"epoch": 0.45315625250020003,
"grad_norm": 1.4922956228256226,
"learning_rate": 9.663083391083658e-07,
"loss": 0.7535,
"step": 354
},
{
"epoch": 0.4544363549083927,
"grad_norm": 0.7376657724380493,
"learning_rate": 9.66072021610371e-07,
"loss": 0.7544,
"step": 355
},
{
"epoch": 0.45571645731658533,
"grad_norm": 0.9707961678504944,
"learning_rate": 9.658349106882773e-07,
"loss": 0.7758,
"step": 356
},
{
"epoch": 0.456996559724778,
"grad_norm": 1.1351879835128784,
"learning_rate": 9.655970067942404e-07,
"loss": 0.8008,
"step": 357
},
{
"epoch": 0.45827666213297064,
"grad_norm": 0.58219313621521,
"learning_rate": 9.65358310381929e-07,
"loss": 0.7755,
"step": 358
},
{
"epoch": 0.4595567645411633,
"grad_norm": 0.6028603911399841,
"learning_rate": 9.65118821906522e-07,
"loss": 0.7682,
"step": 359
},
{
"epoch": 0.46083686694935594,
"grad_norm": 1.380950927734375,
"learning_rate": 9.6487854182471e-07,
"loss": 0.7758,
"step": 360
},
{
"epoch": 0.46083686694935594,
"eval_loss": 0.021408675238490105,
"eval_runtime": 42.4188,
"eval_samples_per_second": 11.693,
"eval_steps_per_second": 1.462,
"step": 360
},
{
"epoch": 0.4621169693575486,
"grad_norm": 0.9132922887802124,
"learning_rate": 9.646374705946925e-07,
"loss": 0.7669,
"step": 361
},
{
"epoch": 0.46339707176574124,
"grad_norm": 0.9454202651977539,
"learning_rate": 9.643956086761777e-07,
"loss": 0.761,
"step": 362
},
{
"epoch": 0.4646771741739339,
"grad_norm": 1.2195969820022583,
"learning_rate": 9.641529565303816e-07,
"loss": 0.7674,
"step": 363
},
{
"epoch": 0.46595727658212654,
"grad_norm": 0.8626465201377869,
"learning_rate": 9.639095146200266e-07,
"loss": 0.7736,
"step": 364
},
{
"epoch": 0.46723737899031925,
"grad_norm": 0.5632688999176025,
"learning_rate": 9.636652834093426e-07,
"loss": 0.7728,
"step": 365
},
{
"epoch": 0.4685174813985119,
"grad_norm": 0.5573896169662476,
"learning_rate": 9.63420263364063e-07,
"loss": 0.7476,
"step": 366
},
{
"epoch": 0.46979758380670456,
"grad_norm": 0.7768682241439819,
"learning_rate": 9.631744549514262e-07,
"loss": 0.7509,
"step": 367
},
{
"epoch": 0.4710776862148972,
"grad_norm": 0.5715169906616211,
"learning_rate": 9.62927858640174e-07,
"loss": 0.7609,
"step": 368
},
{
"epoch": 0.47235778862308986,
"grad_norm": 0.6762582659721375,
"learning_rate": 9.626804749005508e-07,
"loss": 0.7537,
"step": 369
},
{
"epoch": 0.4736378910312825,
"grad_norm": 0.7740899324417114,
"learning_rate": 9.624323042043024e-07,
"loss": 0.7724,
"step": 370
},
{
"epoch": 0.47491799343947516,
"grad_norm": 1.3187012672424316,
"learning_rate": 9.621833470246748e-07,
"loss": 0.7659,
"step": 371
},
{
"epoch": 0.4761980958476678,
"grad_norm": 0.6512274742126465,
"learning_rate": 9.619336038364148e-07,
"loss": 0.7746,
"step": 372
},
{
"epoch": 0.47747819825586046,
"grad_norm": 0.7822607755661011,
"learning_rate": 9.616830751157671e-07,
"loss": 0.7866,
"step": 373
},
{
"epoch": 0.4787583006640531,
"grad_norm": 0.8908462524414062,
"learning_rate": 9.61431761340475e-07,
"loss": 0.773,
"step": 374
},
{
"epoch": 0.48003840307224577,
"grad_norm": 0.6075584888458252,
"learning_rate": 9.611796629897785e-07,
"loss": 0.7687,
"step": 375
},
{
"epoch": 0.4813185054804384,
"grad_norm": 0.8187317848205566,
"learning_rate": 9.60926780544414e-07,
"loss": 0.76,
"step": 376
},
{
"epoch": 0.48259860788863107,
"grad_norm": 0.5584650039672852,
"learning_rate": 9.606731144866129e-07,
"loss": 0.7611,
"step": 377
},
{
"epoch": 0.4838787102968237,
"grad_norm": 0.6771740317344666,
"learning_rate": 9.604186653001008e-07,
"loss": 0.7694,
"step": 378
},
{
"epoch": 0.48515881270501643,
"grad_norm": 1.1669390201568604,
"learning_rate": 9.601634334700969e-07,
"loss": 0.7567,
"step": 379
},
{
"epoch": 0.4864389151132091,
"grad_norm": 1.2172741889953613,
"learning_rate": 9.599074194833132e-07,
"loss": 0.7643,
"step": 380
},
{
"epoch": 0.48771901752140173,
"grad_norm": 0.7804280519485474,
"learning_rate": 9.596506238279525e-07,
"loss": 0.7605,
"step": 381
},
{
"epoch": 0.4889991199295944,
"grad_norm": 0.6591628193855286,
"learning_rate": 9.593930469937086e-07,
"loss": 0.7684,
"step": 382
},
{
"epoch": 0.49027922233778704,
"grad_norm": 0.9486355185508728,
"learning_rate": 9.59134689471765e-07,
"loss": 0.7673,
"step": 383
},
{
"epoch": 0.4915593247459797,
"grad_norm": 0.5388826131820679,
"learning_rate": 9.588755517547936e-07,
"loss": 0.7751,
"step": 384
},
{
"epoch": 0.49283942715417234,
"grad_norm": 0.6004676818847656,
"learning_rate": 9.586156343369543e-07,
"loss": 0.7503,
"step": 385
},
{
"epoch": 0.494119529562365,
"grad_norm": 0.9401939511299133,
"learning_rate": 9.58354937713894e-07,
"loss": 0.7903,
"step": 386
},
{
"epoch": 0.49539963197055764,
"grad_norm": 0.5513790845870972,
"learning_rate": 9.580934623827454e-07,
"loss": 0.7461,
"step": 387
},
{
"epoch": 0.4966797343787503,
"grad_norm": 0.6497021317481995,
"learning_rate": 9.57831208842126e-07,
"loss": 0.7749,
"step": 388
},
{
"epoch": 0.49795983678694294,
"grad_norm": 0.7385431528091431,
"learning_rate": 9.575681775921375e-07,
"loss": 0.7645,
"step": 389
},
{
"epoch": 0.4992399391951356,
"grad_norm": 0.944419801235199,
"learning_rate": 9.57304369134364e-07,
"loss": 0.7574,
"step": 390
},
{
"epoch": 0.4992399391951356,
"eval_loss": 0.021252252161502838,
"eval_runtime": 42.2062,
"eval_samples_per_second": 11.752,
"eval_steps_per_second": 1.469,
"step": 390
},
{
"epoch": 0.5005200416033283,
"grad_norm": 1.0767381191253662,
"learning_rate": 9.57039783971873e-07,
"loss": 0.7612,
"step": 391
},
{
"epoch": 0.501800144011521,
"grad_norm": 0.540380597114563,
"learning_rate": 9.56774422609212e-07,
"loss": 0.7644,
"step": 392
},
{
"epoch": 0.5030802464197136,
"grad_norm": 1.0154279470443726,
"learning_rate": 9.565082855524088e-07,
"loss": 0.7677,
"step": 393
},
{
"epoch": 0.5043603488279063,
"grad_norm": 0.5781416296958923,
"learning_rate": 9.56241373308971e-07,
"loss": 0.7622,
"step": 394
},
{
"epoch": 0.5056404512360989,
"grad_norm": 0.6233311891555786,
"learning_rate": 9.559736863878838e-07,
"loss": 0.7595,
"step": 395
},
{
"epoch": 0.5069205536442916,
"grad_norm": 0.8441587686538696,
"learning_rate": 9.5570522529961e-07,
"loss": 0.7599,
"step": 396
},
{
"epoch": 0.5082006560524842,
"grad_norm": 1.02420175075531,
"learning_rate": 9.554359905560885e-07,
"loss": 0.7547,
"step": 397
},
{
"epoch": 0.5094807584606769,
"grad_norm": 1.3045917749404907,
"learning_rate": 9.551659826707339e-07,
"loss": 0.735,
"step": 398
},
{
"epoch": 0.5107608608688695,
"grad_norm": 0.7551970481872559,
"learning_rate": 9.548952021584347e-07,
"loss": 0.7736,
"step": 399
},
{
"epoch": 0.5120409632770622,
"grad_norm": 0.5530499219894409,
"learning_rate": 9.546236495355527e-07,
"loss": 0.7893,
"step": 400
},
{
"epoch": 0.5133210656852548,
"grad_norm": 1.1218974590301514,
"learning_rate": 9.543513253199225e-07,
"loss": 0.7831,
"step": 401
},
{
"epoch": 0.5146011680934475,
"grad_norm": 0.6517909169197083,
"learning_rate": 9.5407823003085e-07,
"loss": 0.7686,
"step": 402
},
{
"epoch": 0.5158812705016401,
"grad_norm": 0.9001660943031311,
"learning_rate": 9.53804364189111e-07,
"loss": 0.7711,
"step": 403
},
{
"epoch": 0.5171613729098328,
"grad_norm": 0.5411023497581482,
"learning_rate": 9.53529728316951e-07,
"loss": 0.7471,
"step": 404
},
{
"epoch": 0.5184414753180254,
"grad_norm": 0.5554513335227966,
"learning_rate": 9.532543229380844e-07,
"loss": 0.7432,
"step": 405
},
{
"epoch": 0.5197215777262181,
"grad_norm": 0.5336626768112183,
"learning_rate": 9.529781485776922e-07,
"loss": 0.7734,
"step": 406
},
{
"epoch": 0.5210016801344107,
"grad_norm": 0.577154815196991,
"learning_rate": 9.527012057624223e-07,
"loss": 0.7399,
"step": 407
},
{
"epoch": 0.5222817825426034,
"grad_norm": 1.0010712146759033,
"learning_rate": 9.524234950203877e-07,
"loss": 0.729,
"step": 408
},
{
"epoch": 0.523561884950796,
"grad_norm": 0.5498564839363098,
"learning_rate": 9.521450168811661e-07,
"loss": 0.7677,
"step": 409
},
{
"epoch": 0.5248419873589887,
"grad_norm": 0.51145339012146,
"learning_rate": 9.518657718757984e-07,
"loss": 0.7515,
"step": 410
},
{
"epoch": 0.5261220897671813,
"grad_norm": 1.5682653188705444,
"learning_rate": 9.515857605367876e-07,
"loss": 0.7544,
"step": 411
},
{
"epoch": 0.527402192175374,
"grad_norm": 0.6942523717880249,
"learning_rate": 9.513049833980988e-07,
"loss": 0.7423,
"step": 412
},
{
"epoch": 0.5286822945835666,
"grad_norm": 0.541015088558197,
"learning_rate": 9.510234409951566e-07,
"loss": 0.7724,
"step": 413
},
{
"epoch": 0.5299623969917593,
"grad_norm": 0.5375149250030518,
"learning_rate": 9.507411338648454e-07,
"loss": 0.7331,
"step": 414
},
{
"epoch": 0.531242499399952,
"grad_norm": 0.9828507304191589,
"learning_rate": 9.504580625455077e-07,
"loss": 0.7703,
"step": 415
},
{
"epoch": 0.5325226018081447,
"grad_norm": 0.7082284092903137,
"learning_rate": 9.501742275769433e-07,
"loss": 0.7653,
"step": 416
},
{
"epoch": 0.5338027042163374,
"grad_norm": 0.5465125441551208,
"learning_rate": 9.498896295004086e-07,
"loss": 0.759,
"step": 417
},
{
"epoch": 0.53508280662453,
"grad_norm": 1.2730739116668701,
"learning_rate": 9.496042688586145e-07,
"loss": 0.757,
"step": 418
},
{
"epoch": 0.5363629090327227,
"grad_norm": 0.6074537038803101,
"learning_rate": 9.493181461957265e-07,
"loss": 0.741,
"step": 419
},
{
"epoch": 0.5376430114409153,
"grad_norm": 0.6029033064842224,
"learning_rate": 9.490312620573631e-07,
"loss": 0.737,
"step": 420
},
{
"epoch": 0.5376430114409153,
"eval_loss": 0.02122470550239086,
"eval_runtime": 42.3146,
"eval_samples_per_second": 11.722,
"eval_steps_per_second": 1.465,
"step": 420
},
{
"epoch": 0.538923113849108,
"grad_norm": 0.6610042452812195,
"learning_rate": 9.487436169905953e-07,
"loss": 0.7529,
"step": 421
},
{
"epoch": 0.5402032162573006,
"grad_norm": 0.5507071018218994,
"learning_rate": 9.484552115439444e-07,
"loss": 0.7344,
"step": 422
},
{
"epoch": 0.5414833186654933,
"grad_norm": 1.0446666479110718,
"learning_rate": 9.481660462673823e-07,
"loss": 0.7256,
"step": 423
},
{
"epoch": 0.5427634210736859,
"grad_norm": 0.9385281801223755,
"learning_rate": 9.478761217123295e-07,
"loss": 0.7245,
"step": 424
},
{
"epoch": 0.5440435234818786,
"grad_norm": 1.086734414100647,
"learning_rate": 9.475854384316545e-07,
"loss": 0.7484,
"step": 425
},
{
"epoch": 0.5453236258900712,
"grad_norm": 0.5415538549423218,
"learning_rate": 9.47293996979673e-07,
"loss": 0.7556,
"step": 426
},
{
"epoch": 0.5466037282982639,
"grad_norm": 0.7452684640884399,
"learning_rate": 9.470017979121457e-07,
"loss": 0.7473,
"step": 427
},
{
"epoch": 0.5478838307064565,
"grad_norm": 1.1576873064041138,
"learning_rate": 9.467088417862788e-07,
"loss": 0.7513,
"step": 428
},
{
"epoch": 0.5491639331146492,
"grad_norm": 1.2372891902923584,
"learning_rate": 9.464151291607218e-07,
"loss": 0.7317,
"step": 429
},
{
"epoch": 0.5504440355228418,
"grad_norm": 0.5363456010818481,
"learning_rate": 9.46120660595567e-07,
"loss": 0.7582,
"step": 430
},
{
"epoch": 0.5517241379310345,
"grad_norm": 0.5811115503311157,
"learning_rate": 9.458254366523476e-07,
"loss": 0.7422,
"step": 431
},
{
"epoch": 0.5530042403392271,
"grad_norm": 0.5572993755340576,
"learning_rate": 9.455294578940383e-07,
"loss": 0.7691,
"step": 432
},
{
"epoch": 0.5542843427474198,
"grad_norm": 0.7215147614479065,
"learning_rate": 9.452327248850524e-07,
"loss": 0.7518,
"step": 433
},
{
"epoch": 0.5555644451556124,
"grad_norm": 0.5483352541923523,
"learning_rate": 9.449352381912418e-07,
"loss": 0.7443,
"step": 434
},
{
"epoch": 0.5568445475638051,
"grad_norm": 0.5988831520080566,
"learning_rate": 9.446369983798953e-07,
"loss": 0.7471,
"step": 435
},
{
"epoch": 0.5581246499719977,
"grad_norm": 0.5931683778762817,
"learning_rate": 9.443380060197385e-07,
"loss": 0.758,
"step": 436
},
{
"epoch": 0.5594047523801904,
"grad_norm": 1.4560576677322388,
"learning_rate": 9.440382616809316e-07,
"loss": 0.7587,
"step": 437
},
{
"epoch": 0.560684854788383,
"grad_norm": 0.6931043863296509,
"learning_rate": 9.437377659350687e-07,
"loss": 0.7488,
"step": 438
},
{
"epoch": 0.5619649571965757,
"grad_norm": 0.7342694997787476,
"learning_rate": 9.434365193551772e-07,
"loss": 0.7392,
"step": 439
},
{
"epoch": 0.5632450596047683,
"grad_norm": 0.5165682435035706,
"learning_rate": 9.431345225157156e-07,
"loss": 0.758,
"step": 440
},
{
"epoch": 0.564525162012961,
"grad_norm": 0.9768834710121155,
"learning_rate": 9.428317759925741e-07,
"loss": 0.7419,
"step": 441
},
{
"epoch": 0.5658052644211536,
"grad_norm": 2.350641965866089,
"learning_rate": 9.425282803630717e-07,
"loss": 0.749,
"step": 442
},
{
"epoch": 0.5670853668293463,
"grad_norm": 0.9259938597679138,
"learning_rate": 9.422240362059562e-07,
"loss": 0.7588,
"step": 443
},
{
"epoch": 0.5683654692375391,
"grad_norm": 1.1114170551300049,
"learning_rate": 9.419190441014024e-07,
"loss": 0.7616,
"step": 444
},
{
"epoch": 0.5696455716457317,
"grad_norm": 0.5118194222450256,
"learning_rate": 9.416133046310124e-07,
"loss": 0.7636,
"step": 445
},
{
"epoch": 0.5709256740539244,
"grad_norm": 0.5194180011749268,
"learning_rate": 9.413068183778122e-07,
"loss": 0.7734,
"step": 446
},
{
"epoch": 0.572205776462117,
"grad_norm": 0.9125135540962219,
"learning_rate": 9.409995859262529e-07,
"loss": 0.7524,
"step": 447
},
{
"epoch": 0.5734858788703097,
"grad_norm": 1.2486809492111206,
"learning_rate": 9.40691607862208e-07,
"loss": 0.7557,
"step": 448
},
{
"epoch": 0.5747659812785023,
"grad_norm": 2.0603342056274414,
"learning_rate": 9.403828847729729e-07,
"loss": 0.7431,
"step": 449
},
{
"epoch": 0.576046083686695,
"grad_norm": 0.6177510619163513,
"learning_rate": 9.400734172472638e-07,
"loss": 0.7711,
"step": 450
},
{
"epoch": 0.576046083686695,
"eval_loss": 0.02118189074099064,
"eval_runtime": 42.4517,
"eval_samples_per_second": 11.684,
"eval_steps_per_second": 1.46,
"step": 450
},
{
"epoch": 0.5773261860948876,
"grad_norm": 0.5658496022224426,
"learning_rate": 9.397632058752167e-07,
"loss": 0.7371,
"step": 451
},
{
"epoch": 0.5786062885030803,
"grad_norm": 0.5370561480522156,
"learning_rate": 9.394522512483857e-07,
"loss": 0.7273,
"step": 452
},
{
"epoch": 0.5798863909112729,
"grad_norm": 0.7203813195228577,
"learning_rate": 9.391405539597423e-07,
"loss": 0.7542,
"step": 453
},
{
"epoch": 0.5811664933194656,
"grad_norm": 0.48172512650489807,
"learning_rate": 9.388281146036745e-07,
"loss": 0.7251,
"step": 454
},
{
"epoch": 0.5824465957276582,
"grad_norm": 0.8438817262649536,
"learning_rate": 9.385149337759853e-07,
"loss": 0.7527,
"step": 455
},
{
"epoch": 0.5837266981358509,
"grad_norm": 0.7123280763626099,
"learning_rate": 9.382010120738913e-07,
"loss": 0.7298,
"step": 456
},
{
"epoch": 0.5850068005440435,
"grad_norm": 0.6132833361625671,
"learning_rate": 9.378863500960222e-07,
"loss": 0.719,
"step": 457
},
{
"epoch": 0.5862869029522362,
"grad_norm": 0.8068387508392334,
"learning_rate": 9.375709484424193e-07,
"loss": 0.7549,
"step": 458
},
{
"epoch": 0.5875670053604288,
"grad_norm": 0.7438022494316101,
"learning_rate": 9.372548077145343e-07,
"loss": 0.7253,
"step": 459
},
{
"epoch": 0.5888471077686215,
"grad_norm": 0.6478850245475769,
"learning_rate": 9.369379285152287e-07,
"loss": 0.7664,
"step": 460
},
{
"epoch": 0.5901272101768141,
"grad_norm": 0.8622910380363464,
"learning_rate": 9.366203114487717e-07,
"loss": 0.7279,
"step": 461
},
{
"epoch": 0.5914073125850068,
"grad_norm": 1.5068285465240479,
"learning_rate": 9.363019571208397e-07,
"loss": 0.7575,
"step": 462
},
{
"epoch": 0.5926874149931994,
"grad_norm": 1.7766551971435547,
"learning_rate": 9.359828661385152e-07,
"loss": 0.7382,
"step": 463
},
{
"epoch": 0.5939675174013921,
"grad_norm": 1.5634602308273315,
"learning_rate": 9.356630391102855e-07,
"loss": 0.7336,
"step": 464
},
{
"epoch": 0.5952476198095847,
"grad_norm": 1.3918403387069702,
"learning_rate": 9.353424766460409e-07,
"loss": 0.7622,
"step": 465
},
{
"epoch": 0.5965277222177774,
"grad_norm": 0.91881263256073,
"learning_rate": 9.35021179357075e-07,
"loss": 0.7488,
"step": 466
},
{
"epoch": 0.59780782462597,
"grad_norm": 0.9959621429443359,
"learning_rate": 9.346991478560819e-07,
"loss": 0.7457,
"step": 467
},
{
"epoch": 0.5990879270341627,
"grad_norm": 1.7366260290145874,
"learning_rate": 9.343763827571566e-07,
"loss": 0.7359,
"step": 468
},
{
"epoch": 0.6003680294423553,
"grad_norm": 1.0561470985412598,
"learning_rate": 9.340528846757921e-07,
"loss": 0.7328,
"step": 469
},
{
"epoch": 0.601648131850548,
"grad_norm": 1.4831304550170898,
"learning_rate": 9.337286542288797e-07,
"loss": 0.7575,
"step": 470
},
{
"epoch": 0.6029282342587406,
"grad_norm": 0.5210456848144531,
"learning_rate": 9.334036920347073e-07,
"loss": 0.7282,
"step": 471
},
{
"epoch": 0.6042083366669334,
"grad_norm": 0.8331632018089294,
"learning_rate": 9.33077998712958e-07,
"loss": 0.7281,
"step": 472
},
{
"epoch": 0.6054884390751261,
"grad_norm": 0.5809465050697327,
"learning_rate": 9.327515748847093e-07,
"loss": 0.7526,
"step": 473
},
{
"epoch": 0.6067685414833187,
"grad_norm": 0.5814153552055359,
"learning_rate": 9.324244211724315e-07,
"loss": 0.7105,
"step": 474
},
{
"epoch": 0.6080486438915114,
"grad_norm": 0.6324211359024048,
"learning_rate": 9.320965381999871e-07,
"loss": 0.7417,
"step": 475
},
{
"epoch": 0.609328746299704,
"grad_norm": 0.9844563007354736,
"learning_rate": 9.317679265926289e-07,
"loss": 0.7387,
"step": 476
},
{
"epoch": 0.6106088487078967,
"grad_norm": 1.100724220275879,
"learning_rate": 9.31438586976999e-07,
"loss": 0.7351,
"step": 477
},
{
"epoch": 0.6118889511160893,
"grad_norm": 1.1082884073257446,
"learning_rate": 9.311085199811286e-07,
"loss": 0.7522,
"step": 478
},
{
"epoch": 0.613169053524282,
"grad_norm": 0.6220473647117615,
"learning_rate": 9.307777262344351e-07,
"loss": 0.7475,
"step": 479
},
{
"epoch": 0.6144491559324746,
"grad_norm": 1.1218664646148682,
"learning_rate": 9.304462063677222e-07,
"loss": 0.753,
"step": 480
},
{
"epoch": 0.6144491559324746,
"eval_loss": 0.021100390702486038,
"eval_runtime": 42.1514,
"eval_samples_per_second": 11.767,
"eval_steps_per_second": 1.471,
"step": 480
},
{
"epoch": 0.6157292583406673,
"grad_norm": 0.5440327525138855,
"learning_rate": 9.301139610131783e-07,
"loss": 0.7434,
"step": 481
},
{
"epoch": 0.6170093607488599,
"grad_norm": 0.5020488500595093,
"learning_rate": 9.297809908043749e-07,
"loss": 0.739,
"step": 482
},
{
"epoch": 0.6182894631570526,
"grad_norm": 0.8104184865951538,
"learning_rate": 9.29447296376266e-07,
"loss": 0.7571,
"step": 483
},
{
"epoch": 0.6195695655652452,
"grad_norm": 0.4955035150051117,
"learning_rate": 9.291128783651868e-07,
"loss": 0.7407,
"step": 484
},
{
"epoch": 0.6208496679734379,
"grad_norm": 0.9866591095924377,
"learning_rate": 9.28777737408852e-07,
"loss": 0.7333,
"step": 485
},
{
"epoch": 0.6221297703816305,
"grad_norm": 0.4790208041667938,
"learning_rate": 9.284418741463552e-07,
"loss": 0.7373,
"step": 486
},
{
"epoch": 0.6234098727898232,
"grad_norm": 0.6627092361450195,
"learning_rate": 9.28105289218167e-07,
"loss": 0.7487,
"step": 487
},
{
"epoch": 0.6246899751980158,
"grad_norm": 1.1126811504364014,
"learning_rate": 9.277679832661347e-07,
"loss": 0.729,
"step": 488
},
{
"epoch": 0.6259700776062085,
"grad_norm": 0.9420062303543091,
"learning_rate": 9.274299569334802e-07,
"loss": 0.745,
"step": 489
},
{
"epoch": 0.6272501800144011,
"grad_norm": 1.1584370136260986,
"learning_rate": 9.270912108647993e-07,
"loss": 0.7388,
"step": 490
},
{
"epoch": 0.6285302824225938,
"grad_norm": 0.5413680076599121,
"learning_rate": 9.267517457060599e-07,
"loss": 0.7552,
"step": 491
},
{
"epoch": 0.6298103848307864,
"grad_norm": 0.8540847897529602,
"learning_rate": 9.26411562104602e-07,
"loss": 0.737,
"step": 492
},
{
"epoch": 0.6310904872389791,
"grad_norm": 1.9764920473098755,
"learning_rate": 9.260706607091346e-07,
"loss": 0.7271,
"step": 493
},
{
"epoch": 0.6323705896471717,
"grad_norm": 0.5290267467498779,
"learning_rate": 9.257290421697362e-07,
"loss": 0.7184,
"step": 494
},
{
"epoch": 0.6336506920553644,
"grad_norm": 0.563903272151947,
"learning_rate": 9.253867071378524e-07,
"loss": 0.7368,
"step": 495
},
{
"epoch": 0.634930794463557,
"grad_norm": 0.6023145318031311,
"learning_rate": 9.250436562662956e-07,
"loss": 0.7573,
"step": 496
},
{
"epoch": 0.6362108968717497,
"grad_norm": 0.6099826097488403,
"learning_rate": 9.246998902092428e-07,
"loss": 0.7526,
"step": 497
},
{
"epoch": 0.6374909992799423,
"grad_norm": 0.5186932682991028,
"learning_rate": 9.243554096222351e-07,
"loss": 0.7235,
"step": 498
},
{
"epoch": 0.638771101688135,
"grad_norm": 0.5785353183746338,
"learning_rate": 9.240102151621763e-07,
"loss": 0.7478,
"step": 499
},
{
"epoch": 0.6400512040963277,
"grad_norm": 0.5067083239555359,
"learning_rate": 9.236643074873308e-07,
"loss": 0.7283,
"step": 500
},
{
"epoch": 0.6413313065045204,
"grad_norm": 0.7413318157196045,
"learning_rate": 9.233176872573241e-07,
"loss": 0.7214,
"step": 501
},
{
"epoch": 0.6426114089127131,
"grad_norm": 0.9167243838310242,
"learning_rate": 9.229703551331393e-07,
"loss": 0.72,
"step": 502
},
{
"epoch": 0.6438915113209057,
"grad_norm": 1.0522778034210205,
"learning_rate": 9.226223117771183e-07,
"loss": 0.7348,
"step": 503
},
{
"epoch": 0.6451716137290984,
"grad_norm": 0.6642094850540161,
"learning_rate": 9.222735578529583e-07,
"loss": 0.736,
"step": 504
},
{
"epoch": 0.646451716137291,
"grad_norm": 0.8887587189674377,
"learning_rate": 9.219240940257121e-07,
"loss": 0.7305,
"step": 505
},
{
"epoch": 0.6477318185454837,
"grad_norm": 0.9729070663452148,
"learning_rate": 9.215739209617857e-07,
"loss": 0.7488,
"step": 506
},
{
"epoch": 0.6490119209536763,
"grad_norm": 0.8241427540779114,
"learning_rate": 9.212230393289384e-07,
"loss": 0.7415,
"step": 507
},
{
"epoch": 0.650292023361869,
"grad_norm": 0.5997843742370605,
"learning_rate": 9.208714497962796e-07,
"loss": 0.7386,
"step": 508
},
{
"epoch": 0.6515721257700616,
"grad_norm": 0.6482121348381042,
"learning_rate": 9.205191530342696e-07,
"loss": 0.7582,
"step": 509
},
{
"epoch": 0.6528522281782543,
"grad_norm": 0.7210831046104431,
"learning_rate": 9.201661497147167e-07,
"loss": 0.7378,
"step": 510
},
{
"epoch": 0.6528522281782543,
"eval_loss": 0.021014181897044182,
"eval_runtime": 42.1053,
"eval_samples_per_second": 11.78,
"eval_steps_per_second": 1.473,
"step": 510
},
{
"epoch": 0.6541323305864469,
"grad_norm": 0.7056831121444702,
"learning_rate": 9.198124405107772e-07,
"loss": 0.74,
"step": 511
},
{
"epoch": 0.6554124329946396,
"grad_norm": 1.1995331048965454,
"learning_rate": 9.194580260969525e-07,
"loss": 0.7303,
"step": 512
},
{
"epoch": 0.6566925354028322,
"grad_norm": 1.5269051790237427,
"learning_rate": 9.191029071490897e-07,
"loss": 0.7632,
"step": 513
},
{
"epoch": 0.6579726378110249,
"grad_norm": 0.5763581395149231,
"learning_rate": 9.187470843443794e-07,
"loss": 0.7402,
"step": 514
},
{
"epoch": 0.6592527402192175,
"grad_norm": 1.1235899925231934,
"learning_rate": 9.183905583613535e-07,
"loss": 0.7267,
"step": 515
},
{
"epoch": 0.6605328426274102,
"grad_norm": 1.478568434715271,
"learning_rate": 9.180333298798858e-07,
"loss": 0.7591,
"step": 516
},
{
"epoch": 0.6618129450356028,
"grad_norm": 0.718687117099762,
"learning_rate": 9.176753995811893e-07,
"loss": 0.7147,
"step": 517
},
{
"epoch": 0.6630930474437955,
"grad_norm": 0.5757226943969727,
"learning_rate": 9.173167681478152e-07,
"loss": 0.7463,
"step": 518
},
{
"epoch": 0.6643731498519881,
"grad_norm": 0.5394216179847717,
"learning_rate": 9.169574362636521e-07,
"loss": 0.7404,
"step": 519
},
{
"epoch": 0.6656532522601808,
"grad_norm": 0.5092488527297974,
"learning_rate": 9.165974046139239e-07,
"loss": 0.7111,
"step": 520
},
{
"epoch": 0.6669333546683734,
"grad_norm": 0.8180265426635742,
"learning_rate": 9.162366738851892e-07,
"loss": 0.73,
"step": 521
},
{
"epoch": 0.6682134570765661,
"grad_norm": 1.7370868921279907,
"learning_rate": 9.158752447653397e-07,
"loss": 0.7355,
"step": 522
},
{
"epoch": 0.6694935594847587,
"grad_norm": 0.7390193343162537,
"learning_rate": 9.155131179435985e-07,
"loss": 0.7386,
"step": 523
},
{
"epoch": 0.6707736618929514,
"grad_norm": 1.0305149555206299,
"learning_rate": 9.151502941105198e-07,
"loss": 0.7417,
"step": 524
},
{
"epoch": 0.672053764301144,
"grad_norm": 0.49237629771232605,
"learning_rate": 9.147867739579865e-07,
"loss": 0.7133,
"step": 525
},
{
"epoch": 0.6733338667093367,
"grad_norm": 0.5576760768890381,
"learning_rate": 9.144225581792097e-07,
"loss": 0.7431,
"step": 526
},
{
"epoch": 0.6746139691175294,
"grad_norm": 1.8849859237670898,
"learning_rate": 9.140576474687263e-07,
"loss": 0.7209,
"step": 527
},
{
"epoch": 0.675894071525722,
"grad_norm": 0.7206259369850159,
"learning_rate": 9.136920425223993e-07,
"loss": 0.7342,
"step": 528
},
{
"epoch": 0.6771741739339147,
"grad_norm": 0.5466733574867249,
"learning_rate": 9.133257440374149e-07,
"loss": 0.7246,
"step": 529
},
{
"epoch": 0.6784542763421074,
"grad_norm": 0.6503171324729919,
"learning_rate": 9.129587527122824e-07,
"loss": 0.7364,
"step": 530
},
{
"epoch": 0.6797343787503001,
"grad_norm": 0.5716297030448914,
"learning_rate": 9.125910692468316e-07,
"loss": 0.7477,
"step": 531
},
{
"epoch": 0.6810144811584927,
"grad_norm": 2.306088447570801,
"learning_rate": 9.122226943422129e-07,
"loss": 0.7239,
"step": 532
},
{
"epoch": 0.6822945835666854,
"grad_norm": 0.7810466885566711,
"learning_rate": 9.118536287008946e-07,
"loss": 0.7281,
"step": 533
},
{
"epoch": 0.683574685974878,
"grad_norm": 0.5522501468658447,
"learning_rate": 9.114838730266627e-07,
"loss": 0.7405,
"step": 534
},
{
"epoch": 0.6848547883830707,
"grad_norm": 0.6078072786331177,
"learning_rate": 9.111134280246188e-07,
"loss": 0.7348,
"step": 535
},
{
"epoch": 0.6861348907912633,
"grad_norm": 0.5471058487892151,
"learning_rate": 9.10742294401179e-07,
"loss": 0.721,
"step": 536
},
{
"epoch": 0.687414993199456,
"grad_norm": 1.0469000339508057,
"learning_rate": 9.103704728640725e-07,
"loss": 0.7325,
"step": 537
},
{
"epoch": 0.6886950956076486,
"grad_norm": 0.8831820487976074,
"learning_rate": 9.099979641223407e-07,
"loss": 0.715,
"step": 538
},
{
"epoch": 0.6899751980158413,
"grad_norm": 0.6320680975914001,
"learning_rate": 9.096247688863347e-07,
"loss": 0.7291,
"step": 539
},
{
"epoch": 0.6912553004240339,
"grad_norm": 0.9754980206489563,
"learning_rate": 9.092508878677156e-07,
"loss": 0.7564,
"step": 540
},
{
"epoch": 0.6912553004240339,
"eval_loss": 0.021045604720711708,
"eval_runtime": 42.2539,
"eval_samples_per_second": 11.739,
"eval_steps_per_second": 1.467,
"step": 540
},
{
"epoch": 0.6925354028322266,
"grad_norm": 1.4117339849472046,
"learning_rate": 9.088763217794518e-07,
"loss": 0.7423,
"step": 541
},
{
"epoch": 0.6938155052404192,
"grad_norm": 1.0038983821868896,
"learning_rate": 9.085010713358177e-07,
"loss": 0.7174,
"step": 542
},
{
"epoch": 0.6950956076486119,
"grad_norm": 0.5433626174926758,
"learning_rate": 9.081251372523934e-07,
"loss": 0.7449,
"step": 543
},
{
"epoch": 0.6963757100568045,
"grad_norm": 0.8172720670700073,
"learning_rate": 9.077485202460626e-07,
"loss": 0.7149,
"step": 544
},
{
"epoch": 0.6976558124649972,
"grad_norm": 2.134445905685425,
"learning_rate": 9.073712210350108e-07,
"loss": 0.7299,
"step": 545
},
{
"epoch": 0.6989359148731898,
"grad_norm": 1.660037636756897,
"learning_rate": 9.069932403387247e-07,
"loss": 0.733,
"step": 546
},
{
"epoch": 0.7002160172813825,
"grad_norm": 1.5447118282318115,
"learning_rate": 9.066145788779906e-07,
"loss": 0.7274,
"step": 547
},
{
"epoch": 0.7014961196895751,
"grad_norm": 0.4776293933391571,
"learning_rate": 9.06235237374893e-07,
"loss": 0.7332,
"step": 548
},
{
"epoch": 0.7027762220977678,
"grad_norm": 0.5387712121009827,
"learning_rate": 9.05855216552813e-07,
"loss": 0.7292,
"step": 549
},
{
"epoch": 0.7040563245059605,
"grad_norm": 1.151238203048706,
"learning_rate": 9.054745171364275e-07,
"loss": 0.738,
"step": 550
},
{
"epoch": 0.7053364269141531,
"grad_norm": 1.0059211254119873,
"learning_rate": 9.050931398517069e-07,
"loss": 0.733,
"step": 551
},
{
"epoch": 0.7066165293223458,
"grad_norm": 1.5007776021957397,
"learning_rate": 9.047110854259146e-07,
"loss": 0.6961,
"step": 552
},
{
"epoch": 0.7078966317305384,
"grad_norm": 0.4643494784832001,
"learning_rate": 9.043283545876054e-07,
"loss": 0.7356,
"step": 553
},
{
"epoch": 0.7091767341387311,
"grad_norm": 0.446883887052536,
"learning_rate": 9.039449480666235e-07,
"loss": 0.7157,
"step": 554
},
{
"epoch": 0.7104568365469237,
"grad_norm": 0.7078633904457092,
"learning_rate": 9.035608665941021e-07,
"loss": 0.7395,
"step": 555
},
{
"epoch": 0.7117369389551164,
"grad_norm": 0.4792153239250183,
"learning_rate": 9.03176110902461e-07,
"loss": 0.7171,
"step": 556
},
{
"epoch": 0.713017041363309,
"grad_norm": 0.7218549847602844,
"learning_rate": 9.027906817254063e-07,
"loss": 0.7246,
"step": 557
},
{
"epoch": 0.7142971437715018,
"grad_norm": 0.47100692987442017,
"learning_rate": 9.024045797979279e-07,
"loss": 0.7246,
"step": 558
},
{
"epoch": 0.7155772461796944,
"grad_norm": 0.46910184621810913,
"learning_rate": 9.020178058562988e-07,
"loss": 0.7192,
"step": 559
},
{
"epoch": 0.7168573485878871,
"grad_norm": 0.4550006687641144,
"learning_rate": 9.016303606380732e-07,
"loss": 0.721,
"step": 560
},
{
"epoch": 0.7181374509960797,
"grad_norm": 0.4870290458202362,
"learning_rate": 9.01242244882086e-07,
"loss": 0.7312,
"step": 561
},
{
"epoch": 0.7194175534042724,
"grad_norm": 0.48211103677749634,
"learning_rate": 9.0085345932845e-07,
"loss": 0.7042,
"step": 562
},
{
"epoch": 0.720697655812465,
"grad_norm": 0.47238773107528687,
"learning_rate": 9.00464004718556e-07,
"loss": 0.7517,
"step": 563
},
{
"epoch": 0.7219777582206577,
"grad_norm": 0.7546138763427734,
"learning_rate": 9.000738817950701e-07,
"loss": 0.7024,
"step": 564
},
{
"epoch": 0.7232578606288503,
"grad_norm": 1.1235212087631226,
"learning_rate": 8.996830913019331e-07,
"loss": 0.6948,
"step": 565
},
{
"epoch": 0.724537963037043,
"grad_norm": 1.2268662452697754,
"learning_rate": 8.99291633984359e-07,
"loss": 0.7124,
"step": 566
},
{
"epoch": 0.7258180654452356,
"grad_norm": 0.5037409067153931,
"learning_rate": 8.988995105888325e-07,
"loss": 0.7034,
"step": 567
},
{
"epoch": 0.7270981678534283,
"grad_norm": 0.46896108984947205,
"learning_rate": 8.985067218631098e-07,
"loss": 0.7161,
"step": 568
},
{
"epoch": 0.7283782702616209,
"grad_norm": 0.7797430753707886,
"learning_rate": 8.981132685562149e-07,
"loss": 0.736,
"step": 569
},
{
"epoch": 0.7296583726698136,
"grad_norm": 0.5098110437393188,
"learning_rate": 8.977191514184394e-07,
"loss": 0.7143,
"step": 570
},
{
"epoch": 0.7296583726698136,
"eval_loss": 0.020963987335562706,
"eval_runtime": 42.202,
"eval_samples_per_second": 11.753,
"eval_steps_per_second": 1.469,
"step": 570
},
{
"epoch": 0.7309384750780062,
"grad_norm": 0.8123798370361328,
"learning_rate": 8.973243712013406e-07,
"loss": 0.7123,
"step": 571
},
{
"epoch": 0.7322185774861989,
"grad_norm": 0.7426872849464417,
"learning_rate": 8.969289286577407e-07,
"loss": 0.7211,
"step": 572
},
{
"epoch": 0.7334986798943915,
"grad_norm": 1.2957710027694702,
"learning_rate": 8.965328245417245e-07,
"loss": 0.7192,
"step": 573
},
{
"epoch": 0.7347787823025842,
"grad_norm": 0.4550981819629669,
"learning_rate": 8.961360596086386e-07,
"loss": 0.7158,
"step": 574
},
{
"epoch": 0.7360588847107769,
"grad_norm": 0.480466365814209,
"learning_rate": 8.957386346150897e-07,
"loss": 0.7347,
"step": 575
},
{
"epoch": 0.7373389871189695,
"grad_norm": 1.2301396131515503,
"learning_rate": 8.953405503189427e-07,
"loss": 0.7257,
"step": 576
},
{
"epoch": 0.7386190895271622,
"grad_norm": 0.7805120944976807,
"learning_rate": 8.949418074793208e-07,
"loss": 0.7206,
"step": 577
},
{
"epoch": 0.7398991919353548,
"grad_norm": 1.688595175743103,
"learning_rate": 8.945424068566019e-07,
"loss": 0.7201,
"step": 578
},
{
"epoch": 0.7411792943435475,
"grad_norm": 1.5483627319335938,
"learning_rate": 8.941423492124193e-07,
"loss": 0.7298,
"step": 579
},
{
"epoch": 0.7424593967517401,
"grad_norm": 0.7737287878990173,
"learning_rate": 8.937416353096582e-07,
"loss": 0.7192,
"step": 580
},
{
"epoch": 0.7437394991599328,
"grad_norm": 0.4787493646144867,
"learning_rate": 8.933402659124557e-07,
"loss": 0.7268,
"step": 581
},
{
"epoch": 0.7450196015681254,
"grad_norm": 0.5913535952568054,
"learning_rate": 8.92938241786199e-07,
"loss": 0.7195,
"step": 582
},
{
"epoch": 0.7462997039763181,
"grad_norm": 1.0094797611236572,
"learning_rate": 8.92535563697524e-07,
"loss": 0.7332,
"step": 583
},
{
"epoch": 0.7475798063845107,
"grad_norm": 0.9704792499542236,
"learning_rate": 8.921322324143129e-07,
"loss": 0.7487,
"step": 584
},
{
"epoch": 0.7488599087927034,
"grad_norm": 0.5868096947669983,
"learning_rate": 8.917282487056943e-07,
"loss": 0.7229,
"step": 585
},
{
"epoch": 0.750140011200896,
"grad_norm": 0.4691717326641083,
"learning_rate": 8.913236133420404e-07,
"loss": 0.707,
"step": 586
},
{
"epoch": 0.7514201136090888,
"grad_norm": 0.5251399278640747,
"learning_rate": 8.909183270949667e-07,
"loss": 0.7243,
"step": 587
},
{
"epoch": 0.7527002160172814,
"grad_norm": 0.5538453459739685,
"learning_rate": 8.905123907373289e-07,
"loss": 0.7297,
"step": 588
},
{
"epoch": 0.7539803184254741,
"grad_norm": 0.48969927430152893,
"learning_rate": 8.901058050432234e-07,
"loss": 0.7194,
"step": 589
},
{
"epoch": 0.7552604208336667,
"grad_norm": 0.4564533531665802,
"learning_rate": 8.896985707879844e-07,
"loss": 0.7324,
"step": 590
},
{
"epoch": 0.7565405232418594,
"grad_norm": 0.6064324378967285,
"learning_rate": 8.892906887481828e-07,
"loss": 0.7237,
"step": 591
},
{
"epoch": 0.757820625650052,
"grad_norm": 0.7682381272315979,
"learning_rate": 8.88882159701625e-07,
"loss": 0.7391,
"step": 592
},
{
"epoch": 0.7591007280582447,
"grad_norm": 1.681577444076538,
"learning_rate": 8.884729844273509e-07,
"loss": 0.7166,
"step": 593
},
{
"epoch": 0.7603808304664373,
"grad_norm": 1.346693515777588,
"learning_rate": 8.880631637056331e-07,
"loss": 0.7153,
"step": 594
},
{
"epoch": 0.76166093287463,
"grad_norm": 0.47442230582237244,
"learning_rate": 8.876526983179749e-07,
"loss": 0.7147,
"step": 595
},
{
"epoch": 0.7629410352828226,
"grad_norm": 0.7667444348335266,
"learning_rate": 8.872415890471089e-07,
"loss": 0.7119,
"step": 596
},
{
"epoch": 0.7642211376910153,
"grad_norm": 0.44476452469825745,
"learning_rate": 8.868298366769954e-07,
"loss": 0.7079,
"step": 597
},
{
"epoch": 0.765501240099208,
"grad_norm": 1.343685507774353,
"learning_rate": 8.864174419928213e-07,
"loss": 0.7305,
"step": 598
},
{
"epoch": 0.7667813425074006,
"grad_norm": 1.8725303411483765,
"learning_rate": 8.860044057809981e-07,
"loss": 0.722,
"step": 599
},
{
"epoch": 0.7680614449155932,
"grad_norm": 0.7503852844238281,
"learning_rate": 8.855907288291608e-07,
"loss": 0.6865,
"step": 600
},
{
"epoch": 0.7680614449155932,
"eval_loss": 0.020904021337628365,
"eval_runtime": 42.1826,
"eval_samples_per_second": 11.758,
"eval_steps_per_second": 1.47,
"step": 600
},
{
"epoch": 0.7693415473237859,
"grad_norm": 1.1681547164916992,
"learning_rate": 8.851764119261666e-07,
"loss": 0.707,
"step": 601
},
{
"epoch": 0.7706216497319786,
"grad_norm": 1.4232583045959473,
"learning_rate": 8.847614558620922e-07,
"loss": 0.7351,
"step": 602
},
{
"epoch": 0.7719017521401712,
"grad_norm": 2.3306655883789062,
"learning_rate": 8.843458614282339e-07,
"loss": 0.7207,
"step": 603
},
{
"epoch": 0.7731818545483639,
"grad_norm": 2.485917806625366,
"learning_rate": 8.83929629417105e-07,
"loss": 0.7007,
"step": 604
},
{
"epoch": 0.7744619569565565,
"grad_norm": 1.5995652675628662,
"learning_rate": 8.835127606224347e-07,
"loss": 0.695,
"step": 605
},
{
"epoch": 0.7757420593647492,
"grad_norm": 0.7365001440048218,
"learning_rate": 8.830952558391665e-07,
"loss": 0.7108,
"step": 606
},
{
"epoch": 0.7770221617729418,
"grad_norm": 0.43921002745628357,
"learning_rate": 8.826771158634566e-07,
"loss": 0.7179,
"step": 607
},
{
"epoch": 0.7783022641811345,
"grad_norm": 0.5380148887634277,
"learning_rate": 8.822583414926728e-07,
"loss": 0.7096,
"step": 608
},
{
"epoch": 0.7795823665893271,
"grad_norm": 2.004121780395508,
"learning_rate": 8.818389335253922e-07,
"loss": 0.7238,
"step": 609
},
{
"epoch": 0.7808624689975198,
"grad_norm": 1.0534472465515137,
"learning_rate": 8.814188927614004e-07,
"loss": 0.737,
"step": 610
},
{
"epoch": 0.7821425714057124,
"grad_norm": 0.4470048248767853,
"learning_rate": 8.809982200016897e-07,
"loss": 0.7108,
"step": 611
},
{
"epoch": 0.7834226738139051,
"grad_norm": 0.5981615781784058,
"learning_rate": 8.805769160484576e-07,
"loss": 0.7215,
"step": 612
},
{
"epoch": 0.7847027762220977,
"grad_norm": 1.2785091400146484,
"learning_rate": 8.801549817051051e-07,
"loss": 0.6946,
"step": 613
},
{
"epoch": 0.7859828786302904,
"grad_norm": 1.0147285461425781,
"learning_rate": 8.797324177762351e-07,
"loss": 0.7352,
"step": 614
},
{
"epoch": 0.7872629810384831,
"grad_norm": 1.4566447734832764,
"learning_rate": 8.793092250676518e-07,
"loss": 0.7145,
"step": 615
},
{
"epoch": 0.7885430834466758,
"grad_norm": 1.7534832954406738,
"learning_rate": 8.788854043863578e-07,
"loss": 0.7098,
"step": 616
},
{
"epoch": 0.7898231858548684,
"grad_norm": 0.7456167340278625,
"learning_rate": 8.784609565405534e-07,
"loss": 0.6876,
"step": 617
},
{
"epoch": 0.7911032882630611,
"grad_norm": 0.4770120084285736,
"learning_rate": 8.780358823396352e-07,
"loss": 0.7202,
"step": 618
},
{
"epoch": 0.7923833906712537,
"grad_norm": 1.1301631927490234,
"learning_rate": 8.776101825941935e-07,
"loss": 0.7315,
"step": 619
},
{
"epoch": 0.7936634930794464,
"grad_norm": 1.1479843854904175,
"learning_rate": 8.77183858116012e-07,
"loss": 0.7104,
"step": 620
},
{
"epoch": 0.794943595487639,
"grad_norm": 0.7247928977012634,
"learning_rate": 8.767569097180658e-07,
"loss": 0.7053,
"step": 621
},
{
"epoch": 0.7962236978958317,
"grad_norm": 0.6144221425056458,
"learning_rate": 8.763293382145193e-07,
"loss": 0.7183,
"step": 622
},
{
"epoch": 0.7975038003040243,
"grad_norm": 0.7315794229507446,
"learning_rate": 8.759011444207257e-07,
"loss": 0.7276,
"step": 623
},
{
"epoch": 0.798783902712217,
"grad_norm": 0.46502548456192017,
"learning_rate": 8.754723291532245e-07,
"loss": 0.6886,
"step": 624
},
{
"epoch": 0.8000640051204096,
"grad_norm": 0.8581224679946899,
"learning_rate": 8.750428932297403e-07,
"loss": 0.7048,
"step": 625
},
{
"epoch": 0.8013441075286023,
"grad_norm": 1.4743561744689941,
"learning_rate": 8.746128374691812e-07,
"loss": 0.721,
"step": 626
},
{
"epoch": 0.802624209936795,
"grad_norm": 0.47782769799232483,
"learning_rate": 8.741821626916378e-07,
"loss": 0.6966,
"step": 627
},
{
"epoch": 0.8039043123449876,
"grad_norm": 1.0734385251998901,
"learning_rate": 8.737508697183806e-07,
"loss": 0.7256,
"step": 628
},
{
"epoch": 0.8051844147531803,
"grad_norm": 0.4739302396774292,
"learning_rate": 8.733189593718591e-07,
"loss": 0.7109,
"step": 629
},
{
"epoch": 0.8064645171613729,
"grad_norm": 0.46767228841781616,
"learning_rate": 8.728864324757001e-07,
"loss": 0.709,
"step": 630
},
{
"epoch": 0.8064645171613729,
"eval_loss": 0.020846327766776085,
"eval_runtime": 42.128,
"eval_samples_per_second": 11.774,
"eval_steps_per_second": 1.472,
"step": 630
},
{
"epoch": 0.8077446195695656,
"grad_norm": 0.49929046630859375,
"learning_rate": 8.724532898547064e-07,
"loss": 0.6901,
"step": 631
},
{
"epoch": 0.8090247219777582,
"grad_norm": 0.559801459312439,
"learning_rate": 8.720195323348545e-07,
"loss": 0.7107,
"step": 632
},
{
"epoch": 0.8103048243859509,
"grad_norm": 0.45311835408210754,
"learning_rate": 8.715851607432934e-07,
"loss": 0.7216,
"step": 633
},
{
"epoch": 0.8115849267941435,
"grad_norm": 0.430759072303772,
"learning_rate": 8.711501759083439e-07,
"loss": 0.7066,
"step": 634
},
{
"epoch": 0.8128650292023362,
"grad_norm": 0.5016859173774719,
"learning_rate": 8.707145786594953e-07,
"loss": 0.7024,
"step": 635
},
{
"epoch": 0.8141451316105288,
"grad_norm": 0.6638745665550232,
"learning_rate": 8.702783698274053e-07,
"loss": 0.7182,
"step": 636
},
{
"epoch": 0.8154252340187215,
"grad_norm": 0.7069580554962158,
"learning_rate": 8.698415502438976e-07,
"loss": 0.7043,
"step": 637
},
{
"epoch": 0.8167053364269141,
"grad_norm": 1.0888609886169434,
"learning_rate": 8.694041207419607e-07,
"loss": 0.7193,
"step": 638
},
{
"epoch": 0.8179854388351068,
"grad_norm": 1.4110472202301025,
"learning_rate": 8.689660821557462e-07,
"loss": 0.6981,
"step": 639
},
{
"epoch": 0.8192655412432994,
"grad_norm": 0.43904000520706177,
"learning_rate": 8.685274353205667e-07,
"loss": 0.6846,
"step": 640
},
{
"epoch": 0.8205456436514921,
"grad_norm": 0.7627870440483093,
"learning_rate": 8.680881810728957e-07,
"loss": 0.6868,
"step": 641
},
{
"epoch": 0.8218257460596847,
"grad_norm": 1.317055583000183,
"learning_rate": 8.676483202503638e-07,
"loss": 0.7147,
"step": 642
},
{
"epoch": 0.8231058484678774,
"grad_norm": 1.6329659223556519,
"learning_rate": 8.672078536917595e-07,
"loss": 0.7211,
"step": 643
},
{
"epoch": 0.8243859508760701,
"grad_norm": 1.2406091690063477,
"learning_rate": 8.667667822370251e-07,
"loss": 0.6931,
"step": 644
},
{
"epoch": 0.8256660532842628,
"grad_norm": 1.26050865650177,
"learning_rate": 8.663251067272578e-07,
"loss": 0.7095,
"step": 645
},
{
"epoch": 0.8269461556924554,
"grad_norm": 0.6402028203010559,
"learning_rate": 8.658828280047056e-07,
"loss": 0.6943,
"step": 646
},
{
"epoch": 0.8282262581006481,
"grad_norm": 0.8078739643096924,
"learning_rate": 8.654399469127672e-07,
"loss": 0.7088,
"step": 647
},
{
"epoch": 0.8295063605088407,
"grad_norm": 1.8825105428695679,
"learning_rate": 8.6499646429599e-07,
"loss": 0.7388,
"step": 648
},
{
"epoch": 0.8307864629170334,
"grad_norm": 0.7009708285331726,
"learning_rate": 8.645523810000685e-07,
"loss": 0.7079,
"step": 649
},
{
"epoch": 0.832066565325226,
"grad_norm": 0.7658326625823975,
"learning_rate": 8.641076978718427e-07,
"loss": 0.6796,
"step": 650
},
{
"epoch": 0.8333466677334187,
"grad_norm": 2.1865885257720947,
"learning_rate": 8.636624157592963e-07,
"loss": 0.7026,
"step": 651
},
{
"epoch": 0.8346267701416114,
"grad_norm": 0.48259398341178894,
"learning_rate": 8.632165355115551e-07,
"loss": 0.7203,
"step": 652
},
{
"epoch": 0.835906872549804,
"grad_norm": 1.0302852392196655,
"learning_rate": 8.627700579788857e-07,
"loss": 0.7042,
"step": 653
},
{
"epoch": 0.8371869749579967,
"grad_norm": 2.316915988922119,
"learning_rate": 8.623229840126938e-07,
"loss": 0.708,
"step": 654
},
{
"epoch": 0.8384670773661893,
"grad_norm": 2.140012741088867,
"learning_rate": 8.618753144655223e-07,
"loss": 0.7121,
"step": 655
},
{
"epoch": 0.839747179774382,
"grad_norm": 1.511641263961792,
"learning_rate": 8.614270501910498e-07,
"loss": 0.6954,
"step": 656
},
{
"epoch": 0.8410272821825746,
"grad_norm": 2.2881247997283936,
"learning_rate": 8.609781920440891e-07,
"loss": 0.709,
"step": 657
},
{
"epoch": 0.8423073845907673,
"grad_norm": 0.43974825739860535,
"learning_rate": 8.605287408805853e-07,
"loss": 0.7193,
"step": 658
},
{
"epoch": 0.8435874869989599,
"grad_norm": 1.2356144189834595,
"learning_rate": 8.600786975576149e-07,
"loss": 0.7252,
"step": 659
},
{
"epoch": 0.8448675894071526,
"grad_norm": 0.6315829753875732,
"learning_rate": 8.596280629333828e-07,
"loss": 0.7161,
"step": 660
},
{
"epoch": 0.8448675894071526,
"eval_loss": 0.02066558413207531,
"eval_runtime": 41.788,
"eval_samples_per_second": 11.869,
"eval_steps_per_second": 1.484,
"step": 660
},
{
"epoch": 0.8461476918153452,
"grad_norm": 1.5567103624343872,
"learning_rate": 8.591768378672221e-07,
"loss": 0.6695,
"step": 661
},
{
"epoch": 0.8474277942235379,
"grad_norm": 2.070467233657837,
"learning_rate": 8.587250232195916e-07,
"loss": 0.7043,
"step": 662
},
{
"epoch": 0.8487078966317305,
"grad_norm": 1.451274037361145,
"learning_rate": 8.582726198520744e-07,
"loss": 0.7213,
"step": 663
},
{
"epoch": 0.8499879990399232,
"grad_norm": 0.4336334764957428,
"learning_rate": 8.578196286273761e-07,
"loss": 0.6952,
"step": 664
},
{
"epoch": 0.8512681014481158,
"grad_norm": 0.650758683681488,
"learning_rate": 8.573660504093237e-07,
"loss": 0.7169,
"step": 665
},
{
"epoch": 0.8525482038563085,
"grad_norm": 1.487292766571045,
"learning_rate": 8.569118860628632e-07,
"loss": 0.7013,
"step": 666
},
{
"epoch": 0.8538283062645011,
"grad_norm": 0.8874569535255432,
"learning_rate": 8.564571364540587e-07,
"loss": 0.6976,
"step": 667
},
{
"epoch": 0.8551084086726938,
"grad_norm": 0.9208166003227234,
"learning_rate": 8.560018024500898e-07,
"loss": 0.7003,
"step": 668
},
{
"epoch": 0.8563885110808864,
"grad_norm": 1.112074851989746,
"learning_rate": 8.555458849192511e-07,
"loss": 0.6992,
"step": 669
},
{
"epoch": 0.8576686134890791,
"grad_norm": 1.0922183990478516,
"learning_rate": 8.550893847309494e-07,
"loss": 0.7247,
"step": 670
},
{
"epoch": 0.8589487158972717,
"grad_norm": 0.9542738199234009,
"learning_rate": 8.54632302755703e-07,
"loss": 0.6641,
"step": 671
},
{
"epoch": 0.8602288183054644,
"grad_norm": 0.43373188376426697,
"learning_rate": 8.541746398651394e-07,
"loss": 0.7027,
"step": 672
},
{
"epoch": 0.8615089207136571,
"grad_norm": 1.45198655128479,
"learning_rate": 8.537163969319941e-07,
"loss": 0.7067,
"step": 673
},
{
"epoch": 0.8627890231218498,
"grad_norm": 0.8665236830711365,
"learning_rate": 8.532575748301085e-07,
"loss": 0.7037,
"step": 674
},
{
"epoch": 0.8640691255300424,
"grad_norm": 0.9434092044830322,
"learning_rate": 8.527981744344285e-07,
"loss": 0.6965,
"step": 675
},
{
"epoch": 0.8653492279382351,
"grad_norm": 0.7929328083992004,
"learning_rate": 8.523381966210029e-07,
"loss": 0.6902,
"step": 676
},
{
"epoch": 0.8666293303464278,
"grad_norm": 0.812193751335144,
"learning_rate": 8.518776422669813e-07,
"loss": 0.7193,
"step": 677
},
{
"epoch": 0.8679094327546204,
"grad_norm": 0.4908401072025299,
"learning_rate": 8.51416512250613e-07,
"loss": 0.6984,
"step": 678
},
{
"epoch": 0.869189535162813,
"grad_norm": 0.7368214130401611,
"learning_rate": 8.509548074512448e-07,
"loss": 0.6998,
"step": 679
},
{
"epoch": 0.8704696375710057,
"grad_norm": 0.7631279826164246,
"learning_rate": 8.504925287493201e-07,
"loss": 0.7062,
"step": 680
},
{
"epoch": 0.8717497399791984,
"grad_norm": 0.4298534095287323,
"learning_rate": 8.500296770263761e-07,
"loss": 0.6979,
"step": 681
},
{
"epoch": 0.873029842387391,
"grad_norm": 0.7171966433525085,
"learning_rate": 8.495662531650429e-07,
"loss": 0.6987,
"step": 682
},
{
"epoch": 0.8743099447955837,
"grad_norm": 0.7361424565315247,
"learning_rate": 8.491022580490416e-07,
"loss": 0.6965,
"step": 683
},
{
"epoch": 0.8755900472037763,
"grad_norm": 1.069417953491211,
"learning_rate": 8.486376925631829e-07,
"loss": 0.6966,
"step": 684
},
{
"epoch": 0.876870149611969,
"grad_norm": 1.014566421508789,
"learning_rate": 8.481725575933651e-07,
"loss": 0.7064,
"step": 685
},
{
"epoch": 0.8781502520201616,
"grad_norm": 0.5789030194282532,
"learning_rate": 8.477068540265722e-07,
"loss": 0.6808,
"step": 686
},
{
"epoch": 0.8794303544283543,
"grad_norm": 0.7499472498893738,
"learning_rate": 8.472405827508726e-07,
"loss": 0.6495,
"step": 687
},
{
"epoch": 0.8807104568365469,
"grad_norm": 1.3741114139556885,
"learning_rate": 8.467737446554175e-07,
"loss": 0.6857,
"step": 688
},
{
"epoch": 0.8819905592447396,
"grad_norm": 0.5105960369110107,
"learning_rate": 8.463063406304388e-07,
"loss": 0.682,
"step": 689
},
{
"epoch": 0.8832706616529322,
"grad_norm": 1.9599547386169434,
"learning_rate": 8.458383715672474e-07,
"loss": 0.68,
"step": 690
},
{
"epoch": 0.8832706616529322,
"eval_loss": 0.020671645179390907,
"eval_runtime": 41.8896,
"eval_samples_per_second": 11.841,
"eval_steps_per_second": 1.48,
"step": 690
},
{
"epoch": 0.8845507640611249,
"grad_norm": 1.9888514280319214,
"learning_rate": 8.453698383582322e-07,
"loss": 0.6892,
"step": 691
},
{
"epoch": 0.8858308664693175,
"grad_norm": 0.470649391412735,
"learning_rate": 8.449007418968574e-07,
"loss": 0.6826,
"step": 692
},
{
"epoch": 0.8871109688775102,
"grad_norm": 1.6899157762527466,
"learning_rate": 8.444310830776615e-07,
"loss": 0.6939,
"step": 693
},
{
"epoch": 0.8883910712857028,
"grad_norm": 0.6090466380119324,
"learning_rate": 8.439608627962555e-07,
"loss": 0.722,
"step": 694
},
{
"epoch": 0.8896711736938955,
"grad_norm": 1.117171287536621,
"learning_rate": 8.434900819493208e-07,
"loss": 0.7126,
"step": 695
},
{
"epoch": 0.8909512761020881,
"grad_norm": 0.5952681303024292,
"learning_rate": 8.430187414346081e-07,
"loss": 0.707,
"step": 696
},
{
"epoch": 0.8922313785102808,
"grad_norm": 0.7138329744338989,
"learning_rate": 8.425468421509349e-07,
"loss": 0.698,
"step": 697
},
{
"epoch": 0.8935114809184734,
"grad_norm": 0.7613462805747986,
"learning_rate": 8.420743849981846e-07,
"loss": 0.7157,
"step": 698
},
{
"epoch": 0.8947915833266661,
"grad_norm": 1.353546380996704,
"learning_rate": 8.416013708773045e-07,
"loss": 0.7067,
"step": 699
},
{
"epoch": 0.8960716857348587,
"grad_norm": 1.7249506711959839,
"learning_rate": 8.411278006903035e-07,
"loss": 0.7181,
"step": 700
},
{
"epoch": 0.8973517881430515,
"grad_norm": 0.4556410312652588,
"learning_rate": 8.406536753402516e-07,
"loss": 0.7055,
"step": 701
},
{
"epoch": 0.8986318905512442,
"grad_norm": 0.6553078889846802,
"learning_rate": 8.401789957312767e-07,
"loss": 0.6982,
"step": 702
},
{
"epoch": 0.8999119929594368,
"grad_norm": 0.610336184501648,
"learning_rate": 8.397037627685642e-07,
"loss": 0.7138,
"step": 703
},
{
"epoch": 0.9011920953676295,
"grad_norm": 2.2346596717834473,
"learning_rate": 8.392279773583548e-07,
"loss": 0.7007,
"step": 704
},
{
"epoch": 0.9024721977758221,
"grad_norm": 2.556217908859253,
"learning_rate": 8.387516404079418e-07,
"loss": 0.7014,
"step": 705
},
{
"epoch": 0.9037523001840148,
"grad_norm": 1.461926817893982,
"learning_rate": 8.382747528256712e-07,
"loss": 0.6999,
"step": 706
},
{
"epoch": 0.9050324025922074,
"grad_norm": 2.0974724292755127,
"learning_rate": 8.377973155209387e-07,
"loss": 0.6872,
"step": 707
},
{
"epoch": 0.9063125050004001,
"grad_norm": 1.515280842781067,
"learning_rate": 8.373193294041883e-07,
"loss": 0.6979,
"step": 708
},
{
"epoch": 0.9075926074085927,
"grad_norm": 0.5150478482246399,
"learning_rate": 8.368407953869103e-07,
"loss": 0.6961,
"step": 709
},
{
"epoch": 0.9088727098167854,
"grad_norm": 1.1151423454284668,
"learning_rate": 8.363617143816403e-07,
"loss": 0.7083,
"step": 710
},
{
"epoch": 0.910152812224978,
"grad_norm": 2.0105602741241455,
"learning_rate": 8.358820873019566e-07,
"loss": 0.6945,
"step": 711
},
{
"epoch": 0.9114329146331707,
"grad_norm": 3.009431838989258,
"learning_rate": 8.354019150624789e-07,
"loss": 0.7127,
"step": 712
},
{
"epoch": 0.9127130170413633,
"grad_norm": 2.1113877296447754,
"learning_rate": 8.349211985788665e-07,
"loss": 0.6989,
"step": 713
},
{
"epoch": 0.913993119449556,
"grad_norm": 1.300072431564331,
"learning_rate": 8.344399387678167e-07,
"loss": 0.6921,
"step": 714
},
{
"epoch": 0.9152732218577486,
"grad_norm": 0.668084442615509,
"learning_rate": 8.339581365470628e-07,
"loss": 0.6926,
"step": 715
},
{
"epoch": 0.9165533242659413,
"grad_norm": 0.7307219505310059,
"learning_rate": 8.334757928353721e-07,
"loss": 0.7219,
"step": 716
},
{
"epoch": 0.9178334266741339,
"grad_norm": 1.6746070384979248,
"learning_rate": 8.32992908552545e-07,
"loss": 0.6786,
"step": 717
},
{
"epoch": 0.9191135290823266,
"grad_norm": 1.3060693740844727,
"learning_rate": 8.325094846194125e-07,
"loss": 0.7143,
"step": 718
},
{
"epoch": 0.9203936314905192,
"grad_norm": 0.8237175345420837,
"learning_rate": 8.320255219578348e-07,
"loss": 0.7208,
"step": 719
},
{
"epoch": 0.9216737338987119,
"grad_norm": 0.4684383273124695,
"learning_rate": 8.31541021490699e-07,
"loss": 0.6995,
"step": 720
},
{
"epoch": 0.9216737338987119,
"eval_loss": 0.020728060975670815,
"eval_runtime": 42.0998,
"eval_samples_per_second": 11.782,
"eval_steps_per_second": 1.473,
"step": 720
},
{
"epoch": 0.9229538363069045,
"grad_norm": 0.7679601311683655,
"learning_rate": 8.310559841419186e-07,
"loss": 0.7004,
"step": 721
},
{
"epoch": 0.9242339387150972,
"grad_norm": 2.2562859058380127,
"learning_rate": 8.305704108364301e-07,
"loss": 0.7278,
"step": 722
},
{
"epoch": 0.9255140411232898,
"grad_norm": 1.769775390625,
"learning_rate": 8.300843025001922e-07,
"loss": 0.7002,
"step": 723
},
{
"epoch": 0.9267941435314825,
"grad_norm": 1.0874029397964478,
"learning_rate": 8.295976600601843e-07,
"loss": 0.6757,
"step": 724
},
{
"epoch": 0.9280742459396751,
"grad_norm": 0.5694004893302917,
"learning_rate": 8.291104844444037e-07,
"loss": 0.6945,
"step": 725
},
{
"epoch": 0.9293543483478678,
"grad_norm": 0.6500946283340454,
"learning_rate": 8.286227765818652e-07,
"loss": 0.698,
"step": 726
},
{
"epoch": 0.9306344507560604,
"grad_norm": 0.42796462774276733,
"learning_rate": 8.281345374025975e-07,
"loss": 0.6944,
"step": 727
},
{
"epoch": 0.9319145531642531,
"grad_norm": 0.4301977753639221,
"learning_rate": 8.276457678376435e-07,
"loss": 0.6792,
"step": 728
},
{
"epoch": 0.9331946555724457,
"grad_norm": 0.5018278956413269,
"learning_rate": 8.27156468819057e-07,
"loss": 0.6967,
"step": 729
},
{
"epoch": 0.9344747579806385,
"grad_norm": 0.48157456517219543,
"learning_rate": 8.266666412799015e-07,
"loss": 0.7185,
"step": 730
},
{
"epoch": 0.9357548603888312,
"grad_norm": 0.6853249073028564,
"learning_rate": 8.261762861542484e-07,
"loss": 0.7031,
"step": 731
},
{
"epoch": 0.9370349627970238,
"grad_norm": 0.6446681618690491,
"learning_rate": 8.256854043771753e-07,
"loss": 0.689,
"step": 732
},
{
"epoch": 0.9383150652052165,
"grad_norm": 0.42960432171821594,
"learning_rate": 8.251939968847638e-07,
"loss": 0.6707,
"step": 733
},
{
"epoch": 0.9395951676134091,
"grad_norm": 0.6173332929611206,
"learning_rate": 8.247020646140983e-07,
"loss": 0.7159,
"step": 734
},
{
"epoch": 0.9408752700216018,
"grad_norm": 1.5238192081451416,
"learning_rate": 8.242096085032637e-07,
"loss": 0.7032,
"step": 735
},
{
"epoch": 0.9421553724297944,
"grad_norm": 0.4899429678916931,
"learning_rate": 8.237166294913438e-07,
"loss": 0.7158,
"step": 736
},
{
"epoch": 0.9434354748379871,
"grad_norm": 0.4923379123210907,
"learning_rate": 8.2322312851842e-07,
"loss": 0.7051,
"step": 737
},
{
"epoch": 0.9447155772461797,
"grad_norm": 0.41801315546035767,
"learning_rate": 8.227291065255685e-07,
"loss": 0.6934,
"step": 738
},
{
"epoch": 0.9459956796543724,
"grad_norm": 0.6234742999076843,
"learning_rate": 8.222345644548593e-07,
"loss": 0.7116,
"step": 739
},
{
"epoch": 0.947275782062565,
"grad_norm": 1.1815129518508911,
"learning_rate": 8.217395032493541e-07,
"loss": 0.6935,
"step": 740
},
{
"epoch": 0.9485558844707577,
"grad_norm": 0.8116170167922974,
"learning_rate": 8.212439238531044e-07,
"loss": 0.711,
"step": 741
},
{
"epoch": 0.9498359868789503,
"grad_norm": 0.934303343296051,
"learning_rate": 8.207478272111505e-07,
"loss": 0.7122,
"step": 742
},
{
"epoch": 0.951116089287143,
"grad_norm": 0.4953675866127014,
"learning_rate": 8.20251214269518e-07,
"loss": 0.678,
"step": 743
},
{
"epoch": 0.9523961916953356,
"grad_norm": 1.1606484651565552,
"learning_rate": 8.197540859752182e-07,
"loss": 0.7059,
"step": 744
},
{
"epoch": 0.9536762941035283,
"grad_norm": 0.9235550165176392,
"learning_rate": 8.192564432762444e-07,
"loss": 0.696,
"step": 745
},
{
"epoch": 0.9549563965117209,
"grad_norm": 0.7705326080322266,
"learning_rate": 8.18758287121571e-07,
"loss": 0.689,
"step": 746
},
{
"epoch": 0.9562364989199136,
"grad_norm": 0.7169274687767029,
"learning_rate": 8.182596184611513e-07,
"loss": 0.6952,
"step": 747
},
{
"epoch": 0.9575166013281062,
"grad_norm": 0.45125555992126465,
"learning_rate": 8.177604382459166e-07,
"loss": 0.7047,
"step": 748
},
{
"epoch": 0.9587967037362989,
"grad_norm": 1.7524336576461792,
"learning_rate": 8.17260747427773e-07,
"loss": 0.6784,
"step": 749
},
{
"epoch": 0.9600768061444915,
"grad_norm": 0.49168533086776733,
"learning_rate": 8.16760546959601e-07,
"loss": 0.681,
"step": 750
},
{
"epoch": 0.9600768061444915,
"eval_loss": 0.02064095437526703,
"eval_runtime": 42.0421,
"eval_samples_per_second": 11.798,
"eval_steps_per_second": 1.475,
"step": 750
},
{
"epoch": 0.9613569085526842,
"grad_norm": 0.9633902311325073,
"learning_rate": 8.16259837795252e-07,
"loss": 0.6902,
"step": 751
},
{
"epoch": 0.9626370109608768,
"grad_norm": 0.4495463967323303,
"learning_rate": 8.157586208895483e-07,
"loss": 0.7187,
"step": 752
},
{
"epoch": 0.9639171133690695,
"grad_norm": 0.6116464138031006,
"learning_rate": 8.152568971982799e-07,
"loss": 0.6658,
"step": 753
},
{
"epoch": 0.9651972157772621,
"grad_norm": 0.987603485584259,
"learning_rate": 8.147546676782038e-07,
"loss": 0.6987,
"step": 754
},
{
"epoch": 0.9664773181854548,
"grad_norm": 0.7416115999221802,
"learning_rate": 8.142519332870408e-07,
"loss": 0.6825,
"step": 755
},
{
"epoch": 0.9677574205936474,
"grad_norm": 0.7779791355133057,
"learning_rate": 8.137486949834752e-07,
"loss": 0.6906,
"step": 756
},
{
"epoch": 0.9690375230018401,
"grad_norm": 0.9663521647453308,
"learning_rate": 8.132449537271518e-07,
"loss": 0.6684,
"step": 757
},
{
"epoch": 0.9703176254100329,
"grad_norm": 1.8601329326629639,
"learning_rate": 8.127407104786746e-07,
"loss": 0.7114,
"step": 758
},
{
"epoch": 0.9715977278182255,
"grad_norm": 2.383610725402832,
"learning_rate": 8.122359661996046e-07,
"loss": 0.6883,
"step": 759
},
{
"epoch": 0.9728778302264182,
"grad_norm": 1.6185420751571655,
"learning_rate": 8.117307218524591e-07,
"loss": 0.7008,
"step": 760
},
{
"epoch": 0.9741579326346108,
"grad_norm": 0.8225951790809631,
"learning_rate": 8.11224978400708e-07,
"loss": 0.688,
"step": 761
},
{
"epoch": 0.9754380350428035,
"grad_norm": 0.632926881313324,
"learning_rate": 8.107187368087735e-07,
"loss": 0.6947,
"step": 762
},
{
"epoch": 0.9767181374509961,
"grad_norm": 1.3217525482177734,
"learning_rate": 8.102119980420277e-07,
"loss": 0.6863,
"step": 763
},
{
"epoch": 0.9779982398591888,
"grad_norm": 0.8353522419929504,
"learning_rate": 8.097047630667904e-07,
"loss": 0.6769,
"step": 764
},
{
"epoch": 0.9792783422673814,
"grad_norm": 1.7969515323638916,
"learning_rate": 8.091970328503282e-07,
"loss": 0.7054,
"step": 765
},
{
"epoch": 0.9805584446755741,
"grad_norm": 0.6397256851196289,
"learning_rate": 8.086888083608515e-07,
"loss": 0.682,
"step": 766
},
{
"epoch": 0.9818385470837667,
"grad_norm": 0.8505901098251343,
"learning_rate": 8.08180090567514e-07,
"loss": 0.6891,
"step": 767
},
{
"epoch": 0.9831186494919594,
"grad_norm": 1.239424467086792,
"learning_rate": 8.076708804404093e-07,
"loss": 0.7154,
"step": 768
},
{
"epoch": 0.984398751900152,
"grad_norm": 1.5447685718536377,
"learning_rate": 8.071611789505703e-07,
"loss": 0.6849,
"step": 769
},
{
"epoch": 0.9856788543083447,
"grad_norm": 0.405514121055603,
"learning_rate": 8.066509870699671e-07,
"loss": 0.6804,
"step": 770
},
{
"epoch": 0.9869589567165373,
"grad_norm": 1.1980639696121216,
"learning_rate": 8.061403057715042e-07,
"loss": 0.7079,
"step": 771
},
{
"epoch": 0.98823905912473,
"grad_norm": 0.48832324147224426,
"learning_rate": 8.056291360290201e-07,
"loss": 0.6898,
"step": 772
},
{
"epoch": 0.9895191615329226,
"grad_norm": 0.44163626432418823,
"learning_rate": 8.051174788172844e-07,
"loss": 0.6892,
"step": 773
},
{
"epoch": 0.9907992639411153,
"grad_norm": 0.786046028137207,
"learning_rate": 8.046053351119965e-07,
"loss": 0.6987,
"step": 774
},
{
"epoch": 0.9920793663493079,
"grad_norm": 0.9036693572998047,
"learning_rate": 8.040927058897832e-07,
"loss": 0.7015,
"step": 775
},
{
"epoch": 0.9933594687575006,
"grad_norm": 0.6999722123146057,
"learning_rate": 8.035795921281974e-07,
"loss": 0.6867,
"step": 776
},
{
"epoch": 0.9946395711656932,
"grad_norm": 0.4138757586479187,
"learning_rate": 8.03065994805716e-07,
"loss": 0.7073,
"step": 777
},
{
"epoch": 0.9959196735738859,
"grad_norm": 0.706631064414978,
"learning_rate": 8.025519149017378e-07,
"loss": 0.6754,
"step": 778
},
{
"epoch": 0.9971997759820785,
"grad_norm": 0.6649022102355957,
"learning_rate": 8.020373533965821e-07,
"loss": 0.667,
"step": 779
},
{
"epoch": 0.9984798783902712,
"grad_norm": 1.475054144859314,
"learning_rate": 8.015223112714861e-07,
"loss": 0.6938,
"step": 780
},
{
"epoch": 0.9984798783902712,
"eval_loss": 0.020647402852773666,
"eval_runtime": 42.1351,
"eval_samples_per_second": 11.772,
"eval_steps_per_second": 1.471,
"step": 780
},
{
"epoch": 0.9997599807984638,
"grad_norm": 1.2930245399475098,
"learning_rate": 8.010067895086043e-07,
"loss": 0.6853,
"step": 781
},
{
"epoch": 1.0,
"grad_norm": 1.3159685134887695,
"learning_rate": 8.004907890910055e-07,
"loss": 0.6796,
"step": 782
},
{
"epoch": 1.0012801024081928,
"grad_norm": 0.5368277430534363,
"learning_rate": 7.999743110026708e-07,
"loss": 0.7092,
"step": 783
},
{
"epoch": 1.0025602048163853,
"grad_norm": 0.4549940824508667,
"learning_rate": 7.994573562284927e-07,
"loss": 0.6915,
"step": 784
},
{
"epoch": 1.003840307224578,
"grad_norm": 0.5101287961006165,
"learning_rate": 7.989399257542728e-07,
"loss": 0.6698,
"step": 785
},
{
"epoch": 1.0051204096327706,
"grad_norm": 0.6423113346099854,
"learning_rate": 7.984220205667192e-07,
"loss": 0.6908,
"step": 786
},
{
"epoch": 1.0064005120409634,
"grad_norm": 1.1199818849563599,
"learning_rate": 7.979036416534461e-07,
"loss": 0.6915,
"step": 787
},
{
"epoch": 1.007680614449156,
"grad_norm": 0.8028132915496826,
"learning_rate": 7.973847900029704e-07,
"loss": 0.6731,
"step": 788
},
{
"epoch": 1.0089607168573487,
"grad_norm": 0.5896822214126587,
"learning_rate": 7.968654666047107e-07,
"loss": 0.7043,
"step": 789
},
{
"epoch": 1.0102408192655412,
"grad_norm": 0.8032567501068115,
"learning_rate": 7.963456724489857e-07,
"loss": 0.6985,
"step": 790
},
{
"epoch": 1.011520921673734,
"grad_norm": 0.9771206974983215,
"learning_rate": 7.958254085270105e-07,
"loss": 0.6704,
"step": 791
},
{
"epoch": 1.0128010240819265,
"grad_norm": 0.4267595708370209,
"learning_rate": 7.953046758308973e-07,
"loss": 0.7052,
"step": 792
},
{
"epoch": 1.0140811264901193,
"grad_norm": 0.9158257246017456,
"learning_rate": 7.947834753536518e-07,
"loss": 0.6953,
"step": 793
},
{
"epoch": 1.0153612288983118,
"grad_norm": 0.42117831110954285,
"learning_rate": 7.942618080891714e-07,
"loss": 0.6858,
"step": 794
},
{
"epoch": 1.0166413313065046,
"grad_norm": 1.6845707893371582,
"learning_rate": 7.937396750322442e-07,
"loss": 0.6949,
"step": 795
},
{
"epoch": 1.0179214337146971,
"grad_norm": 1.548080325126648,
"learning_rate": 7.932170771785462e-07,
"loss": 0.6953,
"step": 796
},
{
"epoch": 1.0192015361228899,
"grad_norm": 0.41964584589004517,
"learning_rate": 7.926940155246397e-07,
"loss": 0.6711,
"step": 797
},
{
"epoch": 1.0204816385310824,
"grad_norm": 0.500307559967041,
"learning_rate": 7.921704910679714e-07,
"loss": 0.6824,
"step": 798
},
{
"epoch": 1.0217617409392752,
"grad_norm": 0.40395599603652954,
"learning_rate": 7.916465048068711e-07,
"loss": 0.7019,
"step": 799
},
{
"epoch": 1.0230418433474677,
"grad_norm": 0.7821643352508545,
"learning_rate": 7.911220577405484e-07,
"loss": 0.6938,
"step": 800
},
{
"epoch": 1.0243219457556605,
"grad_norm": 1.1643157005310059,
"learning_rate": 7.905971508690923e-07,
"loss": 0.6934,
"step": 801
},
{
"epoch": 1.025602048163853,
"grad_norm": 1.992969036102295,
"learning_rate": 7.900717851934681e-07,
"loss": 0.6792,
"step": 802
},
{
"epoch": 1.0268821505720458,
"grad_norm": 1.5031347274780273,
"learning_rate": 7.895459617155168e-07,
"loss": 0.6799,
"step": 803
},
{
"epoch": 1.0281622529802383,
"grad_norm": 0.5260814428329468,
"learning_rate": 7.890196814379512e-07,
"loss": 0.7027,
"step": 804
},
{
"epoch": 1.029442355388431,
"grad_norm": 0.41678398847579956,
"learning_rate": 7.884929453643561e-07,
"loss": 0.6998,
"step": 805
},
{
"epoch": 1.0307224577966236,
"grad_norm": 0.8173002600669861,
"learning_rate": 7.879657544991852e-07,
"loss": 0.6819,
"step": 806
},
{
"epoch": 1.0320025602048164,
"grad_norm": 0.9889504909515381,
"learning_rate": 7.874381098477597e-07,
"loss": 0.6828,
"step": 807
},
{
"epoch": 1.033282662613009,
"grad_norm": 0.6382724642753601,
"learning_rate": 7.869100124162656e-07,
"loss": 0.7001,
"step": 808
},
{
"epoch": 1.0345627650212017,
"grad_norm": 0.4228520095348358,
"learning_rate": 7.863814632117531e-07,
"loss": 0.6639,
"step": 809
},
{
"epoch": 1.0358428674293942,
"grad_norm": 1.2064498662948608,
"learning_rate": 7.858524632421333e-07,
"loss": 0.6767,
"step": 810
},
{
"epoch": 1.0358428674293942,
"eval_loss": 0.020557139068841934,
"eval_runtime": 42.0148,
"eval_samples_per_second": 11.805,
"eval_steps_per_second": 1.476,
"step": 810
},
{
"epoch": 1.037122969837587,
"grad_norm": 0.8042521476745605,
"learning_rate": 7.853230135161765e-07,
"loss": 0.6906,
"step": 811
},
{
"epoch": 1.0384030722457798,
"grad_norm": 0.6035192608833313,
"learning_rate": 7.847931150435122e-07,
"loss": 0.6942,
"step": 812
},
{
"epoch": 1.0396831746539723,
"grad_norm": 0.4148562252521515,
"learning_rate": 7.842627688346238e-07,
"loss": 0.7067,
"step": 813
},
{
"epoch": 1.040963277062165,
"grad_norm": 0.9750702977180481,
"learning_rate": 7.837319759008497e-07,
"loss": 0.694,
"step": 814
},
{
"epoch": 1.0422433794703576,
"grad_norm": 0.8575407862663269,
"learning_rate": 7.832007372543797e-07,
"loss": 0.6635,
"step": 815
},
{
"epoch": 1.0435234818785504,
"grad_norm": 0.5474435687065125,
"learning_rate": 7.826690539082539e-07,
"loss": 0.6872,
"step": 816
},
{
"epoch": 1.044803584286743,
"grad_norm": 0.6381425261497498,
"learning_rate": 7.821369268763597e-07,
"loss": 0.6725,
"step": 817
},
{
"epoch": 1.0460836866949357,
"grad_norm": 1.992908239364624,
"learning_rate": 7.816043571734316e-07,
"loss": 0.6988,
"step": 818
},
{
"epoch": 1.0473637891031282,
"grad_norm": 2.57561993598938,
"learning_rate": 7.810713458150474e-07,
"loss": 0.6794,
"step": 819
},
{
"epoch": 1.048643891511321,
"grad_norm": 1.7567766904830933,
"learning_rate": 7.805378938176275e-07,
"loss": 0.6938,
"step": 820
},
{
"epoch": 1.0499239939195135,
"grad_norm": 0.6404883861541748,
"learning_rate": 7.800040021984325e-07,
"loss": 0.6822,
"step": 821
},
{
"epoch": 1.0512040963277063,
"grad_norm": 1.1196707487106323,
"learning_rate": 7.794696719755611e-07,
"loss": 0.6752,
"step": 822
},
{
"epoch": 1.0524841987358988,
"grad_norm": 2.2272937297821045,
"learning_rate": 7.789349041679489e-07,
"loss": 0.687,
"step": 823
},
{
"epoch": 1.0537643011440916,
"grad_norm": 1.86038339138031,
"learning_rate": 7.783996997953656e-07,
"loss": 0.6783,
"step": 824
},
{
"epoch": 1.0550444035522841,
"grad_norm": 1.9092817306518555,
"learning_rate": 7.778640598784136e-07,
"loss": 0.6761,
"step": 825
},
{
"epoch": 1.056324505960477,
"grad_norm": 0.75870281457901,
"learning_rate": 7.773279854385255e-07,
"loss": 0.6781,
"step": 826
},
{
"epoch": 1.0576046083686694,
"grad_norm": 0.7749569416046143,
"learning_rate": 7.767914774979627e-07,
"loss": 0.6863,
"step": 827
},
{
"epoch": 1.0588847107768622,
"grad_norm": 0.7584654688835144,
"learning_rate": 7.762545370798134e-07,
"loss": 0.6582,
"step": 828
},
{
"epoch": 1.0601648131850547,
"grad_norm": 1.284524917602539,
"learning_rate": 7.757171652079904e-07,
"loss": 0.6884,
"step": 829
},
{
"epoch": 1.0614449155932475,
"grad_norm": 0.41432639956474304,
"learning_rate": 7.751793629072291e-07,
"loss": 0.6802,
"step": 830
},
{
"epoch": 1.06272501800144,
"grad_norm": 0.5820539593696594,
"learning_rate": 7.746411312030861e-07,
"loss": 0.6857,
"step": 831
},
{
"epoch": 1.0640051204096328,
"grad_norm": 0.39010608196258545,
"learning_rate": 7.741024711219365e-07,
"loss": 0.6827,
"step": 832
},
{
"epoch": 1.0652852228178253,
"grad_norm": 1.1412655115127563,
"learning_rate": 7.735633836909723e-07,
"loss": 0.6893,
"step": 833
},
{
"epoch": 1.066565325226018,
"grad_norm": 0.4019696116447449,
"learning_rate": 7.730238699382007e-07,
"loss": 0.693,
"step": 834
},
{
"epoch": 1.0678454276342106,
"grad_norm": 1.4895787239074707,
"learning_rate": 7.724839308924416e-07,
"loss": 0.6956,
"step": 835
},
{
"epoch": 1.0691255300424034,
"grad_norm": 0.40033113956451416,
"learning_rate": 7.719435675833258e-07,
"loss": 0.6767,
"step": 836
},
{
"epoch": 1.070405632450596,
"grad_norm": 0.6502126455307007,
"learning_rate": 7.714027810412937e-07,
"loss": 0.6803,
"step": 837
},
{
"epoch": 1.0716857348587887,
"grad_norm": 0.6411004662513733,
"learning_rate": 7.708615722975922e-07,
"loss": 0.6801,
"step": 838
},
{
"epoch": 1.0729658372669815,
"grad_norm": 0.47574731707572937,
"learning_rate": 7.703199423842735e-07,
"loss": 0.6943,
"step": 839
},
{
"epoch": 1.074245939675174,
"grad_norm": 0.7577368021011353,
"learning_rate": 7.697778923341931e-07,
"loss": 0.6832,
"step": 840
},
{
"epoch": 1.074245939675174,
"eval_loss": 0.020497383549809456,
"eval_runtime": 42.0176,
"eval_samples_per_second": 11.805,
"eval_steps_per_second": 1.476,
"step": 840
},
{
"epoch": 1.0755260420833668,
"grad_norm": 0.596855103969574,
"learning_rate": 7.692354231810076e-07,
"loss": 0.6833,
"step": 841
},
{
"epoch": 1.0768061444915593,
"grad_norm": 0.4002991020679474,
"learning_rate": 7.686925359591726e-07,
"loss": 0.685,
"step": 842
},
{
"epoch": 1.078086246899752,
"grad_norm": 0.5130592584609985,
"learning_rate": 7.681492317039414e-07,
"loss": 0.6914,
"step": 843
},
{
"epoch": 1.0793663493079446,
"grad_norm": 0.5623389482498169,
"learning_rate": 7.676055114513618e-07,
"loss": 0.6892,
"step": 844
},
{
"epoch": 1.0806464517161374,
"grad_norm": 1.1263748407363892,
"learning_rate": 7.670613762382756e-07,
"loss": 0.6699,
"step": 845
},
{
"epoch": 1.08192655412433,
"grad_norm": 0.4972497224807739,
"learning_rate": 7.665168271023155e-07,
"loss": 0.6813,
"step": 846
},
{
"epoch": 1.0832066565325227,
"grad_norm": 0.9748055338859558,
"learning_rate": 7.659718650819039e-07,
"loss": 0.6956,
"step": 847
},
{
"epoch": 1.0844867589407152,
"grad_norm": 1.449137806892395,
"learning_rate": 7.654264912162499e-07,
"loss": 0.6856,
"step": 848
},
{
"epoch": 1.085766861348908,
"grad_norm": 0.37270116806030273,
"learning_rate": 7.648807065453489e-07,
"loss": 0.6895,
"step": 849
},
{
"epoch": 1.0870469637571005,
"grad_norm": 1.356169581413269,
"learning_rate": 7.643345121099788e-07,
"loss": 0.6755,
"step": 850
},
{
"epoch": 1.0883270661652933,
"grad_norm": 0.8227845430374146,
"learning_rate": 7.637879089516992e-07,
"loss": 0.6938,
"step": 851
},
{
"epoch": 1.0896071685734858,
"grad_norm": 0.9096874594688416,
"learning_rate": 7.632408981128493e-07,
"loss": 0.6683,
"step": 852
},
{
"epoch": 1.0908872709816786,
"grad_norm": 1.1273614168167114,
"learning_rate": 7.626934806365456e-07,
"loss": 0.6676,
"step": 853
},
{
"epoch": 1.0921673733898711,
"grad_norm": 1.7035897970199585,
"learning_rate": 7.621456575666801e-07,
"loss": 0.6977,
"step": 854
},
{
"epoch": 1.093447475798064,
"grad_norm": 0.5126929879188538,
"learning_rate": 7.615974299479179e-07,
"loss": 0.6916,
"step": 855
},
{
"epoch": 1.0947275782062564,
"grad_norm": 0.4571192264556885,
"learning_rate": 7.610487988256959e-07,
"loss": 0.685,
"step": 856
},
{
"epoch": 1.0960076806144492,
"grad_norm": 0.4030444622039795,
"learning_rate": 7.604997652462204e-07,
"loss": 0.6973,
"step": 857
},
{
"epoch": 1.0972877830226417,
"grad_norm": 0.8501233458518982,
"learning_rate": 7.59950330256465e-07,
"loss": 0.6756,
"step": 858
},
{
"epoch": 1.0985678854308345,
"grad_norm": 0.39168065786361694,
"learning_rate": 7.594004949041691e-07,
"loss": 0.6581,
"step": 859
},
{
"epoch": 1.099847987839027,
"grad_norm": 0.46270155906677246,
"learning_rate": 7.588502602378353e-07,
"loss": 0.6656,
"step": 860
},
{
"epoch": 1.1011280902472198,
"grad_norm": 0.4052952229976654,
"learning_rate": 7.582996273067276e-07,
"loss": 0.683,
"step": 861
},
{
"epoch": 1.1024081926554123,
"grad_norm": 0.781087338924408,
"learning_rate": 7.577485971608698e-07,
"loss": 0.6843,
"step": 862
},
{
"epoch": 1.103688295063605,
"grad_norm": 1.425502896308899,
"learning_rate": 7.571971708510426e-07,
"loss": 0.6788,
"step": 863
},
{
"epoch": 1.1049683974717976,
"grad_norm": 0.5255923867225647,
"learning_rate": 7.566453494287829e-07,
"loss": 0.6717,
"step": 864
},
{
"epoch": 1.1062484998799904,
"grad_norm": 1.393507957458496,
"learning_rate": 7.560931339463804e-07,
"loss": 0.6828,
"step": 865
},
{
"epoch": 1.107528602288183,
"grad_norm": 0.48503801226615906,
"learning_rate": 7.555405254568766e-07,
"loss": 0.675,
"step": 866
},
{
"epoch": 1.1088087046963757,
"grad_norm": 0.764251708984375,
"learning_rate": 7.549875250140624e-07,
"loss": 0.69,
"step": 867
},
{
"epoch": 1.1100888071045683,
"grad_norm": 0.8105603456497192,
"learning_rate": 7.544341336724759e-07,
"loss": 0.6709,
"step": 868
},
{
"epoch": 1.111368909512761,
"grad_norm": 1.138421654701233,
"learning_rate": 7.538803524874013e-07,
"loss": 0.6732,
"step": 869
},
{
"epoch": 1.1126490119209538,
"grad_norm": 0.7081236243247986,
"learning_rate": 7.533261825148652e-07,
"loss": 0.703,
"step": 870
},
{
"epoch": 1.1126490119209538,
"eval_loss": 0.020532110705971718,
"eval_runtime": 42.123,
"eval_samples_per_second": 11.775,
"eval_steps_per_second": 1.472,
"step": 870
},
{
"epoch": 1.1139291143291463,
"grad_norm": 0.894440233707428,
"learning_rate": 7.527716248116364e-07,
"loss": 0.665,
"step": 871
},
{
"epoch": 1.115209216737339,
"grad_norm": 0.4775767922401428,
"learning_rate": 7.522166804352226e-07,
"loss": 0.6683,
"step": 872
},
{
"epoch": 1.1164893191455316,
"grad_norm": 0.4611867368221283,
"learning_rate": 7.516613504438691e-07,
"loss": 0.6981,
"step": 873
},
{
"epoch": 1.1177694215537244,
"grad_norm": 0.7616720199584961,
"learning_rate": 7.511056358965566e-07,
"loss": 0.6584,
"step": 874
},
{
"epoch": 1.119049523961917,
"grad_norm": 0.46075233817100525,
"learning_rate": 7.50549537852999e-07,
"loss": 0.6871,
"step": 875
},
{
"epoch": 1.1203296263701097,
"grad_norm": 0.8921419382095337,
"learning_rate": 7.499930573736415e-07,
"loss": 0.6732,
"step": 876
},
{
"epoch": 1.1216097287783022,
"grad_norm": 1.7196431159973145,
"learning_rate": 7.494361955196586e-07,
"loss": 0.7012,
"step": 877
},
{
"epoch": 1.122889831186495,
"grad_norm": 1.0632987022399902,
"learning_rate": 7.48878953352952e-07,
"loss": 0.6646,
"step": 878
},
{
"epoch": 1.1241699335946875,
"grad_norm": 0.4515886604785919,
"learning_rate": 7.483213319361488e-07,
"loss": 0.6806,
"step": 879
},
{
"epoch": 1.1254500360028803,
"grad_norm": 0.5389161109924316,
"learning_rate": 7.477633323325993e-07,
"loss": 0.6694,
"step": 880
},
{
"epoch": 1.1267301384110728,
"grad_norm": 0.4314780831336975,
"learning_rate": 7.472049556063746e-07,
"loss": 0.6808,
"step": 881
},
{
"epoch": 1.1280102408192656,
"grad_norm": 0.7927844524383545,
"learning_rate": 7.466462028222655e-07,
"loss": 0.6859,
"step": 882
},
{
"epoch": 1.1292903432274581,
"grad_norm": 0.4933050870895386,
"learning_rate": 7.460870750457794e-07,
"loss": 0.674,
"step": 883
},
{
"epoch": 1.130570445635651,
"grad_norm": 0.4203268587589264,
"learning_rate": 7.455275733431395e-07,
"loss": 0.6667,
"step": 884
},
{
"epoch": 1.1318505480438434,
"grad_norm": 1.8763399124145508,
"learning_rate": 7.44967698781281e-07,
"loss": 0.6637,
"step": 885
},
{
"epoch": 1.1331306504520362,
"grad_norm": 0.8152745962142944,
"learning_rate": 7.444074524278511e-07,
"loss": 0.6916,
"step": 886
},
{
"epoch": 1.1344107528602287,
"grad_norm": 0.40302833914756775,
"learning_rate": 7.438468353512055e-07,
"loss": 0.6773,
"step": 887
},
{
"epoch": 1.1356908552684215,
"grad_norm": 0.49966704845428467,
"learning_rate": 7.43285848620407e-07,
"loss": 0.6943,
"step": 888
},
{
"epoch": 1.136970957676614,
"grad_norm": 1.1931142807006836,
"learning_rate": 7.427244933052233e-07,
"loss": 0.6677,
"step": 889
},
{
"epoch": 1.1382510600848068,
"grad_norm": 0.5937730669975281,
"learning_rate": 7.421627704761246e-07,
"loss": 0.6723,
"step": 890
},
{
"epoch": 1.1395311624929993,
"grad_norm": 0.4531826674938202,
"learning_rate": 7.416006812042827e-07,
"loss": 0.6682,
"step": 891
},
{
"epoch": 1.1408112649011921,
"grad_norm": 0.7853236198425293,
"learning_rate": 7.410382265615674e-07,
"loss": 0.6735,
"step": 892
},
{
"epoch": 1.1420913673093849,
"grad_norm": 1.2373019456863403,
"learning_rate": 7.404754076205459e-07,
"loss": 0.6731,
"step": 893
},
{
"epoch": 1.1433714697175774,
"grad_norm": 0.6332933306694031,
"learning_rate": 7.399122254544794e-07,
"loss": 0.6738,
"step": 894
},
{
"epoch": 1.14465157212577,
"grad_norm": 1.1668685674667358,
"learning_rate": 7.393486811373224e-07,
"loss": 0.6952,
"step": 895
},
{
"epoch": 1.1459316745339627,
"grad_norm": 0.5281875133514404,
"learning_rate": 7.387847757437196e-07,
"loss": 0.6781,
"step": 896
},
{
"epoch": 1.1472117769421555,
"grad_norm": 0.7266621589660645,
"learning_rate": 7.382205103490042e-07,
"loss": 0.6844,
"step": 897
},
{
"epoch": 1.148491879350348,
"grad_norm": 0.43718716502189636,
"learning_rate": 7.376558860291965e-07,
"loss": 0.6784,
"step": 898
},
{
"epoch": 1.1497719817585406,
"grad_norm": 1.0780441761016846,
"learning_rate": 7.370909038610005e-07,
"loss": 0.6631,
"step": 899
},
{
"epoch": 1.1510520841667333,
"grad_norm": 1.053000807762146,
"learning_rate": 7.36525564921803e-07,
"loss": 0.6991,
"step": 900
},
{
"epoch": 1.1510520841667333,
"eval_loss": 0.020543841645121574,
"eval_runtime": 42.2352,
"eval_samples_per_second": 11.744,
"eval_steps_per_second": 1.468,
"step": 900
},
{
"epoch": 1.152332186574926,
"grad_norm": 2.3958194255828857,
"learning_rate": 7.359598702896709e-07,
"loss": 0.6762,
"step": 901
},
{
"epoch": 1.1536122889831186,
"grad_norm": 0.7371974587440491,
"learning_rate": 7.3539382104335e-07,
"loss": 0.6823,
"step": 902
},
{
"epoch": 1.1548923913913114,
"grad_norm": 1.5400575399398804,
"learning_rate": 7.348274182622613e-07,
"loss": 0.6802,
"step": 903
},
{
"epoch": 1.156172493799504,
"grad_norm": 0.76230388879776,
"learning_rate": 7.342606630265008e-07,
"loss": 0.6836,
"step": 904
},
{
"epoch": 1.1574525962076967,
"grad_norm": 0.7071508765220642,
"learning_rate": 7.336935564168363e-07,
"loss": 0.6904,
"step": 905
},
{
"epoch": 1.1587326986158892,
"grad_norm": 0.568476140499115,
"learning_rate": 7.331260995147057e-07,
"loss": 0.6782,
"step": 906
},
{
"epoch": 1.160012801024082,
"grad_norm": 0.5799767374992371,
"learning_rate": 7.32558293402215e-07,
"loss": 0.6694,
"step": 907
},
{
"epoch": 1.1612929034322745,
"grad_norm": 0.43046560883522034,
"learning_rate": 7.319901391621358e-07,
"loss": 0.6834,
"step": 908
},
{
"epoch": 1.1625730058404673,
"grad_norm": 0.48199447989463806,
"learning_rate": 7.314216378779039e-07,
"loss": 0.6879,
"step": 909
},
{
"epoch": 1.1638531082486598,
"grad_norm": 1.060200810432434,
"learning_rate": 7.308527906336167e-07,
"loss": 0.6722,
"step": 910
},
{
"epoch": 1.1651332106568526,
"grad_norm": 0.7335535883903503,
"learning_rate": 7.302835985140315e-07,
"loss": 0.6686,
"step": 911
},
{
"epoch": 1.1664133130650451,
"grad_norm": 0.43378928303718567,
"learning_rate": 7.297140626045629e-07,
"loss": 0.6695,
"step": 912
},
{
"epoch": 1.167693415473238,
"grad_norm": 0.5960014462471008,
"learning_rate": 7.291441839912817e-07,
"loss": 0.6514,
"step": 913
},
{
"epoch": 1.1689735178814304,
"grad_norm": 1.2673043012619019,
"learning_rate": 7.285739637609113e-07,
"loss": 0.6808,
"step": 914
},
{
"epoch": 1.1702536202896232,
"grad_norm": 0.40168991684913635,
"learning_rate": 7.280034030008276e-07,
"loss": 0.6681,
"step": 915
},
{
"epoch": 1.1715337226978157,
"grad_norm": 1.0041136741638184,
"learning_rate": 7.274325027990549e-07,
"loss": 0.6796,
"step": 916
},
{
"epoch": 1.1728138251060085,
"grad_norm": 0.37877488136291504,
"learning_rate": 7.268612642442656e-07,
"loss": 0.6814,
"step": 917
},
{
"epoch": 1.174093927514201,
"grad_norm": 0.8861886262893677,
"learning_rate": 7.262896884257768e-07,
"loss": 0.6659,
"step": 918
},
{
"epoch": 1.1753740299223938,
"grad_norm": 1.6074557304382324,
"learning_rate": 7.25717776433549e-07,
"loss": 0.6894,
"step": 919
},
{
"epoch": 1.1766541323305864,
"grad_norm": 2.1874148845672607,
"learning_rate": 7.251455293581835e-07,
"loss": 0.6854,
"step": 920
},
{
"epoch": 1.1779342347387791,
"grad_norm": 1.335900068283081,
"learning_rate": 7.24572948290921e-07,
"loss": 0.6897,
"step": 921
},
{
"epoch": 1.1792143371469717,
"grad_norm": 2.0427908897399902,
"learning_rate": 7.240000343236385e-07,
"loss": 0.6767,
"step": 922
},
{
"epoch": 1.1804944395551644,
"grad_norm": 0.5181105136871338,
"learning_rate": 7.234267885488485e-07,
"loss": 0.6844,
"step": 923
},
{
"epoch": 1.1817745419633572,
"grad_norm": 0.4850052297115326,
"learning_rate": 7.228532120596956e-07,
"loss": 0.6779,
"step": 924
},
{
"epoch": 1.1830546443715497,
"grad_norm": 3.076356887817383,
"learning_rate": 7.222793059499558e-07,
"loss": 0.6596,
"step": 925
},
{
"epoch": 1.1843347467797423,
"grad_norm": 3.2298052310943604,
"learning_rate": 7.217050713140328e-07,
"loss": 0.6793,
"step": 926
},
{
"epoch": 1.185614849187935,
"grad_norm": 3.4464282989501953,
"learning_rate": 7.211305092469576e-07,
"loss": 0.6685,
"step": 927
},
{
"epoch": 1.1868949515961278,
"grad_norm": 4.43187952041626,
"learning_rate": 7.205556208443847e-07,
"loss": 0.6937,
"step": 928
},
{
"epoch": 1.1881750540043203,
"grad_norm": 2.211535930633545,
"learning_rate": 7.199804072025919e-07,
"loss": 0.6767,
"step": 929
},
{
"epoch": 1.189455156412513,
"grad_norm": 1.3217605352401733,
"learning_rate": 7.194048694184763e-07,
"loss": 0.6862,
"step": 930
},
{
"epoch": 1.189455156412513,
"eval_loss": 0.020434025675058365,
"eval_runtime": 42.0408,
"eval_samples_per_second": 11.798,
"eval_steps_per_second": 1.475,
"step": 930
},
{
"epoch": 1.1907352588207056,
"grad_norm": 0.7160547375679016,
"learning_rate": 7.18829008589554e-07,
"loss": 0.6729,
"step": 931
},
{
"epoch": 1.1920153612288984,
"grad_norm": 2.5587425231933594,
"learning_rate": 7.182528258139561e-07,
"loss": 0.6713,
"step": 932
},
{
"epoch": 1.193295463637091,
"grad_norm": 2.934382915496826,
"learning_rate": 7.176763221904286e-07,
"loss": 0.6594,
"step": 933
},
{
"epoch": 1.1945755660452837,
"grad_norm": 2.2905616760253906,
"learning_rate": 7.170994988183289e-07,
"loss": 0.6476,
"step": 934
},
{
"epoch": 1.1958556684534762,
"grad_norm": 3.0419278144836426,
"learning_rate": 7.165223567976239e-07,
"loss": 0.6766,
"step": 935
},
{
"epoch": 1.197135770861669,
"grad_norm": 3.3169689178466797,
"learning_rate": 7.159448972288888e-07,
"loss": 0.687,
"step": 936
},
{
"epoch": 1.1984158732698615,
"grad_norm": 2.701469659805298,
"learning_rate": 7.153671212133036e-07,
"loss": 0.6729,
"step": 937
},
{
"epoch": 1.1996959756780543,
"grad_norm": 1.5976871252059937,
"learning_rate": 7.147890298526523e-07,
"loss": 0.6502,
"step": 938
},
{
"epoch": 1.2009760780862468,
"grad_norm": 0.6515759825706482,
"learning_rate": 7.1421062424932e-07,
"loss": 0.6644,
"step": 939
},
{
"epoch": 1.2022561804944396,
"grad_norm": 2.639430046081543,
"learning_rate": 7.136319055062911e-07,
"loss": 0.6815,
"step": 940
},
{
"epoch": 1.2035362829026321,
"grad_norm": 3.5913476943969727,
"learning_rate": 7.130528747271471e-07,
"loss": 0.668,
"step": 941
},
{
"epoch": 1.204816385310825,
"grad_norm": 3.8594934940338135,
"learning_rate": 7.124735330160647e-07,
"loss": 0.6535,
"step": 942
},
{
"epoch": 1.2060964877190175,
"grad_norm": 3.640683174133301,
"learning_rate": 7.118938814778131e-07,
"loss": 0.6794,
"step": 943
},
{
"epoch": 1.2073765901272102,
"grad_norm": 4.632922649383545,
"learning_rate": 7.113139212177529e-07,
"loss": 0.6899,
"step": 944
},
{
"epoch": 1.2086566925354028,
"grad_norm": 1.8212755918502808,
"learning_rate": 7.107336533418329e-07,
"loss": 0.6649,
"step": 945
},
{
"epoch": 1.2099367949435955,
"grad_norm": 2.004613161087036,
"learning_rate": 7.10153078956589e-07,
"loss": 0.6899,
"step": 946
},
{
"epoch": 1.211216897351788,
"grad_norm": 0.39641427993774414,
"learning_rate": 7.09572199169141e-07,
"loss": 0.6654,
"step": 947
},
{
"epoch": 1.2124969997599808,
"grad_norm": 3.110231637954712,
"learning_rate": 7.089910150871917e-07,
"loss": 0.7036,
"step": 948
},
{
"epoch": 1.2137771021681734,
"grad_norm": 3.191833257675171,
"learning_rate": 7.084095278190236e-07,
"loss": 0.67,
"step": 949
},
{
"epoch": 1.2150572045763661,
"grad_norm": 2.9252684116363525,
"learning_rate": 7.078277384734978e-07,
"loss": 0.6701,
"step": 950
},
{
"epoch": 1.2163373069845589,
"grad_norm": 4.220887660980225,
"learning_rate": 7.072456481600516e-07,
"loss": 0.6909,
"step": 951
},
{
"epoch": 1.2176174093927514,
"grad_norm": 2.17702579498291,
"learning_rate": 7.066632579886951e-07,
"loss": 0.6944,
"step": 952
},
{
"epoch": 1.218897511800944,
"grad_norm": 2.6868855953216553,
"learning_rate": 7.060805690700119e-07,
"loss": 0.6488,
"step": 953
},
{
"epoch": 1.2201776142091367,
"grad_norm": 1.0425877571105957,
"learning_rate": 7.054975825151539e-07,
"loss": 0.6658,
"step": 954
},
{
"epoch": 1.2214577166173295,
"grad_norm": 1.281869649887085,
"learning_rate": 7.049142994358411e-07,
"loss": 0.6666,
"step": 955
},
{
"epoch": 1.222737819025522,
"grad_norm": 1.7749693393707275,
"learning_rate": 7.043307209443591e-07,
"loss": 0.6622,
"step": 956
},
{
"epoch": 1.2240179214337146,
"grad_norm": 1.9906210899353027,
"learning_rate": 7.037468481535566e-07,
"loss": 0.658,
"step": 957
},
{
"epoch": 1.2252980238419073,
"grad_norm": 3.294895887374878,
"learning_rate": 7.031626821768436e-07,
"loss": 0.6688,
"step": 958
},
{
"epoch": 1.2265781262501,
"grad_norm": 2.4908313751220703,
"learning_rate": 7.025782241281893e-07,
"loss": 0.6918,
"step": 959
},
{
"epoch": 1.2278582286582926,
"grad_norm": 0.8760585188865662,
"learning_rate": 7.019934751221194e-07,
"loss": 0.6715,
"step": 960
},
{
"epoch": 1.2278582286582926,
"eval_loss": 0.0204321276396513,
"eval_runtime": 42.1397,
"eval_samples_per_second": 11.77,
"eval_steps_per_second": 1.471,
"step": 960
},
{
"epoch": 1.2291383310664854,
"grad_norm": 0.9686982035636902,
"learning_rate": 7.014084362737152e-07,
"loss": 0.6443,
"step": 961
},
{
"epoch": 1.230418433474678,
"grad_norm": 0.6498221755027771,
"learning_rate": 7.008231086986097e-07,
"loss": 0.6757,
"step": 962
},
{
"epoch": 1.2316985358828707,
"grad_norm": 0.954429030418396,
"learning_rate": 7.002374935129878e-07,
"loss": 0.6617,
"step": 963
},
{
"epoch": 1.2329786382910632,
"grad_norm": 1.3566386699676514,
"learning_rate": 6.996515918335814e-07,
"loss": 0.6773,
"step": 964
},
{
"epoch": 1.234258740699256,
"grad_norm": 0.9798348546028137,
"learning_rate": 6.990654047776701e-07,
"loss": 0.6804,
"step": 965
},
{
"epoch": 1.2355388431074485,
"grad_norm": 0.36472949385643005,
"learning_rate": 6.984789334630767e-07,
"loss": 0.6941,
"step": 966
},
{
"epoch": 1.2368189455156413,
"grad_norm": 0.6192675232887268,
"learning_rate": 6.978921790081665e-07,
"loss": 0.6587,
"step": 967
},
{
"epoch": 1.2380990479238339,
"grad_norm": 1.8698980808258057,
"learning_rate": 6.973051425318445e-07,
"loss": 0.6798,
"step": 968
},
{
"epoch": 1.2393791503320266,
"grad_norm": 2.300565004348755,
"learning_rate": 6.967178251535538e-07,
"loss": 0.6718,
"step": 969
},
{
"epoch": 1.2406592527402192,
"grad_norm": 2.7261533737182617,
"learning_rate": 6.961302279932729e-07,
"loss": 0.6685,
"step": 970
},
{
"epoch": 1.241939355148412,
"grad_norm": 3.2374720573425293,
"learning_rate": 6.955423521715142e-07,
"loss": 0.6662,
"step": 971
},
{
"epoch": 1.2432194575566045,
"grad_norm": 2.060549020767212,
"learning_rate": 6.949541988093207e-07,
"loss": 0.6673,
"step": 972
},
{
"epoch": 1.2444995599647972,
"grad_norm": 0.5342932343482971,
"learning_rate": 6.943657690282656e-07,
"loss": 0.6558,
"step": 973
},
{
"epoch": 1.2457796623729898,
"grad_norm": 0.7281977534294128,
"learning_rate": 6.937770639504487e-07,
"loss": 0.6856,
"step": 974
},
{
"epoch": 1.2470597647811825,
"grad_norm": 1.6199723482131958,
"learning_rate": 6.931880846984949e-07,
"loss": 0.6691,
"step": 975
},
{
"epoch": 1.248339867189375,
"grad_norm": 3.3473904132843018,
"learning_rate": 6.925988323955518e-07,
"loss": 0.692,
"step": 976
},
{
"epoch": 1.2496199695975678,
"grad_norm": 2.2117726802825928,
"learning_rate": 6.920093081652878e-07,
"loss": 0.6498,
"step": 977
},
{
"epoch": 1.2509000720057606,
"grad_norm": 2.3039209842681885,
"learning_rate": 6.914195131318898e-07,
"loss": 0.6889,
"step": 978
},
{
"epoch": 1.2521801744139531,
"grad_norm": 1.6228289604187012,
"learning_rate": 6.908294484200612e-07,
"loss": 0.6761,
"step": 979
},
{
"epoch": 1.2534602768221457,
"grad_norm": 0.5737580060958862,
"learning_rate": 6.902391151550196e-07,
"loss": 0.6791,
"step": 980
},
{
"epoch": 1.2547403792303384,
"grad_norm": 1.1989716291427612,
"learning_rate": 6.896485144624948e-07,
"loss": 0.6786,
"step": 981
},
{
"epoch": 1.2560204816385312,
"grad_norm": 1.288958191871643,
"learning_rate": 6.890576474687263e-07,
"loss": 0.6789,
"step": 982
},
{
"epoch": 1.2573005840467237,
"grad_norm": 1.6760433912277222,
"learning_rate": 6.884665153004619e-07,
"loss": 0.689,
"step": 983
},
{
"epoch": 1.2585806864549163,
"grad_norm": 1.3740628957748413,
"learning_rate": 6.878751190849542e-07,
"loss": 0.6735,
"step": 984
},
{
"epoch": 1.259860788863109,
"grad_norm": 0.9336888790130615,
"learning_rate": 6.872834599499606e-07,
"loss": 0.663,
"step": 985
},
{
"epoch": 1.2611408912713018,
"grad_norm": 0.9038626551628113,
"learning_rate": 6.866915390237387e-07,
"loss": 0.6775,
"step": 986
},
{
"epoch": 1.2624209936794943,
"grad_norm": 0.910187304019928,
"learning_rate": 6.86099357435046e-07,
"loss": 0.6748,
"step": 987
},
{
"epoch": 1.2637010960876869,
"grad_norm": 0.3547734022140503,
"learning_rate": 6.855069163131367e-07,
"loss": 0.6734,
"step": 988
},
{
"epoch": 1.2649811984958796,
"grad_norm": 0.5283913612365723,
"learning_rate": 6.849142167877604e-07,
"loss": 0.6577,
"step": 989
},
{
"epoch": 1.2662613009040724,
"grad_norm": 0.5148858428001404,
"learning_rate": 6.843212599891587e-07,
"loss": 0.6642,
"step": 990
},
{
"epoch": 1.2662613009040724,
"eval_loss": 0.020405089482665062,
"eval_runtime": 42.0112,
"eval_samples_per_second": 11.806,
"eval_steps_per_second": 1.476,
"step": 990
},
{
"epoch": 1.267541403312265,
"grad_norm": 0.4507172107696533,
"learning_rate": 6.837280470480645e-07,
"loss": 0.681,
"step": 991
},
{
"epoch": 1.2688215057204577,
"grad_norm": 0.731308102607727,
"learning_rate": 6.831345790956986e-07,
"loss": 0.6729,
"step": 992
},
{
"epoch": 1.2701016081286503,
"grad_norm": 0.41501274704933167,
"learning_rate": 6.825408572637689e-07,
"loss": 0.6541,
"step": 993
},
{
"epoch": 1.271381710536843,
"grad_norm": 0.8684238195419312,
"learning_rate": 6.819468826844665e-07,
"loss": 0.6566,
"step": 994
},
{
"epoch": 1.2726618129450356,
"grad_norm": 0.7077449560165405,
"learning_rate": 6.813526564904651e-07,
"loss": 0.6796,
"step": 995
},
{
"epoch": 1.2739419153532283,
"grad_norm": 1.718634009361267,
"learning_rate": 6.807581798149177e-07,
"loss": 0.657,
"step": 996
},
{
"epoch": 1.2752220177614209,
"grad_norm": 1.1301251649856567,
"learning_rate": 6.801634537914555e-07,
"loss": 0.6834,
"step": 997
},
{
"epoch": 1.2765021201696136,
"grad_norm": 1.1063438653945923,
"learning_rate": 6.795684795541847e-07,
"loss": 0.6845,
"step": 998
},
{
"epoch": 1.2777822225778062,
"grad_norm": 0.8343043923377991,
"learning_rate": 6.789732582376854e-07,
"loss": 0.656,
"step": 999
},
{
"epoch": 1.279062324985999,
"grad_norm": 0.6101583242416382,
"learning_rate": 6.783777909770083e-07,
"loss": 0.6674,
"step": 1000
},
{
"epoch": 1.2803424273941915,
"grad_norm": 0.6108996272087097,
"learning_rate": 6.777820789076738e-07,
"loss": 0.6364,
"step": 1001
},
{
"epoch": 1.2816225298023842,
"grad_norm": 1.2212913036346436,
"learning_rate": 6.771861231656678e-07,
"loss": 0.6817,
"step": 1002
},
{
"epoch": 1.2829026322105768,
"grad_norm": 0.42153313755989075,
"learning_rate": 6.765899248874423e-07,
"loss": 0.6568,
"step": 1003
},
{
"epoch": 1.2841827346187695,
"grad_norm": 0.3836733102798462,
"learning_rate": 6.759934852099113e-07,
"loss": 0.6851,
"step": 1004
},
{
"epoch": 1.2854628370269623,
"grad_norm": 1.8300576210021973,
"learning_rate": 6.753968052704488e-07,
"loss": 0.6568,
"step": 1005
},
{
"epoch": 1.2867429394351548,
"grad_norm": 1.705394983291626,
"learning_rate": 6.747998862068876e-07,
"loss": 0.6838,
"step": 1006
},
{
"epoch": 1.2880230418433474,
"grad_norm": 0.672909140586853,
"learning_rate": 6.742027291575156e-07,
"loss": 0.6802,
"step": 1007
},
{
"epoch": 1.2893031442515401,
"grad_norm": 1.2077293395996094,
"learning_rate": 6.736053352610755e-07,
"loss": 0.6644,
"step": 1008
},
{
"epoch": 1.290583246659733,
"grad_norm": 0.46573755145072937,
"learning_rate": 6.730077056567611e-07,
"loss": 0.6709,
"step": 1009
},
{
"epoch": 1.2918633490679254,
"grad_norm": 1.2819255590438843,
"learning_rate": 6.724098414842158e-07,
"loss": 0.6706,
"step": 1010
},
{
"epoch": 1.293143451476118,
"grad_norm": 2.720734119415283,
"learning_rate": 6.718117438835302e-07,
"loss": 0.6822,
"step": 1011
},
{
"epoch": 1.2944235538843107,
"grad_norm": 3.2891242504119873,
"learning_rate": 6.712134139952403e-07,
"loss": 0.6718,
"step": 1012
},
{
"epoch": 1.2957036562925035,
"grad_norm": 1.871261715888977,
"learning_rate": 6.706148529603248e-07,
"loss": 0.6786,
"step": 1013
},
{
"epoch": 1.296983758700696,
"grad_norm": 1.8228929042816162,
"learning_rate": 6.700160619202032e-07,
"loss": 0.662,
"step": 1014
},
{
"epoch": 1.2982638611088886,
"grad_norm": 0.42994123697280884,
"learning_rate": 6.694170420167338e-07,
"loss": 0.6654,
"step": 1015
},
{
"epoch": 1.2995439635170813,
"grad_norm": 2.0840930938720703,
"learning_rate": 6.688177943922112e-07,
"loss": 0.6456,
"step": 1016
},
{
"epoch": 1.300824065925274,
"grad_norm": 1.4526396989822388,
"learning_rate": 6.68218320189364e-07,
"loss": 0.6529,
"step": 1017
},
{
"epoch": 1.3021041683334666,
"grad_norm": 3.9268534183502197,
"learning_rate": 6.676186205513537e-07,
"loss": 0.6979,
"step": 1018
},
{
"epoch": 1.3033842707416594,
"grad_norm": 1.9589157104492188,
"learning_rate": 6.670186966217704e-07,
"loss": 0.673,
"step": 1019
},
{
"epoch": 1.304664373149852,
"grad_norm": 0.386042058467865,
"learning_rate": 6.664185495446334e-07,
"loss": 0.6805,
"step": 1020
},
{
"epoch": 1.304664373149852,
"eval_loss": 0.020405780524015427,
"eval_runtime": 42.0416,
"eval_samples_per_second": 11.798,
"eval_steps_per_second": 1.475,
"step": 1020
},
{
"epoch": 1.3059444755580447,
"grad_norm": 0.5376230478286743,
"learning_rate": 6.658181804643861e-07,
"loss": 0.6657,
"step": 1021
},
{
"epoch": 1.3072245779662373,
"grad_norm": 1.1283172369003296,
"learning_rate": 6.652175905258963e-07,
"loss": 0.6462,
"step": 1022
},
{
"epoch": 1.30850468037443,
"grad_norm": 1.3118997812271118,
"learning_rate": 6.646167808744523e-07,
"loss": 0.6652,
"step": 1023
},
{
"epoch": 1.3097847827826226,
"grad_norm": 0.8177453875541687,
"learning_rate": 6.640157526557618e-07,
"loss": 0.6706,
"step": 1024
},
{
"epoch": 1.3110648851908153,
"grad_norm": 0.35823681950569153,
"learning_rate": 6.634145070159493e-07,
"loss": 0.667,
"step": 1025
},
{
"epoch": 1.3123449875990079,
"grad_norm": 0.8362091183662415,
"learning_rate": 6.628130451015535e-07,
"loss": 0.6555,
"step": 1026
},
{
"epoch": 1.3136250900072006,
"grad_norm": 0.36832505464553833,
"learning_rate": 6.622113680595258e-07,
"loss": 0.6844,
"step": 1027
},
{
"epoch": 1.3149051924153932,
"grad_norm": 0.4041096270084381,
"learning_rate": 6.61609477037228e-07,
"loss": 0.6783,
"step": 1028
},
{
"epoch": 1.316185294823586,
"grad_norm": 0.3950030207633972,
"learning_rate": 6.610073731824295e-07,
"loss": 0.6543,
"step": 1029
},
{
"epoch": 1.3174653972317785,
"grad_norm": 0.4062904715538025,
"learning_rate": 6.604050576433062e-07,
"loss": 0.677,
"step": 1030
},
{
"epoch": 1.3187454996399712,
"grad_norm": 1.2352319955825806,
"learning_rate": 6.598025315684368e-07,
"loss": 0.6721,
"step": 1031
},
{
"epoch": 1.3200256020481638,
"grad_norm": 1.1156471967697144,
"learning_rate": 6.591997961068024e-07,
"loss": 0.6665,
"step": 1032
},
{
"epoch": 1.3213057044563565,
"grad_norm": 0.6422211527824402,
"learning_rate": 6.585968524077826e-07,
"loss": 0.6609,
"step": 1033
},
{
"epoch": 1.322585806864549,
"grad_norm": 0.37219637632369995,
"learning_rate": 6.579937016211547e-07,
"loss": 0.668,
"step": 1034
},
{
"epoch": 1.3238659092727418,
"grad_norm": 2.088963747024536,
"learning_rate": 6.573903448970905e-07,
"loss": 0.6595,
"step": 1035
},
{
"epoch": 1.3251460116809346,
"grad_norm": 0.8334722518920898,
"learning_rate": 6.567867833861548e-07,
"loss": 0.6579,
"step": 1036
},
{
"epoch": 1.3264261140891271,
"grad_norm": 0.6673969626426697,
"learning_rate": 6.561830182393027e-07,
"loss": 0.6843,
"step": 1037
},
{
"epoch": 1.3277062164973197,
"grad_norm": 0.7796549201011658,
"learning_rate": 6.555790506078775e-07,
"loss": 0.6544,
"step": 1038
},
{
"epoch": 1.3289863189055124,
"grad_norm": 1.3010609149932861,
"learning_rate": 6.549748816436092e-07,
"loss": 0.6744,
"step": 1039
},
{
"epoch": 1.3302664213137052,
"grad_norm": 0.843010663986206,
"learning_rate": 6.54370512498611e-07,
"loss": 0.6538,
"step": 1040
},
{
"epoch": 1.3315465237218977,
"grad_norm": 1.4334732294082642,
"learning_rate": 6.537659443253787e-07,
"loss": 0.686,
"step": 1041
},
{
"epoch": 1.3328266261300903,
"grad_norm": 0.42318978905677795,
"learning_rate": 6.531611782767866e-07,
"loss": 0.6578,
"step": 1042
},
{
"epoch": 1.334106728538283,
"grad_norm": 1.354992389678955,
"learning_rate": 6.525562155060871e-07,
"loss": 0.6876,
"step": 1043
},
{
"epoch": 1.3353868309464758,
"grad_norm": 0.41942623257637024,
"learning_rate": 6.519510571669075e-07,
"loss": 0.6753,
"step": 1044
},
{
"epoch": 1.3366669333546684,
"grad_norm": 1.0365906953811646,
"learning_rate": 6.51345704413248e-07,
"loss": 0.6917,
"step": 1045
},
{
"epoch": 1.337947035762861,
"grad_norm": 0.7890437841415405,
"learning_rate": 6.507401583994793e-07,
"loss": 0.6911,
"step": 1046
},
{
"epoch": 1.3392271381710537,
"grad_norm": 1.4339604377746582,
"learning_rate": 6.501344202803414e-07,
"loss": 0.6744,
"step": 1047
},
{
"epoch": 1.3405072405792464,
"grad_norm": 1.0097036361694336,
"learning_rate": 6.495284912109399e-07,
"loss": 0.6539,
"step": 1048
},
{
"epoch": 1.341787342987439,
"grad_norm": 1.587397575378418,
"learning_rate": 6.489223723467447e-07,
"loss": 0.6739,
"step": 1049
},
{
"epoch": 1.3430674453956317,
"grad_norm": 0.8523529767990112,
"learning_rate": 6.483160648435879e-07,
"loss": 0.6742,
"step": 1050
},
{
"epoch": 1.3430674453956317,
"eval_loss": 0.020404193550348282,
"eval_runtime": 42.0933,
"eval_samples_per_second": 11.783,
"eval_steps_per_second": 1.473,
"step": 1050
},
{
"epoch": 1.3443475478038243,
"grad_norm": 0.48347529768943787,
"learning_rate": 6.477095698576608e-07,
"loss": 0.6597,
"step": 1051
},
{
"epoch": 1.345627650212017,
"grad_norm": 0.5454186201095581,
"learning_rate": 6.471028885455127e-07,
"loss": 0.6624,
"step": 1052
},
{
"epoch": 1.3469077526202096,
"grad_norm": 0.7986537218093872,
"learning_rate": 6.464960220640482e-07,
"loss": 0.6814,
"step": 1053
},
{
"epoch": 1.3481878550284023,
"grad_norm": 1.401473045349121,
"learning_rate": 6.458889715705248e-07,
"loss": 0.6605,
"step": 1054
},
{
"epoch": 1.3494679574365949,
"grad_norm": 0.7585673928260803,
"learning_rate": 6.452817382225506e-07,
"loss": 0.6937,
"step": 1055
},
{
"epoch": 1.3507480598447876,
"grad_norm": 0.8887014985084534,
"learning_rate": 6.446743231780833e-07,
"loss": 0.6603,
"step": 1056
},
{
"epoch": 1.3520281622529802,
"grad_norm": 1.0830944776535034,
"learning_rate": 6.440667275954262e-07,
"loss": 0.682,
"step": 1057
},
{
"epoch": 1.353308264661173,
"grad_norm": 0.38284140825271606,
"learning_rate": 6.434589526332272e-07,
"loss": 0.6526,
"step": 1058
},
{
"epoch": 1.3545883670693655,
"grad_norm": 0.4562026858329773,
"learning_rate": 6.428509994504765e-07,
"loss": 0.6905,
"step": 1059
},
{
"epoch": 1.3558684694775582,
"grad_norm": 1.7439802885055542,
"learning_rate": 6.422428692065037e-07,
"loss": 0.678,
"step": 1060
},
{
"epoch": 1.3571485718857508,
"grad_norm": 0.4282066226005554,
"learning_rate": 6.416345630609763e-07,
"loss": 0.6585,
"step": 1061
},
{
"epoch": 1.3584286742939435,
"grad_norm": 0.6055359840393066,
"learning_rate": 6.410260821738973e-07,
"loss": 0.6523,
"step": 1062
},
{
"epoch": 1.3597087767021363,
"grad_norm": 0.34060728549957275,
"learning_rate": 6.404174277056028e-07,
"loss": 0.6639,
"step": 1063
},
{
"epoch": 1.3609888791103288,
"grad_norm": 0.889231264591217,
"learning_rate": 6.398086008167601e-07,
"loss": 0.6584,
"step": 1064
},
{
"epoch": 1.3622689815185214,
"grad_norm": 0.7120441198348999,
"learning_rate": 6.391996026683648e-07,
"loss": 0.6554,
"step": 1065
},
{
"epoch": 1.3635490839267141,
"grad_norm": 0.4765358567237854,
"learning_rate": 6.385904344217395e-07,
"loss": 0.6637,
"step": 1066
},
{
"epoch": 1.364829186334907,
"grad_norm": 0.9561916589736938,
"learning_rate": 6.379810972385315e-07,
"loss": 0.6777,
"step": 1067
},
{
"epoch": 1.3661092887430994,
"grad_norm": 0.8768443465232849,
"learning_rate": 6.373715922807092e-07,
"loss": 0.659,
"step": 1068
},
{
"epoch": 1.367389391151292,
"grad_norm": 1.495634913444519,
"learning_rate": 6.36761920710562e-07,
"loss": 0.6749,
"step": 1069
},
{
"epoch": 1.3686694935594848,
"grad_norm": 1.2202892303466797,
"learning_rate": 6.361520836906965e-07,
"loss": 0.6734,
"step": 1070
},
{
"epoch": 1.3699495959676775,
"grad_norm": 1.083799958229065,
"learning_rate": 6.355420823840349e-07,
"loss": 0.6655,
"step": 1071
},
{
"epoch": 1.37122969837587,
"grad_norm": 1.4903268814086914,
"learning_rate": 6.349319179538125e-07,
"loss": 0.6636,
"step": 1072
},
{
"epoch": 1.3725098007840626,
"grad_norm": 1.3371798992156982,
"learning_rate": 6.343215915635761e-07,
"loss": 0.6932,
"step": 1073
},
{
"epoch": 1.3737899031922554,
"grad_norm": 1.57052743434906,
"learning_rate": 6.337111043771809e-07,
"loss": 0.6728,
"step": 1074
},
{
"epoch": 1.3750700056004481,
"grad_norm": 0.6461338400840759,
"learning_rate": 6.33100457558789e-07,
"loss": 0.6722,
"step": 1075
},
{
"epoch": 1.3763501080086407,
"grad_norm": 0.8064312934875488,
"learning_rate": 6.32489652272867e-07,
"loss": 0.6755,
"step": 1076
},
{
"epoch": 1.3776302104168334,
"grad_norm": 0.6215510368347168,
"learning_rate": 6.318786896841834e-07,
"loss": 0.6661,
"step": 1077
},
{
"epoch": 1.378910312825026,
"grad_norm": 1.7029057741165161,
"learning_rate": 6.312675709578064e-07,
"loss": 0.6797,
"step": 1078
},
{
"epoch": 1.3801904152332187,
"grad_norm": 1.0701732635498047,
"learning_rate": 6.30656297259103e-07,
"loss": 0.664,
"step": 1079
},
{
"epoch": 1.3814705176414113,
"grad_norm": 0.4341570734977722,
"learning_rate": 6.300448697537345e-07,
"loss": 0.6684,
"step": 1080
},
{
"epoch": 1.3814705176414113,
"eval_loss": 0.020331211388111115,
"eval_runtime": 42.044,
"eval_samples_per_second": 11.797,
"eval_steps_per_second": 1.475,
"step": 1080
},
{
"epoch": 1.382750620049604,
"grad_norm": 0.5554323792457581,
"learning_rate": 6.294332896076564e-07,
"loss": 0.6613,
"step": 1081
},
{
"epoch": 1.3840307224577966,
"grad_norm": 2.0100648403167725,
"learning_rate": 6.288215579871148e-07,
"loss": 0.6725,
"step": 1082
},
{
"epoch": 1.3853108248659893,
"grad_norm": 1.90065336227417,
"learning_rate": 6.282096760586447e-07,
"loss": 0.6639,
"step": 1083
},
{
"epoch": 1.3865909272741819,
"grad_norm": 3.765817403793335,
"learning_rate": 6.275976449890679e-07,
"loss": 0.6848,
"step": 1084
},
{
"epoch": 1.3878710296823746,
"grad_norm": 3.0655605792999268,
"learning_rate": 6.269854659454907e-07,
"loss": 0.664,
"step": 1085
},
{
"epoch": 1.3891511320905672,
"grad_norm": 1.8955802917480469,
"learning_rate": 6.26373140095301e-07,
"loss": 0.6505,
"step": 1086
},
{
"epoch": 1.39043123449876,
"grad_norm": 1.1710799932479858,
"learning_rate": 6.257606686061671e-07,
"loss": 0.6724,
"step": 1087
},
{
"epoch": 1.3917113369069525,
"grad_norm": 0.3802966773509979,
"learning_rate": 6.251480526460356e-07,
"loss": 0.6643,
"step": 1088
},
{
"epoch": 1.3929914393151452,
"grad_norm": 2.213221549987793,
"learning_rate": 6.245352933831271e-07,
"loss": 0.6717,
"step": 1089
},
{
"epoch": 1.394271541723338,
"grad_norm": 2.286634922027588,
"learning_rate": 6.23922391985937e-07,
"loss": 0.6598,
"step": 1090
},
{
"epoch": 1.3955516441315305,
"grad_norm": 1.6092549562454224,
"learning_rate": 6.233093496232305e-07,
"loss": 0.6614,
"step": 1091
},
{
"epoch": 1.396831746539723,
"grad_norm": 3.517232894897461,
"learning_rate": 6.226961674640425e-07,
"loss": 0.6691,
"step": 1092
},
{
"epoch": 1.3981118489479158,
"grad_norm": 2.5525524616241455,
"learning_rate": 6.220828466776742e-07,
"loss": 0.7016,
"step": 1093
},
{
"epoch": 1.3993919513561086,
"grad_norm": 1.5468311309814453,
"learning_rate": 6.214693884336913e-07,
"loss": 0.6493,
"step": 1094
},
{
"epoch": 1.4006720537643012,
"grad_norm": 1.385180950164795,
"learning_rate": 6.208557939019208e-07,
"loss": 0.6755,
"step": 1095
},
{
"epoch": 1.4019521561724937,
"grad_norm": 1.482412338256836,
"learning_rate": 6.20242064252451e-07,
"loss": 0.6753,
"step": 1096
},
{
"epoch": 1.4032322585806865,
"grad_norm": 3.4137392044067383,
"learning_rate": 6.196282006556265e-07,
"loss": 0.6783,
"step": 1097
},
{
"epoch": 1.4045123609888792,
"grad_norm": 2.346161365509033,
"learning_rate": 6.190142042820483e-07,
"loss": 0.666,
"step": 1098
},
{
"epoch": 1.4057924633970718,
"grad_norm": 2.676950693130493,
"learning_rate": 6.184000763025703e-07,
"loss": 0.667,
"step": 1099
},
{
"epoch": 1.4070725658052643,
"grad_norm": 2.321420907974243,
"learning_rate": 6.177858178882967e-07,
"loss": 0.6681,
"step": 1100
},
{
"epoch": 1.408352668213457,
"grad_norm": 2.5199320316314697,
"learning_rate": 6.171714302105818e-07,
"loss": 0.6612,
"step": 1101
},
{
"epoch": 1.4096327706216498,
"grad_norm": 0.7921889424324036,
"learning_rate": 6.165569144410252e-07,
"loss": 0.6931,
"step": 1102
},
{
"epoch": 1.4109128730298424,
"grad_norm": 0.519821047782898,
"learning_rate": 6.159422717514711e-07,
"loss": 0.6743,
"step": 1103
},
{
"epoch": 1.4121929754380351,
"grad_norm": 0.7353885769844055,
"learning_rate": 6.153275033140062e-07,
"loss": 0.6935,
"step": 1104
},
{
"epoch": 1.4134730778462277,
"grad_norm": 2.9378724098205566,
"learning_rate": 6.147126103009562e-07,
"loss": 0.6797,
"step": 1105
},
{
"epoch": 1.4147531802544204,
"grad_norm": 2.134580612182617,
"learning_rate": 6.140975938848849e-07,
"loss": 0.6755,
"step": 1106
},
{
"epoch": 1.416033282662613,
"grad_norm": 1.632208228111267,
"learning_rate": 6.134824552385914e-07,
"loss": 0.6539,
"step": 1107
},
{
"epoch": 1.4173133850708057,
"grad_norm": 0.9331590533256531,
"learning_rate": 6.128671955351077e-07,
"loss": 0.6859,
"step": 1108
},
{
"epoch": 1.4185934874789983,
"grad_norm": 1.6567165851593018,
"learning_rate": 6.122518159476967e-07,
"loss": 0.6846,
"step": 1109
},
{
"epoch": 1.419873589887191,
"grad_norm": 1.2426944971084595,
"learning_rate": 6.1163631764985e-07,
"loss": 0.6525,
"step": 1110
},
{
"epoch": 1.419873589887191,
"eval_loss": 0.020281776785850525,
"eval_runtime": 41.9773,
"eval_samples_per_second": 11.816,
"eval_steps_per_second": 1.477,
"step": 1110
},
{
"epoch": 1.4211536922953836,
"grad_norm": 1.386154055595398,
"learning_rate": 6.110207018152854e-07,
"loss": 0.646,
"step": 1111
},
{
"epoch": 1.4224337947035763,
"grad_norm": 0.7971065044403076,
"learning_rate": 6.10404969617945e-07,
"loss": 0.6446,
"step": 1112
},
{
"epoch": 1.4237138971117689,
"grad_norm": 0.5663548111915588,
"learning_rate": 6.097891222319928e-07,
"loss": 0.6762,
"step": 1113
},
{
"epoch": 1.4249939995199616,
"grad_norm": 1.0177338123321533,
"learning_rate": 6.091731608318123e-07,
"loss": 0.6438,
"step": 1114
},
{
"epoch": 1.4262741019281542,
"grad_norm": 1.681946873664856,
"learning_rate": 6.085570865920044e-07,
"loss": 0.6851,
"step": 1115
},
{
"epoch": 1.427554204336347,
"grad_norm": 0.41219356656074524,
"learning_rate": 6.079409006873856e-07,
"loss": 0.6692,
"step": 1116
},
{
"epoch": 1.4288343067445395,
"grad_norm": 0.360147088766098,
"learning_rate": 6.07324604292985e-07,
"loss": 0.6573,
"step": 1117
},
{
"epoch": 1.4301144091527322,
"grad_norm": 0.7511910796165466,
"learning_rate": 6.067081985840421e-07,
"loss": 0.657,
"step": 1118
},
{
"epoch": 1.4313945115609248,
"grad_norm": 0.8758702874183655,
"learning_rate": 6.060916847360055e-07,
"loss": 0.6634,
"step": 1119
},
{
"epoch": 1.4326746139691175,
"grad_norm": 1.2812691926956177,
"learning_rate": 6.054750639245295e-07,
"loss": 0.6555,
"step": 1120
},
{
"epoch": 1.4339547163773103,
"grad_norm": 0.9138062000274658,
"learning_rate": 6.048583373254727e-07,
"loss": 0.6673,
"step": 1121
},
{
"epoch": 1.4352348187855029,
"grad_norm": 0.8750235438346863,
"learning_rate": 6.042415061148953e-07,
"loss": 0.6702,
"step": 1122
},
{
"epoch": 1.4365149211936954,
"grad_norm": 1.7591211795806885,
"learning_rate": 6.03624571469057e-07,
"loss": 0.6634,
"step": 1123
},
{
"epoch": 1.4377950236018882,
"grad_norm": 2.2637319564819336,
"learning_rate": 6.030075345644148e-07,
"loss": 0.6344,
"step": 1124
},
{
"epoch": 1.439075126010081,
"grad_norm": 2.218717336654663,
"learning_rate": 6.023903965776203e-07,
"loss": 0.6408,
"step": 1125
},
{
"epoch": 1.4403552284182735,
"grad_norm": 1.3015824556350708,
"learning_rate": 6.017731586855186e-07,
"loss": 0.6728,
"step": 1126
},
{
"epoch": 1.441635330826466,
"grad_norm": 1.400359869003296,
"learning_rate": 6.011558220651445e-07,
"loss": 0.6846,
"step": 1127
},
{
"epoch": 1.4429154332346588,
"grad_norm": 0.9837814569473267,
"learning_rate": 6.00538387893722e-07,
"loss": 0.6692,
"step": 1128
},
{
"epoch": 1.4441955356428515,
"grad_norm": 1.9228425025939941,
"learning_rate": 5.999208573486602e-07,
"loss": 0.6307,
"step": 1129
},
{
"epoch": 1.445475638051044,
"grad_norm": 2.6433122158050537,
"learning_rate": 5.993032316075525e-07,
"loss": 0.6605,
"step": 1130
},
{
"epoch": 1.4467557404592366,
"grad_norm": 2.544320583343506,
"learning_rate": 5.986855118481735e-07,
"loss": 0.6627,
"step": 1131
},
{
"epoch": 1.4480358428674294,
"grad_norm": 2.4643025398254395,
"learning_rate": 5.980676992484777e-07,
"loss": 0.6527,
"step": 1132
},
{
"epoch": 1.4493159452756221,
"grad_norm": 1.4606987237930298,
"learning_rate": 5.974497949865961e-07,
"loss": 0.671,
"step": 1133
},
{
"epoch": 1.4505960476838147,
"grad_norm": 0.679926335811615,
"learning_rate": 5.968318002408347e-07,
"loss": 0.6786,
"step": 1134
},
{
"epoch": 1.4518761500920074,
"grad_norm": 0.5531436204910278,
"learning_rate": 5.962137161896714e-07,
"loss": 0.6853,
"step": 1135
},
{
"epoch": 1.4531562525002,
"grad_norm": 1.6512336730957031,
"learning_rate": 5.955955440117559e-07,
"loss": 0.663,
"step": 1136
},
{
"epoch": 1.4544363549083927,
"grad_norm": 1.0797758102416992,
"learning_rate": 5.949772848859042e-07,
"loss": 0.6709,
"step": 1137
},
{
"epoch": 1.4557164573165853,
"grad_norm": 1.055686116218567,
"learning_rate": 5.943589399910996e-07,
"loss": 0.6739,
"step": 1138
},
{
"epoch": 1.456996559724778,
"grad_norm": 0.6718446612358093,
"learning_rate": 5.937405105064879e-07,
"loss": 0.6757,
"step": 1139
},
{
"epoch": 1.4582766621329706,
"grad_norm": 0.7947307825088501,
"learning_rate": 5.931219976113767e-07,
"loss": 0.6595,
"step": 1140
},
{
"epoch": 1.4582766621329706,
"eval_loss": 0.020231926813721657,
"eval_runtime": 41.898,
"eval_samples_per_second": 11.838,
"eval_steps_per_second": 1.48,
"step": 1140
},
{
"epoch": 1.4595567645411633,
"grad_norm": 2.217567205429077,
"learning_rate": 5.925034024852327e-07,
"loss": 0.647,
"step": 1141
},
{
"epoch": 1.4608368669493559,
"grad_norm": 2.1660468578338623,
"learning_rate": 5.918847263076791e-07,
"loss": 0.6752,
"step": 1142
},
{
"epoch": 1.4621169693575486,
"grad_norm": 2.45143461227417,
"learning_rate": 5.912659702584938e-07,
"loss": 0.657,
"step": 1143
},
{
"epoch": 1.4633970717657412,
"grad_norm": 2.1579649448394775,
"learning_rate": 5.90647135517607e-07,
"loss": 0.6273,
"step": 1144
},
{
"epoch": 1.464677174173934,
"grad_norm": 0.9146259427070618,
"learning_rate": 5.900282232650994e-07,
"loss": 0.6464,
"step": 1145
},
{
"epoch": 1.4659572765821265,
"grad_norm": 0.7225512862205505,
"learning_rate": 5.894092346811988e-07,
"loss": 0.6646,
"step": 1146
},
{
"epoch": 1.4672373789903193,
"grad_norm": 1.8353562355041504,
"learning_rate": 5.887901709462787e-07,
"loss": 0.671,
"step": 1147
},
{
"epoch": 1.468517481398512,
"grad_norm": 2.3702549934387207,
"learning_rate": 5.881710332408564e-07,
"loss": 0.6659,
"step": 1148
},
{
"epoch": 1.4697975838067046,
"grad_norm": 1.318329095840454,
"learning_rate": 5.875518227455899e-07,
"loss": 0.6695,
"step": 1149
},
{
"epoch": 1.471077686214897,
"grad_norm": 1.2571388483047485,
"learning_rate": 5.869325406412758e-07,
"loss": 0.6593,
"step": 1150
},
{
"epoch": 1.4723577886230899,
"grad_norm": 0.3515982925891876,
"learning_rate": 5.863131881088477e-07,
"loss": 0.6684,
"step": 1151
},
{
"epoch": 1.4736378910312826,
"grad_norm": 1.0072952508926392,
"learning_rate": 5.856937663293734e-07,
"loss": 0.6645,
"step": 1152
},
{
"epoch": 1.4749179934394752,
"grad_norm": 1.0054341554641724,
"learning_rate": 5.850742764840524e-07,
"loss": 0.6757,
"step": 1153
},
{
"epoch": 1.4761980958476677,
"grad_norm": 1.1498204469680786,
"learning_rate": 5.844547197542144e-07,
"loss": 0.6792,
"step": 1154
},
{
"epoch": 1.4774781982558605,
"grad_norm": 1.4466193914413452,
"learning_rate": 5.838350973213164e-07,
"loss": 0.6568,
"step": 1155
},
{
"epoch": 1.4787583006640532,
"grad_norm": 0.849064290523529,
"learning_rate": 5.832154103669408e-07,
"loss": 0.641,
"step": 1156
},
{
"epoch": 1.4800384030722458,
"grad_norm": 1.025129795074463,
"learning_rate": 5.825956600727931e-07,
"loss": 0.6759,
"step": 1157
},
{
"epoch": 1.4813185054804383,
"grad_norm": 0.7013861536979675,
"learning_rate": 5.819758476206995e-07,
"loss": 0.6934,
"step": 1158
},
{
"epoch": 1.482598607888631,
"grad_norm": 0.40306708216667175,
"learning_rate": 5.813559741926045e-07,
"loss": 0.6717,
"step": 1159
},
{
"epoch": 1.4838787102968238,
"grad_norm": 0.9272669553756714,
"learning_rate": 5.807360409705695e-07,
"loss": 0.6368,
"step": 1160
},
{
"epoch": 1.4851588127050164,
"grad_norm": 0.7975537180900574,
"learning_rate": 5.801160491367693e-07,
"loss": 0.6595,
"step": 1161
},
{
"epoch": 1.4864389151132091,
"grad_norm": 2.527916431427002,
"learning_rate": 5.794959998734907e-07,
"loss": 0.6638,
"step": 1162
},
{
"epoch": 1.4877190175214017,
"grad_norm": 2.931472063064575,
"learning_rate": 5.788758943631301e-07,
"loss": 0.6595,
"step": 1163
},
{
"epoch": 1.4889991199295944,
"grad_norm": 3.970729351043701,
"learning_rate": 5.78255733788191e-07,
"loss": 0.6497,
"step": 1164
},
{
"epoch": 1.490279222337787,
"grad_norm": 3.603180170059204,
"learning_rate": 5.776355193312822e-07,
"loss": 0.6458,
"step": 1165
},
{
"epoch": 1.4915593247459797,
"grad_norm": 2.7362325191497803,
"learning_rate": 5.770152521751147e-07,
"loss": 0.6691,
"step": 1166
},
{
"epoch": 1.4928394271541723,
"grad_norm": 2.2429797649383545,
"learning_rate": 5.763949335025005e-07,
"loss": 0.6464,
"step": 1167
},
{
"epoch": 1.494119529562365,
"grad_norm": 0.7235007882118225,
"learning_rate": 5.757745644963499e-07,
"loss": 0.6657,
"step": 1168
},
{
"epoch": 1.4953996319705576,
"grad_norm": 0.75119549036026,
"learning_rate": 5.751541463396686e-07,
"loss": 0.6506,
"step": 1169
},
{
"epoch": 1.4966797343787503,
"grad_norm": 2.6939613819122314,
"learning_rate": 5.745336802155566e-07,
"loss": 0.6698,
"step": 1170
},
{
"epoch": 1.4966797343787503,
"eval_loss": 0.02045726589858532,
"eval_runtime": 42.3176,
"eval_samples_per_second": 11.721,
"eval_steps_per_second": 1.465,
"step": 1170
},
{
"epoch": 1.4979598367869429,
"grad_norm": 2.579827070236206,
"learning_rate": 5.739131673072048e-07,
"loss": 0.6634,
"step": 1171
},
{
"epoch": 1.4992399391951357,
"grad_norm": 1.8238277435302734,
"learning_rate": 5.732926087978943e-07,
"loss": 0.6612,
"step": 1172
},
{
"epoch": 1.5005200416033282,
"grad_norm": 2.0525503158569336,
"learning_rate": 5.726720058709918e-07,
"loss": 0.6733,
"step": 1173
},
{
"epoch": 1.501800144011521,
"grad_norm": 1.0010119676589966,
"learning_rate": 5.720513597099501e-07,
"loss": 0.6823,
"step": 1174
},
{
"epoch": 1.5030802464197137,
"grad_norm": 0.3749968111515045,
"learning_rate": 5.714306714983033e-07,
"loss": 0.6593,
"step": 1175
},
{
"epoch": 1.5043603488279063,
"grad_norm": 1.0137040615081787,
"learning_rate": 5.708099424196662e-07,
"loss": 0.6542,
"step": 1176
},
{
"epoch": 1.5056404512360988,
"grad_norm": 1.182702898979187,
"learning_rate": 5.701891736577317e-07,
"loss": 0.6569,
"step": 1177
},
{
"epoch": 1.5069205536442916,
"grad_norm": 1.961451530456543,
"learning_rate": 5.695683663962682e-07,
"loss": 0.6665,
"step": 1178
},
{
"epoch": 1.5082006560524843,
"grad_norm": 1.380611777305603,
"learning_rate": 5.689475218191169e-07,
"loss": 0.6454,
"step": 1179
},
{
"epoch": 1.5094807584606769,
"grad_norm": 1.4815675020217896,
"learning_rate": 5.683266411101917e-07,
"loss": 0.6751,
"step": 1180
},
{
"epoch": 1.5107608608688694,
"grad_norm": 0.7939832210540771,
"learning_rate": 5.677057254534736e-07,
"loss": 0.6672,
"step": 1181
},
{
"epoch": 1.5120409632770622,
"grad_norm": 0.4368623197078705,
"learning_rate": 5.670847760330114e-07,
"loss": 0.6662,
"step": 1182
},
{
"epoch": 1.513321065685255,
"grad_norm": 1.385303020477295,
"learning_rate": 5.66463794032918e-07,
"loss": 0.6574,
"step": 1183
},
{
"epoch": 1.5146011680934475,
"grad_norm": 0.5392059087753296,
"learning_rate": 5.658427806373685e-07,
"loss": 0.6636,
"step": 1184
},
{
"epoch": 1.51588127050164,
"grad_norm": 0.45560914278030396,
"learning_rate": 5.652217370305973e-07,
"loss": 0.6685,
"step": 1185
},
{
"epoch": 1.5171613729098328,
"grad_norm": 0.6280664801597595,
"learning_rate": 5.646006643968974e-07,
"loss": 0.6664,
"step": 1186
},
{
"epoch": 1.5184414753180255,
"grad_norm": 1.4717463254928589,
"learning_rate": 5.639795639206166e-07,
"loss": 0.6747,
"step": 1187
},
{
"epoch": 1.519721577726218,
"grad_norm": 1.4434207677841187,
"learning_rate": 5.633584367861555e-07,
"loss": 0.6552,
"step": 1188
},
{
"epoch": 1.5210016801344106,
"grad_norm": 0.7542391419410706,
"learning_rate": 5.627372841779659e-07,
"loss": 0.6669,
"step": 1189
},
{
"epoch": 1.5222817825426034,
"grad_norm": 0.4922533929347992,
"learning_rate": 5.621161072805483e-07,
"loss": 0.6533,
"step": 1190
},
{
"epoch": 1.5235618849507961,
"grad_norm": 1.7764134407043457,
"learning_rate": 5.614949072784492e-07,
"loss": 0.6722,
"step": 1191
},
{
"epoch": 1.5248419873589887,
"grad_norm": 0.9773665070533752,
"learning_rate": 5.608736853562596e-07,
"loss": 0.6604,
"step": 1192
},
{
"epoch": 1.5261220897671812,
"grad_norm": 0.7025289535522461,
"learning_rate": 5.602524426986117e-07,
"loss": 0.6895,
"step": 1193
},
{
"epoch": 1.527402192175374,
"grad_norm": 0.3457857668399811,
"learning_rate": 5.596311804901777e-07,
"loss": 0.6618,
"step": 1194
},
{
"epoch": 1.5286822945835667,
"grad_norm": 0.5850967168807983,
"learning_rate": 5.590098999156667e-07,
"loss": 0.6717,
"step": 1195
},
{
"epoch": 1.5299623969917593,
"grad_norm": 0.611171305179596,
"learning_rate": 5.583886021598234e-07,
"loss": 0.674,
"step": 1196
},
{
"epoch": 1.531242499399952,
"grad_norm": 0.42724570631980896,
"learning_rate": 5.577672884074249e-07,
"loss": 0.6604,
"step": 1197
},
{
"epoch": 1.5325226018081448,
"grad_norm": 0.770753026008606,
"learning_rate": 5.571459598432786e-07,
"loss": 0.6439,
"step": 1198
},
{
"epoch": 1.5338027042163374,
"grad_norm": 1.2898622751235962,
"learning_rate": 5.565246176522204e-07,
"loss": 0.6761,
"step": 1199
},
{
"epoch": 1.53508280662453,
"grad_norm": 2.31323504447937,
"learning_rate": 5.559032630191123e-07,
"loss": 0.6703,
"step": 1200
},
{
"epoch": 1.53508280662453,
"eval_loss": 0.02037089504301548,
"eval_runtime": 42.227,
"eval_samples_per_second": 11.746,
"eval_steps_per_second": 1.468,
"step": 1200
},
{
"epoch": 1.5363629090327227,
"grad_norm": 1.2492107152938843,
"learning_rate": 5.552818971288397e-07,
"loss": 0.6561,
"step": 1201
},
{
"epoch": 1.5376430114409154,
"grad_norm": 0.35306423902511597,
"learning_rate": 5.546605211663099e-07,
"loss": 0.6567,
"step": 1202
},
{
"epoch": 1.538923113849108,
"grad_norm": 0.36753401160240173,
"learning_rate": 5.540391363164491e-07,
"loss": 0.6711,
"step": 1203
},
{
"epoch": 1.5402032162573005,
"grad_norm": 1.5945085287094116,
"learning_rate": 5.534177437642005e-07,
"loss": 0.6884,
"step": 1204
},
{
"epoch": 1.5414833186654933,
"grad_norm": 0.44810953736305237,
"learning_rate": 5.527963446945215e-07,
"loss": 0.6387,
"step": 1205
},
{
"epoch": 1.542763421073686,
"grad_norm": 0.6199507713317871,
"learning_rate": 5.521749402923832e-07,
"loss": 0.662,
"step": 1206
},
{
"epoch": 1.5440435234818786,
"grad_norm": 0.3312099277973175,
"learning_rate": 5.515535317427657e-07,
"loss": 0.6745,
"step": 1207
},
{
"epoch": 1.545323625890071,
"grad_norm": 0.6081328988075256,
"learning_rate": 5.509321202306573e-07,
"loss": 0.6603,
"step": 1208
},
{
"epoch": 1.5466037282982639,
"grad_norm": 0.36688658595085144,
"learning_rate": 5.50310706941052e-07,
"loss": 0.667,
"step": 1209
},
{
"epoch": 1.5478838307064566,
"grad_norm": 0.568301796913147,
"learning_rate": 5.496892930589479e-07,
"loss": 0.6565,
"step": 1210
},
{
"epoch": 1.5491639331146492,
"grad_norm": 0.3534736633300781,
"learning_rate": 5.490678797693427e-07,
"loss": 0.6608,
"step": 1211
},
{
"epoch": 1.5504440355228417,
"grad_norm": 0.3959224224090576,
"learning_rate": 5.484464682572345e-07,
"loss": 0.6769,
"step": 1212
},
{
"epoch": 1.5517241379310345,
"grad_norm": 0.5038546919822693,
"learning_rate": 5.47825059707617e-07,
"loss": 0.6431,
"step": 1213
},
{
"epoch": 1.5530042403392272,
"grad_norm": 0.5618546009063721,
"learning_rate": 5.472036553054786e-07,
"loss": 0.6689,
"step": 1214
},
{
"epoch": 1.5542843427474198,
"grad_norm": 1.3786736726760864,
"learning_rate": 5.465822562357998e-07,
"loss": 0.6809,
"step": 1215
},
{
"epoch": 1.5555644451556123,
"grad_norm": 0.7807756662368774,
"learning_rate": 5.459608636835509e-07,
"loss": 0.6597,
"step": 1216
},
{
"epoch": 1.556844547563805,
"grad_norm": 1.2260596752166748,
"learning_rate": 5.4533947883369e-07,
"loss": 0.6702,
"step": 1217
},
{
"epoch": 1.5581246499719978,
"grad_norm": 1.7564269304275513,
"learning_rate": 5.447181028711601e-07,
"loss": 0.6625,
"step": 1218
},
{
"epoch": 1.5594047523801904,
"grad_norm": 0.4762384593486786,
"learning_rate": 5.440967369808878e-07,
"loss": 0.6251,
"step": 1219
},
{
"epoch": 1.560684854788383,
"grad_norm": 0.7580328583717346,
"learning_rate": 5.434753823477797e-07,
"loss": 0.6384,
"step": 1220
},
{
"epoch": 1.5619649571965757,
"grad_norm": 0.5596209168434143,
"learning_rate": 5.428540401567215e-07,
"loss": 0.6758,
"step": 1221
},
{
"epoch": 1.5632450596047684,
"grad_norm": 0.9199832081794739,
"learning_rate": 5.422327115925752e-07,
"loss": 0.6768,
"step": 1222
},
{
"epoch": 1.564525162012961,
"grad_norm": 0.4001198709011078,
"learning_rate": 5.416113978401765e-07,
"loss": 0.6587,
"step": 1223
},
{
"epoch": 1.5658052644211535,
"grad_norm": 0.45158153772354126,
"learning_rate": 5.409901000843332e-07,
"loss": 0.6693,
"step": 1224
},
{
"epoch": 1.5670853668293463,
"grad_norm": 0.5261472463607788,
"learning_rate": 5.403688195098225e-07,
"loss": 0.6609,
"step": 1225
},
{
"epoch": 1.568365469237539,
"grad_norm": 0.3869059085845947,
"learning_rate": 5.397475573013883e-07,
"loss": 0.6438,
"step": 1226
},
{
"epoch": 1.5696455716457316,
"grad_norm": 0.375410795211792,
"learning_rate": 5.391263146437406e-07,
"loss": 0.6365,
"step": 1227
},
{
"epoch": 1.5709256740539244,
"grad_norm": 0.8657992482185364,
"learning_rate": 5.385050927215507e-07,
"loss": 0.657,
"step": 1228
},
{
"epoch": 1.5722057764621171,
"grad_norm": 0.5424736738204956,
"learning_rate": 5.378838927194518e-07,
"loss": 0.6416,
"step": 1229
},
{
"epoch": 1.5734858788703097,
"grad_norm": 0.3917340934276581,
"learning_rate": 5.372627158220342e-07,
"loss": 0.6661,
"step": 1230
},
{
"epoch": 1.5734858788703097,
"eval_loss": 0.02028779499232769,
"eval_runtime": 42.104,
"eval_samples_per_second": 11.78,
"eval_steps_per_second": 1.473,
"step": 1230
},
{
"epoch": 1.5747659812785022,
"grad_norm": 0.4967162311077118,
"learning_rate": 5.366415632138446e-07,
"loss": 0.6674,
"step": 1231
},
{
"epoch": 1.576046083686695,
"grad_norm": 1.051540732383728,
"learning_rate": 5.360204360793836e-07,
"loss": 0.6492,
"step": 1232
},
{
"epoch": 1.5773261860948877,
"grad_norm": 0.7986653447151184,
"learning_rate": 5.353993356031025e-07,
"loss": 0.6511,
"step": 1233
},
{
"epoch": 1.5786062885030803,
"grad_norm": 0.3991658091545105,
"learning_rate": 5.347782629694025e-07,
"loss": 0.6605,
"step": 1234
},
{
"epoch": 1.5798863909112728,
"grad_norm": 0.49220219254493713,
"learning_rate": 5.341572193626315e-07,
"loss": 0.6542,
"step": 1235
},
{
"epoch": 1.5811664933194656,
"grad_norm": 0.3949640989303589,
"learning_rate": 5.33536205967082e-07,
"loss": 0.6573,
"step": 1236
},
{
"epoch": 1.5824465957276583,
"grad_norm": 1.639223337173462,
"learning_rate": 5.329152239669887e-07,
"loss": 0.6751,
"step": 1237
},
{
"epoch": 1.5837266981358509,
"grad_norm": 0.3700657784938812,
"learning_rate": 5.322942745465265e-07,
"loss": 0.6611,
"step": 1238
},
{
"epoch": 1.5850068005440434,
"grad_norm": 0.8532276153564453,
"learning_rate": 5.316733588898084e-07,
"loss": 0.6816,
"step": 1239
},
{
"epoch": 1.5862869029522362,
"grad_norm": 1.1979786157608032,
"learning_rate": 5.310524781808829e-07,
"loss": 0.6647,
"step": 1240
},
{
"epoch": 1.587567005360429,
"grad_norm": 0.5176545977592468,
"learning_rate": 5.304316336037319e-07,
"loss": 0.655,
"step": 1241
},
{
"epoch": 1.5888471077686215,
"grad_norm": 1.1874502897262573,
"learning_rate": 5.298108263422685e-07,
"loss": 0.6563,
"step": 1242
},
{
"epoch": 1.590127210176814,
"grad_norm": 2.2317183017730713,
"learning_rate": 5.291900575803337e-07,
"loss": 0.658,
"step": 1243
},
{
"epoch": 1.5914073125850068,
"grad_norm": 1.3642164468765259,
"learning_rate": 5.285693285016969e-07,
"loss": 0.6743,
"step": 1244
},
{
"epoch": 1.5926874149931995,
"grad_norm": 0.3846205174922943,
"learning_rate": 5.279486402900499e-07,
"loss": 0.6662,
"step": 1245
},
{
"epoch": 1.593967517401392,
"grad_norm": 0.7175666093826294,
"learning_rate": 5.273279941290082e-07,
"loss": 0.6516,
"step": 1246
},
{
"epoch": 1.5952476198095846,
"grad_norm": 0.332341730594635,
"learning_rate": 5.267073912021058e-07,
"loss": 0.6949,
"step": 1247
},
{
"epoch": 1.5965277222177774,
"grad_norm": 0.3692963719367981,
"learning_rate": 5.26086832692795e-07,
"loss": 0.6651,
"step": 1248
},
{
"epoch": 1.5978078246259702,
"grad_norm": 0.3464144170284271,
"learning_rate": 5.254663197844436e-07,
"loss": 0.6712,
"step": 1249
},
{
"epoch": 1.5990879270341627,
"grad_norm": 1.7411247491836548,
"learning_rate": 5.248458536603314e-07,
"loss": 0.6792,
"step": 1250
},
{
"epoch": 1.6003680294423552,
"grad_norm": 1.1433019638061523,
"learning_rate": 5.242254355036502e-07,
"loss": 0.6512,
"step": 1251
},
{
"epoch": 1.601648131850548,
"grad_norm": 1.2717899084091187,
"learning_rate": 5.236050664974994e-07,
"loss": 0.6698,
"step": 1252
},
{
"epoch": 1.6029282342587408,
"grad_norm": 0.8765652775764465,
"learning_rate": 5.229847478248853e-07,
"loss": 0.6483,
"step": 1253
},
{
"epoch": 1.6042083366669333,
"grad_norm": 0.4434972107410431,
"learning_rate": 5.22364480668718e-07,
"loss": 0.664,
"step": 1254
},
{
"epoch": 1.605488439075126,
"grad_norm": 0.8709170818328857,
"learning_rate": 5.21744266211809e-07,
"loss": 0.6837,
"step": 1255
},
{
"epoch": 1.6067685414833188,
"grad_norm": 0.8440918326377869,
"learning_rate": 5.2112410563687e-07,
"loss": 0.647,
"step": 1256
},
{
"epoch": 1.6080486438915114,
"grad_norm": 0.7353412508964539,
"learning_rate": 5.205040001265093e-07,
"loss": 0.6572,
"step": 1257
},
{
"epoch": 1.609328746299704,
"grad_norm": 1.8442965745925903,
"learning_rate": 5.198839508632308e-07,
"loss": 0.6641,
"step": 1258
},
{
"epoch": 1.6106088487078967,
"grad_norm": 1.093870759010315,
"learning_rate": 5.192639590294307e-07,
"loss": 0.6373,
"step": 1259
},
{
"epoch": 1.6118889511160894,
"grad_norm": 1.4169665575027466,
"learning_rate": 5.186440258073954e-07,
"loss": 0.6739,
"step": 1260
},
{
"epoch": 1.6118889511160894,
"eval_loss": 0.02020900882780552,
"eval_runtime": 41.9852,
"eval_samples_per_second": 11.814,
"eval_steps_per_second": 1.477,
"step": 1260
},
{
"epoch": 1.613169053524282,
"grad_norm": 0.8725627660751343,
"learning_rate": 5.180241523793007e-07,
"loss": 0.6561,
"step": 1261
},
{
"epoch": 1.6144491559324745,
"grad_norm": 0.683057963848114,
"learning_rate": 5.17404339927207e-07,
"loss": 0.6474,
"step": 1262
},
{
"epoch": 1.6157292583406673,
"grad_norm": 0.5126512050628662,
"learning_rate": 5.167845896330593e-07,
"loss": 0.6474,
"step": 1263
},
{
"epoch": 1.61700936074886,
"grad_norm": 1.1767605543136597,
"learning_rate": 5.161649026786836e-07,
"loss": 0.6577,
"step": 1264
},
{
"epoch": 1.6182894631570526,
"grad_norm": 0.5155271291732788,
"learning_rate": 5.155452802457857e-07,
"loss": 0.6353,
"step": 1265
},
{
"epoch": 1.6195695655652451,
"grad_norm": 0.9233950972557068,
"learning_rate": 5.149257235159476e-07,
"loss": 0.6518,
"step": 1266
},
{
"epoch": 1.6208496679734379,
"grad_norm": 0.33516064286231995,
"learning_rate": 5.143062336706266e-07,
"loss": 0.6548,
"step": 1267
},
{
"epoch": 1.6221297703816306,
"grad_norm": 0.34788066148757935,
"learning_rate": 5.136868118911522e-07,
"loss": 0.6637,
"step": 1268
},
{
"epoch": 1.6234098727898232,
"grad_norm": 2.6949563026428223,
"learning_rate": 5.130674593587242e-07,
"loss": 0.6814,
"step": 1269
},
{
"epoch": 1.6246899751980157,
"grad_norm": 2.327502727508545,
"learning_rate": 5.124481772544102e-07,
"loss": 0.669,
"step": 1270
},
{
"epoch": 1.6259700776062085,
"grad_norm": 1.9316380023956299,
"learning_rate": 5.118289667591436e-07,
"loss": 0.6484,
"step": 1271
},
{
"epoch": 1.6272501800144012,
"grad_norm": 0.8158658146858215,
"learning_rate": 5.112098290537212e-07,
"loss": 0.6591,
"step": 1272
},
{
"epoch": 1.6285302824225938,
"grad_norm": 0.5413331985473633,
"learning_rate": 5.105907653188013e-07,
"loss": 0.6538,
"step": 1273
},
{
"epoch": 1.6298103848307863,
"grad_norm": 0.6301608681678772,
"learning_rate": 5.099717767349006e-07,
"loss": 0.6436,
"step": 1274
},
{
"epoch": 1.631090487238979,
"grad_norm": 1.2457534074783325,
"learning_rate": 5.09352864482393e-07,
"loss": 0.6582,
"step": 1275
},
{
"epoch": 1.6323705896471719,
"grad_norm": 0.33607229590415955,
"learning_rate": 5.087340297415062e-07,
"loss": 0.6725,
"step": 1276
},
{
"epoch": 1.6336506920553644,
"grad_norm": 0.5030390024185181,
"learning_rate": 5.08115273692321e-07,
"loss": 0.6369,
"step": 1277
},
{
"epoch": 1.634930794463557,
"grad_norm": 0.5772480368614197,
"learning_rate": 5.074965975147675e-07,
"loss": 0.6621,
"step": 1278
},
{
"epoch": 1.6362108968717497,
"grad_norm": 0.33523985743522644,
"learning_rate": 5.068780023886232e-07,
"loss": 0.6503,
"step": 1279
},
{
"epoch": 1.6374909992799425,
"grad_norm": 0.765847384929657,
"learning_rate": 5.062594894935121e-07,
"loss": 0.6571,
"step": 1280
},
{
"epoch": 1.638771101688135,
"grad_norm": 0.58742356300354,
"learning_rate": 5.056410600089004e-07,
"loss": 0.6552,
"step": 1281
},
{
"epoch": 1.6400512040963275,
"grad_norm": 1.1437314748764038,
"learning_rate": 5.050227151140958e-07,
"loss": 0.6711,
"step": 1282
},
{
"epoch": 1.6413313065045205,
"grad_norm": 0.3895093500614166,
"learning_rate": 5.044044559882443e-07,
"loss": 0.6475,
"step": 1283
},
{
"epoch": 1.642611408912713,
"grad_norm": 0.34801262617111206,
"learning_rate": 5.037862838103285e-07,
"loss": 0.6379,
"step": 1284
},
{
"epoch": 1.6438915113209056,
"grad_norm": 0.33929601311683655,
"learning_rate": 5.031681997591656e-07,
"loss": 0.6627,
"step": 1285
},
{
"epoch": 1.6451716137290984,
"grad_norm": 0.4452283978462219,
"learning_rate": 5.025502050134038e-07,
"loss": 0.6347,
"step": 1286
},
{
"epoch": 1.6464517161372911,
"grad_norm": 0.3652748167514801,
"learning_rate": 5.019323007515222e-07,
"loss": 0.6684,
"step": 1287
},
{
"epoch": 1.6477318185454837,
"grad_norm": 0.5500005483627319,
"learning_rate": 5.013144881518264e-07,
"loss": 0.6443,
"step": 1288
},
{
"epoch": 1.6490119209536762,
"grad_norm": 0.7883321642875671,
"learning_rate": 5.006967683924476e-07,
"loss": 0.6586,
"step": 1289
},
{
"epoch": 1.650292023361869,
"grad_norm": 2.2128090858459473,
"learning_rate": 5.0007914265134e-07,
"loss": 0.6545,
"step": 1290
},
{
"epoch": 1.650292023361869,
"eval_loss": 0.020203562453389168,
"eval_runtime": 41.9377,
"eval_samples_per_second": 11.827,
"eval_steps_per_second": 1.478,
"step": 1290
},
{
"epoch": 1.6515721257700617,
"grad_norm": 1.1714468002319336,
"learning_rate": 4.99461612106278e-07,
"loss": 0.6572,
"step": 1291
},
{
"epoch": 1.6528522281782543,
"grad_norm": 0.9448105692863464,
"learning_rate": 4.988441779348556e-07,
"loss": 0.6473,
"step": 1292
},
{
"epoch": 1.6541323305864468,
"grad_norm": 0.5074780583381653,
"learning_rate": 4.982268413144814e-07,
"loss": 0.6549,
"step": 1293
},
{
"epoch": 1.6554124329946396,
"grad_norm": 0.34554415941238403,
"learning_rate": 4.976096034223798e-07,
"loss": 0.6577,
"step": 1294
},
{
"epoch": 1.6566925354028323,
"grad_norm": 0.9859076142311096,
"learning_rate": 4.969924654355854e-07,
"loss": 0.6513,
"step": 1295
},
{
"epoch": 1.6579726378110249,
"grad_norm": 1.565435528755188,
"learning_rate": 4.96375428530943e-07,
"loss": 0.6605,
"step": 1296
},
{
"epoch": 1.6592527402192174,
"grad_norm": 0.3245958387851715,
"learning_rate": 4.957584938851047e-07,
"loss": 0.6524,
"step": 1297
},
{
"epoch": 1.6605328426274102,
"grad_norm": 1.7261874675750732,
"learning_rate": 4.951416626745271e-07,
"loss": 0.6585,
"step": 1298
},
{
"epoch": 1.661812945035603,
"grad_norm": 0.6510258913040161,
"learning_rate": 4.945249360754706e-07,
"loss": 0.6489,
"step": 1299
},
{
"epoch": 1.6630930474437955,
"grad_norm": 0.4207313656806946,
"learning_rate": 4.939083152639946e-07,
"loss": 0.6433,
"step": 1300
},
{
"epoch": 1.664373149851988,
"grad_norm": 0.4415533244609833,
"learning_rate": 4.93291801415958e-07,
"loss": 0.6449,
"step": 1301
},
{
"epoch": 1.6656532522601808,
"grad_norm": 0.5641946196556091,
"learning_rate": 4.926753957070151e-07,
"loss": 0.6549,
"step": 1302
},
{
"epoch": 1.6669333546683736,
"grad_norm": 0.3372059762477875,
"learning_rate": 4.920590993126143e-07,
"loss": 0.6584,
"step": 1303
},
{
"epoch": 1.668213457076566,
"grad_norm": 1.317020297050476,
"learning_rate": 4.914429134079956e-07,
"loss": 0.6383,
"step": 1304
},
{
"epoch": 1.6694935594847586,
"grad_norm": 0.9823401570320129,
"learning_rate": 4.908268391681878e-07,
"loss": 0.643,
"step": 1305
},
{
"epoch": 1.6707736618929514,
"grad_norm": 1.6719224452972412,
"learning_rate": 4.902108777680073e-07,
"loss": 0.6738,
"step": 1306
},
{
"epoch": 1.6720537643011442,
"grad_norm": 0.5438287258148193,
"learning_rate": 4.895950303820552e-07,
"loss": 0.6813,
"step": 1307
},
{
"epoch": 1.6733338667093367,
"grad_norm": 1.4882230758666992,
"learning_rate": 4.889792981847147e-07,
"loss": 0.6296,
"step": 1308
},
{
"epoch": 1.6746139691175292,
"grad_norm": 1.087120532989502,
"learning_rate": 4.883636823501501e-07,
"loss": 0.6553,
"step": 1309
},
{
"epoch": 1.675894071525722,
"grad_norm": 0.30989930033683777,
"learning_rate": 4.877481840523032e-07,
"loss": 0.6519,
"step": 1310
},
{
"epoch": 1.6771741739339148,
"grad_norm": 0.4575180411338806,
"learning_rate": 4.871328044648924e-07,
"loss": 0.6552,
"step": 1311
},
{
"epoch": 1.6784542763421073,
"grad_norm": 0.3157932162284851,
"learning_rate": 4.865175447614086e-07,
"loss": 0.6477,
"step": 1312
},
{
"epoch": 1.6797343787503,
"grad_norm": 0.3302938640117645,
"learning_rate": 4.859024061151151e-07,
"loss": 0.647,
"step": 1313
},
{
"epoch": 1.6810144811584928,
"grad_norm": 0.32008451223373413,
"learning_rate": 4.852873896990439e-07,
"loss": 0.6685,
"step": 1314
},
{
"epoch": 1.6822945835666854,
"grad_norm": 1.7048025131225586,
"learning_rate": 4.846724966859938e-07,
"loss": 0.6717,
"step": 1315
},
{
"epoch": 1.683574685974878,
"grad_norm": 1.2926671504974365,
"learning_rate": 4.840577282485289e-07,
"loss": 0.6576,
"step": 1316
},
{
"epoch": 1.6848547883830707,
"grad_norm": 1.6346619129180908,
"learning_rate": 4.834430855589747e-07,
"loss": 0.6621,
"step": 1317
},
{
"epoch": 1.6861348907912634,
"grad_norm": 0.3772527873516083,
"learning_rate": 4.828285697894182e-07,
"loss": 0.6425,
"step": 1318
},
{
"epoch": 1.687414993199456,
"grad_norm": 1.7590543031692505,
"learning_rate": 4.822141821117032e-07,
"loss": 0.6641,
"step": 1319
},
{
"epoch": 1.6886950956076485,
"grad_norm": 1.0851612091064453,
"learning_rate": 4.815999236974298e-07,
"loss": 0.6325,
"step": 1320
},
{
"epoch": 1.6886950956076485,
"eval_loss": 0.020313631743192673,
"eval_runtime": 42.2724,
"eval_samples_per_second": 11.733,
"eval_steps_per_second": 1.467,
"step": 1320
},
{
"epoch": 1.6899751980158413,
"grad_norm": 1.5504151582717896,
"learning_rate": 4.809857957179517e-07,
"loss": 0.6461,
"step": 1321
},
{
"epoch": 1.691255300424034,
"grad_norm": 1.2824076414108276,
"learning_rate": 4.803717993443733e-07,
"loss": 0.6614,
"step": 1322
},
{
"epoch": 1.6925354028322266,
"grad_norm": 0.32816481590270996,
"learning_rate": 4.797579357475491e-07,
"loss": 0.6592,
"step": 1323
},
{
"epoch": 1.6938155052404191,
"grad_norm": 0.6346459984779358,
"learning_rate": 4.791442060980793e-07,
"loss": 0.6618,
"step": 1324
},
{
"epoch": 1.695095607648612,
"grad_norm": 1.0189234018325806,
"learning_rate": 4.785306115663088e-07,
"loss": 0.6589,
"step": 1325
},
{
"epoch": 1.6963757100568047,
"grad_norm": 0.3255029022693634,
"learning_rate": 4.779171533223259e-07,
"loss": 0.6634,
"step": 1326
},
{
"epoch": 1.6976558124649972,
"grad_norm": 0.48204153776168823,
"learning_rate": 4.773038325359573e-07,
"loss": 0.6581,
"step": 1327
},
{
"epoch": 1.6989359148731897,
"grad_norm": 1.1111605167388916,
"learning_rate": 4.7669065037676956e-07,
"loss": 0.673,
"step": 1328
},
{
"epoch": 1.7002160172813825,
"grad_norm": 0.33687517046928406,
"learning_rate": 4.7607760801406325e-07,
"loss": 0.6796,
"step": 1329
},
{
"epoch": 1.7014961196895753,
"grad_norm": 1.4620877504348755,
"learning_rate": 4.754647066168729e-07,
"loss": 0.6651,
"step": 1330
},
{
"epoch": 1.7027762220977678,
"grad_norm": 1.102821707725525,
"learning_rate": 4.748519473539645e-07,
"loss": 0.6673,
"step": 1331
},
{
"epoch": 1.7040563245059603,
"grad_norm": 1.53020441532135,
"learning_rate": 4.742393313938327e-07,
"loss": 0.6457,
"step": 1332
},
{
"epoch": 1.705336426914153,
"grad_norm": 0.3985624611377716,
"learning_rate": 4.73626859904699e-07,
"loss": 0.6549,
"step": 1333
},
{
"epoch": 1.7066165293223459,
"grad_norm": 1.3187754154205322,
"learning_rate": 4.7301453405450933e-07,
"loss": 0.6391,
"step": 1334
},
{
"epoch": 1.7078966317305384,
"grad_norm": 0.5049701929092407,
"learning_rate": 4.7240235501093206e-07,
"loss": 0.6464,
"step": 1335
},
{
"epoch": 1.709176734138731,
"grad_norm": 1.1826415061950684,
"learning_rate": 4.7179032394135533e-07,
"loss": 0.6743,
"step": 1336
},
{
"epoch": 1.7104568365469237,
"grad_norm": 1.251682162284851,
"learning_rate": 4.7117844201288515e-07,
"loss": 0.6568,
"step": 1337
},
{
"epoch": 1.7117369389551165,
"grad_norm": 0.8454403281211853,
"learning_rate": 4.7056671039234364e-07,
"loss": 0.6584,
"step": 1338
},
{
"epoch": 1.713017041363309,
"grad_norm": 0.8246471285820007,
"learning_rate": 4.6995513024626543e-07,
"loss": 0.6586,
"step": 1339
},
{
"epoch": 1.7142971437715018,
"grad_norm": 0.8950738906860352,
"learning_rate": 4.693437027408971e-07,
"loss": 0.6612,
"step": 1340
},
{
"epoch": 1.7155772461796945,
"grad_norm": 0.38885048031806946,
"learning_rate": 4.687324290421937e-07,
"loss": 0.6791,
"step": 1341
},
{
"epoch": 1.716857348587887,
"grad_norm": 1.3487435579299927,
"learning_rate": 4.681213103158167e-07,
"loss": 0.6593,
"step": 1342
},
{
"epoch": 1.7181374509960796,
"grad_norm": 0.327681303024292,
"learning_rate": 4.67510347727133e-07,
"loss": 0.664,
"step": 1343
},
{
"epoch": 1.7194175534042724,
"grad_norm": 0.5119345188140869,
"learning_rate": 4.668995424412108e-07,
"loss": 0.6608,
"step": 1344
},
{
"epoch": 1.7206976558124651,
"grad_norm": 0.9584038257598877,
"learning_rate": 4.6628889562281913e-07,
"loss": 0.6455,
"step": 1345
},
{
"epoch": 1.7219777582206577,
"grad_norm": 1.7702795267105103,
"learning_rate": 4.656784084364238e-07,
"loss": 0.6767,
"step": 1346
},
{
"epoch": 1.7232578606288502,
"grad_norm": 1.1456806659698486,
"learning_rate": 4.6506808204618754e-07,
"loss": 0.6656,
"step": 1347
},
{
"epoch": 1.724537963037043,
"grad_norm": 0.3220290541648865,
"learning_rate": 4.644579176159652e-07,
"loss": 0.6623,
"step": 1348
},
{
"epoch": 1.7258180654452357,
"grad_norm": 0.6019139885902405,
"learning_rate": 4.6384791630930353e-07,
"loss": 0.6801,
"step": 1349
},
{
"epoch": 1.7270981678534283,
"grad_norm": 0.7667902708053589,
"learning_rate": 4.63238079289438e-07,
"loss": 0.6698,
"step": 1350
},
{
"epoch": 1.7270981678534283,
"eval_loss": 0.020237334072589874,
"eval_runtime": 42.1433,
"eval_samples_per_second": 11.769,
"eval_steps_per_second": 1.471,
"step": 1350
},
{
"epoch": 1.7283782702616208,
"grad_norm": 0.3756662607192993,
"learning_rate": 4.626284077192908e-07,
"loss": 0.6591,
"step": 1351
},
{
"epoch": 1.7296583726698136,
"grad_norm": 0.6636763215065002,
"learning_rate": 4.620189027614686e-07,
"loss": 0.6515,
"step": 1352
},
{
"epoch": 1.7309384750780064,
"grad_norm": 0.8751712441444397,
"learning_rate": 4.614095655782605e-07,
"loss": 0.6566,
"step": 1353
},
{
"epoch": 1.732218577486199,
"grad_norm": 1.4636147022247314,
"learning_rate": 4.608003973316352e-07,
"loss": 0.6565,
"step": 1354
},
{
"epoch": 1.7334986798943914,
"grad_norm": 0.6845710277557373,
"learning_rate": 4.6019139918324e-07,
"loss": 0.6661,
"step": 1355
},
{
"epoch": 1.7347787823025842,
"grad_norm": 0.31287074089050293,
"learning_rate": 4.595825722943971e-07,
"loss": 0.656,
"step": 1356
},
{
"epoch": 1.736058884710777,
"grad_norm": 0.6977277398109436,
"learning_rate": 4.589739178261027e-07,
"loss": 0.6556,
"step": 1357
},
{
"epoch": 1.7373389871189695,
"grad_norm": 0.7792723774909973,
"learning_rate": 4.5836543693902386e-07,
"loss": 0.6517,
"step": 1358
},
{
"epoch": 1.738619089527162,
"grad_norm": 1.2956465482711792,
"learning_rate": 4.577571307934963e-07,
"loss": 0.6516,
"step": 1359
},
{
"epoch": 1.7398991919353548,
"grad_norm": 0.4135268032550812,
"learning_rate": 4.5714900054952365e-07,
"loss": 0.6615,
"step": 1360
},
{
"epoch": 1.7411792943435476,
"grad_norm": 1.612348198890686,
"learning_rate": 4.565410473667727e-07,
"loss": 0.6353,
"step": 1361
},
{
"epoch": 1.74245939675174,
"grad_norm": 0.43099555373191833,
"learning_rate": 4.559332724045739e-07,
"loss": 0.6753,
"step": 1362
},
{
"epoch": 1.7437394991599326,
"grad_norm": 1.7151196002960205,
"learning_rate": 4.553256768219166e-07,
"loss": 0.6612,
"step": 1363
},
{
"epoch": 1.7450196015681254,
"grad_norm": 1.2959682941436768,
"learning_rate": 4.547182617774493e-07,
"loss": 0.6333,
"step": 1364
},
{
"epoch": 1.7462997039763182,
"grad_norm": 2.2411410808563232,
"learning_rate": 4.5411102842947536e-07,
"loss": 0.6609,
"step": 1365
},
{
"epoch": 1.7475798063845107,
"grad_norm": 1.1098517179489136,
"learning_rate": 4.535039779359517e-07,
"loss": 0.6724,
"step": 1366
},
{
"epoch": 1.7488599087927033,
"grad_norm": 0.5529669523239136,
"learning_rate": 4.5289711145448727e-07,
"loss": 0.6626,
"step": 1367
},
{
"epoch": 1.750140011200896,
"grad_norm": 0.38661330938339233,
"learning_rate": 4.5229043014233923e-07,
"loss": 0.6333,
"step": 1368
},
{
"epoch": 1.7514201136090888,
"grad_norm": 0.29972946643829346,
"learning_rate": 4.516839351564122e-07,
"loss": 0.6624,
"step": 1369
},
{
"epoch": 1.7527002160172813,
"grad_norm": 1.3552956581115723,
"learning_rate": 4.510776276532553e-07,
"loss": 0.6722,
"step": 1370
},
{
"epoch": 1.753980318425474,
"grad_norm": 1.4432309865951538,
"learning_rate": 4.5047150878906005e-07,
"loss": 0.6507,
"step": 1371
},
{
"epoch": 1.7552604208336668,
"grad_norm": 0.44034600257873535,
"learning_rate": 4.4986557971965856e-07,
"loss": 0.6383,
"step": 1372
},
{
"epoch": 1.7565405232418594,
"grad_norm": 0.8172222375869751,
"learning_rate": 4.4925984160052057e-07,
"loss": 0.635,
"step": 1373
},
{
"epoch": 1.757820625650052,
"grad_norm": 0.8878439664840698,
"learning_rate": 4.4865429558675206e-07,
"loss": 0.6806,
"step": 1374
},
{
"epoch": 1.7591007280582447,
"grad_norm": 0.6996995210647583,
"learning_rate": 4.4804894283309234e-07,
"loss": 0.6412,
"step": 1375
},
{
"epoch": 1.7603808304664375,
"grad_norm": 1.6466293334960938,
"learning_rate": 4.4744378449391286e-07,
"loss": 0.6689,
"step": 1376
},
{
"epoch": 1.76166093287463,
"grad_norm": 1.25215744972229,
"learning_rate": 4.468388217232134e-07,
"loss": 0.6502,
"step": 1377
},
{
"epoch": 1.7629410352828225,
"grad_norm": 0.46423929929733276,
"learning_rate": 4.4623405567462123e-07,
"loss": 0.6652,
"step": 1378
},
{
"epoch": 1.7642211376910153,
"grad_norm": 1.15656316280365,
"learning_rate": 4.4562948750138886e-07,
"loss": 0.6783,
"step": 1379
},
{
"epoch": 1.765501240099208,
"grad_norm": 0.41009005904197693,
"learning_rate": 4.450251183563908e-07,
"loss": 0.6553,
"step": 1380
},
{
"epoch": 1.765501240099208,
"eval_loss": 0.020284704864025116,
"eval_runtime": 42.2086,
"eval_samples_per_second": 11.751,
"eval_steps_per_second": 1.469,
"step": 1380
},
{
"epoch": 1.7667813425074006,
"grad_norm": 0.7415822148323059,
"learning_rate": 4.444209493921225e-07,
"loss": 0.6495,
"step": 1381
},
{
"epoch": 1.7680614449155931,
"grad_norm": 1.7425875663757324,
"learning_rate": 4.438169817606975e-07,
"loss": 0.6502,
"step": 1382
},
{
"epoch": 1.769341547323786,
"grad_norm": 0.5185986757278442,
"learning_rate": 4.4321321661384523e-07,
"loss": 0.6698,
"step": 1383
},
{
"epoch": 1.7706216497319787,
"grad_norm": 1.4111460447311401,
"learning_rate": 4.426096551029096e-07,
"loss": 0.6525,
"step": 1384
},
{
"epoch": 1.7719017521401712,
"grad_norm": 0.3655721843242645,
"learning_rate": 4.4200629837884527e-07,
"loss": 0.631,
"step": 1385
},
{
"epoch": 1.7731818545483637,
"grad_norm": 0.5166422128677368,
"learning_rate": 4.4140314759221743e-07,
"loss": 0.6452,
"step": 1386
},
{
"epoch": 1.7744619569565565,
"grad_norm": 1.761288046836853,
"learning_rate": 4.408002038931977e-07,
"loss": 0.6607,
"step": 1387
},
{
"epoch": 1.7757420593647493,
"grad_norm": 2.015368938446045,
"learning_rate": 4.4019746843156314e-07,
"loss": 0.6648,
"step": 1388
},
{
"epoch": 1.7770221617729418,
"grad_norm": 1.4947712421417236,
"learning_rate": 4.395949423566938e-07,
"loss": 0.6616,
"step": 1389
},
{
"epoch": 1.7783022641811344,
"grad_norm": 0.4151802957057953,
"learning_rate": 4.389926268175703e-07,
"loss": 0.6586,
"step": 1390
},
{
"epoch": 1.7795823665893271,
"grad_norm": 1.5793638229370117,
"learning_rate": 4.38390522962772e-07,
"loss": 0.6599,
"step": 1391
},
{
"epoch": 1.7808624689975199,
"grad_norm": 0.5370101928710938,
"learning_rate": 4.377886319404741e-07,
"loss": 0.6617,
"step": 1392
},
{
"epoch": 1.7821425714057124,
"grad_norm": 1.1976677179336548,
"learning_rate": 4.371869548984466e-07,
"loss": 0.6477,
"step": 1393
},
{
"epoch": 1.783422673813905,
"grad_norm": 0.9538538455963135,
"learning_rate": 4.3658549298405077e-07,
"loss": 0.662,
"step": 1394
},
{
"epoch": 1.7847027762220977,
"grad_norm": 0.46199288964271545,
"learning_rate": 4.359842473442381e-07,
"loss": 0.6482,
"step": 1395
},
{
"epoch": 1.7859828786302905,
"grad_norm": 0.888530433177948,
"learning_rate": 4.3538321912554775e-07,
"loss": 0.6466,
"step": 1396
},
{
"epoch": 1.787262981038483,
"grad_norm": 1.623777985572815,
"learning_rate": 4.347824094741038e-07,
"loss": 0.6561,
"step": 1397
},
{
"epoch": 1.7885430834466758,
"grad_norm": 1.2217705249786377,
"learning_rate": 4.3418181953561405e-07,
"loss": 0.6352,
"step": 1398
},
{
"epoch": 1.7898231858548685,
"grad_norm": 1.288587212562561,
"learning_rate": 4.335814504553668e-07,
"loss": 0.641,
"step": 1399
},
{
"epoch": 1.791103288263061,
"grad_norm": 1.1777597665786743,
"learning_rate": 4.3298130337822945e-07,
"loss": 0.6534,
"step": 1400
},
{
"epoch": 1.7923833906712536,
"grad_norm": 0.3725791275501251,
"learning_rate": 4.323813794486464e-07,
"loss": 0.6551,
"step": 1401
},
{
"epoch": 1.7936634930794464,
"grad_norm": 1.6161917448043823,
"learning_rate": 4.3178167981063586e-07,
"loss": 0.6619,
"step": 1402
},
{
"epoch": 1.7949435954876392,
"grad_norm": 1.4094892740249634,
"learning_rate": 4.3118220560778884e-07,
"loss": 0.6447,
"step": 1403
},
{
"epoch": 1.7962236978958317,
"grad_norm": 1.8410543203353882,
"learning_rate": 4.3058295798326614e-07,
"loss": 0.6509,
"step": 1404
},
{
"epoch": 1.7975038003040242,
"grad_norm": 1.322169303894043,
"learning_rate": 4.2998393807979673e-07,
"loss": 0.6509,
"step": 1405
},
{
"epoch": 1.798783902712217,
"grad_norm": 0.830678403377533,
"learning_rate": 4.293851470396753e-07,
"loss": 0.6667,
"step": 1406
},
{
"epoch": 1.8000640051204098,
"grad_norm": 0.42671477794647217,
"learning_rate": 4.287865860047596e-07,
"loss": 0.6466,
"step": 1407
},
{
"epoch": 1.8013441075286023,
"grad_norm": 0.5033804178237915,
"learning_rate": 4.281882561164698e-07,
"loss": 0.6393,
"step": 1408
},
{
"epoch": 1.8026242099367948,
"grad_norm": 1.2624613046646118,
"learning_rate": 4.2759015851578406e-07,
"loss": 0.654,
"step": 1409
},
{
"epoch": 1.8039043123449876,
"grad_norm": 0.75972580909729,
"learning_rate": 4.269922943432389e-07,
"loss": 0.6622,
"step": 1410
},
{
"epoch": 1.8039043123449876,
"eval_loss": 0.020134203135967255,
"eval_runtime": 42.0173,
"eval_samples_per_second": 11.805,
"eval_steps_per_second": 1.476,
"step": 1410
},
{
"epoch": 1.8051844147531804,
"grad_norm": 2.159752368927002,
"learning_rate": 4.263946647389245e-07,
"loss": 0.6395,
"step": 1411
},
{
"epoch": 1.806464517161373,
"grad_norm": 1.3134266138076782,
"learning_rate": 4.257972708424844e-07,
"loss": 0.6381,
"step": 1412
},
{
"epoch": 1.8077446195695654,
"grad_norm": 1.0190292596817017,
"learning_rate": 4.252001137931125e-07,
"loss": 0.6411,
"step": 1413
},
{
"epoch": 1.8090247219777582,
"grad_norm": 0.39045262336730957,
"learning_rate": 4.246031947295511e-07,
"loss": 0.6529,
"step": 1414
},
{
"epoch": 1.810304824385951,
"grad_norm": 0.7252090573310852,
"learning_rate": 4.240065147900888e-07,
"loss": 0.6543,
"step": 1415
},
{
"epoch": 1.8115849267941435,
"grad_norm": 0.33401620388031006,
"learning_rate": 4.2341007511255756e-07,
"loss": 0.6536,
"step": 1416
},
{
"epoch": 1.812865029202336,
"grad_norm": 0.640551745891571,
"learning_rate": 4.228138768343322e-07,
"loss": 0.6507,
"step": 1417
},
{
"epoch": 1.8141451316105288,
"grad_norm": 2.3466696739196777,
"learning_rate": 4.2221792109232644e-07,
"loss": 0.6379,
"step": 1418
},
{
"epoch": 1.8154252340187216,
"grad_norm": 0.35105660557746887,
"learning_rate": 4.216222090229915e-07,
"loss": 0.6569,
"step": 1419
},
{
"epoch": 1.8167053364269141,
"grad_norm": 0.8996425867080688,
"learning_rate": 4.2102674176231455e-07,
"loss": 0.6481,
"step": 1420
},
{
"epoch": 1.8179854388351067,
"grad_norm": 0.8135996460914612,
"learning_rate": 4.204315204458152e-07,
"loss": 0.6479,
"step": 1421
},
{
"epoch": 1.8192655412432994,
"grad_norm": 0.7570270299911499,
"learning_rate": 4.198365462085446e-07,
"loss": 0.6574,
"step": 1422
},
{
"epoch": 1.8205456436514922,
"grad_norm": 1.1389846801757812,
"learning_rate": 4.192418201850825e-07,
"loss": 0.6409,
"step": 1423
},
{
"epoch": 1.8218257460596847,
"grad_norm": 0.3112352788448334,
"learning_rate": 4.18647343509535e-07,
"loss": 0.6567,
"step": 1424
},
{
"epoch": 1.8231058484678773,
"grad_norm": 0.32075387239456177,
"learning_rate": 4.1805311731553364e-07,
"loss": 0.6539,
"step": 1425
},
{
"epoch": 1.8243859508760703,
"grad_norm": 0.6961304545402527,
"learning_rate": 4.174591427362311e-07,
"loss": 0.6582,
"step": 1426
},
{
"epoch": 1.8256660532842628,
"grad_norm": 0.7438198924064636,
"learning_rate": 4.1686542090430133e-07,
"loss": 0.6573,
"step": 1427
},
{
"epoch": 1.8269461556924553,
"grad_norm": 0.4226982593536377,
"learning_rate": 4.1627195295193564e-07,
"loss": 0.6687,
"step": 1428
},
{
"epoch": 1.828226258100648,
"grad_norm": 1.6463003158569336,
"learning_rate": 4.1567874001084134e-07,
"loss": 0.6593,
"step": 1429
},
{
"epoch": 1.8295063605088409,
"grad_norm": 0.6133513450622559,
"learning_rate": 4.1508578321223977e-07,
"loss": 0.6579,
"step": 1430
},
{
"epoch": 1.8307864629170334,
"grad_norm": 0.6251399517059326,
"learning_rate": 4.144930836868632e-07,
"loss": 0.6577,
"step": 1431
},
{
"epoch": 1.832066565325226,
"grad_norm": 0.38442981243133545,
"learning_rate": 4.1390064256495406e-07,
"loss": 0.6497,
"step": 1432
},
{
"epoch": 1.8333466677334187,
"grad_norm": 0.35492774844169617,
"learning_rate": 4.133084609762613e-07,
"loss": 0.647,
"step": 1433
},
{
"epoch": 1.8346267701416115,
"grad_norm": 0.9149113893508911,
"learning_rate": 4.127165400500394e-07,
"loss": 0.6414,
"step": 1434
},
{
"epoch": 1.835906872549804,
"grad_norm": 2.032224178314209,
"learning_rate": 4.121248809150457e-07,
"loss": 0.6367,
"step": 1435
},
{
"epoch": 1.8371869749579965,
"grad_norm": 1.422893762588501,
"learning_rate": 4.115334846995383e-07,
"loss": 0.6425,
"step": 1436
},
{
"epoch": 1.8384670773661893,
"grad_norm": 1.0627795457839966,
"learning_rate": 4.1094235253127374e-07,
"loss": 0.6433,
"step": 1437
},
{
"epoch": 1.839747179774382,
"grad_norm": 0.4423734247684479,
"learning_rate": 4.103514855375051e-07,
"loss": 0.6477,
"step": 1438
},
{
"epoch": 1.8410272821825746,
"grad_norm": 0.7080780863761902,
"learning_rate": 4.097608848449803e-07,
"loss": 0.6487,
"step": 1439
},
{
"epoch": 1.8423073845907671,
"grad_norm": 0.5146299600601196,
"learning_rate": 4.0917055157993883e-07,
"loss": 0.6545,
"step": 1440
},
{
"epoch": 1.8423073845907671,
"eval_loss": 0.02027849666774273,
"eval_runtime": 42.2437,
"eval_samples_per_second": 11.741,
"eval_steps_per_second": 1.468,
"step": 1440
},
{
"epoch": 1.84358748699896,
"grad_norm": 0.9809892773628235,
"learning_rate": 4.085804868681101e-07,
"loss": 0.655,
"step": 1441
},
{
"epoch": 1.8448675894071527,
"grad_norm": 2.0757155418395996,
"learning_rate": 4.0799069183471233e-07,
"loss": 0.6273,
"step": 1442
},
{
"epoch": 1.8461476918153452,
"grad_norm": 2.283313512802124,
"learning_rate": 4.074011676044481e-07,
"loss": 0.655,
"step": 1443
},
{
"epoch": 1.8474277942235378,
"grad_norm": 1.3149728775024414,
"learning_rate": 4.068119153015052e-07,
"loss": 0.6607,
"step": 1444
},
{
"epoch": 1.8487078966317305,
"grad_norm": 0.49532565474510193,
"learning_rate": 4.0622293604955106e-07,
"loss": 0.6469,
"step": 1445
},
{
"epoch": 1.8499879990399233,
"grad_norm": 0.3583681881427765,
"learning_rate": 4.056342309717343e-07,
"loss": 0.6475,
"step": 1446
},
{
"epoch": 1.8512681014481158,
"grad_norm": 0.4949761927127838,
"learning_rate": 4.0504580119067935e-07,
"loss": 0.6506,
"step": 1447
},
{
"epoch": 1.8525482038563084,
"grad_norm": 0.29712027311325073,
"learning_rate": 4.044576478284859e-07,
"loss": 0.632,
"step": 1448
},
{
"epoch": 1.8538283062645011,
"grad_norm": 0.3617751896381378,
"learning_rate": 4.03869772006727e-07,
"loss": 0.6317,
"step": 1449
},
{
"epoch": 1.8551084086726939,
"grad_norm": 1.358906865119934,
"learning_rate": 4.032821748464462e-07,
"loss": 0.652,
"step": 1450
},
{
"epoch": 1.8563885110808864,
"grad_norm": 0.5866574645042419,
"learning_rate": 4.0269485746815543e-07,
"loss": 0.6659,
"step": 1451
},
{
"epoch": 1.857668613489079,
"grad_norm": 1.2951745986938477,
"learning_rate": 4.021078209918336e-07,
"loss": 0.6669,
"step": 1452
},
{
"epoch": 1.8589487158972717,
"grad_norm": 0.7593936920166016,
"learning_rate": 4.015210665369233e-07,
"loss": 0.6683,
"step": 1453
},
{
"epoch": 1.8602288183054645,
"grad_norm": 0.2940188944339752,
"learning_rate": 4.0093459522232987e-07,
"loss": 0.6774,
"step": 1454
},
{
"epoch": 1.861508920713657,
"grad_norm": 1.2073087692260742,
"learning_rate": 4.0034840816641837e-07,
"loss": 0.6492,
"step": 1455
},
{
"epoch": 1.8627890231218498,
"grad_norm": 0.6415184736251831,
"learning_rate": 3.9976250648701225e-07,
"loss": 0.6474,
"step": 1456
},
{
"epoch": 1.8640691255300426,
"grad_norm": 0.49736320972442627,
"learning_rate": 3.991768913013903e-07,
"loss": 0.6657,
"step": 1457
},
{
"epoch": 1.865349227938235,
"grad_norm": 1.4928420782089233,
"learning_rate": 3.985915637262849e-07,
"loss": 0.6617,
"step": 1458
},
{
"epoch": 1.8666293303464276,
"grad_norm": 1.4371532201766968,
"learning_rate": 3.9800652487788066e-07,
"loss": 0.6652,
"step": 1459
},
{
"epoch": 1.8679094327546204,
"grad_norm": 0.6963754892349243,
"learning_rate": 3.974217758718107e-07,
"loss": 0.674,
"step": 1460
},
{
"epoch": 1.8691895351628132,
"grad_norm": 0.35544610023498535,
"learning_rate": 3.968373178231564e-07,
"loss": 0.6474,
"step": 1461
},
{
"epoch": 1.8704696375710057,
"grad_norm": 2.491149425506592,
"learning_rate": 3.9625315184644327e-07,
"loss": 0.6498,
"step": 1462
},
{
"epoch": 1.8717497399791982,
"grad_norm": 1.5386929512023926,
"learning_rate": 3.9566927905564083e-07,
"loss": 0.6576,
"step": 1463
},
{
"epoch": 1.873029842387391,
"grad_norm": 1.0369929075241089,
"learning_rate": 3.9508570056415893e-07,
"loss": 0.6441,
"step": 1464
},
{
"epoch": 1.8743099447955838,
"grad_norm": 1.8902573585510254,
"learning_rate": 3.94502417484846e-07,
"loss": 0.6435,
"step": 1465
},
{
"epoch": 1.8755900472037763,
"grad_norm": 1.3084981441497803,
"learning_rate": 3.9391943092998814e-07,
"loss": 0.6346,
"step": 1466
},
{
"epoch": 1.8768701496119689,
"grad_norm": 0.47784221172332764,
"learning_rate": 3.9333674201130475e-07,
"loss": 0.6489,
"step": 1467
},
{
"epoch": 1.8781502520201616,
"grad_norm": 0.9221143126487732,
"learning_rate": 3.9275435183994855e-07,
"loss": 0.6523,
"step": 1468
},
{
"epoch": 1.8794303544283544,
"grad_norm": 1.5181889533996582,
"learning_rate": 3.9217226152650207e-07,
"loss": 0.6543,
"step": 1469
},
{
"epoch": 1.880710456836547,
"grad_norm": 0.3990873098373413,
"learning_rate": 3.915904721809763e-07,
"loss": 0.6636,
"step": 1470
},
{
"epoch": 1.880710456836547,
"eval_loss": 0.020178191363811493,
"eval_runtime": 42.1335,
"eval_samples_per_second": 11.772,
"eval_steps_per_second": 1.472,
"step": 1470
},
{
"epoch": 1.8819905592447395,
"grad_norm": 0.8142790794372559,
"learning_rate": 3.910089849128084e-07,
"loss": 0.6707,
"step": 1471
},
{
"epoch": 1.8832706616529322,
"grad_norm": 0.9272212982177734,
"learning_rate": 3.904278008308589e-07,
"loss": 0.6275,
"step": 1472
},
{
"epoch": 1.884550764061125,
"grad_norm": 1.6707804203033447,
"learning_rate": 3.89846921043411e-07,
"loss": 0.6531,
"step": 1473
},
{
"epoch": 1.8858308664693175,
"grad_norm": 2.0460212230682373,
"learning_rate": 3.8926634665816707e-07,
"loss": 0.6711,
"step": 1474
},
{
"epoch": 1.88711096887751,
"grad_norm": 0.8614675402641296,
"learning_rate": 3.8868607878224714e-07,
"loss": 0.6419,
"step": 1475
},
{
"epoch": 1.8883910712857028,
"grad_norm": 1.382861852645874,
"learning_rate": 3.88106118522187e-07,
"loss": 0.6461,
"step": 1476
},
{
"epoch": 1.8896711736938956,
"grad_norm": 0.35682398080825806,
"learning_rate": 3.875264669839353e-07,
"loss": 0.6423,
"step": 1477
},
{
"epoch": 1.8909512761020881,
"grad_norm": 0.4068925678730011,
"learning_rate": 3.869471252728529e-07,
"loss": 0.6272,
"step": 1478
},
{
"epoch": 1.8922313785102807,
"grad_norm": 0.6481353044509888,
"learning_rate": 3.863680944937088e-07,
"loss": 0.6635,
"step": 1479
},
{
"epoch": 1.8935114809184734,
"grad_norm": 1.3248523473739624,
"learning_rate": 3.8578937575068006e-07,
"loss": 0.6585,
"step": 1480
},
{
"epoch": 1.8947915833266662,
"grad_norm": 1.5766288042068481,
"learning_rate": 3.852109701473477e-07,
"loss": 0.666,
"step": 1481
},
{
"epoch": 1.8960716857348587,
"grad_norm": 0.30987825989723206,
"learning_rate": 3.846328787866964e-07,
"loss": 0.6501,
"step": 1482
},
{
"epoch": 1.8973517881430515,
"grad_norm": 0.39504796266555786,
"learning_rate": 3.840551027711113e-07,
"loss": 0.6872,
"step": 1483
},
{
"epoch": 1.8986318905512443,
"grad_norm": 1.0687555074691772,
"learning_rate": 3.83477643202376e-07,
"loss": 0.6699,
"step": 1484
},
{
"epoch": 1.8999119929594368,
"grad_norm": 0.49148961901664734,
"learning_rate": 3.829005011816712e-07,
"loss": 0.6604,
"step": 1485
},
{
"epoch": 1.9011920953676293,
"grad_norm": 0.4063304364681244,
"learning_rate": 3.8232367780957143e-07,
"loss": 0.671,
"step": 1486
},
{
"epoch": 1.902472197775822,
"grad_norm": 0.651275634765625,
"learning_rate": 3.8174717418604386e-07,
"loss": 0.6629,
"step": 1487
},
{
"epoch": 1.9037523001840149,
"grad_norm": 0.5661211013793945,
"learning_rate": 3.811709914104461e-07,
"loss": 0.6845,
"step": 1488
},
{
"epoch": 1.9050324025922074,
"grad_norm": 1.1106001138687134,
"learning_rate": 3.805951305815236e-07,
"loss": 0.6574,
"step": 1489
},
{
"epoch": 1.9063125050004,
"grad_norm": 0.7834218740463257,
"learning_rate": 3.8001959279740813e-07,
"loss": 0.6456,
"step": 1490
},
{
"epoch": 1.9075926074085927,
"grad_norm": 0.3771151304244995,
"learning_rate": 3.794443791556151e-07,
"loss": 0.6581,
"step": 1491
},
{
"epoch": 1.9088727098167855,
"grad_norm": 1.2670047283172607,
"learning_rate": 3.788694907530425e-07,
"loss": 0.6598,
"step": 1492
},
{
"epoch": 1.910152812224978,
"grad_norm": 0.3163726329803467,
"learning_rate": 3.782949286859672e-07,
"loss": 0.6414,
"step": 1493
},
{
"epoch": 1.9114329146331706,
"grad_norm": 0.35109463334083557,
"learning_rate": 3.7772069405004424e-07,
"loss": 0.6408,
"step": 1494
},
{
"epoch": 1.9127130170413633,
"grad_norm": 0.857173502445221,
"learning_rate": 3.771467879403044e-07,
"loss": 0.6463,
"step": 1495
},
{
"epoch": 1.913993119449556,
"grad_norm": 0.31337499618530273,
"learning_rate": 3.765732114511516e-07,
"loss": 0.656,
"step": 1496
},
{
"epoch": 1.9152732218577486,
"grad_norm": 0.6555890440940857,
"learning_rate": 3.759999656763615e-07,
"loss": 0.6372,
"step": 1497
},
{
"epoch": 1.9165533242659412,
"grad_norm": 0.34517669677734375,
"learning_rate": 3.754270517090792e-07,
"loss": 0.6565,
"step": 1498
},
{
"epoch": 1.917833426674134,
"grad_norm": 0.761021077632904,
"learning_rate": 3.748544706418165e-07,
"loss": 0.6466,
"step": 1499
},
{
"epoch": 1.9191135290823267,
"grad_norm": 0.8519187569618225,
"learning_rate": 3.742822235664511e-07,
"loss": 0.6666,
"step": 1500
},
{
"epoch": 1.9191135290823267,
"eval_loss": 0.020136365666985512,
"eval_runtime": 42.0089,
"eval_samples_per_second": 11.807,
"eval_steps_per_second": 1.476,
"step": 1500
},
{
"epoch": 1.9203936314905192,
"grad_norm": 1.8772252798080444,
"learning_rate": 3.7371031157422316e-07,
"loss": 0.6474,
"step": 1501
},
{
"epoch": 1.9216737338987118,
"grad_norm": 0.5060604810714722,
"learning_rate": 3.731387357557344e-07,
"loss": 0.6508,
"step": 1502
},
{
"epoch": 1.9229538363069045,
"grad_norm": 0.4918056130409241,
"learning_rate": 3.7256749720094494e-07,
"loss": 0.6315,
"step": 1503
},
{
"epoch": 1.9242339387150973,
"grad_norm": 1.119981050491333,
"learning_rate": 3.7199659699917254e-07,
"loss": 0.6301,
"step": 1504
},
{
"epoch": 1.9255140411232898,
"grad_norm": 0.42985770106315613,
"learning_rate": 3.7142603623908877e-07,
"loss": 0.6469,
"step": 1505
},
{
"epoch": 1.9267941435314824,
"grad_norm": 0.7651292681694031,
"learning_rate": 3.708558160087183e-07,
"loss": 0.6454,
"step": 1506
},
{
"epoch": 1.9280742459396751,
"grad_norm": 0.687855064868927,
"learning_rate": 3.702859373954371e-07,
"loss": 0.6432,
"step": 1507
},
{
"epoch": 1.929354348347868,
"grad_norm": 0.4252788722515106,
"learning_rate": 3.697164014859685e-07,
"loss": 0.6537,
"step": 1508
},
{
"epoch": 1.9306344507560604,
"grad_norm": 0.31047073006629944,
"learning_rate": 3.6914720936638334e-07,
"loss": 0.6713,
"step": 1509
},
{
"epoch": 1.931914553164253,
"grad_norm": 1.0734926462173462,
"learning_rate": 3.685783621220961e-07,
"loss": 0.6351,
"step": 1510
},
{
"epoch": 1.9331946555724457,
"grad_norm": 1.112204909324646,
"learning_rate": 3.6800986083786423e-07,
"loss": 0.6547,
"step": 1511
},
{
"epoch": 1.9344747579806385,
"grad_norm": 1.4943028688430786,
"learning_rate": 3.674417065977852e-07,
"loss": 0.6623,
"step": 1512
},
{
"epoch": 1.935754860388831,
"grad_norm": 1.689070224761963,
"learning_rate": 3.668739004852943e-07,
"loss": 0.6626,
"step": 1513
},
{
"epoch": 1.9370349627970238,
"grad_norm": 0.5321928858757019,
"learning_rate": 3.663064435831639e-07,
"loss": 0.6334,
"step": 1514
},
{
"epoch": 1.9383150652052166,
"grad_norm": 0.34038230776786804,
"learning_rate": 3.657393369734993e-07,
"loss": 0.6379,
"step": 1515
},
{
"epoch": 1.939595167613409,
"grad_norm": 0.8219080567359924,
"learning_rate": 3.651725817377388e-07,
"loss": 0.6649,
"step": 1516
},
{
"epoch": 1.9408752700216017,
"grad_norm": 0.4399322271347046,
"learning_rate": 3.646061789566501e-07,
"loss": 0.6779,
"step": 1517
},
{
"epoch": 1.9421553724297944,
"grad_norm": 0.3037623167037964,
"learning_rate": 3.6404012971032894e-07,
"loss": 0.6555,
"step": 1518
},
{
"epoch": 1.9434354748379872,
"grad_norm": 0.4268603026866913,
"learning_rate": 3.63474435078197e-07,
"loss": 0.6662,
"step": 1519
},
{
"epoch": 1.9447155772461797,
"grad_norm": 0.8760473728179932,
"learning_rate": 3.6290909613899944e-07,
"loss": 0.6691,
"step": 1520
},
{
"epoch": 1.9459956796543723,
"grad_norm": 0.41986730694770813,
"learning_rate": 3.6234411397080346e-07,
"loss": 0.6501,
"step": 1521
},
{
"epoch": 1.947275782062565,
"grad_norm": 0.7702023386955261,
"learning_rate": 3.617794896509958e-07,
"loss": 0.6547,
"step": 1522
},
{
"epoch": 1.9485558844707578,
"grad_norm": 1.2464476823806763,
"learning_rate": 3.612152242562805e-07,
"loss": 0.6624,
"step": 1523
},
{
"epoch": 1.9498359868789503,
"grad_norm": 0.4909172058105469,
"learning_rate": 3.6065131886267765e-07,
"loss": 0.6431,
"step": 1524
},
{
"epoch": 1.9511160892871429,
"grad_norm": 0.3685779273509979,
"learning_rate": 3.600877745455205e-07,
"loss": 0.6464,
"step": 1525
},
{
"epoch": 1.9523961916953356,
"grad_norm": 0.8982672095298767,
"learning_rate": 3.595245923794542e-07,
"loss": 0.6393,
"step": 1526
},
{
"epoch": 1.9536762941035284,
"grad_norm": 0.7910873889923096,
"learning_rate": 3.5896177343843257e-07,
"loss": 0.6306,
"step": 1527
},
{
"epoch": 1.954956396511721,
"grad_norm": 1.9237056970596313,
"learning_rate": 3.5839931879571725e-07,
"loss": 0.664,
"step": 1528
},
{
"epoch": 1.9562364989199135,
"grad_norm": 0.5737236142158508,
"learning_rate": 3.578372295238754e-07,
"loss": 0.6519,
"step": 1529
},
{
"epoch": 1.9575166013281062,
"grad_norm": 0.47908324003219604,
"learning_rate": 3.572755066947768e-07,
"loss": 0.6467,
"step": 1530
},
{
"epoch": 1.9575166013281062,
"eval_loss": 0.02018653228878975,
"eval_runtime": 42.125,
"eval_samples_per_second": 11.774,
"eval_steps_per_second": 1.472,
"step": 1530
},
{
"epoch": 1.958796703736299,
"grad_norm": 0.8703590035438538,
"learning_rate": 3.5671415137959304e-07,
"loss": 0.6616,
"step": 1531
},
{
"epoch": 1.9600768061444915,
"grad_norm": 0.8829367160797119,
"learning_rate": 3.5615316464879443e-07,
"loss": 0.6585,
"step": 1532
},
{
"epoch": 1.961356908552684,
"grad_norm": 0.6368685960769653,
"learning_rate": 3.5559254757214894e-07,
"loss": 0.6373,
"step": 1533
},
{
"epoch": 1.9626370109608768,
"grad_norm": 0.3699598014354706,
"learning_rate": 3.550323012187192e-07,
"loss": 0.6576,
"step": 1534
},
{
"epoch": 1.9639171133690696,
"grad_norm": 0.33403944969177246,
"learning_rate": 3.544724266568606e-07,
"loss": 0.6445,
"step": 1535
},
{
"epoch": 1.9651972157772621,
"grad_norm": 0.39014747738838196,
"learning_rate": 3.5391292495422056e-07,
"loss": 0.6608,
"step": 1536
},
{
"epoch": 1.9664773181854547,
"grad_norm": 0.3596109449863434,
"learning_rate": 3.533537971777345e-07,
"loss": 0.6462,
"step": 1537
},
{
"epoch": 1.9677574205936474,
"grad_norm": 0.5041800141334534,
"learning_rate": 3.5279504439362553e-07,
"loss": 0.6728,
"step": 1538
},
{
"epoch": 1.9690375230018402,
"grad_norm": 0.6463397145271301,
"learning_rate": 3.522366676674008e-07,
"loss": 0.6587,
"step": 1539
},
{
"epoch": 1.9703176254100327,
"grad_norm": 0.8549566864967346,
"learning_rate": 3.5167866806385117e-07,
"loss": 0.6699,
"step": 1540
},
{
"epoch": 1.9715977278182255,
"grad_norm": 1.3436312675476074,
"learning_rate": 3.511210466470481e-07,
"loss": 0.6563,
"step": 1541
},
{
"epoch": 1.9728778302264183,
"grad_norm": 0.7693657279014587,
"learning_rate": 3.505638044803414e-07,
"loss": 0.6469,
"step": 1542
},
{
"epoch": 1.9741579326346108,
"grad_norm": 0.37262585759162903,
"learning_rate": 3.5000694262635844e-07,
"loss": 0.6453,
"step": 1543
},
{
"epoch": 1.9754380350428034,
"grad_norm": 0.2784225642681122,
"learning_rate": 3.4945046214700085e-07,
"loss": 0.6543,
"step": 1544
},
{
"epoch": 1.9767181374509961,
"grad_norm": 0.5659027099609375,
"learning_rate": 3.4889436410344337e-07,
"loss": 0.6448,
"step": 1545
},
{
"epoch": 1.9779982398591889,
"grad_norm": 1.1660345792770386,
"learning_rate": 3.4833864955613084e-07,
"loss": 0.6297,
"step": 1546
},
{
"epoch": 1.9792783422673814,
"grad_norm": 1.1339924335479736,
"learning_rate": 3.477833195647773e-07,
"loss": 0.6308,
"step": 1547
},
{
"epoch": 1.980558444675574,
"grad_norm": 0.615590512752533,
"learning_rate": 3.4722837518836366e-07,
"loss": 0.6517,
"step": 1548
},
{
"epoch": 1.9818385470837667,
"grad_norm": 1.4719653129577637,
"learning_rate": 3.466738174851348e-07,
"loss": 0.6662,
"step": 1549
},
{
"epoch": 1.9831186494919595,
"grad_norm": 0.3114243745803833,
"learning_rate": 3.461196475125986e-07,
"loss": 0.6557,
"step": 1550
},
{
"epoch": 1.984398751900152,
"grad_norm": 0.6217992901802063,
"learning_rate": 3.4556586632752395e-07,
"loss": 0.6568,
"step": 1551
},
{
"epoch": 1.9856788543083446,
"grad_norm": 0.5350921750068665,
"learning_rate": 3.4501247498593753e-07,
"loss": 0.659,
"step": 1552
},
{
"epoch": 1.9869589567165373,
"grad_norm": 0.3131371736526489,
"learning_rate": 3.4445947454312345e-07,
"loss": 0.6583,
"step": 1553
},
{
"epoch": 1.98823905912473,
"grad_norm": 0.8939411044120789,
"learning_rate": 3.439068660536197e-07,
"loss": 0.6352,
"step": 1554
},
{
"epoch": 1.9895191615329226,
"grad_norm": 0.3164510428905487,
"learning_rate": 3.4335465057121715e-07,
"loss": 0.6321,
"step": 1555
},
{
"epoch": 1.9907992639411152,
"grad_norm": 0.7054875493049622,
"learning_rate": 3.4280282914895754e-07,
"loss": 0.6408,
"step": 1556
},
{
"epoch": 1.992079366349308,
"grad_norm": 0.8006320595741272,
"learning_rate": 3.4225140283913033e-07,
"loss": 0.6457,
"step": 1557
},
{
"epoch": 1.9933594687575007,
"grad_norm": 0.5207490921020508,
"learning_rate": 3.4170037269327235e-07,
"loss": 0.6471,
"step": 1558
},
{
"epoch": 1.9946395711656932,
"grad_norm": 0.4709649384021759,
"learning_rate": 3.411497397621646e-07,
"loss": 0.652,
"step": 1559
},
{
"epoch": 1.9959196735738858,
"grad_norm": 0.46237748861312866,
"learning_rate": 3.405995050958308e-07,
"loss": 0.6605,
"step": 1560
},
{
"epoch": 1.9959196735738858,
"eval_loss": 0.020140517503023148,
"eval_runtime": 42.0698,
"eval_samples_per_second": 11.79,
"eval_steps_per_second": 1.474,
"step": 1560
},
{
"epoch": 1.9971997759820785,
"grad_norm": 0.6091731786727905,
"learning_rate": 3.400496697435349e-07,
"loss": 0.6774,
"step": 1561
},
{
"epoch": 1.9984798783902713,
"grad_norm": 0.2919997572898865,
"learning_rate": 3.395002347537796e-07,
"loss": 0.6482,
"step": 1562
},
{
"epoch": 1.9997599807984638,
"grad_norm": 0.7775795459747314,
"learning_rate": 3.389512011743042e-07,
"loss": 0.6577,
"step": 1563
},
{
"epoch": 2.0,
"grad_norm": 1.7572511434555054,
"learning_rate": 3.3840257005208217e-07,
"loss": 0.5824,
"step": 1564
},
{
"epoch": 2.0012801024081925,
"grad_norm": 0.9507853984832764,
"learning_rate": 3.378543424333201e-07,
"loss": 0.6623,
"step": 1565
},
{
"epoch": 2.0025602048163855,
"grad_norm": 0.4480624496936798,
"learning_rate": 3.3730651936345423e-07,
"loss": 0.677,
"step": 1566
},
{
"epoch": 2.003840307224578,
"grad_norm": 0.3929971158504486,
"learning_rate": 3.367591018871506e-07,
"loss": 0.6341,
"step": 1567
},
{
"epoch": 2.0051204096327706,
"grad_norm": 0.33541080355644226,
"learning_rate": 3.3621209104830087e-07,
"loss": 0.6205,
"step": 1568
},
{
"epoch": 2.006400512040963,
"grad_norm": 0.38718631863594055,
"learning_rate": 3.3566548789002133e-07,
"loss": 0.6591,
"step": 1569
},
{
"epoch": 2.007680614449156,
"grad_norm": 0.38684767484664917,
"learning_rate": 3.351192934546511e-07,
"loss": 0.6578,
"step": 1570
},
{
"epoch": 2.0089607168573487,
"grad_norm": 0.7610079646110535,
"learning_rate": 3.3457350878375003e-07,
"loss": 0.6586,
"step": 1571
},
{
"epoch": 2.010240819265541,
"grad_norm": 0.7946922183036804,
"learning_rate": 3.3402813491809625e-07,
"loss": 0.6496,
"step": 1572
},
{
"epoch": 2.0115209216737338,
"grad_norm": 1.0007370710372925,
"learning_rate": 3.3348317289768447e-07,
"loss": 0.6516,
"step": 1573
},
{
"epoch": 2.0128010240819267,
"grad_norm": 0.650123119354248,
"learning_rate": 3.3293862376172444e-07,
"loss": 0.6708,
"step": 1574
},
{
"epoch": 2.0140811264901193,
"grad_norm": 1.0918546915054321,
"learning_rate": 3.3239448854863833e-07,
"loss": 0.6492,
"step": 1575
},
{
"epoch": 2.015361228898312,
"grad_norm": 1.0643458366394043,
"learning_rate": 3.318507682960587e-07,
"loss": 0.6509,
"step": 1576
},
{
"epoch": 2.0166413313065044,
"grad_norm": 0.28287214040756226,
"learning_rate": 3.313074640408273e-07,
"loss": 0.6689,
"step": 1577
},
{
"epoch": 2.0179214337146973,
"grad_norm": 0.32519668340682983,
"learning_rate": 3.307645768189923e-07,
"loss": 0.6397,
"step": 1578
},
{
"epoch": 2.01920153612289,
"grad_norm": 2.0113062858581543,
"learning_rate": 3.3022210766580683e-07,
"loss": 0.6482,
"step": 1579
},
{
"epoch": 2.0204816385310824,
"grad_norm": 1.2784104347229004,
"learning_rate": 3.296800576157266e-07,
"loss": 0.6557,
"step": 1580
},
{
"epoch": 2.021761740939275,
"grad_norm": 0.8624829649925232,
"learning_rate": 3.2913842770240774e-07,
"loss": 0.6513,
"step": 1581
},
{
"epoch": 2.023041843347468,
"grad_norm": 0.31694090366363525,
"learning_rate": 3.2859721895870634e-07,
"loss": 0.6398,
"step": 1582
},
{
"epoch": 2.0243219457556605,
"grad_norm": 1.5329867601394653,
"learning_rate": 3.2805643241667416e-07,
"loss": 0.6382,
"step": 1583
},
{
"epoch": 2.025602048163853,
"grad_norm": 0.9459407329559326,
"learning_rate": 3.2751606910755856e-07,
"loss": 0.64,
"step": 1584
},
{
"epoch": 2.0268821505720456,
"grad_norm": 1.1838010549545288,
"learning_rate": 3.2697613006179934e-07,
"loss": 0.6603,
"step": 1585
},
{
"epoch": 2.0281622529802386,
"grad_norm": 0.2843930423259735,
"learning_rate": 3.2643661630902765e-07,
"loss": 0.6555,
"step": 1586
},
{
"epoch": 2.029442355388431,
"grad_norm": 0.39631158113479614,
"learning_rate": 3.2589752887806363e-07,
"loss": 0.6495,
"step": 1587
},
{
"epoch": 2.0307224577966236,
"grad_norm": 1.081121802330017,
"learning_rate": 3.2535886879691387e-07,
"loss": 0.6439,
"step": 1588
},
{
"epoch": 2.032002560204816,
"grad_norm": 0.867226243019104,
"learning_rate": 3.2482063709277086e-07,
"loss": 0.6448,
"step": 1589
},
{
"epoch": 2.033282662613009,
"grad_norm": 0.5019204616546631,
"learning_rate": 3.242828347920096e-07,
"loss": 0.6559,
"step": 1590
},
{
"epoch": 2.033282662613009,
"eval_loss": 0.020167594775557518,
"eval_runtime": 42.0921,
"eval_samples_per_second": 11.784,
"eval_steps_per_second": 1.473,
"step": 1590
},
{
"epoch": 2.0345627650212017,
"grad_norm": 0.7726768255233765,
"learning_rate": 3.2374546292018666e-07,
"loss": 0.6655,
"step": 1591
},
{
"epoch": 2.0358428674293942,
"grad_norm": 0.3660649061203003,
"learning_rate": 3.2320852250203736e-07,
"loss": 0.6598,
"step": 1592
},
{
"epoch": 2.0371229698375872,
"grad_norm": 0.3929210603237152,
"learning_rate": 3.2267201456147455e-07,
"loss": 0.6401,
"step": 1593
},
{
"epoch": 2.0384030722457798,
"grad_norm": 0.49099859595298767,
"learning_rate": 3.221359401215864e-07,
"loss": 0.6689,
"step": 1594
},
{
"epoch": 2.0396831746539723,
"grad_norm": 0.2908097505569458,
"learning_rate": 3.2160030020463426e-07,
"loss": 0.6673,
"step": 1595
},
{
"epoch": 2.040963277062165,
"grad_norm": 0.28991639614105225,
"learning_rate": 3.2106509583205094e-07,
"loss": 0.6477,
"step": 1596
},
{
"epoch": 2.042243379470358,
"grad_norm": 0.7449044585227966,
"learning_rate": 3.205303280244389e-07,
"loss": 0.6347,
"step": 1597
},
{
"epoch": 2.0435234818785504,
"grad_norm": 0.3190125823020935,
"learning_rate": 3.1999599780156765e-07,
"loss": 0.6504,
"step": 1598
},
{
"epoch": 2.044803584286743,
"grad_norm": 0.34263280034065247,
"learning_rate": 3.194621061823727e-07,
"loss": 0.6541,
"step": 1599
},
{
"epoch": 2.0460836866949355,
"grad_norm": 0.6974402666091919,
"learning_rate": 3.189286541849525e-07,
"loss": 0.6445,
"step": 1600
},
{
"epoch": 2.0473637891031284,
"grad_norm": 0.5479668974876404,
"learning_rate": 3.183956428265684e-07,
"loss": 0.6815,
"step": 1601
},
{
"epoch": 2.048643891511321,
"grad_norm": 0.6569727659225464,
"learning_rate": 3.178630731236402e-07,
"loss": 0.6499,
"step": 1602
},
{
"epoch": 2.0499239939195135,
"grad_norm": 0.44678768515586853,
"learning_rate": 3.1733094609174626e-07,
"loss": 0.6415,
"step": 1603
},
{
"epoch": 2.051204096327706,
"grad_norm": 0.8797255158424377,
"learning_rate": 3.1679926274562023e-07,
"loss": 0.6766,
"step": 1604
},
{
"epoch": 2.052484198735899,
"grad_norm": 0.34989097714424133,
"learning_rate": 3.1626802409915023e-07,
"loss": 0.6443,
"step": 1605
},
{
"epoch": 2.0537643011440916,
"grad_norm": 0.5943762063980103,
"learning_rate": 3.1573723116537626e-07,
"loss": 0.618,
"step": 1606
},
{
"epoch": 2.055044403552284,
"grad_norm": 1.8876229524612427,
"learning_rate": 3.152068849564878e-07,
"loss": 0.6389,
"step": 1607
},
{
"epoch": 2.0563245059604767,
"grad_norm": 1.1450793743133545,
"learning_rate": 3.1467698648382324e-07,
"loss": 0.6329,
"step": 1608
},
{
"epoch": 2.0576046083686697,
"grad_norm": 1.565260887145996,
"learning_rate": 3.1414753675786685e-07,
"loss": 0.6569,
"step": 1609
},
{
"epoch": 2.058884710776862,
"grad_norm": 1.415553331375122,
"learning_rate": 3.136185367882468e-07,
"loss": 0.6619,
"step": 1610
},
{
"epoch": 2.0601648131850547,
"grad_norm": 1.5406972169876099,
"learning_rate": 3.130899875837342e-07,
"loss": 0.6505,
"step": 1611
},
{
"epoch": 2.0614449155932473,
"grad_norm": 1.2182635068893433,
"learning_rate": 3.125618901522402e-07,
"loss": 0.641,
"step": 1612
},
{
"epoch": 2.0627250180014403,
"grad_norm": 0.47365105152130127,
"learning_rate": 3.120342455008148e-07,
"loss": 0.6303,
"step": 1613
},
{
"epoch": 2.064005120409633,
"grad_norm": 1.782963752746582,
"learning_rate": 3.1150705463564414e-07,
"loss": 0.6414,
"step": 1614
},
{
"epoch": 2.0652852228178253,
"grad_norm": 0.8268676996231079,
"learning_rate": 3.1098031856204886e-07,
"loss": 0.6369,
"step": 1615
},
{
"epoch": 2.066565325226018,
"grad_norm": 0.3014861047267914,
"learning_rate": 3.1045403828448333e-07,
"loss": 0.6493,
"step": 1616
},
{
"epoch": 2.067845427634211,
"grad_norm": 0.34252384305000305,
"learning_rate": 3.0992821480653175e-07,
"loss": 0.6848,
"step": 1617
},
{
"epoch": 2.0691255300424034,
"grad_norm": 0.385826975107193,
"learning_rate": 3.0940284913090774e-07,
"loss": 0.6498,
"step": 1618
},
{
"epoch": 2.070405632450596,
"grad_norm": 1.5567173957824707,
"learning_rate": 3.0887794225945143e-07,
"loss": 0.672,
"step": 1619
},
{
"epoch": 2.0716857348587885,
"grad_norm": 1.0404150485992432,
"learning_rate": 3.083534951931289e-07,
"loss": 0.6658,
"step": 1620
},
{
"epoch": 2.0716857348587885,
"eval_loss": 0.020138423889875412,
"eval_runtime": 42.0892,
"eval_samples_per_second": 11.784,
"eval_steps_per_second": 1.473,
"step": 1620
},
{
"epoch": 2.0729658372669815,
"grad_norm": 1.3907960653305054,
"learning_rate": 3.078295089320286e-07,
"loss": 0.6357,
"step": 1621
},
{
"epoch": 2.074245939675174,
"grad_norm": 1.1349884271621704,
"learning_rate": 3.073059844753604e-07,
"loss": 0.6473,
"step": 1622
},
{
"epoch": 2.0755260420833666,
"grad_norm": 0.47560665011405945,
"learning_rate": 3.0678292282145383e-07,
"loss": 0.6488,
"step": 1623
},
{
"epoch": 2.0768061444915595,
"grad_norm": 0.39596259593963623,
"learning_rate": 3.0626032496775574e-07,
"loss": 0.6553,
"step": 1624
},
{
"epoch": 2.078086246899752,
"grad_norm": 1.8026816844940186,
"learning_rate": 3.057381919108286e-07,
"loss": 0.6587,
"step": 1625
},
{
"epoch": 2.0793663493079446,
"grad_norm": 1.008310317993164,
"learning_rate": 3.052165246463483e-07,
"loss": 0.657,
"step": 1626
},
{
"epoch": 2.080646451716137,
"grad_norm": 1.8662000894546509,
"learning_rate": 3.046953241691026e-07,
"loss": 0.6332,
"step": 1627
},
{
"epoch": 2.08192655412433,
"grad_norm": 0.8910163044929504,
"learning_rate": 3.0417459147298964e-07,
"loss": 0.6366,
"step": 1628
},
{
"epoch": 2.0832066565325227,
"grad_norm": 0.3107927441596985,
"learning_rate": 3.036543275510144e-07,
"loss": 0.6579,
"step": 1629
},
{
"epoch": 2.0844867589407152,
"grad_norm": 0.6364381313323975,
"learning_rate": 3.0313453339528907e-07,
"loss": 0.6542,
"step": 1630
},
{
"epoch": 2.0857668613489078,
"grad_norm": 1.1081907749176025,
"learning_rate": 3.0261520999702944e-07,
"loss": 0.6468,
"step": 1631
},
{
"epoch": 2.0870469637571007,
"grad_norm": 1.0331661701202393,
"learning_rate": 3.020963583465539e-07,
"loss": 0.6572,
"step": 1632
},
{
"epoch": 2.0883270661652933,
"grad_norm": 1.2937402725219727,
"learning_rate": 3.015779794332809e-07,
"loss": 0.6376,
"step": 1633
},
{
"epoch": 2.089607168573486,
"grad_norm": 1.2057676315307617,
"learning_rate": 3.010600742457272e-07,
"loss": 0.6459,
"step": 1634
},
{
"epoch": 2.0908872709816784,
"grad_norm": 0.5116521716117859,
"learning_rate": 3.0054264377150733e-07,
"loss": 0.6214,
"step": 1635
},
{
"epoch": 2.0921673733898714,
"grad_norm": 0.5011716485023499,
"learning_rate": 3.0002568899732925e-07,
"loss": 0.6454,
"step": 1636
},
{
"epoch": 2.093447475798064,
"grad_norm": 0.7106552720069885,
"learning_rate": 2.9950921090899474e-07,
"loss": 0.6541,
"step": 1637
},
{
"epoch": 2.0947275782062564,
"grad_norm": 0.8108429908752441,
"learning_rate": 2.9899321049139563e-07,
"loss": 0.6604,
"step": 1638
},
{
"epoch": 2.096007680614449,
"grad_norm": 0.5725364685058594,
"learning_rate": 2.9847768872851386e-07,
"loss": 0.6431,
"step": 1639
},
{
"epoch": 2.097287783022642,
"grad_norm": 0.8272321224212646,
"learning_rate": 2.9796264660341814e-07,
"loss": 0.6475,
"step": 1640
},
{
"epoch": 2.0985678854308345,
"grad_norm": 0.5481138229370117,
"learning_rate": 2.974480850982622e-07,
"loss": 0.654,
"step": 1641
},
{
"epoch": 2.099847987839027,
"grad_norm": 0.6039546728134155,
"learning_rate": 2.96934005194284e-07,
"loss": 0.6672,
"step": 1642
},
{
"epoch": 2.1011280902472196,
"grad_norm": 0.7045806646347046,
"learning_rate": 2.964204078718027e-07,
"loss": 0.6532,
"step": 1643
},
{
"epoch": 2.1024081926554126,
"grad_norm": 1.810629963874817,
"learning_rate": 2.9590729411021676e-07,
"loss": 0.6473,
"step": 1644
},
{
"epoch": 2.103688295063605,
"grad_norm": 1.700823426246643,
"learning_rate": 2.953946648880035e-07,
"loss": 0.6411,
"step": 1645
},
{
"epoch": 2.1049683974717976,
"grad_norm": 2.3987796306610107,
"learning_rate": 2.948825211827155e-07,
"loss": 0.6665,
"step": 1646
},
{
"epoch": 2.10624849987999,
"grad_norm": 2.0299103260040283,
"learning_rate": 2.9437086397097993e-07,
"loss": 0.6486,
"step": 1647
},
{
"epoch": 2.107528602288183,
"grad_norm": 1.6957327127456665,
"learning_rate": 2.9385969422849583e-07,
"loss": 0.6299,
"step": 1648
},
{
"epoch": 2.1088087046963757,
"grad_norm": 0.7744299173355103,
"learning_rate": 2.933490129300329e-07,
"loss": 0.6477,
"step": 1649
},
{
"epoch": 2.1100888071045683,
"grad_norm": 0.4386851489543915,
"learning_rate": 2.928388210494296e-07,
"loss": 0.645,
"step": 1650
},
{
"epoch": 2.1100888071045683,
"eval_loss": 0.02020939625799656,
"eval_runtime": 42.1638,
"eval_samples_per_second": 11.764,
"eval_steps_per_second": 1.47,
"step": 1650
},
{
"epoch": 2.111368909512761,
"grad_norm": 0.41846761107444763,
"learning_rate": 2.923291195595907e-07,
"loss": 0.6313,
"step": 1651
},
{
"epoch": 2.112649011920954,
"grad_norm": 2.6253652572631836,
"learning_rate": 2.918199094324861e-07,
"loss": 0.6643,
"step": 1652
},
{
"epoch": 2.1139291143291463,
"grad_norm": 2.1426334381103516,
"learning_rate": 2.9131119163914847e-07,
"loss": 0.6237,
"step": 1653
},
{
"epoch": 2.115209216737339,
"grad_norm": 2.255629301071167,
"learning_rate": 2.9080296714967183e-07,
"loss": 0.6174,
"step": 1654
},
{
"epoch": 2.116489319145532,
"grad_norm": 1.0299196243286133,
"learning_rate": 2.902952369332097e-07,
"loss": 0.6234,
"step": 1655
},
{
"epoch": 2.1177694215537244,
"grad_norm": 1.690022349357605,
"learning_rate": 2.897880019579724e-07,
"loss": 0.6496,
"step": 1656
},
{
"epoch": 2.119049523961917,
"grad_norm": 1.1600192785263062,
"learning_rate": 2.8928126319122646e-07,
"loss": 0.6303,
"step": 1657
},
{
"epoch": 2.1203296263701095,
"grad_norm": 0.393515944480896,
"learning_rate": 2.887750215992919e-07,
"loss": 0.6285,
"step": 1658
},
{
"epoch": 2.1216097287783025,
"grad_norm": 0.9558416604995728,
"learning_rate": 2.8826927814754096e-07,
"loss": 0.6558,
"step": 1659
},
{
"epoch": 2.122889831186495,
"grad_norm": 0.3670780658721924,
"learning_rate": 2.8776403380039536e-07,
"loss": 0.633,
"step": 1660
},
{
"epoch": 2.1241699335946875,
"grad_norm": 2.515733480453491,
"learning_rate": 2.872592895213255e-07,
"loss": 0.6475,
"step": 1661
},
{
"epoch": 2.12545003600288,
"grad_norm": 0.7478556036949158,
"learning_rate": 2.8675504627284835e-07,
"loss": 0.6287,
"step": 1662
},
{
"epoch": 2.126730138411073,
"grad_norm": 1.8967583179473877,
"learning_rate": 2.862513050165249e-07,
"loss": 0.6593,
"step": 1663
},
{
"epoch": 2.1280102408192656,
"grad_norm": 1.2329922914505005,
"learning_rate": 2.857480667129591e-07,
"loss": 0.6353,
"step": 1664
},
{
"epoch": 2.129290343227458,
"grad_norm": 0.5741075873374939,
"learning_rate": 2.852453323217961e-07,
"loss": 0.6562,
"step": 1665
},
{
"epoch": 2.1305704456356507,
"grad_norm": 0.4127102196216583,
"learning_rate": 2.8474310280172004e-07,
"loss": 0.641,
"step": 1666
},
{
"epoch": 2.1318505480438437,
"grad_norm": 0.342703253030777,
"learning_rate": 2.8424137911045186e-07,
"loss": 0.6509,
"step": 1667
},
{
"epoch": 2.133130650452036,
"grad_norm": 1.8009696006774902,
"learning_rate": 2.8374016220474806e-07,
"loss": 0.6432,
"step": 1668
},
{
"epoch": 2.1344107528602287,
"grad_norm": 2.236605405807495,
"learning_rate": 2.83239453040399e-07,
"loss": 0.6525,
"step": 1669
},
{
"epoch": 2.1356908552684213,
"grad_norm": 1.8374378681182861,
"learning_rate": 2.8273925257222676e-07,
"loss": 0.6534,
"step": 1670
},
{
"epoch": 2.1369709576766143,
"grad_norm": 1.4547172784805298,
"learning_rate": 2.822395617540834e-07,
"loss": 0.6316,
"step": 1671
},
{
"epoch": 2.138251060084807,
"grad_norm": 0.9597583413124084,
"learning_rate": 2.817403815388486e-07,
"loss": 0.637,
"step": 1672
},
{
"epoch": 2.1395311624929993,
"grad_norm": 1.2263540029525757,
"learning_rate": 2.8124171287842903e-07,
"loss": 0.6572,
"step": 1673
},
{
"epoch": 2.140811264901192,
"grad_norm": 0.3359643518924713,
"learning_rate": 2.807435567237557e-07,
"loss": 0.6653,
"step": 1674
},
{
"epoch": 2.142091367309385,
"grad_norm": 0.6983374357223511,
"learning_rate": 2.8024591402478184e-07,
"loss": 0.6443,
"step": 1675
},
{
"epoch": 2.1433714697175774,
"grad_norm": 0.4310856759548187,
"learning_rate": 2.797487857304819e-07,
"loss": 0.6506,
"step": 1676
},
{
"epoch": 2.14465157212577,
"grad_norm": 0.9562615752220154,
"learning_rate": 2.792521727888495e-07,
"loss": 0.6348,
"step": 1677
},
{
"epoch": 2.145931674533963,
"grad_norm": 1.2613625526428223,
"learning_rate": 2.7875607614689557e-07,
"loss": 0.6432,
"step": 1678
},
{
"epoch": 2.1472117769421555,
"grad_norm": 0.378828763961792,
"learning_rate": 2.7826049675064616e-07,
"loss": 0.6462,
"step": 1679
},
{
"epoch": 2.148491879350348,
"grad_norm": 0.6812713146209717,
"learning_rate": 2.777654355451407e-07,
"loss": 0.6475,
"step": 1680
},
{
"epoch": 2.148491879350348,
"eval_loss": 0.02016257867217064,
"eval_runtime": 42.1253,
"eval_samples_per_second": 11.774,
"eval_steps_per_second": 1.472,
"step": 1680
},
{
"epoch": 2.1497719817585406,
"grad_norm": 0.4234199523925781,
"learning_rate": 2.772708934744316e-07,
"loss": 0.6331,
"step": 1681
},
{
"epoch": 2.1510520841667335,
"grad_norm": 1.2147167921066284,
"learning_rate": 2.7677687148157995e-07,
"loss": 0.6522,
"step": 1682
},
{
"epoch": 2.152332186574926,
"grad_norm": 1.3142248392105103,
"learning_rate": 2.762833705086562e-07,
"loss": 0.6716,
"step": 1683
},
{
"epoch": 2.1536122889831186,
"grad_norm": 1.7250616550445557,
"learning_rate": 2.757903914967364e-07,
"loss": 0.66,
"step": 1684
},
{
"epoch": 2.154892391391311,
"grad_norm": 1.1016346216201782,
"learning_rate": 2.7529793538590176e-07,
"loss": 0.636,
"step": 1685
},
{
"epoch": 2.156172493799504,
"grad_norm": 0.8684314489364624,
"learning_rate": 2.7480600311523626e-07,
"loss": 0.6587,
"step": 1686
},
{
"epoch": 2.1574525962076967,
"grad_norm": 0.4194318950176239,
"learning_rate": 2.743145956228248e-07,
"loss": 0.6315,
"step": 1687
},
{
"epoch": 2.1587326986158892,
"grad_norm": 0.7812890410423279,
"learning_rate": 2.738237138457515e-07,
"loss": 0.6715,
"step": 1688
},
{
"epoch": 2.1600128010240818,
"grad_norm": 0.8380625247955322,
"learning_rate": 2.733333587200984e-07,
"loss": 0.6703,
"step": 1689
},
{
"epoch": 2.1612929034322748,
"grad_norm": 0.45093443989753723,
"learning_rate": 2.7284353118094307e-07,
"loss": 0.6445,
"step": 1690
},
{
"epoch": 2.1625730058404673,
"grad_norm": 0.45473405718803406,
"learning_rate": 2.7235423216235655e-07,
"loss": 0.6636,
"step": 1691
},
{
"epoch": 2.16385310824866,
"grad_norm": 0.3037528097629547,
"learning_rate": 2.7186546259740245e-07,
"loss": 0.6689,
"step": 1692
},
{
"epoch": 2.1651332106568524,
"grad_norm": 0.3395703434944153,
"learning_rate": 2.71377223418135e-07,
"loss": 0.6447,
"step": 1693
},
{
"epoch": 2.1664133130650454,
"grad_norm": 0.5670493245124817,
"learning_rate": 2.7088951555559623e-07,
"loss": 0.6509,
"step": 1694
},
{
"epoch": 2.167693415473238,
"grad_norm": 1.1347262859344482,
"learning_rate": 2.7040233993981567e-07,
"loss": 0.6527,
"step": 1695
},
{
"epoch": 2.1689735178814304,
"grad_norm": 0.281864732503891,
"learning_rate": 2.699156974998078e-07,
"loss": 0.6541,
"step": 1696
},
{
"epoch": 2.170253620289623,
"grad_norm": 0.5861067175865173,
"learning_rate": 2.6942958916356994e-07,
"loss": 0.6492,
"step": 1697
},
{
"epoch": 2.171533722697816,
"grad_norm": 0.4594270586967468,
"learning_rate": 2.6894401585808146e-07,
"loss": 0.6656,
"step": 1698
},
{
"epoch": 2.1728138251060085,
"grad_norm": 1.157881259918213,
"learning_rate": 2.6845897850930075e-07,
"loss": 0.6273,
"step": 1699
},
{
"epoch": 2.174093927514201,
"grad_norm": 0.7559251189231873,
"learning_rate": 2.679744780421653e-07,
"loss": 0.6368,
"step": 1700
},
{
"epoch": 2.1753740299223936,
"grad_norm": 0.6006782054901123,
"learning_rate": 2.674905153805874e-07,
"loss": 0.6529,
"step": 1701
},
{
"epoch": 2.1766541323305866,
"grad_norm": 0.621809184551239,
"learning_rate": 2.670070914474551e-07,
"loss": 0.6498,
"step": 1702
},
{
"epoch": 2.177934234738779,
"grad_norm": 0.4362782835960388,
"learning_rate": 2.66524207164628e-07,
"loss": 0.6485,
"step": 1703
},
{
"epoch": 2.1792143371469717,
"grad_norm": 0.45238354802131653,
"learning_rate": 2.660418634529372e-07,
"loss": 0.651,
"step": 1704
},
{
"epoch": 2.180494439555164,
"grad_norm": 0.6232801675796509,
"learning_rate": 2.6556006123218334e-07,
"loss": 0.6282,
"step": 1705
},
{
"epoch": 2.181774541963357,
"grad_norm": 0.37600013613700867,
"learning_rate": 2.6507880142113343e-07,
"loss": 0.6669,
"step": 1706
},
{
"epoch": 2.1830546443715497,
"grad_norm": 0.5129969120025635,
"learning_rate": 2.64598084937521e-07,
"loss": 0.628,
"step": 1707
},
{
"epoch": 2.1843347467797423,
"grad_norm": 0.3126087486743927,
"learning_rate": 2.6411791269804346e-07,
"loss": 0.6486,
"step": 1708
},
{
"epoch": 2.1856148491879352,
"grad_norm": 0.6045825481414795,
"learning_rate": 2.6363828561835964e-07,
"loss": 0.6216,
"step": 1709
},
{
"epoch": 2.186894951596128,
"grad_norm": 0.3571005165576935,
"learning_rate": 2.631592046130896e-07,
"loss": 0.6717,
"step": 1710
},
{
"epoch": 2.186894951596128,
"eval_loss": 0.0201637614518404,
"eval_runtime": 42.1562,
"eval_samples_per_second": 11.766,
"eval_steps_per_second": 1.471,
"step": 1710
},
{
"epoch": 2.1881750540043203,
"grad_norm": 1.2080676555633545,
"learning_rate": 2.6268067059581167e-07,
"loss": 0.6336,
"step": 1711
},
{
"epoch": 2.189455156412513,
"grad_norm": 0.5084894895553589,
"learning_rate": 2.622026844790613e-07,
"loss": 0.6457,
"step": 1712
},
{
"epoch": 2.190735258820706,
"grad_norm": 0.2760125398635864,
"learning_rate": 2.61725247174329e-07,
"loss": 0.6543,
"step": 1713
},
{
"epoch": 2.1920153612288984,
"grad_norm": 0.3985959589481354,
"learning_rate": 2.6124835959205815e-07,
"loss": 0.6456,
"step": 1714
},
{
"epoch": 2.193295463637091,
"grad_norm": 0.510375440120697,
"learning_rate": 2.6077202264164535e-07,
"loss": 0.6357,
"step": 1715
},
{
"epoch": 2.1945755660452835,
"grad_norm": 0.513554036617279,
"learning_rate": 2.602962372314357e-07,
"loss": 0.6494,
"step": 1716
},
{
"epoch": 2.1958556684534765,
"grad_norm": 0.2993606925010681,
"learning_rate": 2.598210042687233e-07,
"loss": 0.6481,
"step": 1717
},
{
"epoch": 2.197135770861669,
"grad_norm": 0.32825639843940735,
"learning_rate": 2.593463246597483e-07,
"loss": 0.6301,
"step": 1718
},
{
"epoch": 2.1984158732698615,
"grad_norm": 0.4421074688434601,
"learning_rate": 2.588721993096964e-07,
"loss": 0.6351,
"step": 1719
},
{
"epoch": 2.199695975678054,
"grad_norm": 0.793501079082489,
"learning_rate": 2.583986291226956e-07,
"loss": 0.6503,
"step": 1720
},
{
"epoch": 2.200976078086247,
"grad_norm": 0.8071904182434082,
"learning_rate": 2.579256150018154e-07,
"loss": 0.6461,
"step": 1721
},
{
"epoch": 2.2022561804944396,
"grad_norm": 0.5882528424263,
"learning_rate": 2.5745315784906507e-07,
"loss": 0.65,
"step": 1722
},
{
"epoch": 2.203536282902632,
"grad_norm": 1.0173689126968384,
"learning_rate": 2.5698125856539187e-07,
"loss": 0.654,
"step": 1723
},
{
"epoch": 2.2048163853108247,
"grad_norm": 0.3979182839393616,
"learning_rate": 2.565099180506792e-07,
"loss": 0.6728,
"step": 1724
},
{
"epoch": 2.2060964877190177,
"grad_norm": 0.6809709668159485,
"learning_rate": 2.5603913720374446e-07,
"loss": 0.6424,
"step": 1725
},
{
"epoch": 2.20737659012721,
"grad_norm": 0.37447798252105713,
"learning_rate": 2.555689169223384e-07,
"loss": 0.6367,
"step": 1726
},
{
"epoch": 2.2086566925354028,
"grad_norm": 0.595008373260498,
"learning_rate": 2.5509925810314263e-07,
"loss": 0.649,
"step": 1727
},
{
"epoch": 2.2099367949435953,
"grad_norm": 0.4547620117664337,
"learning_rate": 2.5463016164176775e-07,
"loss": 0.6324,
"step": 1728
},
{
"epoch": 2.2112168973517883,
"grad_norm": 0.668886125087738,
"learning_rate": 2.5416162843275244e-07,
"loss": 0.6603,
"step": 1729
},
{
"epoch": 2.212496999759981,
"grad_norm": 0.30635368824005127,
"learning_rate": 2.536936593695611e-07,
"loss": 0.6505,
"step": 1730
},
{
"epoch": 2.2137771021681734,
"grad_norm": 0.6017919778823853,
"learning_rate": 2.532262553445824e-07,
"loss": 0.6103,
"step": 1731
},
{
"epoch": 2.215057204576366,
"grad_norm": 1.049589991569519,
"learning_rate": 2.527594172491274e-07,
"loss": 0.6411,
"step": 1732
},
{
"epoch": 2.216337306984559,
"grad_norm": 0.6042690277099609,
"learning_rate": 2.5229314597342775e-07,
"loss": 0.6476,
"step": 1733
},
{
"epoch": 2.2176174093927514,
"grad_norm": 1.0028924942016602,
"learning_rate": 2.518274424066349e-07,
"loss": 0.6268,
"step": 1734
},
{
"epoch": 2.218897511800944,
"grad_norm": 0.2927337884902954,
"learning_rate": 2.5136230743681706e-07,
"loss": 0.6425,
"step": 1735
},
{
"epoch": 2.2201776142091365,
"grad_norm": 1.6567517518997192,
"learning_rate": 2.508977419509586e-07,
"loss": 0.633,
"step": 1736
},
{
"epoch": 2.2214577166173295,
"grad_norm": 0.4849896728992462,
"learning_rate": 2.504337468349573e-07,
"loss": 0.6511,
"step": 1737
},
{
"epoch": 2.222737819025522,
"grad_norm": 0.30732324719429016,
"learning_rate": 2.4997032297362404e-07,
"loss": 0.6561,
"step": 1738
},
{
"epoch": 2.2240179214337146,
"grad_norm": 0.7090358138084412,
"learning_rate": 2.4950747125068e-07,
"loss": 0.6166,
"step": 1739
},
{
"epoch": 2.2252980238419076,
"grad_norm": 0.9555342793464661,
"learning_rate": 2.4904519254875516e-07,
"loss": 0.6499,
"step": 1740
},
{
"epoch": 2.2252980238419076,
"eval_loss": 0.020158497616648674,
"eval_runtime": 42.173,
"eval_samples_per_second": 11.761,
"eval_steps_per_second": 1.47,
"step": 1740
},
{
"epoch": 2.2265781262501,
"grad_norm": 0.5362710356712341,
"learning_rate": 2.48583487749387e-07,
"loss": 0.625,
"step": 1741
},
{
"epoch": 2.2278582286582926,
"grad_norm": 0.32860302925109863,
"learning_rate": 2.481223577330188e-07,
"loss": 0.6407,
"step": 1742
},
{
"epoch": 2.229138331066485,
"grad_norm": 0.36726707220077515,
"learning_rate": 2.476618033789971e-07,
"loss": 0.6376,
"step": 1743
},
{
"epoch": 2.230418433474678,
"grad_norm": 0.528809130191803,
"learning_rate": 2.472018255655714e-07,
"loss": 0.6253,
"step": 1744
},
{
"epoch": 2.2316985358828707,
"grad_norm": 0.41761714220046997,
"learning_rate": 2.467424251698914e-07,
"loss": 0.6488,
"step": 1745
},
{
"epoch": 2.2329786382910632,
"grad_norm": 0.4091174602508545,
"learning_rate": 2.462836030680059e-07,
"loss": 0.6485,
"step": 1746
},
{
"epoch": 2.234258740699256,
"grad_norm": 0.277052640914917,
"learning_rate": 2.4582536013486054e-07,
"loss": 0.6455,
"step": 1747
},
{
"epoch": 2.2355388431074488,
"grad_norm": 0.8211119771003723,
"learning_rate": 2.45367697244297e-07,
"loss": 0.6452,
"step": 1748
},
{
"epoch": 2.2368189455156413,
"grad_norm": 1.5637989044189453,
"learning_rate": 2.449106152690507e-07,
"loss": 0.6307,
"step": 1749
},
{
"epoch": 2.238099047923834,
"grad_norm": 0.436737596988678,
"learning_rate": 2.444541150807489e-07,
"loss": 0.6856,
"step": 1750
},
{
"epoch": 2.2393791503320264,
"grad_norm": 0.3942205011844635,
"learning_rate": 2.4399819754991024e-07,
"loss": 0.6482,
"step": 1751
},
{
"epoch": 2.2406592527402194,
"grad_norm": 0.48517122864723206,
"learning_rate": 2.4354286354594125e-07,
"loss": 0.6437,
"step": 1752
},
{
"epoch": 2.241939355148412,
"grad_norm": 0.397705614566803,
"learning_rate": 2.4308811393713674e-07,
"loss": 0.6446,
"step": 1753
},
{
"epoch": 2.2432194575566045,
"grad_norm": 1.196399211883545,
"learning_rate": 2.426339495906764e-07,
"loss": 0.6583,
"step": 1754
},
{
"epoch": 2.244499559964797,
"grad_norm": 0.7584346532821655,
"learning_rate": 2.4218037137262397e-07,
"loss": 0.6268,
"step": 1755
},
{
"epoch": 2.24577966237299,
"grad_norm": 1.5611481666564941,
"learning_rate": 2.417273801479257e-07,
"loss": 0.6745,
"step": 1756
},
{
"epoch": 2.2470597647811825,
"grad_norm": 0.4745704233646393,
"learning_rate": 2.4127497678040845e-07,
"loss": 0.6377,
"step": 1757
},
{
"epoch": 2.248339867189375,
"grad_norm": 0.385536253452301,
"learning_rate": 2.4082316213277796e-07,
"loss": 0.653,
"step": 1758
},
{
"epoch": 2.2496199695975676,
"grad_norm": 0.9994971752166748,
"learning_rate": 2.403719370666172e-07,
"loss": 0.6381,
"step": 1759
},
{
"epoch": 2.2509000720057606,
"grad_norm": 0.7433024048805237,
"learning_rate": 2.399213024423851e-07,
"loss": 0.6528,
"step": 1760
},
{
"epoch": 2.252180174413953,
"grad_norm": 0.3050110340118408,
"learning_rate": 2.394712591194147e-07,
"loss": 0.6661,
"step": 1761
},
{
"epoch": 2.2534602768221457,
"grad_norm": 0.8573849201202393,
"learning_rate": 2.390218079559109e-07,
"loss": 0.6334,
"step": 1762
},
{
"epoch": 2.2547403792303387,
"grad_norm": 0.940575122833252,
"learning_rate": 2.385729498089502e-07,
"loss": 0.6533,
"step": 1763
},
{
"epoch": 2.256020481638531,
"grad_norm": 0.42652419209480286,
"learning_rate": 2.381246855344776e-07,
"loss": 0.6431,
"step": 1764
},
{
"epoch": 2.2573005840467237,
"grad_norm": 0.32327961921691895,
"learning_rate": 2.3767701598730615e-07,
"loss": 0.6257,
"step": 1765
},
{
"epoch": 2.2585806864549163,
"grad_norm": 0.3992592692375183,
"learning_rate": 2.3722994202111435e-07,
"loss": 0.642,
"step": 1766
},
{
"epoch": 2.259860788863109,
"grad_norm": 0.6527149081230164,
"learning_rate": 2.3678346448844483e-07,
"loss": 0.6657,
"step": 1767
},
{
"epoch": 2.261140891271302,
"grad_norm": 1.0382518768310547,
"learning_rate": 2.3633758424070372e-07,
"loss": 0.6281,
"step": 1768
},
{
"epoch": 2.2624209936794943,
"grad_norm": 1.5223629474639893,
"learning_rate": 2.358923021281571e-07,
"loss": 0.6348,
"step": 1769
},
{
"epoch": 2.263701096087687,
"grad_norm": 0.27793729305267334,
"learning_rate": 2.3544761899993136e-07,
"loss": 0.6533,
"step": 1770
},
{
"epoch": 2.263701096087687,
"eval_loss": 0.02012365497648716,
"eval_runtime": 42.0793,
"eval_samples_per_second": 11.787,
"eval_steps_per_second": 1.473,
"step": 1770
},
{
"epoch": 2.26498119849588,
"grad_norm": 0.29933908581733704,
"learning_rate": 2.3500353570400988e-07,
"loss": 0.6327,
"step": 1771
},
{
"epoch": 2.2662613009040724,
"grad_norm": 0.5139304399490356,
"learning_rate": 2.3456005308723276e-07,
"loss": 0.6492,
"step": 1772
},
{
"epoch": 2.267541403312265,
"grad_norm": 0.5903033018112183,
"learning_rate": 2.341171719952945e-07,
"loss": 0.652,
"step": 1773
},
{
"epoch": 2.2688215057204575,
"grad_norm": 0.8121602535247803,
"learning_rate": 2.3367489327274227e-07,
"loss": 0.629,
"step": 1774
},
{
"epoch": 2.2701016081286505,
"grad_norm": 0.3843027651309967,
"learning_rate": 2.3323321776297478e-07,
"loss": 0.6317,
"step": 1775
},
{
"epoch": 2.271381710536843,
"grad_norm": 0.7982187867164612,
"learning_rate": 2.3279214630824052e-07,
"loss": 0.636,
"step": 1776
},
{
"epoch": 2.2726618129450356,
"grad_norm": 0.40144699811935425,
"learning_rate": 2.3235167974963614e-07,
"loss": 0.639,
"step": 1777
},
{
"epoch": 2.273941915353228,
"grad_norm": 0.7816945910453796,
"learning_rate": 2.3191181892710434e-07,
"loss": 0.6281,
"step": 1778
},
{
"epoch": 2.275222017761421,
"grad_norm": 0.2934492230415344,
"learning_rate": 2.3147256467943316e-07,
"loss": 0.6665,
"step": 1779
},
{
"epoch": 2.2765021201696136,
"grad_norm": 0.8136604428291321,
"learning_rate": 2.310339178442539e-07,
"loss": 0.6292,
"step": 1780
},
{
"epoch": 2.277782222577806,
"grad_norm": 0.45339545607566833,
"learning_rate": 2.305958792580392e-07,
"loss": 0.6539,
"step": 1781
},
{
"epoch": 2.2790623249859987,
"grad_norm": 0.5785622000694275,
"learning_rate": 2.3015844975610238e-07,
"loss": 0.6457,
"step": 1782
},
{
"epoch": 2.2803424273941917,
"grad_norm": 1.0654321908950806,
"learning_rate": 2.2972163017259467e-07,
"loss": 0.6603,
"step": 1783
},
{
"epoch": 2.2816225298023842,
"grad_norm": 0.3077518343925476,
"learning_rate": 2.2928542134050457e-07,
"loss": 0.6581,
"step": 1784
},
{
"epoch": 2.2829026322105768,
"grad_norm": 0.32112276554107666,
"learning_rate": 2.2884982409165615e-07,
"loss": 0.6318,
"step": 1785
},
{
"epoch": 2.2841827346187698,
"grad_norm": 0.622465968132019,
"learning_rate": 2.284148392567065e-07,
"loss": 0.6363,
"step": 1786
},
{
"epoch": 2.2854628370269623,
"grad_norm": 0.4420005977153778,
"learning_rate": 2.2798046766514555e-07,
"loss": 0.65,
"step": 1787
},
{
"epoch": 2.286742939435155,
"grad_norm": 0.33567139506340027,
"learning_rate": 2.2754671014529347e-07,
"loss": 0.6298,
"step": 1788
},
{
"epoch": 2.2880230418433474,
"grad_norm": 0.5566020011901855,
"learning_rate": 2.2711356752429978e-07,
"loss": 0.651,
"step": 1789
},
{
"epoch": 2.28930314425154,
"grad_norm": 0.8339033722877502,
"learning_rate": 2.2668104062814084e-07,
"loss": 0.6603,
"step": 1790
},
{
"epoch": 2.290583246659733,
"grad_norm": 1.1019378900527954,
"learning_rate": 2.262491302816193e-07,
"loss": 0.6372,
"step": 1791
},
{
"epoch": 2.2918633490679254,
"grad_norm": 1.1420990228652954,
"learning_rate": 2.2581783730836222e-07,
"loss": 0.6542,
"step": 1792
},
{
"epoch": 2.293143451476118,
"grad_norm": 0.39219775795936584,
"learning_rate": 2.2538716253081875e-07,
"loss": 0.6465,
"step": 1793
},
{
"epoch": 2.294423553884311,
"grad_norm": 0.5957415103912354,
"learning_rate": 2.2495710677025974e-07,
"loss": 0.6213,
"step": 1794
},
{
"epoch": 2.2957036562925035,
"grad_norm": 0.7786949872970581,
"learning_rate": 2.2452767084677559e-07,
"loss": 0.6439,
"step": 1795
},
{
"epoch": 2.296983758700696,
"grad_norm": 1.0307668447494507,
"learning_rate": 2.2409885557927427e-07,
"loss": 0.6472,
"step": 1796
},
{
"epoch": 2.2982638611088886,
"grad_norm": 1.162601351737976,
"learning_rate": 2.236706617854807e-07,
"loss": 0.6228,
"step": 1797
},
{
"epoch": 2.299543963517081,
"grad_norm": 0.2867487370967865,
"learning_rate": 2.2324309028193411e-07,
"loss": 0.6392,
"step": 1798
},
{
"epoch": 2.300824065925274,
"grad_norm": 0.30754393339157104,
"learning_rate": 2.2281614188398795e-07,
"loss": 0.6541,
"step": 1799
},
{
"epoch": 2.3021041683334666,
"grad_norm": 0.8162621259689331,
"learning_rate": 2.223898174058065e-07,
"loss": 0.665,
"step": 1800
},
{
"epoch": 2.3021041683334666,
"eval_loss": 0.02015284076333046,
"eval_runtime": 42.1539,
"eval_samples_per_second": 11.766,
"eval_steps_per_second": 1.471,
"step": 1800
},
{
"epoch": 2.303384270741659,
"grad_norm": 0.4854496121406555,
"learning_rate": 2.2196411766036487e-07,
"loss": 0.6539,
"step": 1801
},
{
"epoch": 2.304664373149852,
"grad_norm": 0.3153534531593323,
"learning_rate": 2.215390434594465e-07,
"loss": 0.6312,
"step": 1802
},
{
"epoch": 2.3059444755580447,
"grad_norm": 0.4862923324108124,
"learning_rate": 2.2111459561364214e-07,
"loss": 0.6612,
"step": 1803
},
{
"epoch": 2.3072245779662373,
"grad_norm": 0.8877408504486084,
"learning_rate": 2.2069077493234828e-07,
"loss": 0.635,
"step": 1804
},
{
"epoch": 2.30850468037443,
"grad_norm": 0.32969245314598083,
"learning_rate": 2.2026758222376487e-07,
"loss": 0.6496,
"step": 1805
},
{
"epoch": 2.309784782782623,
"grad_norm": 0.4842302203178406,
"learning_rate": 2.19845018294895e-07,
"loss": 0.6378,
"step": 1806
},
{
"epoch": 2.3110648851908153,
"grad_norm": 0.2898105978965759,
"learning_rate": 2.1942308395154247e-07,
"loss": 0.6399,
"step": 1807
},
{
"epoch": 2.312344987599008,
"grad_norm": 0.5234752297401428,
"learning_rate": 2.190017799983102e-07,
"loss": 0.659,
"step": 1808
},
{
"epoch": 2.3136250900072004,
"grad_norm": 1.0354506969451904,
"learning_rate": 2.1858110723859945e-07,
"loss": 0.6449,
"step": 1809
},
{
"epoch": 2.3149051924153934,
"grad_norm": 2.200321912765503,
"learning_rate": 2.181610664746077e-07,
"loss": 0.6705,
"step": 1810
},
{
"epoch": 2.316185294823586,
"grad_norm": 1.7531229257583618,
"learning_rate": 2.1774165850732723e-07,
"loss": 0.6559,
"step": 1811
},
{
"epoch": 2.3174653972317785,
"grad_norm": 0.3324636220932007,
"learning_rate": 2.1732288413654343e-07,
"loss": 0.6529,
"step": 1812
},
{
"epoch": 2.318745499639971,
"grad_norm": 0.6571164727210999,
"learning_rate": 2.169047441608335e-07,
"loss": 0.6681,
"step": 1813
},
{
"epoch": 2.320025602048164,
"grad_norm": 0.400339812040329,
"learning_rate": 2.164872393775654e-07,
"loss": 0.6483,
"step": 1814
},
{
"epoch": 2.3213057044563565,
"grad_norm": 0.2698453962802887,
"learning_rate": 2.1607037058289506e-07,
"loss": 0.6573,
"step": 1815
},
{
"epoch": 2.322585806864549,
"grad_norm": 0.6890880465507507,
"learning_rate": 2.1565413857176622e-07,
"loss": 0.6482,
"step": 1816
},
{
"epoch": 2.323865909272742,
"grad_norm": 0.28772851824760437,
"learning_rate": 2.1523854413790774e-07,
"loss": 0.6543,
"step": 1817
},
{
"epoch": 2.3251460116809346,
"grad_norm": 0.6504804491996765,
"learning_rate": 2.1482358807383343e-07,
"loss": 0.6453,
"step": 1818
},
{
"epoch": 2.326426114089127,
"grad_norm": 0.921272873878479,
"learning_rate": 2.1440927117083916e-07,
"loss": 0.6267,
"step": 1819
},
{
"epoch": 2.3277062164973197,
"grad_norm": 0.4007938504219055,
"learning_rate": 2.139955942190019e-07,
"loss": 0.6349,
"step": 1820
},
{
"epoch": 2.328986318905512,
"grad_norm": 0.30225899815559387,
"learning_rate": 2.1358255800717874e-07,
"loss": 0.6642,
"step": 1821
},
{
"epoch": 2.330266421313705,
"grad_norm": 0.27912068367004395,
"learning_rate": 2.1317016332300448e-07,
"loss": 0.6353,
"step": 1822
},
{
"epoch": 2.3315465237218977,
"grad_norm": 1.1977477073669434,
"learning_rate": 2.1275841095289103e-07,
"loss": 0.6121,
"step": 1823
},
{
"epoch": 2.3328266261300903,
"grad_norm": 0.9994994401931763,
"learning_rate": 2.1234730168202497e-07,
"loss": 0.6363,
"step": 1824
},
{
"epoch": 2.3341067285382833,
"grad_norm": 0.3838488757610321,
"learning_rate": 2.1193683629436675e-07,
"loss": 0.6278,
"step": 1825
},
{
"epoch": 2.335386830946476,
"grad_norm": 0.5517988801002502,
"learning_rate": 2.1152701557264913e-07,
"loss": 0.6426,
"step": 1826
},
{
"epoch": 2.3366669333546684,
"grad_norm": 0.6919355392456055,
"learning_rate": 2.1111784029837509e-07,
"loss": 0.6672,
"step": 1827
},
{
"epoch": 2.337947035762861,
"grad_norm": 0.6093190908432007,
"learning_rate": 2.1070931125181723e-07,
"loss": 0.6386,
"step": 1828
},
{
"epoch": 2.339227138171054,
"grad_norm": 1.0338945388793945,
"learning_rate": 2.1030142921201554e-07,
"loss": 0.649,
"step": 1829
},
{
"epoch": 2.3405072405792464,
"grad_norm": 0.43368566036224365,
"learning_rate": 2.0989419495677658e-07,
"loss": 0.6447,
"step": 1830
},
{
"epoch": 2.3405072405792464,
"eval_loss": 0.02010626532137394,
"eval_runtime": 42.0908,
"eval_samples_per_second": 11.784,
"eval_steps_per_second": 1.473,
"step": 1830
},
{
"epoch": 2.341787342987439,
"grad_norm": 0.6235509514808655,
"learning_rate": 2.0948760926267118e-07,
"loss": 0.6515,
"step": 1831
},
{
"epoch": 2.3430674453956315,
"grad_norm": 1.3620926141738892,
"learning_rate": 2.0908167290503326e-07,
"loss": 0.6815,
"step": 1832
},
{
"epoch": 2.3443475478038245,
"grad_norm": 0.5476362705230713,
"learning_rate": 2.0867638665795948e-07,
"loss": 0.6463,
"step": 1833
},
{
"epoch": 2.345627650212017,
"grad_norm": 0.9010919332504272,
"learning_rate": 2.0827175129430562e-07,
"loss": 0.6424,
"step": 1834
},
{
"epoch": 2.3469077526202096,
"grad_norm": 0.7875086665153503,
"learning_rate": 2.0786776758568715e-07,
"loss": 0.6387,
"step": 1835
},
{
"epoch": 2.348187855028402,
"grad_norm": 0.40548086166381836,
"learning_rate": 2.07464436302476e-07,
"loss": 0.6341,
"step": 1836
},
{
"epoch": 2.349467957436595,
"grad_norm": 0.5045724511146545,
"learning_rate": 2.0706175821380088e-07,
"loss": 0.6604,
"step": 1837
},
{
"epoch": 2.3507480598447876,
"grad_norm": 0.28327035903930664,
"learning_rate": 2.0665973408754434e-07,
"loss": 0.6143,
"step": 1838
},
{
"epoch": 2.35202816225298,
"grad_norm": 0.7128240466117859,
"learning_rate": 2.062583646903419e-07,
"loss": 0.6582,
"step": 1839
},
{
"epoch": 2.3533082646611727,
"grad_norm": 1.006453037261963,
"learning_rate": 2.0585765078758073e-07,
"loss": 0.6578,
"step": 1840
},
{
"epoch": 2.3545883670693657,
"grad_norm": 0.3793086111545563,
"learning_rate": 2.05457593143398e-07,
"loss": 0.6547,
"step": 1841
},
{
"epoch": 2.3558684694775582,
"grad_norm": 0.2993364930152893,
"learning_rate": 2.0505819252067924e-07,
"loss": 0.6294,
"step": 1842
},
{
"epoch": 2.3571485718857508,
"grad_norm": 0.3089614510536194,
"learning_rate": 2.046594496810572e-07,
"loss": 0.6536,
"step": 1843
},
{
"epoch": 2.3584286742939433,
"grad_norm": 0.30341318249702454,
"learning_rate": 2.0426136538491028e-07,
"loss": 0.6429,
"step": 1844
},
{
"epoch": 2.3597087767021363,
"grad_norm": 1.006575345993042,
"learning_rate": 2.0386394039136135e-07,
"loss": 0.6504,
"step": 1845
},
{
"epoch": 2.360988879110329,
"grad_norm": 0.25898298621177673,
"learning_rate": 2.0346717545827537e-07,
"loss": 0.6641,
"step": 1846
},
{
"epoch": 2.3622689815185214,
"grad_norm": 0.28283822536468506,
"learning_rate": 2.0307107134225917e-07,
"loss": 0.6379,
"step": 1847
},
{
"epoch": 2.3635490839267144,
"grad_norm": 0.2747233808040619,
"learning_rate": 2.0267562879865938e-07,
"loss": 0.6539,
"step": 1848
},
{
"epoch": 2.364829186334907,
"grad_norm": 0.34003594517707825,
"learning_rate": 2.022808485815606e-07,
"loss": 0.6524,
"step": 1849
},
{
"epoch": 2.3661092887430994,
"grad_norm": 0.3853084444999695,
"learning_rate": 2.018867314437852e-07,
"loss": 0.6226,
"step": 1850
},
{
"epoch": 2.367389391151292,
"grad_norm": 0.9650640487670898,
"learning_rate": 2.014932781368901e-07,
"loss": 0.6398,
"step": 1851
},
{
"epoch": 2.3686694935594845,
"grad_norm": 0.8094896078109741,
"learning_rate": 2.0110048941116744e-07,
"loss": 0.6344,
"step": 1852
},
{
"epoch": 2.3699495959676775,
"grad_norm": 0.5167139172554016,
"learning_rate": 2.0070836601564123e-07,
"loss": 0.65,
"step": 1853
},
{
"epoch": 2.37122969837587,
"grad_norm": 0.3214775025844574,
"learning_rate": 2.003169086980669e-07,
"loss": 0.6513,
"step": 1854
},
{
"epoch": 2.3725098007840626,
"grad_norm": 0.9151511192321777,
"learning_rate": 1.9992611820492987e-07,
"loss": 0.6614,
"step": 1855
},
{
"epoch": 2.3737899031922556,
"grad_norm": 0.2876303791999817,
"learning_rate": 1.9953599528144393e-07,
"loss": 0.6448,
"step": 1856
},
{
"epoch": 2.375070005600448,
"grad_norm": 0.9985367655754089,
"learning_rate": 1.9914654067154996e-07,
"loss": 0.64,
"step": 1857
},
{
"epoch": 2.3763501080086407,
"grad_norm": 1.0177196264266968,
"learning_rate": 1.9875775511791405e-07,
"loss": 0.6351,
"step": 1858
},
{
"epoch": 2.377630210416833,
"grad_norm": 0.8262308835983276,
"learning_rate": 1.9836963936192668e-07,
"loss": 0.6422,
"step": 1859
},
{
"epoch": 2.378910312825026,
"grad_norm": 0.6126952767372131,
"learning_rate": 1.9798219414370125e-07,
"loss": 0.6483,
"step": 1860
},
{
"epoch": 2.378910312825026,
"eval_loss": 0.02008889988064766,
"eval_runtime": 42.0694,
"eval_samples_per_second": 11.79,
"eval_steps_per_second": 1.474,
"step": 1860
},
{
"epoch": 2.3801904152332187,
"grad_norm": 0.39929261803627014,
"learning_rate": 1.9759542020207208e-07,
"loss": 0.6472,
"step": 1861
},
{
"epoch": 2.3814705176414113,
"grad_norm": 0.349311888217926,
"learning_rate": 1.972093182745936e-07,
"loss": 0.645,
"step": 1862
},
{
"epoch": 2.382750620049604,
"grad_norm": 0.6252041459083557,
"learning_rate": 1.968238890975388e-07,
"loss": 0.6548,
"step": 1863
},
{
"epoch": 2.384030722457797,
"grad_norm": 0.5257276892662048,
"learning_rate": 1.9643913340589796e-07,
"loss": 0.6434,
"step": 1864
},
{
"epoch": 2.3853108248659893,
"grad_norm": 0.5241679549217224,
"learning_rate": 1.9605505193337656e-07,
"loss": 0.6397,
"step": 1865
},
{
"epoch": 2.386590927274182,
"grad_norm": 0.4854609966278076,
"learning_rate": 1.9567164541239458e-07,
"loss": 0.6457,
"step": 1866
},
{
"epoch": 2.3878710296823744,
"grad_norm": 0.9014168977737427,
"learning_rate": 1.9528891457408537e-07,
"loss": 0.6368,
"step": 1867
},
{
"epoch": 2.3891511320905674,
"grad_norm": 0.8353707194328308,
"learning_rate": 1.949068601482931e-07,
"loss": 0.6263,
"step": 1868
},
{
"epoch": 2.39043123449876,
"grad_norm": 0.5165855884552002,
"learning_rate": 1.9452548286357257e-07,
"loss": 0.6397,
"step": 1869
},
{
"epoch": 2.3917113369069525,
"grad_norm": 0.32406508922576904,
"learning_rate": 1.9414478344718686e-07,
"loss": 0.6502,
"step": 1870
},
{
"epoch": 2.392991439315145,
"grad_norm": 1.0820974111557007,
"learning_rate": 1.9376476262510693e-07,
"loss": 0.66,
"step": 1871
},
{
"epoch": 2.394271541723338,
"grad_norm": 0.47412022948265076,
"learning_rate": 1.933854211220094e-07,
"loss": 0.6517,
"step": 1872
},
{
"epoch": 2.3955516441315305,
"grad_norm": 0.6075067520141602,
"learning_rate": 1.930067596612753e-07,
"loss": 0.6502,
"step": 1873
},
{
"epoch": 2.396831746539723,
"grad_norm": 1.3067188262939453,
"learning_rate": 1.9262877896498918e-07,
"loss": 0.6407,
"step": 1874
},
{
"epoch": 2.3981118489479156,
"grad_norm": 0.864513635635376,
"learning_rate": 1.9225147975393729e-07,
"loss": 0.6598,
"step": 1875
},
{
"epoch": 2.3993919513561086,
"grad_norm": 0.708365797996521,
"learning_rate": 1.9187486274760646e-07,
"loss": 0.6525,
"step": 1876
},
{
"epoch": 2.400672053764301,
"grad_norm": 0.5684159994125366,
"learning_rate": 1.9149892866418227e-07,
"loss": 0.6589,
"step": 1877
},
{
"epoch": 2.4019521561724937,
"grad_norm": 0.7958438992500305,
"learning_rate": 1.9112367822054825e-07,
"loss": 0.6633,
"step": 1878
},
{
"epoch": 2.4032322585806867,
"grad_norm": 1.810461163520813,
"learning_rate": 1.9074911213228438e-07,
"loss": 0.6418,
"step": 1879
},
{
"epoch": 2.404512360988879,
"grad_norm": 1.2592270374298096,
"learning_rate": 1.9037523111366523e-07,
"loss": 0.6457,
"step": 1880
},
{
"epoch": 2.4057924633970718,
"grad_norm": 1.924454689025879,
"learning_rate": 1.9000203587765933e-07,
"loss": 0.6351,
"step": 1881
},
{
"epoch": 2.4070725658052643,
"grad_norm": 1.0833786725997925,
"learning_rate": 1.896295271359275e-07,
"loss": 0.639,
"step": 1882
},
{
"epoch": 2.408352668213457,
"grad_norm": 1.5531961917877197,
"learning_rate": 1.8925770559882103e-07,
"loss": 0.6515,
"step": 1883
},
{
"epoch": 2.40963277062165,
"grad_norm": 0.4649311304092407,
"learning_rate": 1.8888657197538122e-07,
"loss": 0.6405,
"step": 1884
},
{
"epoch": 2.4109128730298424,
"grad_norm": 0.36879318952560425,
"learning_rate": 1.8851612697333723e-07,
"loss": 0.6512,
"step": 1885
},
{
"epoch": 2.412192975438035,
"grad_norm": 0.32952210307121277,
"learning_rate": 1.8814637129910533e-07,
"loss": 0.6293,
"step": 1886
},
{
"epoch": 2.413473077846228,
"grad_norm": 1.4149285554885864,
"learning_rate": 1.8777730565778704e-07,
"loss": 0.6734,
"step": 1887
},
{
"epoch": 2.4147531802544204,
"grad_norm": 1.2685195207595825,
"learning_rate": 1.8740893075316837e-07,
"loss": 0.6497,
"step": 1888
},
{
"epoch": 2.416033282662613,
"grad_norm": 1.7101200819015503,
"learning_rate": 1.8704124728771765e-07,
"loss": 0.657,
"step": 1889
},
{
"epoch": 2.4173133850708055,
"grad_norm": 0.5529716610908508,
"learning_rate": 1.8667425596258496e-07,
"loss": 0.6414,
"step": 1890
},
{
"epoch": 2.4173133850708055,
"eval_loss": 0.02006075717508793,
"eval_runtime": 42.0208,
"eval_samples_per_second": 11.804,
"eval_steps_per_second": 1.475,
"step": 1890
},
{
"epoch": 2.4185934874789985,
"grad_norm": 1.6830273866653442,
"learning_rate": 1.8630795747760072e-07,
"loss": 0.6208,
"step": 1891
},
{
"epoch": 2.419873589887191,
"grad_norm": 0.35148826241493225,
"learning_rate": 1.8594235253127372e-07,
"loss": 0.6287,
"step": 1892
},
{
"epoch": 2.4211536922953836,
"grad_norm": 0.4713979661464691,
"learning_rate": 1.855774418207904e-07,
"loss": 0.6293,
"step": 1893
},
{
"epoch": 2.422433794703576,
"grad_norm": 0.6958292722702026,
"learning_rate": 1.8521322604201345e-07,
"loss": 0.6322,
"step": 1894
},
{
"epoch": 2.423713897111769,
"grad_norm": 0.2775862514972687,
"learning_rate": 1.8484970588948018e-07,
"loss": 0.6341,
"step": 1895
},
{
"epoch": 2.4249939995199616,
"grad_norm": 0.26912301778793335,
"learning_rate": 1.8448688205640146e-07,
"loss": 0.6446,
"step": 1896
},
{
"epoch": 2.426274101928154,
"grad_norm": 0.5997962951660156,
"learning_rate": 1.8412475523466031e-07,
"loss": 0.6525,
"step": 1897
},
{
"epoch": 2.4275542043363467,
"grad_norm": 0.8969947695732117,
"learning_rate": 1.8376332611481084e-07,
"loss": 0.6503,
"step": 1898
},
{
"epoch": 2.4288343067445397,
"grad_norm": 0.3669740855693817,
"learning_rate": 1.8340259538607622e-07,
"loss": 0.6452,
"step": 1899
},
{
"epoch": 2.4301144091527322,
"grad_norm": 1.053138256072998,
"learning_rate": 1.83042563736348e-07,
"loss": 0.634,
"step": 1900
},
{
"epoch": 2.431394511560925,
"grad_norm": 0.9371493458747864,
"learning_rate": 1.8268323185218483e-07,
"loss": 0.6419,
"step": 1901
},
{
"epoch": 2.4326746139691178,
"grad_norm": 0.30069494247436523,
"learning_rate": 1.823246004188107e-07,
"loss": 0.6548,
"step": 1902
},
{
"epoch": 2.4339547163773103,
"grad_norm": 0.3713652193546295,
"learning_rate": 1.8196667012011425e-07,
"loss": 0.6549,
"step": 1903
},
{
"epoch": 2.435234818785503,
"grad_norm": 0.3901284635066986,
"learning_rate": 1.816094416386465e-07,
"loss": 0.6644,
"step": 1904
},
{
"epoch": 2.4365149211936954,
"grad_norm": 0.42883288860321045,
"learning_rate": 1.8125291565562065e-07,
"loss": 0.6213,
"step": 1905
},
{
"epoch": 2.437795023601888,
"grad_norm": 0.7028409838676453,
"learning_rate": 1.8089709285091027e-07,
"loss": 0.6397,
"step": 1906
},
{
"epoch": 2.439075126010081,
"grad_norm": 0.9829962849617004,
"learning_rate": 1.8054197390304754e-07,
"loss": 0.6446,
"step": 1907
},
{
"epoch": 2.4403552284182735,
"grad_norm": 0.49874556064605713,
"learning_rate": 1.8018755948922287e-07,
"loss": 0.6511,
"step": 1908
},
{
"epoch": 2.441635330826466,
"grad_norm": 0.7384973764419556,
"learning_rate": 1.7983385028528314e-07,
"loss": 0.6492,
"step": 1909
},
{
"epoch": 2.442915433234659,
"grad_norm": 0.5218079686164856,
"learning_rate": 1.7948084696573042e-07,
"loss": 0.6221,
"step": 1910
},
{
"epoch": 2.4441955356428515,
"grad_norm": 0.3272707760334015,
"learning_rate": 1.7912855020372042e-07,
"loss": 0.6335,
"step": 1911
},
{
"epoch": 2.445475638051044,
"grad_norm": 1.4565428495407104,
"learning_rate": 1.7877696067106156e-07,
"loss": 0.649,
"step": 1912
},
{
"epoch": 2.4467557404592366,
"grad_norm": 0.33118700981140137,
"learning_rate": 1.7842607903821416e-07,
"loss": 0.6471,
"step": 1913
},
{
"epoch": 2.448035842867429,
"grad_norm": 0.3029654920101166,
"learning_rate": 1.780759059742879e-07,
"loss": 0.6325,
"step": 1914
},
{
"epoch": 2.449315945275622,
"grad_norm": 0.2925473749637604,
"learning_rate": 1.777264421470417e-07,
"loss": 0.6441,
"step": 1915
},
{
"epoch": 2.4505960476838147,
"grad_norm": 0.30991068482398987,
"learning_rate": 1.773776882228816e-07,
"loss": 0.6458,
"step": 1916
},
{
"epoch": 2.451876150092007,
"grad_norm": 0.28182026743888855,
"learning_rate": 1.770296448668606e-07,
"loss": 0.6588,
"step": 1917
},
{
"epoch": 2.4531562525002,
"grad_norm": 0.5878859162330627,
"learning_rate": 1.766823127426761e-07,
"loss": 0.6467,
"step": 1918
},
{
"epoch": 2.4544363549083927,
"grad_norm": 0.2892199158668518,
"learning_rate": 1.7633569251266917e-07,
"loss": 0.668,
"step": 1919
},
{
"epoch": 2.4557164573165853,
"grad_norm": 0.47324714064598083,
"learning_rate": 1.7598978483782373e-07,
"loss": 0.6538,
"step": 1920
},
{
"epoch": 2.4557164573165853,
"eval_loss": 0.020135222002863884,
"eval_runtime": 42.0901,
"eval_samples_per_second": 11.784,
"eval_steps_per_second": 1.473,
"step": 1920
},
{
"epoch": 2.456996559724778,
"grad_norm": 0.9060631990432739,
"learning_rate": 1.7564459037776473e-07,
"loss": 0.645,
"step": 1921
},
{
"epoch": 2.458276662132971,
"grad_norm": 0.37348079681396484,
"learning_rate": 1.7530010979075718e-07,
"loss": 0.6481,
"step": 1922
},
{
"epoch": 2.4595567645411633,
"grad_norm": 0.31659358739852905,
"learning_rate": 1.7495634373370443e-07,
"loss": 0.63,
"step": 1923
},
{
"epoch": 2.460836866949356,
"grad_norm": 0.3929433822631836,
"learning_rate": 1.746132928621476e-07,
"loss": 0.6291,
"step": 1924
},
{
"epoch": 2.4621169693575484,
"grad_norm": 0.598603367805481,
"learning_rate": 1.742709578302639e-07,
"loss": 0.6541,
"step": 1925
},
{
"epoch": 2.4633970717657414,
"grad_norm": 0.4392068088054657,
"learning_rate": 1.739293392908654e-07,
"loss": 0.6299,
"step": 1926
},
{
"epoch": 2.464677174173934,
"grad_norm": 0.2982366383075714,
"learning_rate": 1.7358843789539795e-07,
"loss": 0.6717,
"step": 1927
},
{
"epoch": 2.4659572765821265,
"grad_norm": 0.29809802770614624,
"learning_rate": 1.7324825429393985e-07,
"loss": 0.6564,
"step": 1928
},
{
"epoch": 2.467237378990319,
"grad_norm": 0.44110092520713806,
"learning_rate": 1.7290878913520068e-07,
"loss": 0.6521,
"step": 1929
},
{
"epoch": 2.468517481398512,
"grad_norm": 0.3481731414794922,
"learning_rate": 1.725700430665198e-07,
"loss": 0.6382,
"step": 1930
},
{
"epoch": 2.4697975838067046,
"grad_norm": 0.26957058906555176,
"learning_rate": 1.7223201673386522e-07,
"loss": 0.6434,
"step": 1931
},
{
"epoch": 2.471077686214897,
"grad_norm": 0.6669008731842041,
"learning_rate": 1.71894710781833e-07,
"loss": 0.6581,
"step": 1932
},
{
"epoch": 2.47235778862309,
"grad_norm": 1.3197649717330933,
"learning_rate": 1.7155812585364487e-07,
"loss": 0.6667,
"step": 1933
},
{
"epoch": 2.4736378910312826,
"grad_norm": 0.4848359227180481,
"learning_rate": 1.7122226259114807e-07,
"loss": 0.6314,
"step": 1934
},
{
"epoch": 2.474917993439475,
"grad_norm": 0.3677651584148407,
"learning_rate": 1.708871216348132e-07,
"loss": 0.6271,
"step": 1935
},
{
"epoch": 2.4761980958476677,
"grad_norm": 0.3303697109222412,
"learning_rate": 1.7055270362373395e-07,
"loss": 0.6494,
"step": 1936
},
{
"epoch": 2.4774781982558602,
"grad_norm": 1.5756772756576538,
"learning_rate": 1.702190091956252e-07,
"loss": 0.6344,
"step": 1937
},
{
"epoch": 2.4787583006640532,
"grad_norm": 0.3608613908290863,
"learning_rate": 1.6988603898682175e-07,
"loss": 0.645,
"step": 1938
},
{
"epoch": 2.4800384030722458,
"grad_norm": 0.2569604218006134,
"learning_rate": 1.6955379363227767e-07,
"loss": 0.6626,
"step": 1939
},
{
"epoch": 2.4813185054804383,
"grad_norm": 0.49216943979263306,
"learning_rate": 1.6922227376556486e-07,
"loss": 0.6532,
"step": 1940
},
{
"epoch": 2.4825986078886313,
"grad_norm": 0.27307888865470886,
"learning_rate": 1.6889148001887139e-07,
"loss": 0.6493,
"step": 1941
},
{
"epoch": 2.483878710296824,
"grad_norm": 1.0339336395263672,
"learning_rate": 1.6856141302300087e-07,
"loss": 0.6279,
"step": 1942
},
{
"epoch": 2.4851588127050164,
"grad_norm": 0.7342440485954285,
"learning_rate": 1.6823207340737115e-07,
"loss": 0.6548,
"step": 1943
},
{
"epoch": 2.486438915113209,
"grad_norm": 0.47728464007377625,
"learning_rate": 1.679034618000129e-07,
"loss": 0.6477,
"step": 1944
},
{
"epoch": 2.487719017521402,
"grad_norm": 0.7339931130409241,
"learning_rate": 1.6757557882756842e-07,
"loss": 0.6381,
"step": 1945
},
{
"epoch": 2.4889991199295944,
"grad_norm": 0.5934532880783081,
"learning_rate": 1.6724842511529063e-07,
"loss": 0.6552,
"step": 1946
},
{
"epoch": 2.490279222337787,
"grad_norm": 0.32484838366508484,
"learning_rate": 1.66922001287042e-07,
"loss": 0.6645,
"step": 1947
},
{
"epoch": 2.4915593247459795,
"grad_norm": 0.274696409702301,
"learning_rate": 1.665963079652927e-07,
"loss": 0.6305,
"step": 1948
},
{
"epoch": 2.4928394271541725,
"grad_norm": 1.2078450918197632,
"learning_rate": 1.662713457711204e-07,
"loss": 0.6549,
"step": 1949
},
{
"epoch": 2.494119529562365,
"grad_norm": 0.4069227874279022,
"learning_rate": 1.6594711532420786e-07,
"loss": 0.6358,
"step": 1950
},
{
"epoch": 2.494119529562365,
"eval_loss": 0.020105183124542236,
"eval_runtime": 42.1086,
"eval_samples_per_second": 11.779,
"eval_steps_per_second": 1.472,
"step": 1950
},
{
"epoch": 2.4953996319705576,
"grad_norm": 0.4317651093006134,
"learning_rate": 1.6562361724284346e-07,
"loss": 0.6629,
"step": 1951
},
{
"epoch": 2.49667973437875,
"grad_norm": 0.7961587905883789,
"learning_rate": 1.6530085214391804e-07,
"loss": 0.6489,
"step": 1952
},
{
"epoch": 2.497959836786943,
"grad_norm": 0.2762162685394287,
"learning_rate": 1.64978820642925e-07,
"loss": 0.6363,
"step": 1953
},
{
"epoch": 2.4992399391951357,
"grad_norm": 0.2738543152809143,
"learning_rate": 1.6465752335395906e-07,
"loss": 0.6448,
"step": 1954
},
{
"epoch": 2.500520041603328,
"grad_norm": 0.35184672474861145,
"learning_rate": 1.643369608897145e-07,
"loss": 0.6431,
"step": 1955
},
{
"epoch": 2.501800144011521,
"grad_norm": 0.40584972500801086,
"learning_rate": 1.6401713386148477e-07,
"loss": 0.645,
"step": 1956
},
{
"epoch": 2.5030802464197137,
"grad_norm": 0.272732138633728,
"learning_rate": 1.6369804287916025e-07,
"loss": 0.6452,
"step": 1957
},
{
"epoch": 2.5043603488279063,
"grad_norm": 0.30653154850006104,
"learning_rate": 1.6337968855122827e-07,
"loss": 0.6493,
"step": 1958
},
{
"epoch": 2.505640451236099,
"grad_norm": 0.36809736490249634,
"learning_rate": 1.630620714847713e-07,
"loss": 0.6319,
"step": 1959
},
{
"epoch": 2.5069205536442913,
"grad_norm": 0.2883507311344147,
"learning_rate": 1.6274519228546562e-07,
"loss": 0.6398,
"step": 1960
},
{
"epoch": 2.5082006560524843,
"grad_norm": 0.30058497190475464,
"learning_rate": 1.6242905155758072e-07,
"loss": 0.6275,
"step": 1961
},
{
"epoch": 2.509480758460677,
"grad_norm": 0.5942174196243286,
"learning_rate": 1.6211364990397782e-07,
"loss": 0.6454,
"step": 1962
},
{
"epoch": 2.5107608608688694,
"grad_norm": 0.8409835696220398,
"learning_rate": 1.6179898792610875e-07,
"loss": 0.6408,
"step": 1963
},
{
"epoch": 2.5120409632770624,
"grad_norm": 0.283600777387619,
"learning_rate": 1.614850662240148e-07,
"loss": 0.6463,
"step": 1964
},
{
"epoch": 2.513321065685255,
"grad_norm": 0.34936267137527466,
"learning_rate": 1.6117188539632538e-07,
"loss": 0.6308,
"step": 1965
},
{
"epoch": 2.5146011680934475,
"grad_norm": 0.9134256839752197,
"learning_rate": 1.6085944604025765e-07,
"loss": 0.6504,
"step": 1966
},
{
"epoch": 2.51588127050164,
"grad_norm": 1.156744360923767,
"learning_rate": 1.6054774875161434e-07,
"loss": 0.6549,
"step": 1967
},
{
"epoch": 2.5171613729098326,
"grad_norm": 0.35297149419784546,
"learning_rate": 1.6023679412478336e-07,
"loss": 0.6536,
"step": 1968
},
{
"epoch": 2.5184414753180255,
"grad_norm": 0.8533351421356201,
"learning_rate": 1.5992658275273618e-07,
"loss": 0.6467,
"step": 1969
},
{
"epoch": 2.519721577726218,
"grad_norm": 0.5023815035820007,
"learning_rate": 1.5961711522702708e-07,
"loss": 0.6331,
"step": 1970
},
{
"epoch": 2.5210016801344106,
"grad_norm": 0.292744904756546,
"learning_rate": 1.593083921377921e-07,
"loss": 0.6521,
"step": 1971
},
{
"epoch": 2.5222817825426036,
"grad_norm": 0.8255204558372498,
"learning_rate": 1.5900041407374706e-07,
"loss": 0.6605,
"step": 1972
},
{
"epoch": 2.523561884950796,
"grad_norm": 0.2568628489971161,
"learning_rate": 1.586931816221877e-07,
"loss": 0.6509,
"step": 1973
},
{
"epoch": 2.5248419873589887,
"grad_norm": 0.6833187937736511,
"learning_rate": 1.583866953689876e-07,
"loss": 0.6503,
"step": 1974
},
{
"epoch": 2.5261220897671812,
"grad_norm": 0.4279085695743561,
"learning_rate": 1.580809558985975e-07,
"loss": 0.649,
"step": 1975
},
{
"epoch": 2.5274021921753738,
"grad_norm": 0.4677436053752899,
"learning_rate": 1.5777596379404386e-07,
"loss": 0.6225,
"step": 1976
},
{
"epoch": 2.5286822945835667,
"grad_norm": 0.45068204402923584,
"learning_rate": 1.5747171963692826e-07,
"loss": 0.6621,
"step": 1977
},
{
"epoch": 2.5299623969917593,
"grad_norm": 0.3752884268760681,
"learning_rate": 1.5716822400742587e-07,
"loss": 0.6682,
"step": 1978
},
{
"epoch": 2.5312424993999523,
"grad_norm": 0.8851690888404846,
"learning_rate": 1.568654774842843e-07,
"loss": 0.6589,
"step": 1979
},
{
"epoch": 2.532522601808145,
"grad_norm": 1.1126904487609863,
"learning_rate": 1.5656348064482283e-07,
"loss": 0.6584,
"step": 1980
},
{
"epoch": 2.532522601808145,
"eval_loss": 0.020100239664316177,
"eval_runtime": 42.1841,
"eval_samples_per_second": 11.758,
"eval_steps_per_second": 1.47,
"step": 1980
},
{
"epoch": 2.5338027042163374,
"grad_norm": 0.31389060616493225,
"learning_rate": 1.5626223406493127e-07,
"loss": 0.6569,
"step": 1981
},
{
"epoch": 2.53508280662453,
"grad_norm": 0.3966534733772278,
"learning_rate": 1.559617383190684e-07,
"loss": 0.6622,
"step": 1982
},
{
"epoch": 2.5363629090327224,
"grad_norm": 0.6878266930580139,
"learning_rate": 1.5566199398026147e-07,
"loss": 0.6325,
"step": 1983
},
{
"epoch": 2.5376430114409154,
"grad_norm": 0.5802293419837952,
"learning_rate": 1.5536300162010455e-07,
"loss": 0.6589,
"step": 1984
},
{
"epoch": 2.538923113849108,
"grad_norm": 1.3978415727615356,
"learning_rate": 1.5506476180875825e-07,
"loss": 0.6356,
"step": 1985
},
{
"epoch": 2.5402032162573005,
"grad_norm": 0.5816534757614136,
"learning_rate": 1.547672751149475e-07,
"loss": 0.6425,
"step": 1986
},
{
"epoch": 2.5414833186654935,
"grad_norm": 0.43562421202659607,
"learning_rate": 1.5447054210596166e-07,
"loss": 0.6389,
"step": 1987
},
{
"epoch": 2.542763421073686,
"grad_norm": 0.3010362684726715,
"learning_rate": 1.5417456334765228e-07,
"loss": 0.6161,
"step": 1988
},
{
"epoch": 2.5440435234818786,
"grad_norm": 0.699810266494751,
"learning_rate": 1.5387933940443302e-07,
"loss": 0.6409,
"step": 1989
},
{
"epoch": 2.545323625890071,
"grad_norm": 0.6081046462059021,
"learning_rate": 1.5358487083927816e-07,
"loss": 0.638,
"step": 1990
},
{
"epoch": 2.5466037282982636,
"grad_norm": 1.1989212036132812,
"learning_rate": 1.5329115821372114e-07,
"loss": 0.6363,
"step": 1991
},
{
"epoch": 2.5478838307064566,
"grad_norm": 0.26108258962631226,
"learning_rate": 1.5299820208785425e-07,
"loss": 0.6491,
"step": 1992
},
{
"epoch": 2.549163933114649,
"grad_norm": 1.3608566522598267,
"learning_rate": 1.527060030203271e-07,
"loss": 0.6456,
"step": 1993
},
{
"epoch": 2.5504440355228417,
"grad_norm": 0.5607214570045471,
"learning_rate": 1.5241456156834542e-07,
"loss": 0.633,
"step": 1994
},
{
"epoch": 2.5517241379310347,
"grad_norm": 0.3214998245239258,
"learning_rate": 1.521238782876705e-07,
"loss": 0.6415,
"step": 1995
},
{
"epoch": 2.5530042403392272,
"grad_norm": 1.757861614227295,
"learning_rate": 1.5183395373261767e-07,
"loss": 0.6462,
"step": 1996
},
{
"epoch": 2.55428434274742,
"grad_norm": 0.28445497155189514,
"learning_rate": 1.5154478845605559e-07,
"loss": 0.6606,
"step": 1997
},
{
"epoch": 2.5555644451556123,
"grad_norm": 0.34707996249198914,
"learning_rate": 1.5125638300940474e-07,
"loss": 0.6353,
"step": 1998
},
{
"epoch": 2.556844547563805,
"grad_norm": 0.29214709997177124,
"learning_rate": 1.5096873794263671e-07,
"loss": 0.6659,
"step": 1999
},
{
"epoch": 2.558124649971998,
"grad_norm": 0.6082428693771362,
"learning_rate": 1.506818538042735e-07,
"loss": 0.629,
"step": 2000
},
{
"epoch": 2.5594047523801904,
"grad_norm": 0.31330883502960205,
"learning_rate": 1.503957311413855e-07,
"loss": 0.6626,
"step": 2001
},
{
"epoch": 2.560684854788383,
"grad_norm": 0.8802220821380615,
"learning_rate": 1.5011037049959147e-07,
"loss": 0.6589,
"step": 2002
},
{
"epoch": 2.561964957196576,
"grad_norm": 0.7895910739898682,
"learning_rate": 1.4982577242305664e-07,
"loss": 0.6457,
"step": 2003
},
{
"epoch": 2.5632450596047684,
"grad_norm": 0.37694650888442993,
"learning_rate": 1.495419374544923e-07,
"loss": 0.6426,
"step": 2004
},
{
"epoch": 2.564525162012961,
"grad_norm": 0.6797393560409546,
"learning_rate": 1.492588661351547e-07,
"loss": 0.6587,
"step": 2005
},
{
"epoch": 2.5658052644211535,
"grad_norm": 0.8739597797393799,
"learning_rate": 1.4897655900484343e-07,
"loss": 0.6471,
"step": 2006
},
{
"epoch": 2.567085366829346,
"grad_norm": 0.643576443195343,
"learning_rate": 1.4869501660190116e-07,
"loss": 0.6731,
"step": 2007
},
{
"epoch": 2.568365469237539,
"grad_norm": 0.9068968892097473,
"learning_rate": 1.4841423946321224e-07,
"loss": 0.6579,
"step": 2008
},
{
"epoch": 2.5696455716457316,
"grad_norm": 1.8010550737380981,
"learning_rate": 1.4813422812420163e-07,
"loss": 0.6415,
"step": 2009
},
{
"epoch": 2.5709256740539246,
"grad_norm": 0.8079454302787781,
"learning_rate": 1.4785498311883379e-07,
"loss": 0.6232,
"step": 2010
},
{
"epoch": 2.5709256740539246,
"eval_loss": 0.020073214545845985,
"eval_runtime": 42.0804,
"eval_samples_per_second": 11.787,
"eval_steps_per_second": 1.473,
"step": 2010
},
{
"epoch": 2.572205776462117,
"grad_norm": 0.3770584166049957,
"learning_rate": 1.4757650497961216e-07,
"loss": 0.6395,
"step": 2011
},
{
"epoch": 2.5734858788703097,
"grad_norm": 0.4250401556491852,
"learning_rate": 1.4729879423757765e-07,
"loss": 0.658,
"step": 2012
},
{
"epoch": 2.574765981278502,
"grad_norm": 0.32617440819740295,
"learning_rate": 1.470218514223077e-07,
"loss": 0.6586,
"step": 2013
},
{
"epoch": 2.5760460836866947,
"grad_norm": 0.845801830291748,
"learning_rate": 1.4674567706191562e-07,
"loss": 0.6599,
"step": 2014
},
{
"epoch": 2.5773261860948877,
"grad_norm": 1.5616546869277954,
"learning_rate": 1.4647027168304884e-07,
"loss": 0.6508,
"step": 2015
},
{
"epoch": 2.5786062885030803,
"grad_norm": 0.2734609842300415,
"learning_rate": 1.4619563581088912e-07,
"loss": 0.6527,
"step": 2016
},
{
"epoch": 2.579886390911273,
"grad_norm": 0.29470905661582947,
"learning_rate": 1.4592176996915017e-07,
"loss": 0.6474,
"step": 2017
},
{
"epoch": 2.581166493319466,
"grad_norm": 0.697109580039978,
"learning_rate": 1.456486746800775e-07,
"loss": 0.6349,
"step": 2018
},
{
"epoch": 2.5824465957276583,
"grad_norm": 0.9615988731384277,
"learning_rate": 1.4537635046444732e-07,
"loss": 0.6394,
"step": 2019
},
{
"epoch": 2.583726698135851,
"grad_norm": 0.3116724193096161,
"learning_rate": 1.4510479784156536e-07,
"loss": 0.6373,
"step": 2020
},
{
"epoch": 2.5850068005440434,
"grad_norm": 0.7228888869285583,
"learning_rate": 1.448340173292661e-07,
"loss": 0.654,
"step": 2021
},
{
"epoch": 2.586286902952236,
"grad_norm": 0.26621726155281067,
"learning_rate": 1.4456400944391144e-07,
"loss": 0.6639,
"step": 2022
},
{
"epoch": 2.587567005360429,
"grad_norm": 0.6949889063835144,
"learning_rate": 1.4429477470039e-07,
"loss": 0.6215,
"step": 2023
},
{
"epoch": 2.5888471077686215,
"grad_norm": 0.6114367842674255,
"learning_rate": 1.440263136121163e-07,
"loss": 0.6645,
"step": 2024
},
{
"epoch": 2.590127210176814,
"grad_norm": 0.2784302234649658,
"learning_rate": 1.4375862669102902e-07,
"loss": 0.6497,
"step": 2025
},
{
"epoch": 2.591407312585007,
"grad_norm": 0.5807334184646606,
"learning_rate": 1.4349171444759116e-07,
"loss": 0.6612,
"step": 2026
},
{
"epoch": 2.5926874149931995,
"grad_norm": 0.28845226764678955,
"learning_rate": 1.432255773907881e-07,
"loss": 0.6408,
"step": 2027
},
{
"epoch": 2.593967517401392,
"grad_norm": 1.5370500087738037,
"learning_rate": 1.42960216028127e-07,
"loss": 0.6622,
"step": 2028
},
{
"epoch": 2.5952476198095846,
"grad_norm": 0.7225543260574341,
"learning_rate": 1.4269563086563597e-07,
"loss": 0.6421,
"step": 2029
},
{
"epoch": 2.596527722217777,
"grad_norm": 0.7571536302566528,
"learning_rate": 1.4243182240786262e-07,
"loss": 0.6372,
"step": 2030
},
{
"epoch": 2.59780782462597,
"grad_norm": 0.3931668996810913,
"learning_rate": 1.4216879115787401e-07,
"loss": 0.629,
"step": 2031
},
{
"epoch": 2.5990879270341627,
"grad_norm": 0.6966521143913269,
"learning_rate": 1.4190653761725458e-07,
"loss": 0.6561,
"step": 2032
},
{
"epoch": 2.6003680294423552,
"grad_norm": 0.7810983657836914,
"learning_rate": 1.4164506228610595e-07,
"loss": 0.6524,
"step": 2033
},
{
"epoch": 2.601648131850548,
"grad_norm": 0.40300697088241577,
"learning_rate": 1.4138436566304574e-07,
"loss": 0.6531,
"step": 2034
},
{
"epoch": 2.6029282342587408,
"grad_norm": 0.6950014233589172,
"learning_rate": 1.4112444824520648e-07,
"loss": 0.6425,
"step": 2035
},
{
"epoch": 2.6042083366669333,
"grad_norm": 1.385738492012024,
"learning_rate": 1.4086531052823515e-07,
"loss": 0.6432,
"step": 2036
},
{
"epoch": 2.605488439075126,
"grad_norm": 0.2667698264122009,
"learning_rate": 1.4060695300629141e-07,
"loss": 0.6361,
"step": 2037
},
{
"epoch": 2.606768541483319,
"grad_norm": 1.029186487197876,
"learning_rate": 1.4034937617204745e-07,
"loss": 0.6563,
"step": 2038
},
{
"epoch": 2.6080486438915114,
"grad_norm": 0.9542225003242493,
"learning_rate": 1.4009258051668678e-07,
"loss": 0.6434,
"step": 2039
},
{
"epoch": 2.609328746299704,
"grad_norm": 0.8851271867752075,
"learning_rate": 1.3983656652990296e-07,
"loss": 0.6306,
"step": 2040
},
{
"epoch": 2.609328746299704,
"eval_loss": 0.020110566169023514,
"eval_runtime": 42.1071,
"eval_samples_per_second": 11.779,
"eval_steps_per_second": 1.472,
"step": 2040
},
{
"epoch": 2.610608848707897,
"grad_norm": 1.1771515607833862,
"learning_rate": 1.3958133469989923e-07,
"loss": 0.6485,
"step": 2041
},
{
"epoch": 2.6118889511160894,
"grad_norm": 0.6489231586456299,
"learning_rate": 1.3932688551338717e-07,
"loss": 0.6426,
"step": 2042
},
{
"epoch": 2.613169053524282,
"grad_norm": 0.4497769773006439,
"learning_rate": 1.3907321945558598e-07,
"loss": 0.6486,
"step": 2043
},
{
"epoch": 2.6144491559324745,
"grad_norm": 1.1315453052520752,
"learning_rate": 1.3882033701022138e-07,
"loss": 0.6535,
"step": 2044
},
{
"epoch": 2.615729258340667,
"grad_norm": 0.2650417387485504,
"learning_rate": 1.385682386595249e-07,
"loss": 0.65,
"step": 2045
},
{
"epoch": 2.61700936074886,
"grad_norm": 0.5155853033065796,
"learning_rate": 1.3831692488423283e-07,
"loss": 0.6284,
"step": 2046
},
{
"epoch": 2.6182894631570526,
"grad_norm": 0.3587488532066345,
"learning_rate": 1.3806639616358516e-07,
"loss": 0.644,
"step": 2047
},
{
"epoch": 2.619569565565245,
"grad_norm": 0.9130818843841553,
"learning_rate": 1.378166529753251e-07,
"loss": 0.6749,
"step": 2048
},
{
"epoch": 2.620849667973438,
"grad_norm": 1.1361536979675293,
"learning_rate": 1.3756769579569757e-07,
"loss": 0.6607,
"step": 2049
},
{
"epoch": 2.6221297703816306,
"grad_norm": 0.34557247161865234,
"learning_rate": 1.3731952509944912e-07,
"loss": 0.6224,
"step": 2050
},
{
"epoch": 2.623409872789823,
"grad_norm": 0.8922829627990723,
"learning_rate": 1.3707214135982596e-07,
"loss": 0.6424,
"step": 2051
},
{
"epoch": 2.6246899751980157,
"grad_norm": 1.022491693496704,
"learning_rate": 1.3682554504857385e-07,
"loss": 0.65,
"step": 2052
},
{
"epoch": 2.6259700776062083,
"grad_norm": 1.3524134159088135,
"learning_rate": 1.3657973663593708e-07,
"loss": 0.6689,
"step": 2053
},
{
"epoch": 2.6272501800144012,
"grad_norm": 0.38051751255989075,
"learning_rate": 1.3633471659065737e-07,
"loss": 0.6335,
"step": 2054
},
{
"epoch": 2.628530282422594,
"grad_norm": 0.8873854279518127,
"learning_rate": 1.360904853799732e-07,
"loss": 0.6239,
"step": 2055
},
{
"epoch": 2.6298103848307863,
"grad_norm": 0.813712477684021,
"learning_rate": 1.3584704346961845e-07,
"loss": 0.6341,
"step": 2056
},
{
"epoch": 2.6310904872389793,
"grad_norm": 0.6309866905212402,
"learning_rate": 1.3560439132382217e-07,
"loss": 0.6192,
"step": 2057
},
{
"epoch": 2.632370589647172,
"grad_norm": 1.087878704071045,
"learning_rate": 1.3536252940530733e-07,
"loss": 0.6348,
"step": 2058
},
{
"epoch": 2.6336506920553644,
"grad_norm": 0.3924737572669983,
"learning_rate": 1.351214581752899e-07,
"loss": 0.6529,
"step": 2059
},
{
"epoch": 2.634930794463557,
"grad_norm": 0.35310786962509155,
"learning_rate": 1.3488117809347796e-07,
"loss": 0.6602,
"step": 2060
},
{
"epoch": 2.6362108968717495,
"grad_norm": 0.4035593867301941,
"learning_rate": 1.346416896180712e-07,
"loss": 0.655,
"step": 2061
},
{
"epoch": 2.6374909992799425,
"grad_norm": 1.4132459163665771,
"learning_rate": 1.3440299320575965e-07,
"loss": 0.6629,
"step": 2062
},
{
"epoch": 2.638771101688135,
"grad_norm": 1.1046189069747925,
"learning_rate": 1.3416508931172283e-07,
"loss": 0.6439,
"step": 2063
},
{
"epoch": 2.6400512040963275,
"grad_norm": 0.7213155031204224,
"learning_rate": 1.339279783896288e-07,
"loss": 0.6512,
"step": 2064
},
{
"epoch": 2.6413313065045205,
"grad_norm": 0.8375394344329834,
"learning_rate": 1.3369166089163406e-07,
"loss": 0.6455,
"step": 2065
},
{
"epoch": 2.642611408912713,
"grad_norm": 0.4188143014907837,
"learning_rate": 1.3345613726838156e-07,
"loss": 0.6387,
"step": 2066
},
{
"epoch": 2.6438915113209056,
"grad_norm": 1.2632055282592773,
"learning_rate": 1.3322140796900063e-07,
"loss": 0.6485,
"step": 2067
},
{
"epoch": 2.645171613729098,
"grad_norm": 0.5636139512062073,
"learning_rate": 1.329874734411057e-07,
"loss": 0.6625,
"step": 2068
},
{
"epoch": 2.646451716137291,
"grad_norm": 0.5707480907440186,
"learning_rate": 1.3275433413079572e-07,
"loss": 0.6407,
"step": 2069
},
{
"epoch": 2.6477318185454837,
"grad_norm": 0.6409482955932617,
"learning_rate": 1.3252199048265337e-07,
"loss": 0.6486,
"step": 2070
},
{
"epoch": 2.6477318185454837,
"eval_loss": 0.02007230557501316,
"eval_runtime": 42.1234,
"eval_samples_per_second": 11.775,
"eval_steps_per_second": 1.472,
"step": 2070
},
{
"epoch": 2.649011920953676,
"grad_norm": 0.36744558811187744,
"learning_rate": 1.3229044293974374e-07,
"loss": 0.6546,
"step": 2071
},
{
"epoch": 2.650292023361869,
"grad_norm": 0.5668392181396484,
"learning_rate": 1.3205969194361394e-07,
"loss": 0.6388,
"step": 2072
},
{
"epoch": 2.6515721257700617,
"grad_norm": 1.3150979280471802,
"learning_rate": 1.318297379342922e-07,
"loss": 0.6559,
"step": 2073
},
{
"epoch": 2.6528522281782543,
"grad_norm": 1.2430988550186157,
"learning_rate": 1.316005813502869e-07,
"loss": 0.6478,
"step": 2074
},
{
"epoch": 2.654132330586447,
"grad_norm": 0.32038238644599915,
"learning_rate": 1.3137222262858562e-07,
"loss": 0.6593,
"step": 2075
},
{
"epoch": 2.6554124329946394,
"grad_norm": 0.48588600754737854,
"learning_rate": 1.3114466220465456e-07,
"loss": 0.648,
"step": 2076
},
{
"epoch": 2.6566925354028323,
"grad_norm": 0.9980317950248718,
"learning_rate": 1.3091790051243788e-07,
"loss": 0.6553,
"step": 2077
},
{
"epoch": 2.657972637811025,
"grad_norm": 0.7658243179321289,
"learning_rate": 1.3069193798435607e-07,
"loss": 0.6426,
"step": 2078
},
{
"epoch": 2.6592527402192174,
"grad_norm": 0.39222031831741333,
"learning_rate": 1.3046677505130606e-07,
"loss": 0.6499,
"step": 2079
},
{
"epoch": 2.6605328426274104,
"grad_norm": 0.9409124851226807,
"learning_rate": 1.3024241214266006e-07,
"loss": 0.6613,
"step": 2080
},
{
"epoch": 2.661812945035603,
"grad_norm": 0.31442388892173767,
"learning_rate": 1.3001884968626438e-07,
"loss": 0.6574,
"step": 2081
},
{
"epoch": 2.6630930474437955,
"grad_norm": 0.37446996569633484,
"learning_rate": 1.297960881084391e-07,
"loss": 0.6572,
"step": 2082
},
{
"epoch": 2.664373149851988,
"grad_norm": 1.1007232666015625,
"learning_rate": 1.2957412783397686e-07,
"loss": 0.6536,
"step": 2083
},
{
"epoch": 2.6656532522601806,
"grad_norm": 0.287696897983551,
"learning_rate": 1.2935296928614276e-07,
"loss": 0.6333,
"step": 2084
},
{
"epoch": 2.6669333546683736,
"grad_norm": 0.9584454298019409,
"learning_rate": 1.291326128866724e-07,
"loss": 0.6513,
"step": 2085
},
{
"epoch": 2.668213457076566,
"grad_norm": 0.2974662184715271,
"learning_rate": 1.2891305905577237e-07,
"loss": 0.6584,
"step": 2086
},
{
"epoch": 2.6694935594847586,
"grad_norm": 1.1847333908081055,
"learning_rate": 1.2869430821211826e-07,
"loss": 0.6439,
"step": 2087
},
{
"epoch": 2.6707736618929516,
"grad_norm": 0.38718274235725403,
"learning_rate": 1.2847636077285478e-07,
"loss": 0.6365,
"step": 2088
},
{
"epoch": 2.672053764301144,
"grad_norm": 0.3305584490299225,
"learning_rate": 1.2825921715359447e-07,
"loss": 0.6555,
"step": 2089
},
{
"epoch": 2.6733338667093367,
"grad_norm": 0.997892439365387,
"learning_rate": 1.2804287776841697e-07,
"loss": 0.6517,
"step": 2090
},
{
"epoch": 2.6746139691175292,
"grad_norm": 0.6771605610847473,
"learning_rate": 1.2782734302986842e-07,
"loss": 0.6497,
"step": 2091
},
{
"epoch": 2.675894071525722,
"grad_norm": 0.3155212998390198,
"learning_rate": 1.2761261334896044e-07,
"loss": 0.653,
"step": 2092
},
{
"epoch": 2.6771741739339148,
"grad_norm": 1.4205725193023682,
"learning_rate": 1.2739868913516957e-07,
"loss": 0.643,
"step": 2093
},
{
"epoch": 2.6784542763421073,
"grad_norm": 0.5671343803405762,
"learning_rate": 1.2718557079643622e-07,
"loss": 0.6334,
"step": 2094
},
{
"epoch": 2.6797343787503003,
"grad_norm": 0.37014326453208923,
"learning_rate": 1.2697325873916414e-07,
"loss": 0.6425,
"step": 2095
},
{
"epoch": 2.681014481158493,
"grad_norm": 0.2635645866394043,
"learning_rate": 1.267617533682197e-07,
"loss": 0.6311,
"step": 2096
},
{
"epoch": 2.6822945835666854,
"grad_norm": 0.26906466484069824,
"learning_rate": 1.2655105508693064e-07,
"loss": 0.6438,
"step": 2097
},
{
"epoch": 2.683574685974878,
"grad_norm": 0.28571176528930664,
"learning_rate": 1.2634116429708573e-07,
"loss": 0.6415,
"step": 2098
},
{
"epoch": 2.6848547883830705,
"grad_norm": 1.2504156827926636,
"learning_rate": 1.2613208139893426e-07,
"loss": 0.6339,
"step": 2099
},
{
"epoch": 2.6861348907912634,
"grad_norm": 0.34544482827186584,
"learning_rate": 1.2592380679118435e-07,
"loss": 0.6687,
"step": 2100
},
{
"epoch": 2.6861348907912634,
"eval_loss": 0.020092330873012543,
"eval_runtime": 42.1497,
"eval_samples_per_second": 11.768,
"eval_steps_per_second": 1.471,
"step": 2100
},
{
"epoch": 2.687414993199456,
"grad_norm": 0.4327585697174072,
"learning_rate": 1.2571634087100321e-07,
"loss": 0.6427,
"step": 2101
},
{
"epoch": 2.6886950956076485,
"grad_norm": 0.4953400194644928,
"learning_rate": 1.2550968403401558e-07,
"loss": 0.6646,
"step": 2102
},
{
"epoch": 2.6899751980158415,
"grad_norm": 0.4877380430698395,
"learning_rate": 1.2530383667430375e-07,
"loss": 0.6541,
"step": 2103
},
{
"epoch": 2.691255300424034,
"grad_norm": 0.4688189625740051,
"learning_rate": 1.25098799184406e-07,
"loss": 0.6586,
"step": 2104
},
{
"epoch": 2.6925354028322266,
"grad_norm": 0.5246747136116028,
"learning_rate": 1.2489457195531633e-07,
"loss": 0.652,
"step": 2105
},
{
"epoch": 2.693815505240419,
"grad_norm": 0.34565263986587524,
"learning_rate": 1.2469115537648377e-07,
"loss": 0.6326,
"step": 2106
},
{
"epoch": 2.6950956076486117,
"grad_norm": 0.2795601487159729,
"learning_rate": 1.2448854983581132e-07,
"loss": 0.6417,
"step": 2107
},
{
"epoch": 2.6963757100568047,
"grad_norm": 0.48766008019447327,
"learning_rate": 1.2428675571965562e-07,
"loss": 0.6258,
"step": 2108
},
{
"epoch": 2.697655812464997,
"grad_norm": 0.29841724038124084,
"learning_rate": 1.240857734128256e-07,
"loss": 0.6526,
"step": 2109
},
{
"epoch": 2.6989359148731897,
"grad_norm": 0.4421617388725281,
"learning_rate": 1.238856032985824e-07,
"loss": 0.6495,
"step": 2110
},
{
"epoch": 2.7002160172813827,
"grad_norm": 0.5446280837059021,
"learning_rate": 1.236862457586384e-07,
"loss": 0.6568,
"step": 2111
},
{
"epoch": 2.7014961196895753,
"grad_norm": 0.37962427735328674,
"learning_rate": 1.2348770117315614e-07,
"loss": 0.6455,
"step": 2112
},
{
"epoch": 2.702776222097768,
"grad_norm": 0.3219340443611145,
"learning_rate": 1.2328996992074811e-07,
"loss": 0.6486,
"step": 2113
},
{
"epoch": 2.7040563245059603,
"grad_norm": 1.2223472595214844,
"learning_rate": 1.2309305237847595e-07,
"loss": 0.6584,
"step": 2114
},
{
"epoch": 2.705336426914153,
"grad_norm": 0.28701382875442505,
"learning_rate": 1.2289694892184945e-07,
"loss": 0.6321,
"step": 2115
},
{
"epoch": 2.706616529322346,
"grad_norm": 0.3444139361381531,
"learning_rate": 1.2270165992482598e-07,
"loss": 0.6331,
"step": 2116
},
{
"epoch": 2.7078966317305384,
"grad_norm": 1.5178614854812622,
"learning_rate": 1.2250718575980963e-07,
"loss": 0.6279,
"step": 2117
},
{
"epoch": 2.709176734138731,
"grad_norm": 0.3234931528568268,
"learning_rate": 1.2231352679765105e-07,
"loss": 0.677,
"step": 2118
},
{
"epoch": 2.710456836546924,
"grad_norm": 0.28122273087501526,
"learning_rate": 1.2212068340764607e-07,
"loss": 0.6314,
"step": 2119
},
{
"epoch": 2.7117369389551165,
"grad_norm": 0.30400002002716064,
"learning_rate": 1.2192865595753536e-07,
"loss": 0.6458,
"step": 2120
},
{
"epoch": 2.713017041363309,
"grad_norm": 0.2736770510673523,
"learning_rate": 1.217374448135035e-07,
"loss": 0.6349,
"step": 2121
},
{
"epoch": 2.7142971437715016,
"grad_norm": 0.9443513751029968,
"learning_rate": 1.2154705034017864e-07,
"loss": 0.6313,
"step": 2122
},
{
"epoch": 2.7155772461796945,
"grad_norm": 0.38654351234436035,
"learning_rate": 1.2135747290063154e-07,
"loss": 0.6596,
"step": 2123
},
{
"epoch": 2.716857348587887,
"grad_norm": 1.1964975595474243,
"learning_rate": 1.2116871285637472e-07,
"loss": 0.6518,
"step": 2124
},
{
"epoch": 2.7181374509960796,
"grad_norm": 1.687131404876709,
"learning_rate": 1.2098077056736218e-07,
"loss": 0.66,
"step": 2125
},
{
"epoch": 2.7194175534042726,
"grad_norm": 0.4430772066116333,
"learning_rate": 1.207936463919886e-07,
"loss": 0.6545,
"step": 2126
},
{
"epoch": 2.720697655812465,
"grad_norm": 0.7075240612030029,
"learning_rate": 1.2060734068708825e-07,
"loss": 0.6224,
"step": 2127
},
{
"epoch": 2.7219777582206577,
"grad_norm": 0.5436376929283142,
"learning_rate": 1.204218538079349e-07,
"loss": 0.635,
"step": 2128
},
{
"epoch": 2.7232578606288502,
"grad_norm": 0.45615154504776,
"learning_rate": 1.202371861082407e-07,
"loss": 0.6657,
"step": 2129
},
{
"epoch": 2.7245379630370428,
"grad_norm": 1.546213150024414,
"learning_rate": 1.2005333794015588e-07,
"loss": 0.6434,
"step": 2130
},
{
"epoch": 2.7245379630370428,
"eval_loss": 0.020118294283747673,
"eval_runtime": 42.1126,
"eval_samples_per_second": 11.778,
"eval_steps_per_second": 1.472,
"step": 2130
},
{
"epoch": 2.7258180654452357,
"grad_norm": 0.7086462378501892,
"learning_rate": 1.198703096542676e-07,
"loss": 0.6432,
"step": 2131
},
{
"epoch": 2.7270981678534283,
"grad_norm": 0.9689601063728333,
"learning_rate": 1.196881015995998e-07,
"loss": 0.6536,
"step": 2132
},
{
"epoch": 2.728378270261621,
"grad_norm": 0.31954434514045715,
"learning_rate": 1.1950671412361208e-07,
"loss": 0.6393,
"step": 2133
},
{
"epoch": 2.729658372669814,
"grad_norm": 0.3902779519557953,
"learning_rate": 1.1932614757219947e-07,
"loss": 0.6556,
"step": 2134
},
{
"epoch": 2.7309384750780064,
"grad_norm": 0.5591553449630737,
"learning_rate": 1.1914640228969133e-07,
"loss": 0.6462,
"step": 2135
},
{
"epoch": 2.732218577486199,
"grad_norm": 0.5208947062492371,
"learning_rate": 1.1896747861885107e-07,
"loss": 0.6214,
"step": 2136
},
{
"epoch": 2.7334986798943914,
"grad_norm": 0.5015496611595154,
"learning_rate": 1.187893769008752e-07,
"loss": 0.6423,
"step": 2137
},
{
"epoch": 2.734778782302584,
"grad_norm": 0.5757572054862976,
"learning_rate": 1.1861209747539304e-07,
"loss": 0.6298,
"step": 2138
},
{
"epoch": 2.736058884710777,
"grad_norm": 0.6351795792579651,
"learning_rate": 1.1843564068046549e-07,
"loss": 0.6456,
"step": 2139
},
{
"epoch": 2.7373389871189695,
"grad_norm": 0.8434006571769714,
"learning_rate": 1.1826000685258507e-07,
"loss": 0.6337,
"step": 2140
},
{
"epoch": 2.738619089527162,
"grad_norm": 0.6475664377212524,
"learning_rate": 1.1808519632667484e-07,
"loss": 0.6476,
"step": 2141
},
{
"epoch": 2.739899191935355,
"grad_norm": 0.7432494759559631,
"learning_rate": 1.1791120943608785e-07,
"loss": 0.6276,
"step": 2142
},
{
"epoch": 2.7411792943435476,
"grad_norm": 1.0871083736419678,
"learning_rate": 1.1773804651260653e-07,
"loss": 0.6625,
"step": 2143
},
{
"epoch": 2.74245939675174,
"grad_norm": 0.757992684841156,
"learning_rate": 1.1756570788644207e-07,
"loss": 0.6348,
"step": 2144
},
{
"epoch": 2.7437394991599326,
"grad_norm": 0.3062693774700165,
"learning_rate": 1.1739419388623381e-07,
"loss": 0.6413,
"step": 2145
},
{
"epoch": 2.745019601568125,
"grad_norm": 0.9409393072128296,
"learning_rate": 1.1722350483904849e-07,
"loss": 0.6239,
"step": 2146
},
{
"epoch": 2.746299703976318,
"grad_norm": 0.8624541163444519,
"learning_rate": 1.1705364107037979e-07,
"loss": 0.6187,
"step": 2147
},
{
"epoch": 2.7475798063845107,
"grad_norm": 0.5095512866973877,
"learning_rate": 1.1688460290414756e-07,
"loss": 0.6427,
"step": 2148
},
{
"epoch": 2.7488599087927033,
"grad_norm": 0.9675753712654114,
"learning_rate": 1.1671639066269744e-07,
"loss": 0.6738,
"step": 2149
},
{
"epoch": 2.7501400112008962,
"grad_norm": 0.39443734288215637,
"learning_rate": 1.165490046667999e-07,
"loss": 0.6337,
"step": 2150
},
{
"epoch": 2.751420113609089,
"grad_norm": 0.560065507888794,
"learning_rate": 1.1638244523564986e-07,
"loss": 0.6471,
"step": 2151
},
{
"epoch": 2.7527002160172813,
"grad_norm": 0.2955935299396515,
"learning_rate": 1.1621671268686605e-07,
"loss": 0.6489,
"step": 2152
},
{
"epoch": 2.753980318425474,
"grad_norm": 0.33874306082725525,
"learning_rate": 1.1605180733649039e-07,
"loss": 0.6302,
"step": 2153
},
{
"epoch": 2.755260420833667,
"grad_norm": 0.7609798908233643,
"learning_rate": 1.1588772949898742e-07,
"loss": 0.6435,
"step": 2154
},
{
"epoch": 2.7565405232418594,
"grad_norm": 0.3307383954524994,
"learning_rate": 1.1572447948724361e-07,
"loss": 0.6496,
"step": 2155
},
{
"epoch": 2.757820625650052,
"grad_norm": 0.4271416664123535,
"learning_rate": 1.1556205761256676e-07,
"loss": 0.6498,
"step": 2156
},
{
"epoch": 2.759100728058245,
"grad_norm": 0.6107046008110046,
"learning_rate": 1.154004641846856e-07,
"loss": 0.6548,
"step": 2157
},
{
"epoch": 2.7603808304664375,
"grad_norm": 0.2714780867099762,
"learning_rate": 1.1523969951174894e-07,
"loss": 0.6572,
"step": 2158
},
{
"epoch": 2.76166093287463,
"grad_norm": 0.7054845690727234,
"learning_rate": 1.150797639003253e-07,
"loss": 0.653,
"step": 2159
},
{
"epoch": 2.7629410352828225,
"grad_norm": 0.2917812466621399,
"learning_rate": 1.1492065765540216e-07,
"loss": 0.654,
"step": 2160
},
{
"epoch": 2.7629410352828225,
"eval_loss": 0.020075028762221336,
"eval_runtime": 42.0874,
"eval_samples_per_second": 11.785,
"eval_steps_per_second": 1.473,
"step": 2160
},
{
"epoch": 2.764221137691015,
"grad_norm": 0.5847063660621643,
"learning_rate": 1.1476238108038554e-07,
"loss": 0.6317,
"step": 2161
},
{
"epoch": 2.765501240099208,
"grad_norm": 0.5979964137077332,
"learning_rate": 1.1460493447709921e-07,
"loss": 0.6442,
"step": 2162
},
{
"epoch": 2.7667813425074006,
"grad_norm": 0.2768544554710388,
"learning_rate": 1.1444831814578415e-07,
"loss": 0.6493,
"step": 2163
},
{
"epoch": 2.768061444915593,
"grad_norm": 0.625067949295044,
"learning_rate": 1.1429253238509846e-07,
"loss": 0.6508,
"step": 2164
},
{
"epoch": 2.769341547323786,
"grad_norm": 0.40523001551628113,
"learning_rate": 1.1413757749211602e-07,
"loss": 0.6684,
"step": 2165
},
{
"epoch": 2.7706216497319787,
"grad_norm": 0.33590465784072876,
"learning_rate": 1.139834537623264e-07,
"loss": 0.6386,
"step": 2166
},
{
"epoch": 2.771901752140171,
"grad_norm": 0.2729111313819885,
"learning_rate": 1.1383016148963414e-07,
"loss": 0.6331,
"step": 2167
},
{
"epoch": 2.7731818545483637,
"grad_norm": 0.5212605595588684,
"learning_rate": 1.1367770096635839e-07,
"loss": 0.65,
"step": 2168
},
{
"epoch": 2.7744619569565563,
"grad_norm": 0.3095559775829315,
"learning_rate": 1.1352607248323215e-07,
"loss": 0.6618,
"step": 2169
},
{
"epoch": 2.7757420593647493,
"grad_norm": 0.3293081820011139,
"learning_rate": 1.1337527632940161e-07,
"loss": 0.6569,
"step": 2170
},
{
"epoch": 2.777022161772942,
"grad_norm": 0.48291870951652527,
"learning_rate": 1.1322531279242598e-07,
"loss": 0.6435,
"step": 2171
},
{
"epoch": 2.7783022641811344,
"grad_norm": 0.5574477314949036,
"learning_rate": 1.1307618215827659e-07,
"loss": 0.6568,
"step": 2172
},
{
"epoch": 2.7795823665893273,
"grad_norm": 0.6038992404937744,
"learning_rate": 1.1292788471133654e-07,
"loss": 0.6518,
"step": 2173
},
{
"epoch": 2.78086246899752,
"grad_norm": 0.2844580113887787,
"learning_rate": 1.1278042073440001e-07,
"loss": 0.649,
"step": 2174
},
{
"epoch": 2.7821425714057124,
"grad_norm": 0.31601741909980774,
"learning_rate": 1.1263379050867195e-07,
"loss": 0.6428,
"step": 2175
},
{
"epoch": 2.783422673813905,
"grad_norm": 0.3326012194156647,
"learning_rate": 1.1248799431376723e-07,
"loss": 0.6337,
"step": 2176
},
{
"epoch": 2.7847027762220975,
"grad_norm": 0.365177720785141,
"learning_rate": 1.1234303242771029e-07,
"loss": 0.6436,
"step": 2177
},
{
"epoch": 2.7859828786302905,
"grad_norm": 0.4773918688297272,
"learning_rate": 1.1219890512693478e-07,
"loss": 0.6466,
"step": 2178
},
{
"epoch": 2.787262981038483,
"grad_norm": 0.7270103693008423,
"learning_rate": 1.120556126862827e-07,
"loss": 0.6179,
"step": 2179
},
{
"epoch": 2.788543083446676,
"grad_norm": 0.29453837871551514,
"learning_rate": 1.1191315537900392e-07,
"loss": 0.6331,
"step": 2180
},
{
"epoch": 2.7898231858548685,
"grad_norm": 0.46061971783638,
"learning_rate": 1.1177153347675606e-07,
"loss": 0.6409,
"step": 2181
},
{
"epoch": 2.791103288263061,
"grad_norm": 0.6121891736984253,
"learning_rate": 1.1163074724960326e-07,
"loss": 0.6381,
"step": 2182
},
{
"epoch": 2.7923833906712536,
"grad_norm": 0.3224369287490845,
"learning_rate": 1.1149079696601652e-07,
"loss": 0.6476,
"step": 2183
},
{
"epoch": 2.793663493079446,
"grad_norm": 0.7230015993118286,
"learning_rate": 1.1135168289287241e-07,
"loss": 0.6481,
"step": 2184
},
{
"epoch": 2.794943595487639,
"grad_norm": 0.34099048376083374,
"learning_rate": 1.1121340529545317e-07,
"loss": 0.6152,
"step": 2185
},
{
"epoch": 2.7962236978958317,
"grad_norm": 1.5147699117660522,
"learning_rate": 1.1107596443744568e-07,
"loss": 0.6531,
"step": 2186
},
{
"epoch": 2.7975038003040242,
"grad_norm": 0.2872607409954071,
"learning_rate": 1.1093936058094127e-07,
"loss": 0.653,
"step": 2187
},
{
"epoch": 2.798783902712217,
"grad_norm": 0.5864285826683044,
"learning_rate": 1.1080359398643536e-07,
"loss": 0.6341,
"step": 2188
},
{
"epoch": 2.8000640051204098,
"grad_norm": 0.42131397128105164,
"learning_rate": 1.1066866491282649e-07,
"loss": 0.6095,
"step": 2189
},
{
"epoch": 2.8013441075286023,
"grad_norm": 0.2504804730415344,
"learning_rate": 1.1053457361741624e-07,
"loss": 0.6481,
"step": 2190
},
{
"epoch": 2.8013441075286023,
"eval_loss": 0.02010684460401535,
"eval_runtime": 42.1314,
"eval_samples_per_second": 11.773,
"eval_steps_per_second": 1.472,
"step": 2190
},
{
"epoch": 2.802624209936795,
"grad_norm": 0.3099571168422699,
"learning_rate": 1.104013203559086e-07,
"loss": 0.6536,
"step": 2191
},
{
"epoch": 2.8039043123449874,
"grad_norm": 0.7082545161247253,
"learning_rate": 1.1026890538240936e-07,
"loss": 0.6151,
"step": 2192
},
{
"epoch": 2.8051844147531804,
"grad_norm": 1.1165101528167725,
"learning_rate": 1.1013732894942596e-07,
"loss": 0.6421,
"step": 2193
},
{
"epoch": 2.806464517161373,
"grad_norm": 0.2601620554924011,
"learning_rate": 1.1000659130786663e-07,
"loss": 0.6553,
"step": 2194
},
{
"epoch": 2.8077446195695654,
"grad_norm": 0.8848174214363098,
"learning_rate": 1.0987669270704018e-07,
"loss": 0.6582,
"step": 2195
},
{
"epoch": 2.8090247219777584,
"grad_norm": 0.5151593685150146,
"learning_rate": 1.0974763339465529e-07,
"loss": 0.652,
"step": 2196
},
{
"epoch": 2.810304824385951,
"grad_norm": 0.2939353585243225,
"learning_rate": 1.0961941361682011e-07,
"loss": 0.6342,
"step": 2197
},
{
"epoch": 2.8115849267941435,
"grad_norm": 1.5515726804733276,
"learning_rate": 1.0949203361804223e-07,
"loss": 0.6708,
"step": 2198
},
{
"epoch": 2.812865029202336,
"grad_norm": 1.2032933235168457,
"learning_rate": 1.0936549364122745e-07,
"loss": 0.6557,
"step": 2199
},
{
"epoch": 2.8141451316105286,
"grad_norm": 0.33010733127593994,
"learning_rate": 1.0923979392767982e-07,
"loss": 0.6734,
"step": 2200
},
{
"epoch": 2.8154252340187216,
"grad_norm": 0.9063467979431152,
"learning_rate": 1.0911493471710108e-07,
"loss": 0.6448,
"step": 2201
},
{
"epoch": 2.816705336426914,
"grad_norm": 1.4805728197097778,
"learning_rate": 1.0899091624759019e-07,
"loss": 0.6095,
"step": 2202
},
{
"epoch": 2.8179854388351067,
"grad_norm": 1.0414221286773682,
"learning_rate": 1.0886773875564284e-07,
"loss": 0.6583,
"step": 2203
},
{
"epoch": 2.8192655412432996,
"grad_norm": 0.3527986705303192,
"learning_rate": 1.08745402476151e-07,
"loss": 0.6344,
"step": 2204
},
{
"epoch": 2.820545643651492,
"grad_norm": 0.8493846654891968,
"learning_rate": 1.0862390764240257e-07,
"loss": 0.6512,
"step": 2205
},
{
"epoch": 2.8218257460596847,
"grad_norm": 0.9866908192634583,
"learning_rate": 1.085032544860808e-07,
"loss": 0.6576,
"step": 2206
},
{
"epoch": 2.8231058484678773,
"grad_norm": 0.4657198190689087,
"learning_rate": 1.0838344323726395e-07,
"loss": 0.638,
"step": 2207
},
{
"epoch": 2.8243859508760703,
"grad_norm": 1.1018624305725098,
"learning_rate": 1.082644741244248e-07,
"loss": 0.6349,
"step": 2208
},
{
"epoch": 2.825666053284263,
"grad_norm": 0.4456295073032379,
"learning_rate": 1.0814634737443024e-07,
"loss": 0.6477,
"step": 2209
},
{
"epoch": 2.8269461556924553,
"grad_norm": 0.8415900468826294,
"learning_rate": 1.0802906321254085e-07,
"loss": 0.6446,
"step": 2210
},
{
"epoch": 2.8282262581006483,
"grad_norm": 1.4421777725219727,
"learning_rate": 1.079126218624103e-07,
"loss": 0.6701,
"step": 2211
},
{
"epoch": 2.829506360508841,
"grad_norm": 0.5015147924423218,
"learning_rate": 1.0779702354608525e-07,
"loss": 0.6392,
"step": 2212
},
{
"epoch": 2.8307864629170334,
"grad_norm": 1.0721427202224731,
"learning_rate": 1.0768226848400465e-07,
"loss": 0.6611,
"step": 2213
},
{
"epoch": 2.832066565325226,
"grad_norm": 0.38133323192596436,
"learning_rate": 1.0756835689499952e-07,
"loss": 0.6486,
"step": 2214
},
{
"epoch": 2.8333466677334185,
"grad_norm": 0.287044495344162,
"learning_rate": 1.0745528899629228e-07,
"loss": 0.6255,
"step": 2215
},
{
"epoch": 2.8346267701416115,
"grad_norm": 0.8329699635505676,
"learning_rate": 1.0734306500349653e-07,
"loss": 0.6447,
"step": 2216
},
{
"epoch": 2.835906872549804,
"grad_norm": 0.6404094696044922,
"learning_rate": 1.0723168513061665e-07,
"loss": 0.6379,
"step": 2217
},
{
"epoch": 2.8371869749579965,
"grad_norm": 1.269181728363037,
"learning_rate": 1.0712114959004729e-07,
"loss": 0.6483,
"step": 2218
},
{
"epoch": 2.8384670773661895,
"grad_norm": 1.1914838552474976,
"learning_rate": 1.0701145859257309e-07,
"loss": 0.6281,
"step": 2219
},
{
"epoch": 2.839747179774382,
"grad_norm": 0.3412242829799652,
"learning_rate": 1.0690261234736801e-07,
"loss": 0.6291,
"step": 2220
},
{
"epoch": 2.839747179774382,
"eval_loss": 0.02010653167963028,
"eval_runtime": 42.1079,
"eval_samples_per_second": 11.779,
"eval_steps_per_second": 1.472,
"step": 2220
},
{
"epoch": 2.8410272821825746,
"grad_norm": 0.6087857484817505,
"learning_rate": 1.0679461106199524e-07,
"loss": 0.6157,
"step": 2221
},
{
"epoch": 2.842307384590767,
"grad_norm": 0.2712996006011963,
"learning_rate": 1.0668745494240679e-07,
"loss": 0.6626,
"step": 2222
},
{
"epoch": 2.8435874869989597,
"grad_norm": 0.7269452810287476,
"learning_rate": 1.0658114419294279e-07,
"loss": 0.6433,
"step": 2223
},
{
"epoch": 2.8448675894071527,
"grad_norm": 0.47443509101867676,
"learning_rate": 1.0647567901633142e-07,
"loss": 0.6392,
"step": 2224
},
{
"epoch": 2.846147691815345,
"grad_norm": 0.8108417391777039,
"learning_rate": 1.0637105961368836e-07,
"loss": 0.6239,
"step": 2225
},
{
"epoch": 2.8474277942235378,
"grad_norm": 0.5707200169563293,
"learning_rate": 1.0626728618451647e-07,
"loss": 0.6219,
"step": 2226
},
{
"epoch": 2.8487078966317307,
"grad_norm": 0.7317054271697998,
"learning_rate": 1.0616435892670531e-07,
"loss": 0.6421,
"step": 2227
},
{
"epoch": 2.8499879990399233,
"grad_norm": 0.8396162390708923,
"learning_rate": 1.0606227803653105e-07,
"loss": 0.6571,
"step": 2228
},
{
"epoch": 2.851268101448116,
"grad_norm": 0.5900576114654541,
"learning_rate": 1.0596104370865573e-07,
"loss": 0.6692,
"step": 2229
},
{
"epoch": 2.8525482038563084,
"grad_norm": 1.075056791305542,
"learning_rate": 1.0586065613612695e-07,
"loss": 0.6594,
"step": 2230
},
{
"epoch": 2.853828306264501,
"grad_norm": 0.5356476902961731,
"learning_rate": 1.0576111551037783e-07,
"loss": 0.6276,
"step": 2231
},
{
"epoch": 2.855108408672694,
"grad_norm": 0.7195831537246704,
"learning_rate": 1.0566242202122628e-07,
"loss": 0.65,
"step": 2232
},
{
"epoch": 2.8563885110808864,
"grad_norm": 0.3165750503540039,
"learning_rate": 1.0556457585687477e-07,
"loss": 0.6199,
"step": 2233
},
{
"epoch": 2.857668613489079,
"grad_norm": 0.38355469703674316,
"learning_rate": 1.0546757720391002e-07,
"loss": 0.6591,
"step": 2234
},
{
"epoch": 2.858948715897272,
"grad_norm": 1.0184906721115112,
"learning_rate": 1.0537142624730257e-07,
"loss": 0.6486,
"step": 2235
},
{
"epoch": 2.8602288183054645,
"grad_norm": 0.8666162490844727,
"learning_rate": 1.0527612317040646e-07,
"loss": 0.6475,
"step": 2236
},
{
"epoch": 2.861508920713657,
"grad_norm": 0.41836732625961304,
"learning_rate": 1.0518166815495888e-07,
"loss": 0.6618,
"step": 2237
},
{
"epoch": 2.8627890231218496,
"grad_norm": 0.2589111924171448,
"learning_rate": 1.0508806138107978e-07,
"loss": 0.6391,
"step": 2238
},
{
"epoch": 2.8640691255300426,
"grad_norm": 1.23524010181427,
"learning_rate": 1.0499530302727162e-07,
"loss": 0.6584,
"step": 2239
},
{
"epoch": 2.865349227938235,
"grad_norm": 0.8812917470932007,
"learning_rate": 1.0490339327041903e-07,
"loss": 0.6241,
"step": 2240
},
{
"epoch": 2.8666293303464276,
"grad_norm": 0.2986970543861389,
"learning_rate": 1.0481233228578823e-07,
"loss": 0.6554,
"step": 2241
},
{
"epoch": 2.8679094327546206,
"grad_norm": 1.0834957361221313,
"learning_rate": 1.04722120247027e-07,
"loss": 0.6274,
"step": 2242
},
{
"epoch": 2.869189535162813,
"grad_norm": 0.41948211193084717,
"learning_rate": 1.046327573261643e-07,
"loss": 0.6498,
"step": 2243
},
{
"epoch": 2.8704696375710057,
"grad_norm": 0.34662750363349915,
"learning_rate": 1.0454424369360973e-07,
"loss": 0.6444,
"step": 2244
},
{
"epoch": 2.8717497399791982,
"grad_norm": 0.48483341932296753,
"learning_rate": 1.0445657951815343e-07,
"loss": 0.6433,
"step": 2245
},
{
"epoch": 2.873029842387391,
"grad_norm": 1.1565371751785278,
"learning_rate": 1.0436976496696571e-07,
"loss": 0.6348,
"step": 2246
},
{
"epoch": 2.8743099447955838,
"grad_norm": 1.0118498802185059,
"learning_rate": 1.0428380020559657e-07,
"loss": 0.6556,
"step": 2247
},
{
"epoch": 2.8755900472037763,
"grad_norm": 1.3405448198318481,
"learning_rate": 1.0419868539797565e-07,
"loss": 0.6474,
"step": 2248
},
{
"epoch": 2.876870149611969,
"grad_norm": 0.6180388331413269,
"learning_rate": 1.0411442070641178e-07,
"loss": 0.6396,
"step": 2249
},
{
"epoch": 2.878150252020162,
"grad_norm": 0.261161208152771,
"learning_rate": 1.0403100629159248e-07,
"loss": 0.6425,
"step": 2250
},
{
"epoch": 2.878150252020162,
"eval_loss": 0.02006879262626171,
"eval_runtime": 42.1198,
"eval_samples_per_second": 11.776,
"eval_steps_per_second": 1.472,
"step": 2250
},
{
"epoch": 2.8794303544283544,
"grad_norm": 0.3375232219696045,
"learning_rate": 1.03948442312584e-07,
"loss": 0.622,
"step": 2251
},
{
"epoch": 2.880710456836547,
"grad_norm": 0.9228675961494446,
"learning_rate": 1.0386672892683095e-07,
"loss": 0.6401,
"step": 2252
},
{
"epoch": 2.8819905592447395,
"grad_norm": 0.38941460847854614,
"learning_rate": 1.0378586629015573e-07,
"loss": 0.6376,
"step": 2253
},
{
"epoch": 2.883270661652932,
"grad_norm": 0.8098536729812622,
"learning_rate": 1.0370585455675845e-07,
"loss": 0.6716,
"step": 2254
},
{
"epoch": 2.884550764061125,
"grad_norm": 0.30574071407318115,
"learning_rate": 1.0362669387921666e-07,
"loss": 0.6562,
"step": 2255
},
{
"epoch": 2.8858308664693175,
"grad_norm": 0.35651296377182007,
"learning_rate": 1.0354838440848501e-07,
"loss": 0.6405,
"step": 2256
},
{
"epoch": 2.88711096887751,
"grad_norm": 0.3437579870223999,
"learning_rate": 1.0347092629389483e-07,
"loss": 0.6382,
"step": 2257
},
{
"epoch": 2.888391071285703,
"grad_norm": 0.5851202011108398,
"learning_rate": 1.0339431968315409e-07,
"loss": 0.6553,
"step": 2258
},
{
"epoch": 2.8896711736938956,
"grad_norm": 0.8172543048858643,
"learning_rate": 1.0331856472234694e-07,
"loss": 0.6499,
"step": 2259
},
{
"epoch": 2.890951276102088,
"grad_norm": 0.7027254700660706,
"learning_rate": 1.032436615559335e-07,
"loss": 0.6402,
"step": 2260
},
{
"epoch": 2.8922313785102807,
"grad_norm": 1.2736692428588867,
"learning_rate": 1.0316961032674962e-07,
"loss": 0.6371,
"step": 2261
},
{
"epoch": 2.893511480918473,
"grad_norm": 0.32884854078292847,
"learning_rate": 1.0309641117600635e-07,
"loss": 0.6706,
"step": 2262
},
{
"epoch": 2.894791583326666,
"grad_norm": 0.3352726101875305,
"learning_rate": 1.0302406424329015e-07,
"loss": 0.6549,
"step": 2263
},
{
"epoch": 2.8960716857348587,
"grad_norm": 0.268131822347641,
"learning_rate": 1.0295256966656222e-07,
"loss": 0.6421,
"step": 2264
},
{
"epoch": 2.8973517881430517,
"grad_norm": 0.3668014109134674,
"learning_rate": 1.0288192758215837e-07,
"loss": 0.6235,
"step": 2265
},
{
"epoch": 2.8986318905512443,
"grad_norm": 1.1026606559753418,
"learning_rate": 1.0281213812478874e-07,
"loss": 0.6285,
"step": 2266
},
{
"epoch": 2.899911992959437,
"grad_norm": 0.873980700969696,
"learning_rate": 1.0274320142753759e-07,
"loss": 0.6554,
"step": 2267
},
{
"epoch": 2.9011920953676293,
"grad_norm": 0.46991366147994995,
"learning_rate": 1.026751176218631e-07,
"loss": 0.6276,
"step": 2268
},
{
"epoch": 2.902472197775822,
"grad_norm": 1.3535581827163696,
"learning_rate": 1.0260788683759685e-07,
"loss": 0.6674,
"step": 2269
},
{
"epoch": 2.903752300184015,
"grad_norm": 0.5768007636070251,
"learning_rate": 1.0254150920294386e-07,
"loss": 0.641,
"step": 2270
},
{
"epoch": 2.9050324025922074,
"grad_norm": 0.5021919012069702,
"learning_rate": 1.0247598484448239e-07,
"loss": 0.6254,
"step": 2271
},
{
"epoch": 2.9063125050004,
"grad_norm": 0.2904020845890045,
"learning_rate": 1.0241131388716332e-07,
"loss": 0.6506,
"step": 2272
},
{
"epoch": 2.907592607408593,
"grad_norm": 0.2539806365966797,
"learning_rate": 1.0234749645431021e-07,
"loss": 0.633,
"step": 2273
},
{
"epoch": 2.9088727098167855,
"grad_norm": 0.9190971851348877,
"learning_rate": 1.0228453266761909e-07,
"loss": 0.6383,
"step": 2274
},
{
"epoch": 2.910152812224978,
"grad_norm": 0.661307692527771,
"learning_rate": 1.0222242264715804e-07,
"loss": 0.6389,
"step": 2275
},
{
"epoch": 2.9114329146331706,
"grad_norm": 0.530551016330719,
"learning_rate": 1.0216116651136716e-07,
"loss": 0.658,
"step": 2276
},
{
"epoch": 2.912713017041363,
"grad_norm": 0.32086044549942017,
"learning_rate": 1.0210076437705812e-07,
"loss": 0.6531,
"step": 2277
},
{
"epoch": 2.913993119449556,
"grad_norm": 0.4508582651615143,
"learning_rate": 1.0204121635941417e-07,
"loss": 0.6273,
"step": 2278
},
{
"epoch": 2.9152732218577486,
"grad_norm": 0.28816190361976624,
"learning_rate": 1.0198252257198972e-07,
"loss": 0.6499,
"step": 2279
},
{
"epoch": 2.916553324265941,
"grad_norm": 0.7827352285385132,
"learning_rate": 1.0192468312671037e-07,
"loss": 0.6591,
"step": 2280
},
{
"epoch": 2.916553324265941,
"eval_loss": 0.0201045423746109,
"eval_runtime": 42.1529,
"eval_samples_per_second": 11.767,
"eval_steps_per_second": 1.471,
"step": 2280
},
{
"epoch": 2.917833426674134,
"grad_norm": 0.2672688961029053,
"learning_rate": 1.0186769813387225e-07,
"loss": 0.6463,
"step": 2281
},
{
"epoch": 2.9191135290823267,
"grad_norm": 0.439020574092865,
"learning_rate": 1.0181156770214242e-07,
"loss": 0.6474,
"step": 2282
},
{
"epoch": 2.9203936314905192,
"grad_norm": 0.515463650226593,
"learning_rate": 1.0175629193855824e-07,
"loss": 0.6305,
"step": 2283
},
{
"epoch": 2.9216737338987118,
"grad_norm": 0.2739676833152771,
"learning_rate": 1.0170187094852709e-07,
"loss": 0.6364,
"step": 2284
},
{
"epoch": 2.9229538363069043,
"grad_norm": 1.2020562887191772,
"learning_rate": 1.016483048358266e-07,
"loss": 0.6339,
"step": 2285
},
{
"epoch": 2.9242339387150973,
"grad_norm": 0.4133013188838959,
"learning_rate": 1.0159559370260409e-07,
"loss": 0.6365,
"step": 2286
},
{
"epoch": 2.92551404112329,
"grad_norm": 0.912691593170166,
"learning_rate": 1.0154373764937644e-07,
"loss": 0.6346,
"step": 2287
},
{
"epoch": 2.9267941435314824,
"grad_norm": 0.9713746309280396,
"learning_rate": 1.0149273677503007e-07,
"loss": 0.6637,
"step": 2288
},
{
"epoch": 2.9280742459396754,
"grad_norm": 0.32678431272506714,
"learning_rate": 1.014425911768205e-07,
"loss": 0.6286,
"step": 2289
},
{
"epoch": 2.929354348347868,
"grad_norm": 0.5092898607254028,
"learning_rate": 1.0139330095037235e-07,
"loss": 0.6623,
"step": 2290
},
{
"epoch": 2.9306344507560604,
"grad_norm": 0.2719021141529083,
"learning_rate": 1.0134486618967915e-07,
"loss": 0.6389,
"step": 2291
},
{
"epoch": 2.931914553164253,
"grad_norm": 0.9849359393119812,
"learning_rate": 1.0129728698710294e-07,
"loss": 0.6368,
"step": 2292
},
{
"epoch": 2.9331946555724455,
"grad_norm": 0.9234448075294495,
"learning_rate": 1.0125056343337446e-07,
"loss": 0.6375,
"step": 2293
},
{
"epoch": 2.9344747579806385,
"grad_norm": 0.9093217849731445,
"learning_rate": 1.0120469561759268e-07,
"loss": 0.64,
"step": 2294
},
{
"epoch": 2.935754860388831,
"grad_norm": 1.1087493896484375,
"learning_rate": 1.0115968362722468e-07,
"loss": 0.6638,
"step": 2295
},
{
"epoch": 2.937034962797024,
"grad_norm": 0.6836243867874146,
"learning_rate": 1.0111552754810566e-07,
"loss": 0.6499,
"step": 2296
},
{
"epoch": 2.9383150652052166,
"grad_norm": 0.3947342038154602,
"learning_rate": 1.010722274644386e-07,
"loss": 0.6378,
"step": 2297
},
{
"epoch": 2.939595167613409,
"grad_norm": 0.27283111214637756,
"learning_rate": 1.0102978345879404e-07,
"loss": 0.6553,
"step": 2298
},
{
"epoch": 2.9408752700216017,
"grad_norm": 0.5560145378112793,
"learning_rate": 1.0098819561211024e-07,
"loss": 0.6317,
"step": 2299
},
{
"epoch": 2.942155372429794,
"grad_norm": 0.5116812586784363,
"learning_rate": 1.0094746400369259e-07,
"loss": 0.6507,
"step": 2300
},
{
"epoch": 2.943435474837987,
"grad_norm": 0.7335453629493713,
"learning_rate": 1.0090758871121388e-07,
"loss": 0.6246,
"step": 2301
},
{
"epoch": 2.9447155772461797,
"grad_norm": 0.5693823099136353,
"learning_rate": 1.008685698107138e-07,
"loss": 0.6618,
"step": 2302
},
{
"epoch": 2.9459956796543723,
"grad_norm": 0.4048636257648468,
"learning_rate": 1.008304073765991e-07,
"loss": 0.6341,
"step": 2303
},
{
"epoch": 2.9472757820625652,
"grad_norm": 0.8174906969070435,
"learning_rate": 1.0079310148164313e-07,
"loss": 0.6685,
"step": 2304
},
{
"epoch": 2.948555884470758,
"grad_norm": 0.31603822112083435,
"learning_rate": 1.0075665219698608e-07,
"loss": 0.6268,
"step": 2305
},
{
"epoch": 2.9498359868789503,
"grad_norm": 0.3102402687072754,
"learning_rate": 1.0072105959213451e-07,
"loss": 0.6447,
"step": 2306
},
{
"epoch": 2.951116089287143,
"grad_norm": 0.3637251853942871,
"learning_rate": 1.0068632373496124e-07,
"loss": 0.653,
"step": 2307
},
{
"epoch": 2.9523961916953354,
"grad_norm": 0.40536120533943176,
"learning_rate": 1.0065244469170558e-07,
"loss": 0.6648,
"step": 2308
},
{
"epoch": 2.9536762941035284,
"grad_norm": 0.8023518323898315,
"learning_rate": 1.0061942252697273e-07,
"loss": 0.6171,
"step": 2309
},
{
"epoch": 2.954956396511721,
"grad_norm": 0.4299080967903137,
"learning_rate": 1.0058725730373396e-07,
"loss": 0.6426,
"step": 2310
},
{
"epoch": 2.954956396511721,
"eval_loss": 0.020083000883460045,
"eval_runtime": 42.1151,
"eval_samples_per_second": 11.777,
"eval_steps_per_second": 1.472,
"step": 2310
},
{
"epoch": 2.9562364989199135,
"grad_norm": 0.5772362351417542,
"learning_rate": 1.0055594908332647e-07,
"loss": 0.636,
"step": 2311
},
{
"epoch": 2.9575166013281065,
"grad_norm": 0.3647783696651459,
"learning_rate": 1.00525497925453e-07,
"loss": 0.649,
"step": 2312
},
{
"epoch": 2.958796703736299,
"grad_norm": 0.27724897861480713,
"learning_rate": 1.0049590388818224e-07,
"loss": 0.6384,
"step": 2313
},
{
"epoch": 2.9600768061444915,
"grad_norm": 0.5586848258972168,
"learning_rate": 1.0046716702794808e-07,
"loss": 0.6588,
"step": 2314
},
{
"epoch": 2.961356908552684,
"grad_norm": 0.46139171719551086,
"learning_rate": 1.0043928739954999e-07,
"loss": 0.6595,
"step": 2315
},
{
"epoch": 2.9626370109608766,
"grad_norm": 0.3093836009502411,
"learning_rate": 1.0041226505615277e-07,
"loss": 0.6579,
"step": 2316
},
{
"epoch": 2.9639171133690696,
"grad_norm": 0.2686119079589844,
"learning_rate": 1.0038610004928639e-07,
"loss": 0.6305,
"step": 2317
},
{
"epoch": 2.965197215777262,
"grad_norm": 0.39112165570259094,
"learning_rate": 1.0036079242884591e-07,
"loss": 0.6405,
"step": 2318
},
{
"epoch": 2.9664773181854547,
"grad_norm": 0.26842445135116577,
"learning_rate": 1.0033634224309143e-07,
"loss": 0.6459,
"step": 2319
},
{
"epoch": 2.9677574205936477,
"grad_norm": 0.6161180138587952,
"learning_rate": 1.0031274953864799e-07,
"loss": 0.6436,
"step": 2320
},
{
"epoch": 2.96903752300184,
"grad_norm": 0.7368577718734741,
"learning_rate": 1.0029001436050538e-07,
"loss": 0.6354,
"step": 2321
},
{
"epoch": 2.9703176254100327,
"grad_norm": 0.32090792059898376,
"learning_rate": 1.0026813675201831e-07,
"loss": 0.6474,
"step": 2322
},
{
"epoch": 2.9715977278182253,
"grad_norm": 1.411336898803711,
"learning_rate": 1.0024711675490596e-07,
"loss": 0.6707,
"step": 2323
},
{
"epoch": 2.9728778302264183,
"grad_norm": 1.18115234375,
"learning_rate": 1.0022695440925222e-07,
"loss": 0.6497,
"step": 2324
},
{
"epoch": 2.974157932634611,
"grad_norm": 0.9594967365264893,
"learning_rate": 1.0020764975350545e-07,
"loss": 0.6556,
"step": 2325
},
{
"epoch": 2.9754380350428034,
"grad_norm": 0.35163840651512146,
"learning_rate": 1.001892028244785e-07,
"loss": 0.6418,
"step": 2326
},
{
"epoch": 2.9767181374509963,
"grad_norm": 0.3306455612182617,
"learning_rate": 1.0017161365734851e-07,
"loss": 0.6332,
"step": 2327
},
{
"epoch": 2.977998239859189,
"grad_norm": 0.7934905290603638,
"learning_rate": 1.00154882285657e-07,
"loss": 0.6148,
"step": 2328
},
{
"epoch": 2.9792783422673814,
"grad_norm": 0.6301752328872681,
"learning_rate": 1.001390087413096e-07,
"loss": 0.6455,
"step": 2329
},
{
"epoch": 2.980558444675574,
"grad_norm": 0.2567738890647888,
"learning_rate": 1.0012399305457622e-07,
"loss": 0.6224,
"step": 2330
},
{
"epoch": 2.9818385470837665,
"grad_norm": 0.5269167423248291,
"learning_rate": 1.0010983525409086e-07,
"loss": 0.6434,
"step": 2331
},
{
"epoch": 2.9831186494919595,
"grad_norm": 0.3913140296936035,
"learning_rate": 1.0009653536685168e-07,
"loss": 0.6425,
"step": 2332
},
{
"epoch": 2.984398751900152,
"grad_norm": 0.46846702694892883,
"learning_rate": 1.000840934182206e-07,
"loss": 0.6526,
"step": 2333
},
{
"epoch": 2.9856788543083446,
"grad_norm": 0.3315781354904175,
"learning_rate": 1.0007250943192381e-07,
"loss": 0.662,
"step": 2334
},
{
"epoch": 2.9869589567165375,
"grad_norm": 1.0006517171859741,
"learning_rate": 1.0006178343005118e-07,
"loss": 0.638,
"step": 2335
},
{
"epoch": 2.98823905912473,
"grad_norm": 0.27513471245765686,
"learning_rate": 1.0005191543305659e-07,
"loss": 0.6604,
"step": 2336
},
{
"epoch": 2.9895191615329226,
"grad_norm": 0.2785768210887909,
"learning_rate": 1.0004290545975764e-07,
"loss": 0.6237,
"step": 2337
},
{
"epoch": 2.990799263941115,
"grad_norm": 0.2952953577041626,
"learning_rate": 1.000347535273359e-07,
"loss": 0.6508,
"step": 2338
},
{
"epoch": 2.9920793663493077,
"grad_norm": 0.3556389808654785,
"learning_rate": 1.0002745965133658e-07,
"loss": 0.624,
"step": 2339
},
{
"epoch": 2.9933594687575007,
"grad_norm": 1.2344200611114502,
"learning_rate": 1.0002102384566857e-07,
"loss": 0.6274,
"step": 2340
},
{
"epoch": 2.9933594687575007,
"eval_loss": 0.020086178556084633,
"eval_runtime": 42.1347,
"eval_samples_per_second": 11.772,
"eval_steps_per_second": 1.471,
"step": 2340
},
{
"epoch": 2.9946395711656932,
"grad_norm": 0.3444899916648865,
"learning_rate": 1.0001544612260471e-07,
"loss": 0.6496,
"step": 2341
},
{
"epoch": 2.9959196735738858,
"grad_norm": 0.26558321714401245,
"learning_rate": 1.0001072649278125e-07,
"loss": 0.6326,
"step": 2342
},
{
"epoch": 2.9971997759820788,
"grad_norm": 0.2798824906349182,
"learning_rate": 1.000068649651983e-07,
"loss": 0.6276,
"step": 2343
},
{
"epoch": 2.9984798783902713,
"grad_norm": 0.3596898317337036,
"learning_rate": 1.0000386154721955e-07,
"loss": 0.6416,
"step": 2344
},
{
"epoch": 2.999759980798464,
"grad_norm": 0.3293759822845459,
"learning_rate": 1.0000171624457236e-07,
"loss": 0.6371,
"step": 2345
},
{
"epoch": 3.0,
"grad_norm": 0.8627230525016785,
"learning_rate": 1.0000042906134765e-07,
"loss": 0.6206,
"step": 2346
}
],
"logging_steps": 1,
"max_steps": 2346,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.342670915493167e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}