{
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.09929697740000794,
  "global_step": 5000,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.0,
      "learning_rate": 9.92063492063492e-07,
      "loss": 10.57,
      "theoretical_loss": 20.84128112621979,
      "tokens_seen": 65536
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.984126984126984e-06,
      "loss": 10.5575,
      "theoretical_loss": 17.594664429001284,
      "tokens_seen": 131072
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.9761904761904763e-06,
      "loss": 10.5059,
      "theoretical_loss": 15.967940417509208,
      "tokens_seen": 196608
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.968253968253968e-06,
      "loss": 10.3609,
      "theoretical_loss": 14.92078008066121,
      "tokens_seen": 262144
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.96031746031746e-06,
      "loss": 10.2003,
      "theoretical_loss": 14.164680262435617,
      "tokens_seen": 327680
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.9523809523809525e-06,
      "loss": 9.9558,
      "theoretical_loss": 13.581024797222863,
      "tokens_seen": 393216
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.944444444444444e-06,
      "loss": 9.7673,
      "theoretical_loss": 13.11027232607383,
      "tokens_seen": 458752
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.936507936507936e-06,
      "loss": 9.5702,
      "theoretical_loss": 12.718592950155966,
      "tokens_seen": 524288
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.928571428571428e-06,
      "loss": 9.4144,
      "theoretical_loss": 12.385055788546264,
      "tokens_seen": 589824
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.92063492063492e-06,
      "loss": 9.2409,
      "theoretical_loss": 12.09587593170772,
      "tokens_seen": 655360
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.0912698412698412e-05,
      "loss": 9.0755,
      "theoretical_loss": 11.841529555774319,
      "tokens_seen": 720896
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.1904761904761905e-05,
      "loss": 9.1598,
      "theoretical_loss": 11.615182533379372,
      "tokens_seen": 786432
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.2896825396825396e-05,
      "loss": 8.936,
      "theoretical_loss": 11.41177746485943,
      "tokens_seen": 851968
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.3888888888888888e-05,
      "loss": 8.8081,
      "theoretical_loss": 11.227475026784514,
      "tokens_seen": 917504
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.4880952380952381e-05,
      "loss": 8.793,
      "theoretical_loss": 11.059297242650555,
      "tokens_seen": 983040
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.5873015873015872e-05,
      "loss": 8.7241,
      "theoretical_loss": 10.90489141112959,
      "tokens_seen": 1048576
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.6865079365079364e-05,
      "loss": 8.6332,
      "theoretical_loss": 10.762369064735367,
      "tokens_seen": 1114112
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.7857142857142855e-05,
      "loss": 8.5137,
      "theoretical_loss": 10.63019320090292,
      "tokens_seen": 1179648
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.884920634920635e-05,
      "loss": 8.5658,
      "theoretical_loss": 10.507097497029282,
      "tokens_seen": 1245184
    },
    {
      "epoch": 0.0,
      "learning_rate": 1.984126984126984e-05,
      "loss": 8.4685,
      "theoretical_loss": 10.392027268435971,
      "tokens_seen": 1310720
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.0833333333333333e-05,
      "loss": 8.4186,
      "theoretical_loss": 10.284095545569386,
      "tokens_seen": 1376256
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.1825396825396824e-05,
      "loss": 8.3801,
      "theoretical_loss": 10.182549877942659,
      "tokens_seen": 1441792
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.2817460317460315e-05,
      "loss": 8.226,
      "theoretical_loss": 10.08674688640524,
      "tokens_seen": 1507328
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.380952380952381e-05,
      "loss": 8.1708,
      "theoretical_loss": 9.99613250351292,
      "tokens_seen": 1572864
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.48015873015873e-05,
      "loss": 8.1552,
      "theoretical_loss": 9.91022645106575,
      "tokens_seen": 1638400
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.5793650793650793e-05,
      "loss": 8.0894,
      "theoretical_loss": 9.828609916213201,
      "tokens_seen": 1703936
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.6785714285714284e-05,
      "loss": 8.1028,
      "theoretical_loss": 9.750915671580087,
      "tokens_seen": 1769472
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.7777777777777776e-05,
      "loss": 7.95,
      "theoretical_loss": 9.676820083754187,
      "tokens_seen": 1835008
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.876984126984127e-05,
      "loss": 7.7419,
      "theoretical_loss": 9.606036595818281,
      "tokens_seen": 1900544
    },
    {
      "epoch": 0.0,
      "learning_rate": 2.9761904761904762e-05,
      "loss": 7.998,
      "theoretical_loss": 9.538310371437493,
      "tokens_seen": 1966080
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.075396825396825e-05,
      "loss": 7.8014,
      "theoretical_loss": 9.473413862304575,
      "tokens_seen": 2031616
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.1746031746031745e-05,
      "loss": 7.7064,
      "theoretical_loss": 9.411143115583098,
      "tokens_seen": 2097152
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.273809523809524e-05,
      "loss": 7.7622,
      "theoretical_loss": 9.351314678906622,
      "tokens_seen": 2162688
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.373015873015873e-05,
      "loss": 7.7184,
      "theoretical_loss": 9.293762991332915,
      "tokens_seen": 2228224
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.472222222222222e-05,
      "loss": 7.6797,
      "theoretical_loss": 9.238338172117398,
      "tokens_seen": 2293760
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.571428571428571e-05,
      "loss": 7.4593,
      "theoretical_loss": 9.184904137180933,
      "tokens_seen": 2359296
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.670634920634921e-05,
      "loss": 7.5483,
      "theoretical_loss": 9.133336987085992,
      "tokens_seen": 2424832
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.76984126984127e-05,
      "loss": 7.592,
      "theoretical_loss": 9.083523621206375,
      "tokens_seen": 2490368
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.8690476190476195e-05,
      "loss": 7.5142,
      "theoretical_loss": 9.03536054131647,
      "tokens_seen": 2555904
    },
    {
      "epoch": 0.0,
      "learning_rate": 3.968253968253968e-05,
      "loss": 7.4052,
      "theoretical_loss": 8.988752814581996,
      "tokens_seen": 2621440
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.067460317460318e-05,
      "loss": 7.4385,
      "theoretical_loss": 8.943613171313253,
      "tokens_seen": 2686976
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.1666666666666665e-05,
      "loss": 7.2827,
      "theoretical_loss": 8.899861217150864,
      "tokens_seen": 2752512
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.265873015873016e-05,
      "loss": 7.3631,
      "theoretical_loss": 8.85742274282614,
      "tokens_seen": 2818048
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.365079365079365e-05,
      "loss": 7.3531,
      "theoretical_loss": 8.816229117451055,
      "tokens_seen": 2883584
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.464285714285714e-05,
      "loss": 7.2072,
      "theoretical_loss": 8.776216753584098,
      "tokens_seen": 2949120
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.563492063492063e-05,
      "loss": 7.0976,
      "theoretical_loss": 8.737326634193474,
      "tokens_seen": 3014656
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.6626984126984126e-05,
      "loss": 7.1816,
      "theoretical_loss": 8.699503893181488,
      "tokens_seen": 3080192
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.761904761904762e-05,
      "loss": 7.0114,
      "theoretical_loss": 8.662697442408115,
      "tokens_seen": 3145728
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.8611111111111115e-05,
      "loss": 7.1207,
      "theoretical_loss": 8.626859639208966,
      "tokens_seen": 3211264
    },
    {
      "epoch": 0.0,
      "learning_rate": 4.96031746031746e-05,
      "loss": 7.0124,
      "theoretical_loss": 8.591945989283708,
      "tokens_seen": 3276800
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.05952380952381e-05,
      "loss": 6.891,
      "theoretical_loss": 8.557914880567758,
      "tokens_seen": 3342336
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.1587301587301586e-05,
      "loss": 6.9598,
      "theoretical_loss": 8.524727344318643,
      "tokens_seen": 3407872
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.257936507936508e-05,
      "loss": 6.7816,
      "theoretical_loss": 8.492346840169828,
      "tokens_seen": 3473408
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.357142857142857e-05,
      "loss": 6.7244,
      "theoretical_loss": 8.460739062345422,
      "tokens_seen": 3538944
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.4563492063492063e-05,
      "loss": 6.8671,
      "theoretical_loss": 8.429871764603359,
      "tokens_seen": 3604480
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.555555555555555e-05,
      "loss": 6.7976,
      "theoretical_loss": 8.399714601792851,
      "tokens_seen": 3670016
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.6547619047619046e-05,
      "loss": 6.7397,
      "theoretical_loss": 8.370238986183718,
      "tokens_seen": 3735552
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.753968253968254e-05,
      "loss": 6.7241,
      "theoretical_loss": 8.34141795695797,
      "tokens_seen": 3801088
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.8531746031746036e-05,
      "loss": 6.5309,
      "theoretical_loss": 8.313226061453822,
      "tokens_seen": 3866624
    },
    {
      "epoch": 0.0,
      "learning_rate": 5.9523809523809524e-05,
      "loss": 6.528,
      "theoretical_loss": 8.285639246924504,
      "tokens_seen": 3932160
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.051587301587302e-05,
      "loss": 6.4751,
      "theoretical_loss": 8.258634761722755,
      "tokens_seen": 3997696
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.15079365079365e-05,
      "loss": 6.4183,
      "theoretical_loss": 8.232191064950612,
      "tokens_seen": 4063232
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.25e-05,
      "loss": 6.3916,
      "theoretical_loss": 8.206287743725687,
      "tokens_seen": 4128768
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.349206349206349e-05,
      "loss": 6.3042,
      "theoretical_loss": 8.180905437312258,
      "tokens_seen": 4194304
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.448412698412699e-05,
      "loss": 6.3144,
      "theoretical_loss": 8.15602576745014,
      "tokens_seen": 4259840
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.547619047619048e-05,
      "loss": 6.2482,
      "theoretical_loss": 8.13163127428835,
      "tokens_seen": 4325376
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.646825396825397e-05,
      "loss": 6.2294,
      "theoretical_loss": 8.107705357395282,
      "tokens_seen": 4390912
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.746031746031745e-05,
      "loss": 6.0636,
      "theoretical_loss": 8.084232221374057,
      "tokens_seen": 4456448
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.845238095238096e-05,
      "loss": 6.2193,
      "theoretical_loss": 8.06119682566165,
      "tokens_seen": 4521984
    },
    {
      "epoch": 0.0,
      "learning_rate": 6.944444444444444e-05,
      "loss": 6.1018,
      "theoretical_loss": 8.038584838134476,
      "tokens_seen": 4587520
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.043650793650793e-05,
      "loss": 5.9739,
      "theoretical_loss": 8.016382592182019,
      "tokens_seen": 4653056
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.142857142857142e-05,
      "loss": 6.0808,
      "theoretical_loss": 7.994577046944442,
      "tokens_seen": 4718592
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.242063492063492e-05,
      "loss": 5.9853,
      "theoretical_loss": 7.973155750440629,
      "tokens_seen": 4784128
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.341269841269842e-05,
      "loss": 5.9869,
      "theoretical_loss": 7.95210680534016,
      "tokens_seen": 4849664
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.440476190476191e-05,
      "loss": 5.9608,
      "theoretical_loss": 7.931418837156708,
      "tokens_seen": 4915200
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.53968253968254e-05,
      "loss": 5.8623,
      "theoretical_loss": 7.911080964661844,
      "tokens_seen": 4980736
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.63888888888889e-05,
      "loss": 5.941,
      "theoretical_loss": 7.891082772337269,
      "tokens_seen": 5046272
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.738095238095239e-05,
      "loss": 5.9656,
      "theoretical_loss": 7.871414284700578,
      "tokens_seen": 5111808
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.837301587301588e-05,
      "loss": 5.7778,
      "theoretical_loss": 7.852065942354954,
      "tokens_seen": 5177344
    },
    {
      "epoch": 0.0,
      "learning_rate": 7.936507936507937e-05,
      "loss": 5.8178,
      "theoretical_loss": 7.833028579626806,
      "tokens_seen": 5242880
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.035714285714287e-05,
      "loss": 5.7832,
      "theoretical_loss": 7.814293403667714,
      "tokens_seen": 5308416
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.134920634920635e-05,
      "loss": 5.8231,
      "theoretical_loss": 7.795851974908005,
      "tokens_seen": 5373952
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.234126984126984e-05,
      "loss": 5.6365,
      "theoretical_loss": 7.77769618875926,
      "tokens_seen": 5439488
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.333333333333333e-05,
      "loss": 5.789,
      "theoretical_loss": 7.7598182584719595,
      "tokens_seen": 5505024
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.432539682539683e-05,
      "loss": 5.5228,
      "theoretical_loss": 7.742210699062561,
      "tokens_seen": 5570560
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.531746031746032e-05,
      "loss": 5.4866,
      "theoretical_loss": 7.724866312231575,
      "tokens_seen": 5636096
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.630952380952381e-05,
      "loss": 5.691,
      "theoretical_loss": 7.707778172200822,
      "tokens_seen": 5701632
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.73015873015873e-05,
      "loss": 5.518,
      "theoretical_loss": 7.6909396124039695,
      "tokens_seen": 5767168
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.82936507936508e-05,
      "loss": 5.4731,
      "theoretical_loss": 7.67434421296992,
      "tokens_seen": 5832704
    },
    {
      "epoch": 0.0,
      "learning_rate": 8.928571428571429e-05,
      "loss": 5.4697,
      "theoretical_loss": 7.657985788943502,
      "tokens_seen": 5898240
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.027777777777777e-05,
      "loss": 5.438,
      "theoretical_loss": 7.641858379192337,
      "tokens_seen": 5963776
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.126984126984126e-05,
      "loss": 5.5312,
      "theoretical_loss": 7.625956235952921,
      "tokens_seen": 6029312
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.226190476190476e-05,
      "loss": 5.392,
      "theoretical_loss": 7.610273814972529,
      "tokens_seen": 6094848
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.325396825396825e-05,
      "loss": 5.5359,
      "theoretical_loss": 7.594805766207012,
      "tokens_seen": 6160384
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.424603174603175e-05,
      "loss": 5.4454,
      "theoretical_loss": 7.57954692503759,
      "tokens_seen": 6225920
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.523809523809524e-05,
      "loss": 5.4462,
      "theoretical_loss": 7.5644923039725604,
      "tokens_seen": 6291456
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.623015873015874e-05,
      "loss": 5.4599,
      "theoretical_loss": 7.549637084802403,
      "tokens_seen": 6356992
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.722222222222223e-05,
      "loss": 5.4769,
      "theoretical_loss": 7.534976611179138,
      "tokens_seen": 6422528
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.821428571428572e-05,
      "loss": 5.4082,
      "theoretical_loss": 7.52050638159289,
      "tokens_seen": 6488064
    },
    {
      "epoch": 0.0,
      "objective/train/docs_used": 8801,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 5.3720479011535645,
      "objective/train/theoretical_loss": 7.506222042720672,
      "objective/train/tokens_used": 27013600,
      "theoretical_loss": 7.506222042720672,
      "tokens_seen": 6553600
    },
    {
      "epoch": 0.0,
      "learning_rate": 9.92063492063492e-05,
      "loss": 5.372,
      "theoretical_loss": 7.506222042720672,
      "tokens_seen": 6553600
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010019841269841271,
      "loss": 5.4248,
      "theoretical_loss": 7.492119383124103,
      "tokens_seen": 6619136
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001011904761904762,
      "loss": 5.3686,
      "theoretical_loss": 7.478194327274557,
      "tokens_seen": 6684672
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010218253968253968,
      "loss": 5.2901,
      "theoretical_loss": 7.46444292988566,
      "tokens_seen": 6750208
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010317460317460317,
      "loss": 5.2232,
      "theoretical_loss": 7.450861370534546,
      "tokens_seen": 6815744
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010416666666666667,
      "loss": 5.4176,
      "theoretical_loss": 7.437445948554516,
      "tokens_seen": 6881280
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010515873015873016,
      "loss": 5.2525,
      "theoretical_loss": 7.424193078182986,
      "tokens_seen": 6946816
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010615079365079365,
      "loss": 5.254,
      "theoretical_loss": 7.411099283949674,
      "tokens_seen": 7012352
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010714285714285714,
      "loss": 5.2283,
      "theoretical_loss": 7.3981611962910145,
      "tokens_seen": 7077888
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010813492063492064,
      "loss": 5.2068,
      "theoretical_loss": 7.38537554737773,
      "tokens_seen": 7143424
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00010912698412698413,
      "loss": 5.1696,
      "theoretical_loss": 7.372739167143329,
      "tokens_seen": 7208960
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011011904761904761,
      "loss": 5.1633,
      "theoretical_loss": 7.36024897950216,
      "tokens_seen": 7274496
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001111111111111111,
      "loss": 5.2043,
      "theoretical_loss": 7.347901998746318,
      "tokens_seen": 7340032
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001121031746031746,
      "loss": 5.1537,
      "theoretical_loss": 7.335695326111465,
      "tokens_seen": 7405568
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011309523809523809,
      "loss": 5.2588,
      "theoretical_loss": 7.323626146502205,
      "tokens_seen": 7471104
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011408730158730158,
      "loss": 5.237,
      "theoretical_loss": 7.311691725368293,
      "tokens_seen": 7536640
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011507936507936508,
      "loss": 5.1792,
      "theoretical_loss": 7.299889405723473,
      "tokens_seen": 7602176
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011607142857142858,
      "loss": 5.0581,
      "theoretical_loss": 7.288216605299264,
      "tokens_seen": 7667712
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011706349206349207,
      "loss": 5.0636,
      "theoretical_loss": 7.276670813826511,
      "tokens_seen": 7733248
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011805555555555556,
      "loss": 5.083,
      "theoretical_loss": 7.265249590437903,
      "tokens_seen": 7798784
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00011904761904761905,
      "loss": 5.1164,
      "theoretical_loss": 7.253950561185138,
      "tokens_seen": 7864320
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00012003968253968255,
      "loss": 5.0105,
      "theoretical_loss": 7.242771416664761,
      "tokens_seen": 7929856
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00012103174603174604,
      "loss": 5.1424,
      "theoretical_loss": 7.231709909747042,
      "tokens_seen": 7995392
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00012202380952380953,
      "loss": 5.0006,
      "theoretical_loss": 7.220763853402656,
      "tokens_seen": 8060928
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.000123015873015873,
      "loss": 5.0226,
      "theoretical_loss": 7.209931118622157,
      "tokens_seen": 8126464
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001240079365079365,
      "loss": 5.1077,
      "theoretical_loss": 7.199209632423606,
      "tokens_seen": 8192000
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.000125,
      "loss": 5.0472,
      "theoretical_loss": 7.188597375943913,
      "tokens_seen": 8257536
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001259920634920635,
      "loss": 5.0067,
      "theoretical_loss": 7.178092382609779,
      "tokens_seen": 8323072
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00012698412698412698,
      "loss": 5.092,
      "theoretical_loss": 7.1676927363842795,
      "tokens_seen": 8388608
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00012797619047619048,
      "loss": 5.127,
      "theoretical_loss": 7.157396570085435,
      "tokens_seen": 8454144
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00012896825396825398,
      "loss": 5.1444,
      "theoretical_loss": 7.147202063773257,
      "tokens_seen": 8519680
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00012996031746031748,
      "loss": 5.0517,
      "theoretical_loss": 7.137107443201986,
      "tokens_seen": 8585216
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00013095238095238096,
      "loss": 4.8137,
      "theoretical_loss": 7.127110978334411,
      "tokens_seen": 8650752
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00013194444444444446,
      "loss": 5.0952,
      "theoretical_loss": 7.117210981915334,
      "tokens_seen": 8716288
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00013293650793650793,
      "loss": 4.8899,
      "theoretical_loss": 7.10740580810139,
      "tokens_seen": 8781824
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00013392857142857144,
      "loss": 4.9341,
      "theoretical_loss": 7.097693851144607,
      "tokens_seen": 8847360
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001349206349206349,
      "loss": 4.9441,
      "theoretical_loss": 7.088073544127209,
      "tokens_seen": 8912896
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001359126984126984,
      "loss": 5.0403,
      "theoretical_loss": 7.07854335774531,
      "tokens_seen": 8978432
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001369047619047619,
      "loss": 4.9326,
      "theoretical_loss": 7.069101799139266,
      "tokens_seen": 9043968
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00013789682539682541,
      "loss": 4.8767,
      "theoretical_loss": 7.0597474107685745,
      "tokens_seen": 9109504
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001388888888888889,
      "loss": 4.8795,
      "theoretical_loss": 7.050478769329319,
      "tokens_seen": 9175040
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001398809523809524,
      "loss": 4.8761,
      "theoretical_loss": 7.0412944847122505,
      "tokens_seen": 9240576
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014087301587301586,
      "loss": 4.9672,
      "theoretical_loss": 7.032193198999712,
      "tokens_seen": 9306112
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014186507936507937,
      "loss": 4.9156,
      "theoretical_loss": 7.023173585499698,
      "tokens_seen": 9371648
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014285714285714284,
      "loss": 4.9229,
      "theoretical_loss": 7.014234347815421,
      "tokens_seen": 9437184
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014384920634920634,
      "loss": 4.8403,
      "theoretical_loss": 7.00537421894883,
      "tokens_seen": 9502720
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014484126984126984,
      "loss": 4.6538,
      "theoretical_loss": 6.996591960436656,
      "tokens_seen": 9568256
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014583333333333335,
      "loss": 4.7905,
      "theoretical_loss": 6.9878863615175355,
      "tokens_seen": 9633792
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014682539682539685,
      "loss": 4.6794,
      "theoretical_loss": 6.97925623832895,
      "tokens_seen": 9699328
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014781746031746032,
      "loss": 4.7634,
      "theoretical_loss": 6.97070043313267,
      "tokens_seen": 9764864
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00014880952380952382,
      "loss": 4.7783,
      "theoretical_loss": 6.962217813567541,
      "tokens_seen": 9830400
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001498015873015873,
      "loss": 4.6554,
      "theoretical_loss": 6.953807271928458,
      "tokens_seen": 9895936
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001507936507936508,
      "loss": 4.7528,
      "theoretical_loss": 6.945467724470439,
      "tokens_seen": 9961472
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00015178571428571427,
      "loss": 4.7602,
      "theoretical_loss": 6.937198110736788,
      "tokens_seen": 10027008
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001527777777777778,
      "loss": 4.755,
      "theoretical_loss": 6.928997392910329,
      "tokens_seen": 10092544
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00015376984126984128,
      "loss": 4.6096,
      "theoretical_loss": 6.920864555186801,
      "tokens_seen": 10158080
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00015476190476190478,
      "loss": 4.7397,
      "theoretical_loss": 6.912798603169512,
      "tokens_seen": 10223616
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00015575396825396825,
      "loss": 4.5113,
      "theoretical_loss": 6.904798563284391,
      "tokens_seen": 10289152
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00015674603174603175,
      "loss": 4.7738,
      "theoretical_loss": 6.896863482214638,
      "tokens_seen": 10354688
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00015773809523809523,
      "loss": 4.8292,
      "theoretical_loss": 6.888992426354192,
      "tokens_seen": 10420224
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00015873015873015873,
      "loss": 4.9638,
      "theoretical_loss": 6.881184481279271,
      "tokens_seen": 10485760
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001597222222222222,
      "loss": 4.8244,
      "theoretical_loss": 6.873438751237283,
      "tokens_seen": 10551296
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016071428571428573,
      "loss": 4.7133,
      "theoretical_loss": 6.865754358652436,
      "tokens_seen": 10616832
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001617063492063492,
      "loss": 4.6853,
      "theoretical_loss": 6.85813044364739,
      "tokens_seen": 10682368
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001626984126984127,
      "loss": 4.7801,
      "theoretical_loss": 6.85056616358036,
      "tokens_seen": 10747904
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016369047619047618,
      "loss": 4.7655,
      "theoretical_loss": 6.843060692597036,
      "tokens_seen": 10813440
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016468253968253969,
      "loss": 4.7216,
      "theoretical_loss": 6.835613221196822,
      "tokens_seen": 10878976
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016567460317460316,
      "loss": 4.7279,
      "theoretical_loss": 6.8282229558127865,
      "tokens_seen": 10944512
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016666666666666666,
      "loss": 4.831,
      "theoretical_loss": 6.820889118404866,
      "tokens_seen": 11010048
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016765873015873016,
      "loss": 4.8006,
      "theoretical_loss": 6.813610946065789,
      "tokens_seen": 11075584
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016865079365079366,
      "loss": 4.6289,
      "theoretical_loss": 6.806387690639279,
      "tokens_seen": 11141120
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00016964285714285717,
      "loss": 4.7368,
      "theoretical_loss": 6.799218618350064,
      "tokens_seen": 11206656
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00017063492063492064,
      "loss": 4.5985,
      "theoretical_loss": 6.792103009445266,
      "tokens_seen": 11272192
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00017162698412698414,
      "loss": 4.8098,
      "theoretical_loss": 6.7850401578467645,
      "tokens_seen": 11337728
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00017261904761904762,
      "loss": 4.6315,
      "theoretical_loss": 6.778029370814127,
      "tokens_seen": 11403264
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00017361111111111112,
      "loss": 4.6174,
      "theoretical_loss": 6.771069968617732,
      "tokens_seen": 11468800
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001746031746031746,
      "loss": 4.7272,
      "theoretical_loss": 6.764161284221716,
      "tokens_seen": 11534336
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001755952380952381,
      "loss": 4.6183,
      "theoretical_loss": 6.757302662976402,
      "tokens_seen": 11599872
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001765873015873016,
      "loss": 4.6966,
      "theoretical_loss": 6.750493462319867,
      "tokens_seen": 11665408
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001775793650793651,
      "loss": 4.7339,
      "theoretical_loss": 6.74373305148833,
      "tokens_seen": 11730944
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00017857142857142857,
      "loss": 4.7134,
      "theoretical_loss": 6.737020811235054,
      "tokens_seen": 11796480
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00017956349206349207,
      "loss": 4.6286,
      "theoretical_loss": 6.730356133557465,
      "tokens_seen": 11862016
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00018055555555555555,
      "loss": 4.4444,
      "theoretical_loss": 6.7237384214322,
      "tokens_seen": 11927552
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00018154761904761905,
      "loss": 4.7447,
      "theoretical_loss": 6.717167088557821,
      "tokens_seen": 11993088
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00018253968253968252,
      "loss": 4.5531,
      "theoretical_loss": 6.710641559104915,
      "tokens_seen": 12058624
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00018353174603174602,
      "loss": 4.6625,
      "theoretical_loss": 6.704161267473356,
      "tokens_seen": 12124160
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00018452380952380953,
      "loss": 4.6132,
      "theoretical_loss": 6.697725658056456,
      "tokens_seen": 12189696
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00018551587301587303,
      "loss": 4.6292,
      "theoretical_loss": 6.691334185011799,
      "tokens_seen": 12255232
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001865079365079365,
      "loss": 4.7133,
      "theoretical_loss": 6.68498631203852,
      "tokens_seen": 12320768
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001875,
      "loss": 4.691,
      "theoretical_loss": 6.678681512160812,
      "tokens_seen": 12386304
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001884920634920635,
      "loss": 4.7534,
      "theoretical_loss": 6.672419267517472,
      "tokens_seen": 12451840
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00018948412698412698,
      "loss": 4.6791,
      "theoretical_loss": 6.666199069157267,
      "tokens_seen": 12517376
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019047619047619048,
      "loss": 4.5523,
      "theoretical_loss": 6.660020416839945,
      "tokens_seen": 12582912
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019146825396825398,
      "loss": 4.6548,
      "theoretical_loss": 6.65388281884269,
      "tokens_seen": 12648448
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019246031746031748,
      "loss": 4.5496,
      "theoretical_loss": 6.647785791771864,
      "tokens_seen": 12713984
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019345238095238096,
      "loss": 4.5721,
      "theoretical_loss": 6.641728860379852,
      "tokens_seen": 12779520
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019444444444444446,
      "loss": 4.7166,
      "theoretical_loss": 6.635711557386854,
      "tokens_seen": 12845056
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019543650793650793,
      "loss": 4.6405,
      "theoretical_loss": 6.629733423307451,
      "tokens_seen": 12910592
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019642857142857144,
      "loss": 4.6085,
      "theoretical_loss": 6.6237940062818215,
      "tokens_seen": 12976128
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001974206349206349,
      "loss": 4.5872,
      "theoretical_loss": 6.617892861911426,
      "tokens_seen": 13041664
    },
    {
      "epoch": 0.0,
      "objective/train/docs_used": 11219,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 4.548152923583984,
      "objective/train/theoretical_loss": 6.612029553099055,
      "objective/train/tokens_used": 33567200,
      "theoretical_loss": 6.612029553099055,
      "tokens_seen": 13107200
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0001984126984126984,
      "loss": 4.5482,
      "theoretical_loss": 6.612029553099055,
      "tokens_seen": 13107200
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00019940476190476191,
      "loss": 4.6479,
      "theoretical_loss": 6.606203649893072,
      "tokens_seen": 13172736
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020039682539682542,
      "loss": 4.5875,
      "theoretical_loss": 6.600414729335739,
      "tokens_seen": 13238272
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002013888888888889,
      "loss": 4.475,
      "theoretical_loss": 6.5946623753155045,
      "tokens_seen": 13303808
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002023809523809524,
      "loss": 4.5872,
      "theoretical_loss": 6.588946178423104,
      "tokens_seen": 13369344
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020337301587301587,
      "loss": 4.5251,
      "theoretical_loss": 6.583265735811386,
      "tokens_seen": 13434880
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020436507936507937,
      "loss": 4.4433,
      "theoretical_loss": 6.577620651058732,
      "tokens_seen": 13500416
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020535714285714284,
      "loss": 4.6432,
      "theoretical_loss": 6.572010534035971,
      "tokens_seen": 13565952
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020634920634920634,
      "loss": 4.6116,
      "theoretical_loss": 6.566435000776667,
      "tokens_seen": 13631488
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020734126984126985,
      "loss": 4.5378,
      "theoretical_loss": 6.5608936733507095,
      "tokens_seen": 13697024
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020833333333333335,
      "loss": 4.6093,
      "theoretical_loss": 6.555386179741061,
      "tokens_seen": 13762560
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00020932539682539685,
      "loss": 4.4419,
      "theoretical_loss": 6.549912153723619,
      "tokens_seen": 13828096
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00021031746031746032,
      "loss": 4.5299,
      "theoretical_loss": 6.544471234750057,
      "tokens_seen": 13893632
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00021130952380952382,
      "loss": 4.5811,
      "theoretical_loss": 6.539063067833591,
      "tokens_seen": 13959168
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002123015873015873,
      "loss": 4.472,
      "theoretical_loss": 6.533687303437551,
      "tokens_seen": 14024704
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002132936507936508,
      "loss": 4.5249,
      "theoretical_loss": 6.528343597366709,
      "tokens_seen": 14090240
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00021428571428571427,
      "loss": 4.6486,
      "theoretical_loss": 6.523031610661259,
      "tokens_seen": 14155776
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002152777777777778,
      "loss": 4.536,
      "theoretical_loss": 6.517751009493386,
      "tokens_seen": 14221312
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00021626984126984128,
      "loss": 4.3907,
      "theoretical_loss": 6.51250146506634,
      "tokens_seen": 14286848
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00021726190476190478,
      "loss": 4.5595,
      "theoretical_loss": 6.507282653515952,
      "tokens_seen": 14352384
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00021825396825396825,
      "loss": 4.4164,
      "theoretical_loss": 6.5020942558145105,
      "tokens_seen": 14417920
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00021924603174603176,
      "loss": 4.4118,
      "theoretical_loss": 6.496935957676949,
      "tokens_seen": 14483456
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00022023809523809523,
      "loss": 4.5316,
      "theoretical_loss": 6.491807449469257,
      "tokens_seen": 14548992
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00022123015873015873,
      "loss": 4.4642,
      "theoretical_loss": 6.486708426119071,
      "tokens_seen": 14614528
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002222222222222222,
      "loss": 4.4812,
      "theoretical_loss": 6.481638587028371,
      "tokens_seen": 14680064
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00022321428571428573,
      "loss": 4.3737,
      "theoretical_loss": 6.4765976359882345,
      "tokens_seen": 14745600
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002242063492063492,
      "loss": 4.3225,
      "theoretical_loss": 6.47158528109558,
      "tokens_seen": 14811136
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002251984126984127,
      "loss": 4.6289,
      "theoretical_loss": 6.466601234671855,
      "tokens_seen": 14876672
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00022619047619047618,
      "loss": 4.5985,
      "theoretical_loss": 6.461645213183605,
      "tokens_seen": 14942208
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00022718253968253969,
      "loss": 4.3973,
      "theoretical_loss": 6.45671693716488,
      "tokens_seen": 15007744
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00022817460317460316,
      "loss": 4.4341,
      "theoretical_loss": 6.451816131141427,
      "tokens_seen": 15073280
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00022916666666666666,
      "loss": 4.5321,
      "theoretical_loss": 6.4469425235566105,
      "tokens_seen": 15138816
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00023015873015873016,
      "loss": 4.5217,
      "theoretical_loss": 6.442095846699032,
      "tokens_seen": 15204352
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00023115079365079367,
      "loss": 4.5034,
      "theoretical_loss": 6.437275836631781,
      "tokens_seen": 15269888
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00023214285714285717,
      "loss": 4.5036,
      "theoretical_loss": 6.432482233123297,
      "tokens_seen": 15335424
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00023313492063492064,
      "loss": 4.4423,
      "theoretical_loss": 6.427714779579773,
      "tokens_seen": 15400960
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00023412698412698414,
      "loss": 4.2959,
      "theoretical_loss": 6.422973222979093,
      "tokens_seen": 15466496
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00023511904761904762,
      "loss": 4.34,
      "theoretical_loss": 6.418257313806215,
      "tokens_seen": 15532032
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00023611111111111112,
      "loss": 4.4737,
      "theoretical_loss": 6.413566805990028,
      "tokens_seen": 15597568
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002371031746031746,
      "loss": 4.323,
      "theoretical_loss": 6.408901456841564,
      "tokens_seen": 15663104
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002380952380952381,
      "loss": 4.5029,
      "theoretical_loss": 6.404261026993607,
      "tokens_seen": 15728640
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002390873015873016,
      "loss": 4.5405,
      "theoretical_loss": 6.399645280341607,
      "tokens_seen": 15794176
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002400793650793651,
      "loss": 4.3171,
      "theoretical_loss": 6.395053983985889,
      "tokens_seen": 15859712
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00024107142857142857,
      "loss": 4.3153,
      "theoretical_loss": 6.390486908175121,
      "tokens_seen": 15925248
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00024206349206349207,
      "loss": 4.4497,
      "theoretical_loss": 6.385943826251012,
      "tokens_seen": 15990784
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00024305555555555555,
      "loss": 4.5192,
      "theoretical_loss": 6.381424514594194,
      "tokens_seen": 16056320
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00024404761904761905,
      "loss": 4.2424,
      "theoretical_loss": 6.376928752571271,
      "tokens_seen": 16121856
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00024503968253968255,
      "loss": 4.4348,
      "theoretical_loss": 6.372456322483007,
      "tokens_seen": 16187392
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.000246031746031746,
      "loss": 4.4564,
      "theoretical_loss": 6.368007009513611,
      "tokens_seen": 16252928
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.00024702380952380955,
      "loss": 4.4592,
      "theoretical_loss": 6.363580601681101,
      "tokens_seen": 16318464
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.000248015873015873,
      "loss": 4.4969,
      "theoretical_loss": 6.359176889788724,
      "tokens_seen": 16384000
    },
    {
      "epoch": 0.0,
      "learning_rate": 0.0002490079365079365,
      "loss": 4.3476,
      "theoretical_loss": 6.354795667377392,
      "tokens_seen": 16449536
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025,
      "loss": 4.3854,
      "theoretical_loss": 6.350436730679111,
      "tokens_seen": 16515072
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002509920634920635,
      "loss": 4.3448,
      "theoretical_loss": 6.346099878571405,
      "tokens_seen": 16580608
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000251984126984127,
      "loss": 4.3477,
      "theoretical_loss": 6.341784912532662,
      "tokens_seen": 16646144
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025297619047619046,
      "loss": 4.3746,
      "theoretical_loss": 6.337491636598426,
      "tokens_seen": 16711680
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025396825396825396,
      "loss": 4.281,
      "theoretical_loss": 6.33321985731858,
      "tokens_seen": 16777216
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025496031746031746,
      "loss": 4.3563,
      "theoretical_loss": 6.328969383715416,
      "tokens_seen": 16842752
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025595238095238096,
      "loss": 4.4228,
      "theoretical_loss": 6.324740027242559,
      "tokens_seen": 16908288
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002569444444444444,
      "loss": 4.3566,
      "theoretical_loss": 6.32053160174474,
      "tokens_seen": 16973824
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025793650793650796,
      "loss": 4.5574,
      "theoretical_loss": 6.316343923418371,
      "tokens_seen": 17039360
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025892857142857146,
      "loss": 4.351,
      "theoretical_loss": 6.312176810772938,
      "tokens_seen": 17104896
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00025992063492063497,
      "loss": 4.1858,
      "theoretical_loss": 6.308030084593148,
      "tokens_seen": 17170432
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002609126984126984,
      "loss": 4.339,
      "theoretical_loss": 6.30390356790187,
      "tokens_seen": 17235968
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002619047619047619,
      "loss": 4.2961,
      "theoretical_loss": 6.2997970859237835,
      "tokens_seen": 17301504
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002628968253968254,
      "loss": 4.5464,
      "theoretical_loss": 6.295710466049778,
      "tokens_seen": 17367040
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002638888888888889,
      "loss": 4.4167,
      "theoretical_loss": 6.29164353780205,
      "tokens_seen": 17432576
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00026488095238095237,
      "loss": 4.1236,
      "theoretical_loss": 6.287596132799887,
      "tokens_seen": 17498112
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00026587301587301587,
      "loss": 4.2505,
      "theoretical_loss": 6.283568084726138,
      "tokens_seen": 17563648
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00026686507936507937,
      "loss": 4.4231,
      "theoretical_loss": 6.27955922929433,
      "tokens_seen": 17629184
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00026785714285714287,
      "loss": 4.3106,
      "theoretical_loss": 6.2755694042164425,
      "tokens_seen": 17694720
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002688492063492063,
      "loss": 4.3239,
      "theoretical_loss": 6.271598449171293,
      "tokens_seen": 17760256
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002698412698412698,
      "loss": 4.2995,
      "theoretical_loss": 6.267646205773557,
      "tokens_seen": 17825792
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002708333333333333,
      "loss": 4.2127,
      "theoretical_loss": 6.263712517543373,
      "tokens_seen": 17891328
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002718253968253968,
      "loss": 4.3255,
      "theoretical_loss": 6.25979722987654,
      "tokens_seen": 17956864
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002728174603174603,
      "loss": 4.3932,
      "theoretical_loss": 6.255900190015284,
      "tokens_seen": 18022400
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002738095238095238,
      "loss": 4.367,
      "theoretical_loss": 6.252021247019596,
      "tokens_seen": 18087936
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002748015873015873,
      "loss": 4.0692,
      "theoretical_loss": 6.2481602517390975,
      "tokens_seen": 18153472
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00027579365079365083,
      "loss": 4.3825,
      "theoretical_loss": 6.244317056785462,
      "tokens_seen": 18219008
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00027678571428571433,
      "loss": 4.2132,
      "theoretical_loss": 6.240491516505343,
      "tokens_seen": 18284544
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002777777777777778,
      "loss": 4.2545,
      "theoretical_loss": 6.236683486953819,
      "tokens_seen": 18350080
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002787698412698413,
      "loss": 4.1146,
      "theoretical_loss": 6.232892825868342,
      "tokens_seen": 18415616
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002797619047619048,
      "loss": 4.2899,
      "theoretical_loss": 6.229119392643171,
      "tokens_seen": 18481152
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002807539682539683,
      "loss": 4.1144,
      "theoretical_loss": 6.225363048304281,
      "tokens_seen": 18546688
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00028174603174603173,
      "loss": 4.1101,
      "theoretical_loss": 6.221623655484739,
      "tokens_seen": 18612224
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00028273809523809523,
      "loss": 4.2015,
      "theoretical_loss": 6.217901078400542,
      "tokens_seen": 18677760
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00028373015873015873,
      "loss": 4.3328,
      "theoretical_loss": 6.214195182826902,
      "tokens_seen": 18743296
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00028472222222222223,
      "loss": 4.1305,
      "theoretical_loss": 6.2105058360749545,
      "tokens_seen": 18808832
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002857142857142857,
      "loss": 4.1529,
      "theoretical_loss": 6.206832906968911,
      "tokens_seen": 18874368
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002867063492063492,
      "loss": 4.1035,
      "theoretical_loss": 6.203176265823624,
      "tokens_seen": 18939904
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002876984126984127,
      "loss": 4.2723,
      "theoretical_loss": 6.1995357844225545,
      "tokens_seen": 19005440
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002886904761904762,
      "loss": 4.2344,
      "theoretical_loss": 6.195911335996151,
      "tokens_seen": 19070976
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002896825396825397,
      "loss": 4.2861,
      "theoretical_loss": 6.192302795200606,
      "tokens_seen": 19136512
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002906746031746032,
      "loss": 4.2357,
      "theoretical_loss": 6.188710038097013,
      "tokens_seen": 19202048
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002916666666666667,
      "loss": 4.1594,
      "theoretical_loss": 6.185132942130884,
      "tokens_seen": 19267584
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002926587301587302,
      "loss": 4.231,
      "theoretical_loss": 6.181571386112038,
      "tokens_seen": 19333120
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002936507936507937,
      "loss": 4.2702,
      "theoretical_loss": 6.178025250194852,
      "tokens_seen": 19398656
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00029464285714285714,
      "loss": 4.2964,
      "theoretical_loss": 6.174494415858863,
      "tokens_seen": 19464192
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00029563492063492064,
      "loss": 4.075,
      "theoretical_loss": 6.170978765889705,
      "tokens_seen": 19529728
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00029662698412698414,
      "loss": 4.221,
      "theoretical_loss": 6.167478184360402,
      "tokens_seen": 19595264
    },
    {
      "epoch": 0.01,
      "objective/train/docs_used": 13257,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 4.213552951812744,
      "objective/train/theoretical_loss": 6.163992556612967,
      "objective/train/tokens_used": 40120800,
      "theoretical_loss": 6.163992556612967,
      "tokens_seen": 19660800
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00029761904761904765,
      "loss": 4.2136,
      "theoretical_loss": 6.163992556612967,
      "tokens_seen": 19660800
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002986111111111111,
      "loss": 3.9919,
      "theoretical_loss": 6.160521769240346,
      "tokens_seen": 19726336
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0002996031746031746,
      "loss": 4.221,
      "theoretical_loss": 6.157065710068663,
      "tokens_seen": 19791872
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003005952380952381,
      "loss": 4.3205,
      "theoretical_loss": 6.1536242681397795,
      "tokens_seen": 19857408
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003015873015873016,
      "loss": 4.0838,
      "theoretical_loss": 6.150197333694162,
      "tokens_seen": 19922944
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00030257936507936505,
      "loss": 4.2887,
      "theoretical_loss": 6.146784798154039,
      "tokens_seen": 19988480
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00030357142857142855,
      "loss": 4.0491,
      "theoretical_loss": 6.143386554106854,
      "tokens_seen": 20054016
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00030456349206349205,
      "loss": 4.0459,
      "theoretical_loss": 6.140002495289,
      "tokens_seen": 20119552
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003055555555555556,
      "loss": 4.1703,
      "theoretical_loss": 6.136632516569836,
      "tokens_seen": 20185088
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00030654761904761905,
      "loss": 4.046,
      "theoretical_loss": 6.133276513935977,
      "tokens_seen": 20250624
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00030753968253968255,
      "loss": 4.1565,
      "theoretical_loss": 6.129934384475845,
      "tokens_seen": 20316160
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00030853174603174605,
      "loss": 4.0405,
      "theoretical_loss": 6.126606026364497,
      "tokens_seen": 20381696
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00030952380952380956,
      "loss": 4.1987,
      "theoretical_loss": 6.123291338848694,
      "tokens_seen": 20447232
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000310515873015873,
      "loss": 4.1926,
      "theoretical_loss": 6.119990222232234,
      "tokens_seen": 20512768
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003115079365079365,
      "loss": 4.1449,
      "theoretical_loss": 6.116702577861526,
      "tokens_seen": 20578304
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003125,
      "loss": 4.3035,
      "theoretical_loss": 6.113428308111404,
      "tokens_seen": 20643840
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003134920634920635,
      "loss": 4.0146,
      "theoretical_loss": 6.110167316371188,
      "tokens_seen": 20709376
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000314484126984127,
      "loss": 4.0786,
      "theoretical_loss": 6.106919507030966,
      "tokens_seen": 20774912
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00031547619047619046,
      "loss": 4.1093,
      "theoretical_loss": 6.103684785468113,
      "tokens_seen": 20840448
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00031646825396825396,
      "loss": 4.1765,
      "theoretical_loss": 6.100463058034027,
      "tokens_seen": 20905984
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00031746031746031746,
      "loss": 4.2131,
      "theoretical_loss": 6.097254232041089,
      "tokens_seen": 20971520
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00031845238095238096,
      "loss": 4.0818,
      "theoretical_loss": 6.094058215749833,
      "tokens_seen": 21037056
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003194444444444444,
      "loss": 4.1589,
      "theoretical_loss": 6.090874918356328,
      "tokens_seen": 21102592
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00032043650793650796,
      "loss": 4.1419,
      "theoretical_loss": 6.087704249979775,
      "tokens_seen": 21168128
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00032142857142857147,
      "loss": 4.062,
      "theoretical_loss": 6.084546121650289,
      "tokens_seen": 21233664
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00032242063492063497,
      "loss": 4.2009,
      "theoretical_loss": 6.081400445296899,
      "tokens_seen": 21299200
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003234126984126984,
      "loss": 4.1374,
      "theoretical_loss": 6.078267133735724,
      "tokens_seen": 21364736
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003244047619047619,
      "loss": 4.0396,
      "theoretical_loss": 6.075146100658356,
      "tokens_seen": 21430272
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003253968253968254,
      "loss": 3.9758,
      "theoretical_loss": 6.072037260620421,
      "tokens_seen": 21495808
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003263888888888889,
      "loss": 4.0547,
      "theoretical_loss": 6.0689405290303275,
      "tokens_seen": 21561344
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00032738095238095237,
      "loss": 4.05,
      "theoretical_loss": 6.065855822138193,
      "tokens_seen": 21626880
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00032837301587301587,
      "loss": 4.0569,
      "theoretical_loss": 6.06278305702495,
      "tokens_seen": 21692416
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00032936507936507937,
      "loss": 4.1009,
      "theoretical_loss": 6.05972215159162,
      "tokens_seen": 21757952
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00033035714285714287,
      "loss": 4.0304,
      "theoretical_loss": 6.056673024548766,
      "tokens_seen": 21823488
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003313492063492063,
      "loss": 4.1621,
      "theoretical_loss": 6.053635595406105,
      "tokens_seen": 21889024
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003323412698412698,
      "loss": 4.0006,
      "theoretical_loss": 6.050609784462289,
      "tokens_seen": 21954560
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003333333333333333,
      "loss": 3.9889,
      "theoretical_loss": 6.047595512794841,
      "tokens_seen": 22020096
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003343253968253968,
      "loss": 3.9508,
      "theoretical_loss": 6.044592702250255,
      "tokens_seen": 22085632
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003353174603174603,
      "loss": 4.0401,
      "theoretical_loss": 6.041601275434251,
      "tokens_seen": 22151168
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003363095238095238,
      "loss": 3.7752,
      "theoretical_loss": 6.038621155702174,
      "tokens_seen": 22216704
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00033730158730158733,
      "loss": 4.1797,
      "theoretical_loss": 6.0356522671495485,
      "tokens_seen": 22282240
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00033829365079365083,
      "loss": 4.0355,
      "theoretical_loss": 6.032694534602784,
      "tokens_seen": 22347776
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00033928571428571433,
      "loss": 4.0139,
      "theoretical_loss": 6.029747883610009,
      "tokens_seen": 22413312
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003402777777777778,
      "loss": 4.0618,
      "theoretical_loss": 6.026812240432067,
      "tokens_seen": 22478848
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003412698412698413,
      "loss": 4.1903,
      "theoretical_loss": 6.023887532033628,
      "tokens_seen": 22544384
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003422619047619048,
      "loss": 3.9621,
      "theoretical_loss": 6.020973686074459,
      "tokens_seen": 22609920
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003432539682539683,
      "loss": 3.997,
      "theoretical_loss": 6.018070630900809,
      "tokens_seen": 22675456
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00034424603174603173,
      "loss": 3.9894,
      "theoretical_loss": 6.015178295536933,
      "tokens_seen": 22740992
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00034523809523809523,
      "loss": 4.0614,
      "theoretical_loss": 6.012296609676753,
      "tokens_seen": 22806528
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00034623015873015873,
      "loss": 3.9515,
      "theoretical_loss": 6.009425503675624,
      "tokens_seen": 22872064
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00034722222222222224,
      "loss": 4.0254,
      "theoretical_loss": 6.006564908542249,
      "tokens_seen": 22937600
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003482142857142857,
      "loss": 4.043,
      "theoretical_loss": 6.003714755930698,
      "tokens_seen": 23003136
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003492063492063492,
      "loss": 3.9562,
      "theoretical_loss": 6.000874978132554,
      "tokens_seen": 23068672
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003501984126984127,
      "loss": 4.0368,
      "theoretical_loss": 5.998045508069175,
      "tokens_seen": 23134208
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003511904761904762,
      "loss": 4.0716,
      "theoretical_loss": 5.995226279284073,
      "tokens_seen": 23199744
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003521825396825397,
      "loss": 4.0211,
      "theoretical_loss": 5.992417225935405,
      "tokens_seen": 23265280
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003531746031746032,
      "loss": 3.8049,
      "theoretical_loss": 5.989618282788578,
      "tokens_seen": 23330816
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003541666666666667,
      "loss": 3.9377,
      "theoretical_loss": 5.9868293852089565,
      "tokens_seen": 23396352
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003551587301587302,
      "loss": 3.8989,
      "theoretical_loss": 5.984050469154685,
      "tokens_seen": 23461888
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003561507936507937,
      "loss": 3.9557,
      "theoretical_loss": 5.981281471169619,
      "tokens_seen": 23527424
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00035714285714285714,
      "loss": 4.0183,
      "theoretical_loss": 5.978522328376346,
      "tokens_seen": 23592960
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00035813492063492064,
      "loss": 4.1151,
      "theoretical_loss": 5.975772978469321,
      "tokens_seen": 23658496
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00035912698412698415,
      "loss": 3.924,
      "theoretical_loss": 5.973033359708099,
      "tokens_seen": 23724032
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00036011904761904765,
      "loss": 3.9394,
      "theoretical_loss": 5.9703034109106685,
      "tokens_seen": 23789568
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003611111111111111,
      "loss": 3.8989,
      "theoretical_loss": 5.967583071446869,
      "tokens_seen": 23855104
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003621031746031746,
      "loss": 3.9315,
      "theoretical_loss": 5.9648722812319255,
      "tokens_seen": 23920640
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003630952380952381,
      "loss": 3.9015,
      "theoretical_loss": 5.962170980720055,
      "tokens_seen": 23986176
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003640873015873016,
      "loss": 3.9288,
      "theoretical_loss": 5.959479110898181,
      "tokens_seen": 24051712
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00036507936507936505,
      "loss": 3.9998,
      "theoretical_loss": 5.956796613279727,
      "tokens_seen": 24117248
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00036607142857142855,
      "loss": 3.9783,
      "theoretical_loss": 5.954123429898508,
      "tokens_seen": 24182784
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00036706349206349205,
      "loss": 3.8271,
      "theoretical_loss": 5.951459503302701,
      "tokens_seen": 24248320
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003680555555555556,
      "loss": 3.9248,
      "theoretical_loss": 5.948804776548908,
      "tokens_seen": 24313856
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00036904761904761905,
      "loss": 3.8119,
      "theoretical_loss": 5.9461591931963,
      "tokens_seen": 24379392
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00037003968253968255,
      "loss": 3.8313,
      "theoretical_loss": 5.943522697300843,
      "tokens_seen": 24444928
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00037103174603174606,
      "loss": 3.8336,
      "theoretical_loss": 5.940895233409613,
      "tokens_seen": 24510464
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00037202380952380956,
      "loss": 3.8865,
      "theoretical_loss": 5.938276746555175,
      "tokens_seen": 24576000
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000373015873015873,
      "loss": 3.8508,
      "theoretical_loss": 5.9356671822500635,
      "tokens_seen": 24641536
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003740079365079365,
      "loss": 3.9692,
      "theoretical_loss": 5.933066486481318,
      "tokens_seen": 24707072
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000375,
      "loss": 3.8679,
      "theoretical_loss": 5.930474605705113,
      "tokens_seen": 24772608
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003759920634920635,
      "loss": 4.0348,
      "theoretical_loss": 5.927891486841449,
      "tokens_seen": 24838144
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000376984126984127,
      "loss": 3.8988,
      "theoretical_loss": 5.925317077268927,
      "tokens_seen": 24903680
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00037797619047619046,
      "loss": 3.9071,
      "theoretical_loss": 5.92275132481959,
      "tokens_seen": 24969216
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00037896825396825396,
      "loss": 3.9918,
      "theoretical_loss": 5.9201941777738405,
      "tokens_seen": 25034752
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00037996031746031746,
      "loss": 3.8031,
      "theoretical_loss": 5.917645584855421,
      "tokens_seen": 25100288
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00038095238095238096,
      "loss": 3.9526,
      "theoretical_loss": 5.915105495226474,
      "tokens_seen": 25165824
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003819444444444444,
      "loss": 3.9215,
      "theoretical_loss": 5.912573858482657,
      "tokens_seen": 25231360
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00038293650793650797,
      "loss": 3.9148,
      "theoretical_loss": 5.910050624648335,
      "tokens_seen": 25296896
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00038392857142857147,
      "loss": 3.9626,
      "theoretical_loss": 5.907535744171835,
      "tokens_seen": 25362432
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00038492063492063497,
      "loss": 3.9325,
      "theoretical_loss": 5.905029167920765,
      "tokens_seen": 25427968
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003859126984126984,
      "loss": 3.7173,
      "theoretical_loss": 5.902530847177394,
      "tokens_seen": 25493504
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003869047619047619,
      "loss": 3.8313,
      "theoretical_loss": 5.900040733634098,
      "tokens_seen": 25559040
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003878968253968254,
      "loss": 3.829,
      "theoretical_loss": 5.897558779388872,
      "tokens_seen": 25624576
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003888888888888889,
      "loss": 3.7469,
      "theoretical_loss": 5.895084936940887,
      "tokens_seen": 25690112
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00038988095238095237,
      "loss": 3.87,
      "theoretical_loss": 5.892619159186127,
      "tokens_seen": 25755648
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00039087301587301587,
      "loss": 3.8523,
      "theoretical_loss": 5.890161399413071,
      "tokens_seen": 25821184
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00039186507936507937,
      "loss": 3.8159,
      "theoretical_loss": 5.887711611298428,
      "tokens_seen": 25886720
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003928571428571429,
      "loss": 3.909,
      "theoretical_loss": 5.885269748902955,
      "tokens_seen": 25952256
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003938492063492063,
      "loss": 3.8381,
      "theoretical_loss": 5.882835766667295,
      "tokens_seen": 26017792
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003948412698412698,
      "loss": 3.8308,
      "theoretical_loss": 5.880409619407899,
      "tokens_seen": 26083328
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003958333333333333,
      "loss": 3.8903,
      "theoretical_loss": 5.877991262312986,
      "tokens_seen": 26148864
    },
    {
      "epoch": 0.01,
      "objective/train/docs_used": 15466,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 3.96624755859375,
      "objective/train/theoretical_loss": 5.875580650938565,
      "objective/train/tokens_used": 46674400,
      "theoretical_loss": 5.875580650938565,
      "tokens_seen": 26214400
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003968253968253968,
      "loss": 3.9662,
      "theoretical_loss": 5.875580650938565,
      "tokens_seen": 26214400
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0003978174603174603,
      "loss": 3.8801,
      "theoretical_loss": 5.873177741204501,
      "tokens_seen": 26279936
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00039880952380952383,
      "loss": 3.7995,
      "theoretical_loss": 5.8707824893906455,
      "tokens_seen": 26345472
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00039980158730158733,
      "loss": 3.7179,
      "theoretical_loss": 5.868394852133001,
      "tokens_seen": 26411008
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00040079365079365083,
      "loss": 3.7859,
      "theoretical_loss": 5.866014786419951,
      "tokens_seen": 26476544
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00040178571428571433,
      "loss": 3.7832,
      "theoretical_loss": 5.86364224958853,
      "tokens_seen": 26542080
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004027777777777778,
      "loss": 3.8285,
      "theoretical_loss": 5.861277199320743,
      "tokens_seen": 26607616
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004037698412698413,
      "loss": 3.7206,
      "theoretical_loss": 5.858919593639941,
      "tokens_seen": 26673152
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004047619047619048,
      "loss": 3.9171,
      "theoretical_loss": 5.856569390907229,
      "tokens_seen": 26738688
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004057539682539683,
      "loss": 4.0372,
      "theoretical_loss": 5.854226549817936,
      "tokens_seen": 26804224
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00040674603174603173,
      "loss": 3.8327,
      "theoretical_loss": 5.851891029398114,
      "tokens_seen": 26869760
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00040773809523809523,
      "loss": 3.8704,
      "theoretical_loss": 5.8495627890011015,
      "tokens_seen": 26935296
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00040873015873015874,
      "loss": 3.7695,
      "theoretical_loss": 5.847241788304114,
      "tokens_seen": 27000832
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00040972222222222224,
      "loss": 4.0391,
      "theoretical_loss": 5.844927987304884,
      "tokens_seen": 27066368
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004107142857142857,
      "loss": 3.7913,
      "theoretical_loss": 5.842621346318348,
      "tokens_seen": 27131904
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004117063492063492,
      "loss": 3.7292,
      "theoretical_loss": 5.84032182597337,
      "tokens_seen": 27197440
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004126984126984127,
      "loss": 3.7938,
      "theoretical_loss": 5.8380293872095095,
      "tokens_seen": 27262976
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004136904761904762,
      "loss": 3.7732,
      "theoretical_loss": 5.835743991273832,
      "tokens_seen": 27328512
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004146825396825397,
      "loss": 3.7526,
      "theoretical_loss": 5.833465599717752,
      "tokens_seen": 27394048
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004156746031746032,
      "loss": 3.8184,
      "theoretical_loss": 5.831194174393929,
      "tokens_seen": 27459584
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004166666666666667,
      "loss": 3.7399,
      "theoretical_loss": 5.828929677453187,
      "tokens_seen": 27525120
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004176587301587302,
      "loss": 3.8206,
      "theoretical_loss": 5.826672071341488,
      "tokens_seen": 27590656
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004186507936507937,
      "loss": 3.784,
      "theoretical_loss": 5.824421318796932,
      "tokens_seen": 27656192
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00041964285714285714,
      "loss": 3.7237,
      "theoretical_loss": 5.822177382846799,
      "tokens_seen": 27721728
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00042063492063492065,
      "loss": 3.7892,
      "theoretical_loss": 5.8199402268046265,
      "tokens_seen": 27787264
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00042162698412698415,
      "loss": 3.7308,
      "theoretical_loss": 5.817709814267329,
      "tokens_seen": 27852800
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00042261904761904765,
      "loss": 3.754,
      "theoretical_loss": 5.815486109112342,
      "tokens_seen": 27918336
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004236111111111111,
      "loss": 3.7047,
      "theoretical_loss": 5.813269075494812,
      "tokens_seen": 27983872
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004246031746031746,
      "loss": 3.6798,
      "theoretical_loss": 5.811058677844817,
      "tokens_seen": 28049408
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004255952380952381,
      "loss": 3.7836,
      "theoretical_loss": 5.808854880864618,
      "tokens_seen": 28114944
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004265873015873016,
      "loss": 3.6829,
      "theoretical_loss": 5.8066576495259525,
      "tokens_seen": 28180480
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00042757936507936505,
      "loss": 3.7336,
      "theoretical_loss": 5.804466949067352,
      "tokens_seen": 28246016
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00042857142857142855,
      "loss": 3.7028,
      "theoretical_loss": 5.8022827449914995,
      "tokens_seen": 28311552
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00042956349206349205,
      "loss": 3.7253,
      "theoretical_loss": 5.800105003062612,
      "tokens_seen": 28377088
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004305555555555556,
      "loss": 3.7865,
      "theoretical_loss": 5.797933689303866,
      "tokens_seen": 28442624
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00043154761904761905,
      "loss": 3.7362,
      "theoretical_loss": 5.795768769994842,
      "tokens_seen": 28508160
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00043253968253968256,
      "loss": 3.7797,
      "theoretical_loss": 5.793610211669004,
      "tokens_seen": 28573696
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00043353174603174606,
      "loss": 3.8398,
      "theoretical_loss": 5.79145798111122,
      "tokens_seen": 28639232
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00043452380952380956,
      "loss": 3.6596,
      "theoretical_loss": 5.789312045355292,
      "tokens_seen": 28704768
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000435515873015873,
      "loss": 3.5764,
      "theoretical_loss": 5.787172371681535,
      "tokens_seen": 28770304
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004365079365079365,
      "loss": 3.6438,
      "theoretical_loss": 5.785038927614373,
      "tokens_seen": 28835840
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004375,
      "loss": 3.7172,
      "theoretical_loss": 5.782911680919971,
      "tokens_seen": 28901376
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004384920634920635,
      "loss": 3.7214,
      "theoretical_loss": 5.78079059960389,
      "tokens_seen": 28966912
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000439484126984127,
      "loss": 3.7085,
      "theoretical_loss": 5.77867565190877,
      "tokens_seen": 29032448
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00044047619047619046,
      "loss": 3.7999,
      "theoretical_loss": 5.776566806312052,
      "tokens_seen": 29097984
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00044146825396825396,
      "loss": 3.6701,
      "theoretical_loss": 5.774464031523705,
      "tokens_seen": 29163520
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00044246031746031746,
      "loss": 3.7651,
      "theoretical_loss": 5.772367296484001,
      "tokens_seen": 29229056
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00044345238095238096,
      "loss": 3.6895,
      "theoretical_loss": 5.770276570361309,
      "tokens_seen": 29294592
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004444444444444444,
      "loss": 3.7151,
      "theoretical_loss": 5.768191822549908,
      "tokens_seen": 29360128
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00044543650793650797,
      "loss": 3.6942,
      "theoretical_loss": 5.766113022667838,
      "tokens_seen": 29425664
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00044642857142857147,
      "loss": 3.5692,
      "theoretical_loss": 5.764040140554766,
      "tokens_seen": 29491200
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00044742063492063497,
      "loss": 3.7563,
      "theoretical_loss": 5.761973146269881,
      "tokens_seen": 29556736
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004484126984126984,
      "loss": 3.5912,
      "theoretical_loss": 5.759912010089819,
      "tokens_seen": 29622272
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004494047619047619,
      "loss": 3.5895,
      "theoretical_loss": 5.757856702506597,
      "tokens_seen": 29687808
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004503968253968254,
      "loss": 3.7117,
      "theoretical_loss": 5.755807194225595,
      "tokens_seen": 29753344
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004513888888888889,
      "loss": 3.5724,
      "theoretical_loss": 5.753763456163529,
      "tokens_seen": 29818880
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00045238095238095237,
      "loss": 3.7994,
      "theoretical_loss": 5.751725459446487,
      "tokens_seen": 29884416
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00045337301587301587,
      "loss": 3.605,
      "theoretical_loss": 5.7496931754079466,
      "tokens_seen": 29949952
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00045436507936507937,
      "loss": 3.6932,
      "theoretical_loss": 5.747666575586849,
      "tokens_seen": 30015488
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004553571428571429,
      "loss": 3.8026,
      "theoretical_loss": 5.7456456317256785,
      "tokens_seen": 30081024
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004563492063492063,
      "loss": 3.6252,
      "theoretical_loss": 5.743630315768563,
      "tokens_seen": 30146560
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004573412698412698,
      "loss": 3.7536,
      "theoretical_loss": 5.741620599859402,
      "tokens_seen": 30212096
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004583333333333333,
      "loss": 3.4642,
      "theoretical_loss": 5.739616456340021,
      "tokens_seen": 30277632
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004593253968253968,
      "loss": 3.6488,
      "theoretical_loss": 5.737617857748329,
      "tokens_seen": 30343168
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00046031746031746033,
      "loss": 3.6519,
      "theoretical_loss": 5.73562477681652,
      "tokens_seen": 30408704
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00046130952380952383,
      "loss": 3.4473,
      "theoretical_loss": 5.733637186469274,
      "tokens_seen": 30474240
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00046230158730158733,
      "loss": 3.5813,
      "theoretical_loss": 5.731655059821993,
      "tokens_seen": 30539776
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00046329365079365083,
      "loss": 3.692,
      "theoretical_loss": 5.729678370179052,
      "tokens_seen": 30605312
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00046428571428571433,
      "loss": 3.6374,
      "theoretical_loss": 5.727707091032062,
      "tokens_seen": 30670848
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004652777777777778,
      "loss": 3.7492,
      "theoretical_loss": 5.725741196058175,
      "tokens_seen": 30736384
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004662698412698413,
      "loss": 3.7066,
      "theoretical_loss": 5.723780659118377,
      "tokens_seen": 30801920
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004672619047619048,
      "loss": 3.5702,
      "theoretical_loss": 5.721825454255825,
      "tokens_seen": 30867456
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004682539682539683,
      "loss": 3.6714,
      "theoretical_loss": 5.71987555569419,
      "tokens_seen": 30932992
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00046924603174603173,
      "loss": 3.7337,
      "theoretical_loss": 5.717930937836029,
      "tokens_seen": 30998528
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00047023809523809523,
      "loss": 3.5677,
      "theoretical_loss": 5.715991575261159,
      "tokens_seen": 31064064
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00047123015873015874,
      "loss": 3.5316,
      "theoretical_loss": 5.714057442725068,
      "tokens_seen": 31129600
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00047222222222222224,
      "loss": 3.7366,
      "theoretical_loss": 5.712128515157324,
      "tokens_seen": 31195136
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004732142857142857,
      "loss": 3.4648,
      "theoretical_loss": 5.710204767660022,
      "tokens_seen": 31260672
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004742063492063492,
      "loss": 3.5909,
      "theoretical_loss": 5.708286175506232,
      "tokens_seen": 31326208
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004751984126984127,
      "loss": 3.6522,
      "theoretical_loss": 5.706372714138472,
      "tokens_seen": 31391744
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004761904761904762,
      "loss": 3.443,
      "theoretical_loss": 5.704464359167195,
      "tokens_seen": 31457280
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004771825396825397,
      "loss": 3.597,
      "theoretical_loss": 5.702561086369294,
      "tokens_seen": 31522816
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004781746031746032,
      "loss": 3.7024,
      "theoretical_loss": 5.7006628716866246,
      "tokens_seen": 31588352
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004791666666666667,
      "loss": 3.6175,
      "theoretical_loss": 5.698769691224539,
      "tokens_seen": 31653888
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004801587301587302,
      "loss": 3.5041,
      "theoretical_loss": 5.696881521250441,
      "tokens_seen": 31719424
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004811507936507937,
      "loss": 3.5685,
      "theoretical_loss": 5.694998338192356,
      "tokens_seen": 31784960
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00048214285714285715,
      "loss": 3.6852,
      "theoretical_loss": 5.693120118637513,
      "tokens_seen": 31850496
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00048313492063492065,
      "loss": 3.6242,
      "theoretical_loss": 5.691246839330946,
      "tokens_seen": 31916032
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00048412698412698415,
      "loss": 3.6537,
      "theoretical_loss": 5.689378477174106,
      "tokens_seen": 31981568
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00048511904761904765,
      "loss": 3.4547,
      "theoretical_loss": 5.687515009223498,
      "tokens_seen": 32047104
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004861111111111111,
      "loss": 3.6126,
      "theoretical_loss": 5.685656412689318,
      "tokens_seen": 32112640
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004871031746031746,
      "loss": 3.5792,
      "theoretical_loss": 5.683802664934115,
      "tokens_seen": 32178176
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004880952380952381,
      "loss": 3.4457,
      "theoretical_loss": 5.681953743471466,
      "tokens_seen": 32243712
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004890873015873016,
      "loss": 3.4997,
      "theoretical_loss": 5.680109625964663,
      "tokens_seen": 32309248
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004900793650793651,
      "loss": 3.4432,
      "theoretical_loss": 5.678270290225415,
      "tokens_seen": 32374784
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004910714285714286,
      "loss": 3.511,
      "theoretical_loss": 5.676435714212562,
      "tokens_seen": 32440320
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000492063492063492,
      "loss": 3.3567,
      "theoretical_loss": 5.674605876030808,
      "tokens_seen": 32505856
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004930555555555556,
      "loss": 3.4618,
      "theoretical_loss": 5.672780753929461,
      "tokens_seen": 32571392
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004940476190476191,
      "loss": 3.5175,
      "theoretical_loss": 5.67096032630119,
      "tokens_seen": 32636928
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004950396825396826,
      "loss": 3.4605,
      "theoretical_loss": 5.669144571680797,
      "tokens_seen": 32702464
    },
    {
      "epoch": 0.01,
      "objective/train/docs_used": 17558,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 3.390838384628296,
      "objective/train/theoretical_loss": 5.667333468743994,
      "objective/train/tokens_used": 53228000,
      "theoretical_loss": 5.667333468743994,
      "tokens_seen": 32768000
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000496031746031746,
      "loss": 3.3908,
      "theoretical_loss": 5.667333468743994,
      "tokens_seen": 32768000
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004970238095238095,
      "loss": 3.5148,
      "theoretical_loss": 5.665526996306205,
      "tokens_seen": 32833536
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498015873015873,
      "loss": 3.3903,
      "theoretical_loss": 5.663725133321369,
      "tokens_seen": 32899072
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990079365079365,
      "loss": 3.5635,
      "theoretical_loss": 5.661927858880761,
      "tokens_seen": 32964608
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0005,
      "loss": 3.7548,
      "theoretical_loss": 5.6601351522118275,
      "tokens_seen": 33030144
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999899699097292,
      "loss": 3.536,
      "theoretical_loss": 5.65834699267703,
      "tokens_seen": 33095680
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999799398194584,
      "loss": 3.5551,
      "theoretical_loss": 5.6565633597727025,
      "tokens_seen": 33161216
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999699097291876,
      "loss": 3.477,
      "theoretical_loss": 5.65478423312792,
      "tokens_seen": 33226752
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999598796389167,
      "loss": 3.5855,
      "theoretical_loss": 5.65300959250338,
      "tokens_seen": 33292288
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499949849548646,
      "loss": 3.7033,
      "theoretical_loss": 5.651239417790293,
      "tokens_seen": 33357824
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999398194583751,
      "loss": 3.505,
      "theoretical_loss": 5.649473689009292,
      "tokens_seen": 33423360
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999297893681044,
      "loss": 3.5374,
      "theoretical_loss": 5.6477123863093395,
      "tokens_seen": 33488896
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999197592778335,
      "loss": 3.4503,
      "theoretical_loss": 5.645955489966661,
      "tokens_seen": 33554432
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004999097291875627,
      "loss": 3.3937,
      "theoretical_loss": 5.644202980383678,
      "tokens_seen": 33619968
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998996990972919,
      "loss": 3.5262,
      "theoretical_loss": 5.6424548380879616,
      "tokens_seen": 33685504
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998896690070211,
      "loss": 3.4711,
      "theoretical_loss": 5.640711043731184,
      "tokens_seen": 33751040
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998796389167503,
      "loss": 3.4382,
      "theoretical_loss": 5.6389715780880945,
      "tokens_seen": 33816576
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998696088264795,
      "loss": 3.5489,
      "theoretical_loss": 5.6372364220555,
      "tokens_seen": 33882112
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998595787362087,
      "loss": 3.6025,
      "theoretical_loss": 5.635505556651251,
      "tokens_seen": 33947648
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998495486459378,
      "loss": 3.3862,
      "theoretical_loss": 5.633778963013247,
      "tokens_seen": 34013184
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499839518555667,
      "loss": 3.4561,
      "theoretical_loss": 5.632056622398448,
      "tokens_seen": 34078720
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998294884653962,
      "loss": 3.6089,
      "theoretical_loss": 5.63033851618189,
      "tokens_seen": 34144256
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998194583751254,
      "loss": 3.5204,
      "theoretical_loss": 5.628624625855725,
      "tokens_seen": 34209792
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004998094282848546,
      "loss": 3.3783,
      "theoretical_loss": 5.626914933028255,
      "tokens_seen": 34275328
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997993981945837,
      "loss": 3.6614,
      "theoretical_loss": 5.625209419422983,
      "tokens_seen": 34340864
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997893681043129,
      "loss": 3.4331,
      "theoretical_loss": 5.623508066877678,
      "tokens_seen": 34406400
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997793380140421,
      "loss": 3.4157,
      "theoretical_loss": 5.621810857343441,
      "tokens_seen": 34471936
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997693079237714,
      "loss": 3.5587,
      "theoretical_loss": 5.620117772883784,
      "tokens_seen": 34537472
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997592778335005,
      "loss": 3.3822,
      "theoretical_loss": 5.618428795673718,
      "tokens_seen": 34603008
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997492477432298,
      "loss": 3.4897,
      "theoretical_loss": 5.616743907998853,
      "tokens_seen": 34668544
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997392176529588,
      "loss": 3.3971,
      "theoretical_loss": 5.6150630922545,
      "tokens_seen": 34734080
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997291875626881,
      "loss": 3.3863,
      "theoretical_loss": 5.613386330944792,
      "tokens_seen": 34799616
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997191574724173,
      "loss": 3.3675,
      "theoretical_loss": 5.6117136066818,
      "tokens_seen": 34865152
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004997091273821465,
      "loss": 3.586,
      "theoretical_loss": 5.610044902184672,
      "tokens_seen": 34930688
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996990972918757,
      "loss": 3.5703,
      "theoretical_loss": 5.608380200278775,
      "tokens_seen": 34996224
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996890672016048,
      "loss": 3.5581,
      "theoretical_loss": 5.606719483894837,
      "tokens_seen": 35061760
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499679037111334,
      "loss": 3.5169,
      "theoretical_loss": 5.605062736068113,
      "tokens_seen": 35127296
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996690070210632,
      "loss": 3.4007,
      "theoretical_loss": 5.603409939937547,
      "tokens_seen": 35192832
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996589769307924,
      "loss": 3.6062,
      "theoretical_loss": 5.601761078744952,
      "tokens_seen": 35258368
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996489468405216,
      "loss": 3.3509,
      "theoretical_loss": 5.600116135834183,
      "tokens_seen": 35323904
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996389167502507,
      "loss": 3.4179,
      "theoretical_loss": 5.598475094650334,
      "tokens_seen": 35389440
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996288866599799,
      "loss": 3.4208,
      "theoretical_loss": 5.59683793873894,
      "tokens_seen": 35454976
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996188565697091,
      "loss": 3.3361,
      "theoretical_loss": 5.595204651745176,
      "tokens_seen": 35520512
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004996088264794383,
      "loss": 3.4685,
      "theoretical_loss": 5.593575217413074,
      "tokens_seen": 35586048
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995987963891675,
      "loss": 3.4891,
      "theoretical_loss": 5.591949619584746,
      "tokens_seen": 35651584
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995887662988968,
      "loss": 3.4972,
      "theoretical_loss": 5.590327842199611,
      "tokens_seen": 35717120
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995787362086258,
      "loss": 3.4464,
      "theoretical_loss": 5.588709869293634,
      "tokens_seen": 35782656
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995687061183551,
      "loss": 3.3525,
      "theoretical_loss": 5.5870956849985705,
      "tokens_seen": 35848192
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995586760280842,
      "loss": 3.2901,
      "theoretical_loss": 5.585485273541212,
      "tokens_seen": 35913728
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995486459378135,
      "loss": 3.5269,
      "theoretical_loss": 5.583878619242652,
      "tokens_seen": 35979264
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995386158475427,
      "loss": 3.4616,
      "theoretical_loss": 5.582275706517549,
      "tokens_seen": 36044800
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995285857572718,
      "loss": 3.3898,
      "theoretical_loss": 5.580676519873396,
      "tokens_seen": 36110336
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499518555667001,
      "loss": 3.356,
      "theoretical_loss": 5.579081043909808,
      "tokens_seen": 36175872
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004995085255767302,
      "loss": 3.3792,
      "theoretical_loss": 5.577489263317796,
      "tokens_seen": 36241408
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994984954864594,
      "loss": 3.4043,
      "theoretical_loss": 5.5759011628790764,
      "tokens_seen": 36306944
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994884653961886,
      "loss": 3.5405,
      "theoretical_loss": 5.574316727465358,
      "tokens_seen": 36372480
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994784353059178,
      "loss": 3.4498,
      "theoretical_loss": 5.572735942037655,
      "tokens_seen": 36438016
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994684052156469,
      "loss": 3.4169,
      "theoretical_loss": 5.571158791645597,
      "tokens_seen": 36503552
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994583751253761,
      "loss": 3.4215,
      "theoretical_loss": 5.569585261426752,
      "tokens_seen": 36569088
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994483450351053,
      "loss": 3.3804,
      "theoretical_loss": 5.568015336605953,
      "tokens_seen": 36634624
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994383149448345,
      "loss": 3.3453,
      "theoretical_loss": 5.566449002494627,
      "tokens_seen": 36700160
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994282848545637,
      "loss": 3.3654,
      "theoretical_loss": 5.564886244490136,
      "tokens_seen": 36765696
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994182547642928,
      "loss": 3.3193,
      "theoretical_loss": 5.563327048075124,
      "tokens_seen": 36831232
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004994082246740221,
      "loss": 3.4339,
      "theoretical_loss": 5.5617713988168616,
      "tokens_seen": 36896768
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993981945837512,
      "loss": 3.2252,
      "theoretical_loss": 5.560219282366614,
      "tokens_seen": 36962304
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993881644934805,
      "loss": 3.3157,
      "theoretical_loss": 5.558670684458994,
      "tokens_seen": 37027840
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993781344032096,
      "loss": 3.5121,
      "theoretical_loss": 5.557125590911339,
      "tokens_seen": 37093376
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993681043129389,
      "loss": 3.2515,
      "theoretical_loss": 5.5555839876230815,
      "tokens_seen": 37158912
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499358074222668,
      "loss": 3.4722,
      "theoretical_loss": 5.55404586057513,
      "tokens_seen": 37224448
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993480441323972,
      "loss": 3.5037,
      "theoretical_loss": 5.5525111958292594,
      "tokens_seen": 37289984
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993380140421264,
      "loss": 3.3667,
      "theoretical_loss": 5.550979979527501,
      "tokens_seen": 37355520
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993279839518556,
      "loss": 3.4939,
      "theoretical_loss": 5.549452197891538,
      "tokens_seen": 37421056
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993179538615848,
      "loss": 3.2738,
      "theoretical_loss": 5.547927837222119,
      "tokens_seen": 37486592
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004993079237713139,
      "loss": 3.358,
      "theoretical_loss": 5.546406883898451,
      "tokens_seen": 37552128
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992978936810431,
      "loss": 3.376,
      "theoretical_loss": 5.544889324377628,
      "tokens_seen": 37617664
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992878635907723,
      "loss": 3.355,
      "theoretical_loss": 5.543375145194048,
      "tokens_seen": 37683200
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992778335005015,
      "loss": 3.4592,
      "theoretical_loss": 5.541864332958831,
      "tokens_seen": 37748736
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992678034102307,
      "loss": 3.465,
      "theoretical_loss": 5.540356874359257,
      "tokens_seen": 37814272
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992577733199598,
      "loss": 3.3846,
      "theoretical_loss": 5.538852756158201,
      "tokens_seen": 37879808
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499247743229689,
      "loss": 3.4192,
      "theoretical_loss": 5.537351965193569,
      "tokens_seen": 37945344
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992377131394183,
      "loss": 3.3583,
      "theoretical_loss": 5.535854488377751,
      "tokens_seen": 38010880
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992276830491475,
      "loss": 3.3463,
      "theoretical_loss": 5.534360312697064,
      "tokens_seen": 38076416
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992176529588767,
      "loss": 3.2503,
      "theoretical_loss": 5.532869425211214,
      "tokens_seen": 38141952
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004992076228686059,
      "loss": 3.2676,
      "theoretical_loss": 5.531381813052757,
      "tokens_seen": 38207488
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499197592778335,
      "loss": 3.2285,
      "theoretical_loss": 5.529897463426559,
      "tokens_seen": 38273024
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991875626880642,
      "loss": 3.3245,
      "theoretical_loss": 5.528416363609276,
      "tokens_seen": 38338560
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991775325977934,
      "loss": 3.4277,
      "theoretical_loss": 5.526938500948817,
      "tokens_seen": 38404096
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991675025075226,
      "loss": 3.2982,
      "theoretical_loss": 5.525463862863836,
      "tokens_seen": 38469632
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991574724172518,
      "loss": 3.2881,
      "theoretical_loss": 5.523992436843209,
      "tokens_seen": 38535168
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499147442326981,
      "loss": 3.3465,
      "theoretical_loss": 5.522524210445528,
      "tokens_seen": 38600704
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991374122367101,
      "loss": 3.1983,
      "theoretical_loss": 5.521059171298592,
      "tokens_seen": 38666240
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991273821464393,
      "loss": 3.231,
      "theoretical_loss": 5.519597307098907,
      "tokens_seen": 38731776
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991173520561685,
      "loss": 3.3325,
      "theoretical_loss": 5.518138605611188,
      "tokens_seen": 38797312
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004991073219658977,
      "loss": 3.4569,
      "theoretical_loss": 5.516683054667868,
      "tokens_seen": 38862848
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499097291875627,
      "loss": 3.4351,
      "theoretical_loss": 5.515230642168607,
      "tokens_seen": 38928384
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499087261785356,
      "loss": 3.3569,
      "theoretical_loss": 5.513781356079811,
      "tokens_seen": 38993920
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990772316950853,
      "loss": 3.3533,
      "theoretical_loss": 5.512335184434152,
      "tokens_seen": 39059456
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990672016048144,
      "loss": 3.1605,
      "theoretical_loss": 5.5108921153300905,
      "tokens_seen": 39124992
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990571715145437,
      "loss": 3.2703,
      "theoretical_loss": 5.5094521369314045,
      "tokens_seen": 39190528
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990471414242729,
      "loss": 3.3855,
      "theoretical_loss": 5.5080152374667275,
      "tokens_seen": 39256064
    },
    {
      "epoch": 0.01,
      "objective/train/docs_used": 19585,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 3.3629393577575684,
      "objective/train/theoretical_loss": 5.506581405229079,
      "objective/train/tokens_used": 59781600,
      "theoretical_loss": 5.506581405229079,
      "tokens_seen": 39321600
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000499037111334002,
      "loss": 3.3629,
      "theoretical_loss": 5.506581405229079,
      "tokens_seen": 39321600
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990270812437312,
      "loss": 3.3483,
      "theoretical_loss": 5.505150628575409,
      "tokens_seen": 39387136
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990170511534604,
      "loss": 3.3147,
      "theoretical_loss": 5.503722895926143,
      "tokens_seen": 39452672
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004990070210631896,
      "loss": 3.2502,
      "theoretical_loss": 5.50229819576473,
      "tokens_seen": 39518208
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989969909729188,
      "loss": 3.3219,
      "theoretical_loss": 5.500876516637199,
      "tokens_seen": 39583744
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498986960882648,
      "loss": 3.3525,
      "theoretical_loss": 5.49945784715171,
      "tokens_seen": 39649280
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989769307923771,
      "loss": 3.2179,
      "theoretical_loss": 5.498042175978123,
      "tokens_seen": 39714816
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989669007021063,
      "loss": 3.2698,
      "theoretical_loss": 5.496629491847553,
      "tokens_seen": 39780352
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989568706118355,
      "loss": 3.1855,
      "theoretical_loss": 5.495219783551947,
      "tokens_seen": 39845888
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989468405215647,
      "loss": 3.2569,
      "theoretical_loss": 5.493813039943654,
      "tokens_seen": 39911424
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989368104312939,
      "loss": 3.2971,
      "theoretical_loss": 5.492409249934996,
      "tokens_seen": 39976960
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498926780341023,
      "loss": 3.2503,
      "theoretical_loss": 5.491008402497855,
      "tokens_seen": 40042496
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989167502507523,
      "loss": 3.1823,
      "theoretical_loss": 5.489610486663252,
      "tokens_seen": 40108032
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004989067201604814,
      "loss": 3.0557,
      "theoretical_loss": 5.488215491520933,
      "tokens_seen": 40173568
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988966900702107,
      "loss": 3.3045,
      "theoretical_loss": 5.486823406218962,
      "tokens_seen": 40239104
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988866599799398,
      "loss": 3.2865,
      "theoretical_loss": 5.485434219963315,
      "tokens_seen": 40304640
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988766298896691,
      "loss": 3.3721,
      "theoretical_loss": 5.484047922017476,
      "tokens_seen": 40370176
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988665997993982,
      "loss": 3.1699,
      "theoretical_loss": 5.482664501702036,
      "tokens_seen": 40435712
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988565697091274,
      "loss": 3.2696,
      "theoretical_loss": 5.481283948394303,
      "tokens_seen": 40501248
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988465396188566,
      "loss": 3.1909,
      "theoretical_loss": 5.479906251527901,
      "tokens_seen": 40566784
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988365095285858,
      "loss": 3.2715,
      "theoretical_loss": 5.478531400592393,
      "tokens_seen": 40632320
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498826479438315,
      "loss": 2.9755,
      "theoretical_loss": 5.4771593851328815,
      "tokens_seen": 40697856
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988164493480441,
      "loss": 3.2593,
      "theoretical_loss": 5.475790194749637,
      "tokens_seen": 40763392
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004988064192577733,
      "loss": 3.1545,
      "theoretical_loss": 5.474423819097713,
      "tokens_seen": 40828928
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987963891675025,
      "loss": 3.3448,
      "theoretical_loss": 5.473060247886572,
      "tokens_seen": 40894464
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987863590772317,
      "loss": 3.2691,
      "theoretical_loss": 5.471699470879715,
      "tokens_seen": 40960000
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987763289869609,
      "loss": 3.2084,
      "theoretical_loss": 5.470341477894303,
      "tokens_seen": 41025536
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00049876629889669,
      "loss": 3.1007,
      "theoretical_loss": 5.468986258800805,
      "tokens_seen": 41091072
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987562688064192,
      "loss": 3.2336,
      "theoretical_loss": 5.4676338035226175,
      "tokens_seen": 41156608
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987462387161484,
      "loss": 3.1282,
      "theoretical_loss": 5.466284102035719,
      "tokens_seen": 41222144
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987362086258777,
      "loss": 3.0817,
      "theoretical_loss": 5.464937144368307,
      "tokens_seen": 41287680
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987261785356068,
      "loss": 3.1578,
      "theoretical_loss": 5.463592920600435,
      "tokens_seen": 41353216
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987161484453361,
      "loss": 3.2962,
      "theoretical_loss": 5.46225142086368,
      "tokens_seen": 41418752
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004987061183550651,
      "loss": 3.3285,
      "theoretical_loss": 5.460912635340775,
      "tokens_seen": 41484288
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986960882647944,
      "loss": 3.0354,
      "theoretical_loss": 5.459576554265276,
      "tokens_seen": 41549824
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986860581745236,
      "loss": 3.2417,
      "theoretical_loss": 5.458243167921212,
      "tokens_seen": 41615360
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986760280842528,
      "loss": 3.2507,
      "theoretical_loss": 5.456912466642748,
      "tokens_seen": 41680896
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498665997993982,
      "loss": 3.1067,
      "theoretical_loss": 5.455584440813853,
      "tokens_seen": 41746432
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986559679037111,
      "loss": 3.1821,
      "theoretical_loss": 5.454259080867951,
      "tokens_seen": 41811968
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986459378134403,
      "loss": 3.2994,
      "theoretical_loss": 5.4529363772876085,
      "tokens_seen": 41877504
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986359077231695,
      "loss": 3.2123,
      "theoretical_loss": 5.451616320604193,
      "tokens_seen": 41943040
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986258776328987,
      "loss": 3.2072,
      "theoretical_loss": 5.450298901397547,
      "tokens_seen": 42008576
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004986158475426279,
      "loss": 3.2143,
      "theoretical_loss": 5.448984110295672,
      "tokens_seen": 42074112
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498605817452357,
      "loss": 3.1127,
      "theoretical_loss": 5.447671937974404,
      "tokens_seen": 42139648
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985957873620862,
      "loss": 3.1397,
      "theoretical_loss": 5.446362375157092,
      "tokens_seen": 42205184
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985857572718154,
      "loss": 3.1662,
      "theoretical_loss": 5.445055412614287,
      "tokens_seen": 42270720
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985757271815446,
      "loss": 3.21,
      "theoretical_loss": 5.443751041163428,
      "tokens_seen": 42336256
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985656970912738,
      "loss": 3.1764,
      "theoretical_loss": 5.442449251668533,
      "tokens_seen": 42401792
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985556670010031,
      "loss": 3.1617,
      "theoretical_loss": 5.441150035039886,
      "tokens_seen": 42467328
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985456369107321,
      "loss": 3.0955,
      "theoretical_loss": 5.439853382233738,
      "tokens_seen": 42532864
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985356068204614,
      "loss": 3.2009,
      "theoretical_loss": 5.438559284252003,
      "tokens_seen": 42598400
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985255767301905,
      "loss": 3.0843,
      "theoretical_loss": 5.437267732141949,
      "tokens_seen": 42663936
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004985155466399198,
      "loss": 3.1647,
      "theoretical_loss": 5.435978716995917,
      "tokens_seen": 42729472
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498505516549649,
      "loss": 3.2097,
      "theoretical_loss": 5.434692229951009,
      "tokens_seen": 42795008
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984954864593782,
      "loss": 3.1425,
      "theoretical_loss": 5.433408262188802,
      "tokens_seen": 42860544
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984854563691073,
      "loss": 3.0812,
      "theoretical_loss": 5.432126804935059,
      "tokens_seen": 42926080
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984754262788365,
      "loss": 3.1467,
      "theoretical_loss": 5.430847849459438,
      "tokens_seen": 42991616
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984653961885657,
      "loss": 3.1398,
      "theoretical_loss": 5.429571387075203,
      "tokens_seen": 43057152
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984553660982949,
      "loss": 3.1179,
      "theoretical_loss": 5.428297409138947,
      "tokens_seen": 43122688
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984453360080241,
      "loss": 3.1614,
      "theoretical_loss": 5.427025907050307,
      "tokens_seen": 43188224
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984353059177532,
      "loss": 3.2857,
      "theoretical_loss": 5.425756872251682,
      "tokens_seen": 43253760
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984252758274825,
      "loss": 3.0898,
      "theoretical_loss": 5.42449029622796,
      "tokens_seen": 43319296
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984152457372116,
      "loss": 3.0581,
      "theoretical_loss": 5.423226170506243,
      "tokens_seen": 43384832
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004984052156469409,
      "loss": 3.1724,
      "theoretical_loss": 5.421964486655567,
      "tokens_seen": 43450368
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00049839518555667,
      "loss": 2.9901,
      "theoretical_loss": 5.420705236286646,
      "tokens_seen": 43515904
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983851554663993,
      "loss": 3.1203,
      "theoretical_loss": 5.41944841105159,
      "tokens_seen": 43581440
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983751253761284,
      "loss": 3.17,
      "theoretical_loss": 5.418194002643643,
      "tokens_seen": 43646976
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983650952858576,
      "loss": 3.073,
      "theoretical_loss": 5.416942002796926,
      "tokens_seen": 43712512
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983550651955868,
      "loss": 3.113,
      "theoretical_loss": 5.415692403286162,
      "tokens_seen": 43778048
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498345035105316,
      "loss": 3.1429,
      "theoretical_loss": 5.414445195926426,
      "tokens_seen": 43843584
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983350050150452,
      "loss": 2.8647,
      "theoretical_loss": 5.413200372572884,
      "tokens_seen": 43909120
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983249749247743,
      "loss": 3.2555,
      "theoretical_loss": 5.411957925120538,
      "tokens_seen": 43974656
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983149448345035,
      "loss": 3.0809,
      "theoretical_loss": 5.410717845503969,
      "tokens_seen": 44040192
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004983049147442327,
      "loss": 3.0973,
      "theoretical_loss": 5.40948012569709,
      "tokens_seen": 44105728
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982948846539619,
      "loss": 3.1235,
      "theoretical_loss": 5.408244757712893,
      "tokens_seen": 44171264
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982848545636911,
      "loss": 3.0748,
      "theoretical_loss": 5.407011733603199,
      "tokens_seen": 44236800
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982748244734202,
      "loss": 3.0184,
      "theoretical_loss": 5.4057810454584185,
      "tokens_seen": 44302336
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982647943831494,
      "loss": 2.9238,
      "theoretical_loss": 5.404552685407301,
      "tokens_seen": 44367872
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982547642928786,
      "loss": 3.152,
      "theoretical_loss": 5.403326645616698,
      "tokens_seen": 44433408
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982447342026079,
      "loss": 3.0075,
      "theoretical_loss": 5.402102918291316,
      "tokens_seen": 44498944
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498234704112337,
      "loss": 3.1436,
      "theoretical_loss": 5.400881495673488,
      "tokens_seen": 44564480
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982246740220663,
      "loss": 3.0921,
      "theoretical_loss": 5.3996623700429245,
      "tokens_seen": 44630016
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982146439317953,
      "loss": 3.1295,
      "theoretical_loss": 5.398445533716492,
      "tokens_seen": 44695552
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004982046138415246,
      "loss": 2.9969,
      "theoretical_loss": 5.3972309790479684,
      "tokens_seen": 44761088
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981945837512538,
      "loss": 3.0808,
      "theoretical_loss": 5.39601869842782,
      "tokens_seen": 44826624
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498184553660983,
      "loss": 3.1248,
      "theoretical_loss": 5.394808684282968,
      "tokens_seen": 44892160
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981745235707122,
      "loss": 3.0875,
      "theoretical_loss": 5.393600929076564,
      "tokens_seen": 44957696
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981644934804413,
      "loss": 3.1635,
      "theoretical_loss": 5.392395425307758,
      "tokens_seen": 45023232
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981544633901705,
      "loss": 3.0473,
      "theoretical_loss": 5.391192165511484,
      "tokens_seen": 45088768
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981444332998997,
      "loss": 3.2321,
      "theoretical_loss": 5.389991142258227,
      "tokens_seen": 45154304
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981344032096289,
      "loss": 3.1885,
      "theoretical_loss": 5.38879234815381,
      "tokens_seen": 45219840
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981243731193581,
      "loss": 3.019,
      "theoretical_loss": 5.387595775839175,
      "tokens_seen": 45285376
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981143430290873,
      "loss": 3.0539,
      "theoretical_loss": 5.386401417990159,
      "tokens_seen": 45350912
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004981043129388164,
      "loss": 2.9902,
      "theoretical_loss": 5.385209267317286,
      "tokens_seen": 45416448
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980942828485456,
      "loss": 2.9288,
      "theoretical_loss": 5.3840193165655466,
      "tokens_seen": 45481984
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980842527582748,
      "loss": 2.9307,
      "theoretical_loss": 5.382831558514191,
      "tokens_seen": 45547520
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000498074222668004,
      "loss": 3.0931,
      "theoretical_loss": 5.3816459859765144,
      "tokens_seen": 45613056
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980641925777333,
      "loss": 2.9796,
      "theoretical_loss": 5.380462591799651,
      "tokens_seen": 45678592
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980541624874623,
      "loss": 3.0299,
      "theoretical_loss": 5.379281368864362,
      "tokens_seen": 45744128
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980441323971916,
      "loss": 3.1505,
      "theoretical_loss": 5.378102310084834,
      "tokens_seen": 45809664
    },
    {
      "epoch": 0.01,
      "objective/train/docs_used": 21809,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 3.154682159423828,
      "objective/train/theoretical_loss": 5.376925408408475,
      "objective/train/tokens_used": 66335200,
      "theoretical_loss": 5.376925408408475,
      "tokens_seen": 45875200
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980341023069207,
      "loss": 3.1547,
      "theoretical_loss": 5.376925408408475,
      "tokens_seen": 45875200
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.00049802407221665,
      "loss": 2.9733,
      "theoretical_loss": 5.375750656815705,
      "tokens_seen": 45940736
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980140421263792,
      "loss": 3.1594,
      "theoretical_loss": 5.37457804831976,
      "tokens_seen": 46006272
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004980040120361084,
      "loss": 3.0962,
      "theoretical_loss": 5.373407575966493,
      "tokens_seen": 46071808
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979939819458375,
      "loss": 2.8869,
      "theoretical_loss": 5.372239232834173,
      "tokens_seen": 46137344
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979839518555667,
      "loss": 3.0556,
      "theoretical_loss": 5.3710730120332855,
      "tokens_seen": 46202880
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979739217652959,
      "loss": 3.0697,
      "theoretical_loss": 5.369908906706346,
      "tokens_seen": 46268416
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979638916750251,
      "loss": 3.1048,
      "theoretical_loss": 5.368746910027696,
      "tokens_seen": 46333952
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979538615847543,
      "loss": 3.0384,
      "theoretical_loss": 5.3675870152033145,
      "tokens_seen": 46399488
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979438314944834,
      "loss": 3.1318,
      "theoretical_loss": 5.36642921547063,
      "tokens_seen": 46465024
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979338014042126,
      "loss": 3.024,
      "theoretical_loss": 5.365273504098326,
      "tokens_seen": 46530560
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979237713139418,
      "loss": 3.0969,
      "theoretical_loss": 5.364119874386157,
      "tokens_seen": 46596096
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000497913741223671,
      "loss": 2.9584,
      "theoretical_loss": 5.362968319664756,
      "tokens_seen": 46661632
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004979037111334002,
      "loss": 3.0184,
      "theoretical_loss": 5.361818833295455,
      "tokens_seen": 46727168
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978936810431293,
      "loss": 2.9283,
      "theoretical_loss": 5.3606714086701,
      "tokens_seen": 46792704
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978836509528586,
      "loss": 3.0468,
      "theoretical_loss": 5.359526039210861,
      "tokens_seen": 46858240
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978736208625877,
      "loss": 2.9606,
      "theoretical_loss": 5.358382718370063,
      "tokens_seen": 46923776
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000497863590772317,
      "loss": 2.909,
      "theoretical_loss": 5.357241439629992,
      "tokens_seen": 46989312
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978535606820461,
      "loss": 3.1137,
      "theoretical_loss": 5.3561021965027305,
      "tokens_seen": 47054848
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978435305917754,
      "loss": 3.2255,
      "theoretical_loss": 5.354964982529967,
      "tokens_seen": 47120384
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978335005015045,
      "loss": 2.9644,
      "theoretical_loss": 5.353829791282831,
      "tokens_seen": 47185920
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978234704112337,
      "loss": 2.8901,
      "theoretical_loss": 5.35269661636171,
      "tokens_seen": 47251456
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978134403209629,
      "loss": 2.9033,
      "theoretical_loss": 5.35156545139608,
      "tokens_seen": 47316992
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004978034102306921,
      "loss": 2.9469,
      "theoretical_loss": 5.350436290044332,
      "tokens_seen": 47382528
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977933801404213,
      "loss": 2.9728,
      "theoretical_loss": 5.3493091259936,
      "tokens_seen": 47448064
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977833500501504,
      "loss": 3.0629,
      "theoretical_loss": 5.348183952959596,
      "tokens_seen": 47513600
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977733199598796,
      "loss": 3.0233,
      "theoretical_loss": 5.347060764686436,
      "tokens_seen": 47579136
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977632898696088,
      "loss": 3.0684,
      "theoretical_loss": 5.345939554946472,
      "tokens_seen": 47644672
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000497753259779338,
      "loss": 2.8888,
      "theoretical_loss": 5.344820317540132,
      "tokens_seen": 47710208
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977432296890672,
      "loss": 2.8556,
      "theoretical_loss": 5.343703046295751,
      "tokens_seen": 47775744
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977331995987965,
      "loss": 3.066,
      "theoretical_loss": 5.342587735069408,
      "tokens_seen": 47841280
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977231695085255,
      "loss": 3.062,
      "theoretical_loss": 5.3414743777447615,
      "tokens_seen": 47906816
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004977131394182548,
      "loss": 2.9453,
      "theoretical_loss": 5.340362968232892,
      "tokens_seen": 47972352
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000497703109327984,
      "loss": 2.9467,
      "theoretical_loss": 5.339253500472138,
      "tokens_seen": 48037888
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976930792377132,
      "loss": 3.0105,
      "theoretical_loss": 5.338145968427941,
      "tokens_seen": 48103424
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976830491474424,
      "loss": 3.0003,
      "theoretical_loss": 5.337040366092687,
      "tokens_seen": 48168960
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976730190571715,
      "loss": 2.9753,
      "theoretical_loss": 5.335936687485542,
      "tokens_seen": 48234496
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976629889669007,
      "loss": 2.903,
      "theoretical_loss": 5.334834926652308,
      "tokens_seen": 48300032
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976529588766299,
      "loss": 3.0445,
      "theoretical_loss": 5.33373507766526,
      "tokens_seen": 48365568
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976429287863591,
      "loss": 2.871,
      "theoretical_loss": 5.332637134622999,
      "tokens_seen": 48431104
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976328986960883,
      "loss": 2.9853,
      "theoretical_loss": 5.331541091650294,
      "tokens_seen": 48496640
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976228686058175,
      "loss": 3.0156,
      "theoretical_loss": 5.330446942897931,
      "tokens_seen": 48562176
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976128385155466,
      "loss": 2.7853,
      "theoretical_loss": 5.32935468254257,
      "tokens_seen": 48627712
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004976028084252758,
      "loss": 2.9611,
      "theoretical_loss": 5.328264304786586,
      "tokens_seen": 48693248
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.000497592778335005,
      "loss": 2.956,
      "theoretical_loss": 5.327175803857929,
      "tokens_seen": 48758784
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975827482447342,
      "loss": 2.8931,
      "theoretical_loss": 5.326089174009972,
      "tokens_seen": 48824320
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975727181544635,
      "loss": 3.0134,
      "theoretical_loss": 5.325004409521368,
      "tokens_seen": 48889856
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975626880641925,
      "loss": 2.9185,
      "theoretical_loss": 5.323921504695903,
      "tokens_seen": 48955392
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975526579739218,
      "loss": 2.9769,
      "theoretical_loss": 5.322840453862356,
      "tokens_seen": 49020928
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975426278836509,
      "loss": 2.9023,
      "theoretical_loss": 5.3217612513743475,
      "tokens_seen": 49086464
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975325977933802,
      "loss": 3.0444,
      "theoretical_loss": 5.320683891610208,
      "tokens_seen": 49152000
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975225677031094,
      "loss": 2.9715,
      "theoretical_loss": 5.3196083689728315,
      "tokens_seen": 49217536
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975125376128386,
      "loss": 2.8958,
      "theoretical_loss": 5.318534677889536,
      "tokens_seen": 49283072
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004975025075225677,
      "loss": 2.9378,
      "theoretical_loss": 5.317462812811925,
      "tokens_seen": 49348608
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004974924774322969,
      "loss": 2.9857,
      "theoretical_loss": 5.316392768215751,
      "tokens_seen": 49414144
    },
    {
      "epoch": 0.01,
      "learning_rate": 0.0004974824473420261,
      "loss": 2.7824,
      "theoretical_loss": 5.315324538600778,
      "tokens_seen": 49479680
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004974724172517553,
      "loss": 2.7899,
      "theoretical_loss": 5.31425811849064,
      "tokens_seen": 49545216
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004974623871614845,
      "loss": 2.8594,
      "theoretical_loss": 5.313193502432718,
      "tokens_seen": 49610752
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004974523570712136,
      "loss": 3.0895,
      "theoretical_loss": 5.312130684997992,
      "tokens_seen": 49676288
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004974423269809428,
      "loss": 3.049,
      "theoretical_loss": 5.31106966078092,
      "tokens_seen": 49741824
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000497432296890672,
      "loss": 2.8131,
      "theoretical_loss": 5.310010424399295,
      "tokens_seen": 49807360
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004974222668004012,
      "loss": 2.8747,
      "theoretical_loss": 5.308952970494124,
      "tokens_seen": 49872896
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004974122367101304,
      "loss": 2.928,
      "theoretical_loss": 5.307897293729489,
      "tokens_seen": 49938432
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004974022066198595,
      "loss": 2.8825,
      "theoretical_loss": 5.306843388792423,
      "tokens_seen": 50003968
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973921765295888,
      "loss": 2.928,
      "theoretical_loss": 5.305791250392778,
      "tokens_seen": 50069504
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973821464393179,
      "loss": 2.9203,
      "theoretical_loss": 5.304740873263098,
      "tokens_seen": 50135040
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973721163490472,
      "loss": 2.8721,
      "theoretical_loss": 5.303692252158496,
      "tokens_seen": 50200576
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973620862587763,
      "loss": 2.8404,
      "theoretical_loss": 5.302645381856522,
      "tokens_seen": 50266112
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973520561685056,
      "loss": 2.9695,
      "theoretical_loss": 5.30160025715704,
      "tokens_seen": 50331648
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973420260782347,
      "loss": 2.899,
      "theoretical_loss": 5.300556872882108,
      "tokens_seen": 50397184
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973319959879639,
      "loss": 2.7762,
      "theoretical_loss": 5.299515223875848,
      "tokens_seen": 50462720
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973219658976931,
      "loss": 2.8181,
      "theoretical_loss": 5.2984753050043265,
      "tokens_seen": 50528256
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973119358074223,
      "loss": 2.8952,
      "theoretical_loss": 5.2974371111554355,
      "tokens_seen": 50593792
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004973019057171515,
      "loss": 2.9388,
      "theoretical_loss": 5.296400637238764,
      "tokens_seen": 50659328
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972918756268806,
      "loss": 2.92,
      "theoretical_loss": 5.295365878185488,
      "tokens_seen": 50724864
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972818455366098,
      "loss": 2.7393,
      "theoretical_loss": 5.294332828948243,
      "tokens_seen": 50790400
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000497271815446339,
      "loss": 2.8858,
      "theoretical_loss": 5.2933014845010105,
      "tokens_seen": 50855936
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972617853560682,
      "loss": 2.9176,
      "theoretical_loss": 5.292271839838996,
      "tokens_seen": 50921472
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972517552657974,
      "loss": 2.9702,
      "theoretical_loss": 5.291243889978516,
      "tokens_seen": 50987008
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972417251755266,
      "loss": 2.9364,
      "theoretical_loss": 5.290217629956882,
      "tokens_seen": 51052544
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972316950852557,
      "loss": 2.9143,
      "theoretical_loss": 5.289193054832282,
      "tokens_seen": 51118080
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972216649949849,
      "loss": 2.8264,
      "theoretical_loss": 5.288170159683668,
      "tokens_seen": 51183616
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972116349047142,
      "loss": 2.8464,
      "theoretical_loss": 5.287148939610645,
      "tokens_seen": 51249152
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004972016048144433,
      "loss": 2.8921,
      "theoretical_loss": 5.28612938973335,
      "tokens_seen": 51314688
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971915747241726,
      "loss": 2.6527,
      "theoretical_loss": 5.285111505192349,
      "tokens_seen": 51380224
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971815446339017,
      "loss": 2.7572,
      "theoretical_loss": 5.284095281148522,
      "tokens_seen": 51445760
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971715145436309,
      "loss": 2.7725,
      "theoretical_loss": 5.283080712782951,
      "tokens_seen": 51511296
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971614844533601,
      "loss": 2.752,
      "theoretical_loss": 5.282067795296811,
      "tokens_seen": 51576832
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971514543630893,
      "loss": 2.9421,
      "theoretical_loss": 5.28105652391126,
      "tokens_seen": 51642368
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971414242728185,
      "loss": 2.8771,
      "theoretical_loss": 5.280046893867333,
      "tokens_seen": 51707904
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971313941825477,
      "loss": 2.9517,
      "theoretical_loss": 5.279038900425832,
      "tokens_seen": 51773440
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971213640922768,
      "loss": 2.9064,
      "theoretical_loss": 5.278032538867221,
      "tokens_seen": 51838976
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000497111334002006,
      "loss": 2.7607,
      "theoretical_loss": 5.277027804491517,
      "tokens_seen": 51904512
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004971013039117352,
      "loss": 2.8018,
      "theoretical_loss": 5.2760246926181855,
      "tokens_seen": 51970048
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970912738214644,
      "loss": 2.8671,
      "theoretical_loss": 5.275023198586037,
      "tokens_seen": 52035584
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970812437311936,
      "loss": 2.7002,
      "theoretical_loss": 5.274023317753125,
      "tokens_seen": 52101120
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970712136409227,
      "loss": 2.768,
      "theoretical_loss": 5.273025045496631,
      "tokens_seen": 52166656
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970611835506519,
      "loss": 2.7162,
      "theoretical_loss": 5.272028377212777,
      "tokens_seen": 52232192
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970511534603811,
      "loss": 2.7547,
      "theoretical_loss": 5.271033308316715,
      "tokens_seen": 52297728
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970411233701103,
      "loss": 2.7141,
      "theoretical_loss": 5.270039834242425,
      "tokens_seen": 52363264
    },
    {
      "epoch": 0.02,
      "objective/train/docs_used": 24258,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 2.749826192855835,
      "objective/train/theoretical_loss": 5.269047950442619,
      "objective/train/tokens_used": 72888800,
      "theoretical_loss": 5.269047950442619,
      "tokens_seen": 52428800
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970310932798396,
      "loss": 2.7498,
      "theoretical_loss": 5.269047950442619,
      "tokens_seen": 52428800
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970210631895686,
      "loss": 2.7132,
      "theoretical_loss": 5.2680576523886335,
      "tokens_seen": 52494336
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970110330992979,
      "loss": 2.7417,
      "theoretical_loss": 5.2670689355703395,
      "tokens_seen": 52559872
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004970010030090271,
      "loss": 2.7468,
      "theoretical_loss": 5.266081795496035,
      "tokens_seen": 52625408
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969909729187563,
      "loss": 2.7824,
      "theoretical_loss": 5.265096227692354,
      "tokens_seen": 52690944
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969809428284855,
      "loss": 2.7776,
      "theoretical_loss": 5.264112227704162,
      "tokens_seen": 52756480
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969709127382147,
      "loss": 2.6769,
      "theoretical_loss": 5.263129791094466,
      "tokens_seen": 52822016
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969608826479438,
      "loss": 2.8026,
      "theoretical_loss": 5.26214891344431,
      "tokens_seen": 52887552
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496950852557673,
      "loss": 2.7814,
      "theoretical_loss": 5.26116959035269,
      "tokens_seen": 52953088
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969408224674022,
      "loss": 2.6021,
      "theoretical_loss": 5.260191817436452,
      "tokens_seen": 53018624
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969307923771314,
      "loss": 2.8741,
      "theoretical_loss": 5.259215590330195,
      "tokens_seen": 53084160
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969207622868606,
      "loss": 2.6955,
      "theoretical_loss": 5.258240904686186,
      "tokens_seen": 53149696
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004969107321965897,
      "loss": 2.8699,
      "theoretical_loss": 5.25726775617426,
      "tokens_seen": 53215232
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496900702106319,
      "loss": 2.7865,
      "theoretical_loss": 5.256296140481728,
      "tokens_seen": 53280768
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968906720160481,
      "loss": 2.8965,
      "theoretical_loss": 5.255326053313292,
      "tokens_seen": 53346304
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968806419257774,
      "loss": 2.6581,
      "theoretical_loss": 5.254357490390941,
      "tokens_seen": 53411840
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968706118355065,
      "loss": 2.6403,
      "theoretical_loss": 5.253390447453873,
      "tokens_seen": 53477376
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968605817452358,
      "loss": 2.6442,
      "theoretical_loss": 5.252424920258396,
      "tokens_seen": 53542912
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968505516549649,
      "loss": 2.8163,
      "theoretical_loss": 5.251460904577845,
      "tokens_seen": 53608448
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968405215646941,
      "loss": 2.6282,
      "theoretical_loss": 5.250498396202486,
      "tokens_seen": 53673984
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968304914744233,
      "loss": 2.6553,
      "theoretical_loss": 5.249537390939436,
      "tokens_seen": 53739520
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968204613841525,
      "loss": 2.8896,
      "theoretical_loss": 5.248577884612564,
      "tokens_seen": 53805056
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968104312938817,
      "loss": 2.6234,
      "theoretical_loss": 5.247619873062416,
      "tokens_seen": 53870592
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004968004012036108,
      "loss": 2.4346,
      "theoretical_loss": 5.246663352146122,
      "tokens_seen": 53936128
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.00049679037111334,
      "loss": 2.7873,
      "theoretical_loss": 5.245708317737305,
      "tokens_seen": 54001664
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967803410230692,
      "loss": 2.571,
      "theoretical_loss": 5.244754765726007,
      "tokens_seen": 54067200
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967703109327984,
      "loss": 2.7026,
      "theoretical_loss": 5.243802692018596,
      "tokens_seen": 54132736
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967602808425276,
      "loss": 2.7919,
      "theoretical_loss": 5.242852092537677,
      "tokens_seen": 54198272
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967502507522568,
      "loss": 2.6906,
      "theoretical_loss": 5.241902963222023,
      "tokens_seen": 54263808
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967402206619859,
      "loss": 2.8103,
      "theoretical_loss": 5.240955300026476,
      "tokens_seen": 54329344
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967301905717151,
      "loss": 2.7066,
      "theoretical_loss": 5.240009098921874,
      "tokens_seen": 54394880
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967201604814444,
      "loss": 2.7564,
      "theoretical_loss": 5.239064355894965,
      "tokens_seen": 54460416
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967101303911735,
      "loss": 2.6458,
      "theoretical_loss": 5.238121066948324,
      "tokens_seen": 54525952
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004967001003009028,
      "loss": 2.726,
      "theoretical_loss": 5.237179228100272,
      "tokens_seen": 54591488
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496690070210632,
      "loss": 2.6527,
      "theoretical_loss": 5.2362388353848,
      "tokens_seen": 54657024
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004966800401203611,
      "loss": 2.5542,
      "theoretical_loss": 5.23529988485148,
      "tokens_seen": 54722560
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004966700100300903,
      "loss": 2.6998,
      "theoretical_loss": 5.2343623725653945,
      "tokens_seen": 54788096
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004966599799398195,
      "loss": 2.834,
      "theoretical_loss": 5.233426294607049,
      "tokens_seen": 54853632
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004966499498495487,
      "loss": 2.6569,
      "theoretical_loss": 5.232491647072299,
      "tokens_seen": 54919168
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004966399197592779,
      "loss": 2.5116,
      "theoretical_loss": 5.231558426072269,
      "tokens_seen": 54984704
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496629889669007,
      "loss": 2.5202,
      "theoretical_loss": 5.230626627733274,
      "tokens_seen": 55050240
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004966198595787362,
      "loss": 2.7,
      "theoretical_loss": 5.2296962481967455,
      "tokens_seen": 55115776
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004966098294884654,
      "loss": 2.6416,
      "theoretical_loss": 5.228767283619151,
      "tokens_seen": 55181312
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965997993981946,
      "loss": 2.7292,
      "theoretical_loss": 5.227839730171918,
      "tokens_seen": 55246848
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965897693079238,
      "loss": 2.7759,
      "theoretical_loss": 5.2269135840413625,
      "tokens_seen": 55312384
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965797392176529,
      "loss": 2.5854,
      "theoretical_loss": 5.225988841428606,
      "tokens_seen": 55377920
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965697091273821,
      "loss": 2.6574,
      "theoretical_loss": 5.225065498549508,
      "tokens_seen": 55443456
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965596790371113,
      "loss": 2.7252,
      "theoretical_loss": 5.224143551634588,
      "tokens_seen": 55508992
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965496489468405,
      "loss": 2.6538,
      "theoretical_loss": 5.22322299692895,
      "tokens_seen": 55574528
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965396188565698,
      "loss": 2.7017,
      "theoretical_loss": 5.222303830692211,
      "tokens_seen": 55640064
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965295887662988,
      "loss": 2.6246,
      "theoretical_loss": 5.22138604919843,
      "tokens_seen": 55705600
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965195586760281,
      "loss": 2.6904,
      "theoretical_loss": 5.220469648736031,
      "tokens_seen": 55771136
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004965095285857573,
      "loss": 2.8584,
      "theoretical_loss": 5.219554625607731,
      "tokens_seen": 55836672
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964994984954865,
      "loss": 2.7487,
      "theoretical_loss": 5.218640976130474,
      "tokens_seen": 55902208
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964894684052157,
      "loss": 2.6744,
      "theoretical_loss": 5.217728696635353,
      "tokens_seen": 55967744
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964794383149449,
      "loss": 2.5643,
      "theoretical_loss": 5.216817783467543,
      "tokens_seen": 56033280
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496469408224674,
      "loss": 2.7877,
      "theoretical_loss": 5.215908232986227,
      "tokens_seen": 56098816
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964593781344032,
      "loss": 2.4655,
      "theoretical_loss": 5.215000041564533,
      "tokens_seen": 56164352
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964493480441324,
      "loss": 2.6462,
      "theoretical_loss": 5.214093205589455,
      "tokens_seen": 56229888
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964393179538616,
      "loss": 2.765,
      "theoretical_loss": 5.213187721461791,
      "tokens_seen": 56295424
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964292878635908,
      "loss": 2.5278,
      "theoretical_loss": 5.212283585596071,
      "tokens_seen": 56360960
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.00049641925777332,
      "loss": 2.5646,
      "theoretical_loss": 5.211380794420492,
      "tokens_seen": 56426496
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004964092276830491,
      "loss": 2.5327,
      "theoretical_loss": 5.210479344376845,
      "tokens_seen": 56492032
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963991975927783,
      "loss": 2.6528,
      "theoretical_loss": 5.209579231920451,
      "tokens_seen": 56557568
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963891675025075,
      "loss": 2.6071,
      "theoretical_loss": 5.208680453520092,
      "tokens_seen": 56623104
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963791374122367,
      "loss": 2.5526,
      "theoretical_loss": 5.2077830056579515,
      "tokens_seen": 56688640
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963691073219659,
      "loss": 2.548,
      "theoretical_loss": 5.206886884829535,
      "tokens_seen": 56754176
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963590772316951,
      "loss": 2.6361,
      "theoretical_loss": 5.205992087543614,
      "tokens_seen": 56819712
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963490471414242,
      "loss": 2.6921,
      "theoretical_loss": 5.205098610322162,
      "tokens_seen": 56885248
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963390170511535,
      "loss": 2.5257,
      "theoretical_loss": 5.204206449700279,
      "tokens_seen": 56950784
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963289869608827,
      "loss": 2.667,
      "theoretical_loss": 5.203315602226139,
      "tokens_seen": 57016320
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004963189568706119,
      "loss": 2.6729,
      "theoretical_loss": 5.2024260644609175,
      "tokens_seen": 57081856
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496308926780341,
      "loss": 2.4228,
      "theoretical_loss": 5.201537832978731,
      "tokens_seen": 57147392
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962988966900702,
      "loss": 2.6159,
      "theoretical_loss": 5.200650904366574,
      "tokens_seen": 57212928
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962888665997994,
      "loss": 2.5174,
      "theoretical_loss": 5.199765275224252,
      "tokens_seen": 57278464
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962788365095286,
      "loss": 2.5108,
      "theoretical_loss": 5.198880942164323,
      "tokens_seen": 57344000
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962688064192578,
      "loss": 2.5028,
      "theoretical_loss": 5.197997901812036,
      "tokens_seen": 57409536
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496258776328987,
      "loss": 2.5871,
      "theoretical_loss": 5.197116150805264,
      "tokens_seen": 57475072
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962487462387161,
      "loss": 2.5696,
      "theoretical_loss": 5.196235685794446,
      "tokens_seen": 57540608
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962387161484453,
      "loss": 2.623,
      "theoretical_loss": 5.195356503442525,
      "tokens_seen": 57606144
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962286860581746,
      "loss": 2.5793,
      "theoretical_loss": 5.194478600424889,
      "tokens_seen": 57671680
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004962186559679037,
      "loss": 2.5067,
      "theoretical_loss": 5.193601973429306,
      "tokens_seen": 57737216
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496208625877633,
      "loss": 2.5086,
      "theoretical_loss": 5.192726619155867,
      "tokens_seen": 57802752
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961985957873621,
      "loss": 2.6492,
      "theoretical_loss": 5.191852534316928,
      "tokens_seen": 57868288
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961885656970913,
      "loss": 2.5899,
      "theoretical_loss": 5.190979715637049,
      "tokens_seen": 57933824
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961785356068205,
      "loss": 2.5058,
      "theoretical_loss": 5.190108159852929,
      "tokens_seen": 57999360
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961685055165497,
      "loss": 2.6349,
      "theoretical_loss": 5.189237863713357,
      "tokens_seen": 58064896
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961584754262789,
      "loss": 2.5785,
      "theoretical_loss": 5.188368823979152,
      "tokens_seen": 58130432
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961484453360081,
      "loss": 2.4292,
      "theoretical_loss": 5.187501037423096,
      "tokens_seen": 58195968
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961384152457372,
      "loss": 2.5084,
      "theoretical_loss": 5.186634500829886,
      "tokens_seen": 58261504
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961283851554664,
      "loss": 2.6022,
      "theoretical_loss": 5.185769210996076,
      "tokens_seen": 58327040
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961183550651956,
      "loss": 2.5535,
      "theoretical_loss": 5.184905164730012,
      "tokens_seen": 58392576
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004961083249749248,
      "loss": 2.5439,
      "theoretical_loss": 5.184042358851785,
      "tokens_seen": 58458112
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496098294884654,
      "loss": 2.5192,
      "theoretical_loss": 5.1831807901931715,
      "tokens_seen": 58523648
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960882647943831,
      "loss": 2.4975,
      "theoretical_loss": 5.18232045559757,
      "tokens_seen": 58589184
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960782347041123,
      "loss": 2.5354,
      "theoretical_loss": 5.181461351919959,
      "tokens_seen": 58654720
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960682046138415,
      "loss": 2.4185,
      "theoretical_loss": 5.180603476026832,
      "tokens_seen": 58720256
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960581745235707,
      "loss": 2.5335,
      "theoretical_loss": 5.179746824796146,
      "tokens_seen": 58785792
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960481444333,
      "loss": 2.4877,
      "theoretical_loss": 5.178891395117262,
      "tokens_seen": 58851328
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000496038114343029,
      "loss": 2.4174,
      "theoretical_loss": 5.178037183890902,
      "tokens_seen": 58916864
    },
    {
      "epoch": 0.02,
      "objective/train/docs_used": 26422,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 2.4600493907928467,
      "objective/train/theoretical_loss": 5.177184188029082,
      "objective/train/tokens_used": 79442400,
      "theoretical_loss": 5.177184188029082,
      "tokens_seen": 58982400
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960280842527583,
      "loss": 2.46,
      "theoretical_loss": 5.177184188029082,
      "tokens_seen": 58982400
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960180541624875,
      "loss": 2.4715,
      "theoretical_loss": 5.1763324044550645,
      "tokens_seen": 59047936
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004960080240722167,
      "loss": 2.5171,
      "theoretical_loss": 5.175481830103307,
      "tokens_seen": 59113472
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959979939819459,
      "loss": 2.5327,
      "theoretical_loss": 5.174632461919406,
      "tokens_seen": 59179008
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959879638916751,
      "loss": 2.4399,
      "theoretical_loss": 5.173784296860043,
      "tokens_seen": 59244544
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959779338014042,
      "loss": 2.5282,
      "theoretical_loss": 5.172937331892934,
      "tokens_seen": 59310080
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959679037111334,
      "loss": 2.6172,
      "theoretical_loss": 5.17209156399678,
      "tokens_seen": 59375616
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959578736208626,
      "loss": 2.5134,
      "theoretical_loss": 5.171246990161208,
      "tokens_seen": 59441152
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959478435305918,
      "loss": 2.402,
      "theoretical_loss": 5.17040360738673,
      "tokens_seen": 59506688
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495937813440321,
      "loss": 2.5603,
      "theoretical_loss": 5.169561412684677,
      "tokens_seen": 59572224
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959277833500501,
      "loss": 2.4992,
      "theoretical_loss": 5.168720403077165,
      "tokens_seen": 59637760
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959177532597793,
      "loss": 2.4826,
      "theoretical_loss": 5.167880575597031,
      "tokens_seen": 59703296
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004959077231695085,
      "loss": 2.3429,
      "theoretical_loss": 5.167041927287787,
      "tokens_seen": 59768832
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958976930792377,
      "loss": 2.6096,
      "theoretical_loss": 5.166204455203575,
      "tokens_seen": 59834368
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958876629889669,
      "loss": 2.5375,
      "theoretical_loss": 5.16536815640911,
      "tokens_seen": 59899904
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495877632898696,
      "loss": 2.538,
      "theoretical_loss": 5.1645330279796315,
      "tokens_seen": 59965440
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958676028084253,
      "loss": 2.455,
      "theoretical_loss": 5.1636990670008585,
      "tokens_seen": 60030976
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958575727181544,
      "loss": 2.5097,
      "theoretical_loss": 5.162866270568938,
      "tokens_seen": 60096512
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958475426278837,
      "loss": 2.4676,
      "theoretical_loss": 5.162034635790397,
      "tokens_seen": 60162048
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958375125376129,
      "loss": 2.5354,
      "theoretical_loss": 5.1612041597820895,
      "tokens_seen": 60227584
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958274824473421,
      "loss": 2.6086,
      "theoretical_loss": 5.160374839671159,
      "tokens_seen": 60293120
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958174523570712,
      "loss": 2.6129,
      "theoretical_loss": 5.1595466725949795,
      "tokens_seen": 60358656
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004958074222668004,
      "loss": 2.587,
      "theoretical_loss": 5.158719655701115,
      "tokens_seen": 60424192
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957973921765296,
      "loss": 2.5393,
      "theoretical_loss": 5.157893786147269,
      "tokens_seen": 60489728
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957873620862588,
      "loss": 2.5871,
      "theoretical_loss": 5.157069061101238,
      "tokens_seen": 60555264
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495777331995988,
      "loss": 2.5605,
      "theoretical_loss": 5.156245477740866,
      "tokens_seen": 60620800
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957673019057172,
      "loss": 2.4561,
      "theoretical_loss": 5.155423033253997,
      "tokens_seen": 60686336
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957572718154463,
      "loss": 2.5154,
      "theoretical_loss": 5.154601724838431,
      "tokens_seen": 60751872
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957472417251755,
      "loss": 2.5328,
      "theoretical_loss": 5.153781549701872,
      "tokens_seen": 60817408
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957372116349047,
      "loss": 2.4836,
      "theoretical_loss": 5.15296250506189,
      "tokens_seen": 60882944
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957271815446339,
      "loss": 2.3349,
      "theoretical_loss": 5.152144588145871,
      "tokens_seen": 60948480
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957171514543631,
      "loss": 2.4154,
      "theoretical_loss": 5.151327796190975,
      "tokens_seen": 61014016
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004957071213640923,
      "loss": 2.2835,
      "theoretical_loss": 5.1505121264440845,
      "tokens_seen": 61079552
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956970912738214,
      "loss": 2.3097,
      "theoretical_loss": 5.149697576161769,
      "tokens_seen": 61145088
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956870611835507,
      "loss": 2.5132,
      "theoretical_loss": 5.148884142610232,
      "tokens_seen": 61210624
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956770310932798,
      "loss": 2.3864,
      "theoretical_loss": 5.148071823065274,
      "tokens_seen": 61276160
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956670010030091,
      "loss": 2.5728,
      "theoretical_loss": 5.147260614812246,
      "tokens_seen": 61341696
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956569709127383,
      "loss": 2.3495,
      "theoretical_loss": 5.146450515146002,
      "tokens_seen": 61407232
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956469408224674,
      "loss": 2.4936,
      "theoretical_loss": 5.145641521370861,
      "tokens_seen": 61472768
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956369107321966,
      "loss": 2.4722,
      "theoretical_loss": 5.144833630800562,
      "tokens_seen": 61538304
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956268806419258,
      "loss": 2.4723,
      "theoretical_loss": 5.1440268407582215,
      "tokens_seen": 61603840
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495616850551655,
      "loss": 2.3882,
      "theoretical_loss": 5.143221148576288,
      "tokens_seen": 61669376
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004956068204613842,
      "loss": 2.4053,
      "theoretical_loss": 5.142416551596505,
      "tokens_seen": 61734912
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955967903711133,
      "loss": 2.5142,
      "theoretical_loss": 5.141613047169862,
      "tokens_seen": 61800448
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955867602808425,
      "loss": 2.5359,
      "theoretical_loss": 5.14081063265656,
      "tokens_seen": 61865984
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955767301905717,
      "loss": 2.3818,
      "theoretical_loss": 5.140009305425963,
      "tokens_seen": 61931520
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955667001003009,
      "loss": 2.4796,
      "theoretical_loss": 5.13920906285656,
      "tokens_seen": 61997056
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955566700100301,
      "loss": 2.3293,
      "theoretical_loss": 5.138409902335925,
      "tokens_seen": 62062592
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955466399197592,
      "loss": 2.49,
      "theoretical_loss": 5.137611821260673,
      "tokens_seen": 62128128
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955366098294884,
      "loss": 2.4665,
      "theoretical_loss": 5.13681481703642,
      "tokens_seen": 62193664
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955265797392177,
      "loss": 2.4,
      "theoretical_loss": 5.136018887077743,
      "tokens_seen": 62259200
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955165496489468,
      "loss": 2.39,
      "theoretical_loss": 5.13522402880814,
      "tokens_seen": 62324736
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004955065195586761,
      "loss": 2.4258,
      "theoretical_loss": 5.13443023965999,
      "tokens_seen": 62390272
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954964894684052,
      "loss": 2.4257,
      "theoretical_loss": 5.13363751707451,
      "tokens_seen": 62455808
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954864593781344,
      "loss": 2.393,
      "theoretical_loss": 5.132845858501721,
      "tokens_seen": 62521344
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954764292878636,
      "loss": 2.3509,
      "theoretical_loss": 5.132055261400403,
      "tokens_seen": 62586880
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954663991975928,
      "loss": 2.3172,
      "theoretical_loss": 5.131265723238059,
      "tokens_seen": 62652416
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495456369107322,
      "loss": 2.3923,
      "theoretical_loss": 5.130477241490876,
      "tokens_seen": 62717952
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954463390170512,
      "loss": 2.3112,
      "theoretical_loss": 5.129689813643683,
      "tokens_seen": 62783488
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954363089267803,
      "loss": 2.3915,
      "theoretical_loss": 5.128903437189917,
      "tokens_seen": 62849024
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954262788365095,
      "loss": 2.4438,
      "theoretical_loss": 5.128118109631581,
      "tokens_seen": 62914560
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954162487462387,
      "loss": 2.4319,
      "theoretical_loss": 5.127333828479208,
      "tokens_seen": 62980096
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004954062186559679,
      "loss": 2.2958,
      "theoretical_loss": 5.126550591251821,
      "tokens_seen": 63045632
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953961885656971,
      "loss": 2.4476,
      "theoretical_loss": 5.125768395476896,
      "tokens_seen": 63111168
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953861584754263,
      "loss": 2.4543,
      "theoretical_loss": 5.124987238690329,
      "tokens_seen": 63176704
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953761283851555,
      "loss": 2.4147,
      "theoretical_loss": 5.124207118436388,
      "tokens_seen": 63242240
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953660982948846,
      "loss": 2.4041,
      "theoretical_loss": 5.123428032267688,
      "tokens_seen": 63307776
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953560682046139,
      "loss": 2.5179,
      "theoretical_loss": 5.122649977745146,
      "tokens_seen": 63373312
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953460381143431,
      "loss": 2.3879,
      "theoretical_loss": 5.121872952437947,
      "tokens_seen": 63438848
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953360080240723,
      "loss": 2.4021,
      "theoretical_loss": 5.121096953923507,
      "tokens_seen": 63504384
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953259779338014,
      "loss": 2.4684,
      "theoretical_loss": 5.1203219797874375,
      "tokens_seen": 63569920
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953159478435306,
      "loss": 2.2992,
      "theoretical_loss": 5.119548027623509,
      "tokens_seen": 63635456
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004953059177532598,
      "loss": 2.4577,
      "theoretical_loss": 5.118775095033612,
      "tokens_seen": 63700992
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495295887662989,
      "loss": 2.4288,
      "theoretical_loss": 5.118003179627729,
      "tokens_seen": 63766528
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952858575727182,
      "loss": 2.4904,
      "theoretical_loss": 5.11723227902389,
      "tokens_seen": 63832064
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952758274824474,
      "loss": 2.4304,
      "theoretical_loss": 5.1164623908481435,
      "tokens_seen": 63897600
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952657973921765,
      "loss": 2.3191,
      "theoretical_loss": 5.115693512734515,
      "tokens_seen": 63963136
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952557673019057,
      "loss": 2.3302,
      "theoretical_loss": 5.114925642324982,
      "tokens_seen": 64028672
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952457372116349,
      "loss": 2.3538,
      "theoretical_loss": 5.114158777269429,
      "tokens_seen": 64094208
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952357071213641,
      "loss": 2.4022,
      "theoretical_loss": 5.113392915225617,
      "tokens_seen": 64159744
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952256770310933,
      "loss": 2.3597,
      "theoretical_loss": 5.112628053859153,
      "tokens_seen": 64225280
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952156469408225,
      "loss": 2.45,
      "theoretical_loss": 5.1118641908434475,
      "tokens_seen": 64290816
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004952056168505516,
      "loss": 2.2314,
      "theoretical_loss": 5.111101323859687,
      "tokens_seen": 64356352
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951955867602809,
      "loss": 2.397,
      "theoretical_loss": 5.1103394505968005,
      "tokens_seen": 64421888
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.00049518555667001,
      "loss": 2.4147,
      "theoretical_loss": 5.109578568751417,
      "tokens_seen": 64487424
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951755265797393,
      "loss": 2.4355,
      "theoretical_loss": 5.108818676027845,
      "tokens_seen": 64552960
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951654964894685,
      "loss": 2.3471,
      "theoretical_loss": 5.108059770138027,
      "tokens_seen": 64618496
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951554663991976,
      "loss": 2.2936,
      "theoretical_loss": 5.107301848801519,
      "tokens_seen": 64684032
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951454363089268,
      "loss": 2.2763,
      "theoretical_loss": 5.106544909745443,
      "tokens_seen": 64749568
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495135406218656,
      "loss": 2.2821,
      "theoretical_loss": 5.105788950704467,
      "tokens_seen": 64815104
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951253761283852,
      "loss": 2.3171,
      "theoretical_loss": 5.105033969420764,
      "tokens_seen": 64880640
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951153460381144,
      "loss": 2.4088,
      "theoretical_loss": 5.104279963643982,
      "tokens_seen": 64946176
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004951053159478435,
      "loss": 2.2594,
      "theoretical_loss": 5.103526931131217,
      "tokens_seen": 65011712
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950952858575727,
      "loss": 2.363,
      "theoretical_loss": 5.102774869646972,
      "tokens_seen": 65077248
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950852557673019,
      "loss": 2.4473,
      "theoretical_loss": 5.102023776963131,
      "tokens_seen": 65142784
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950752256770311,
      "loss": 2.3401,
      "theoretical_loss": 5.101273650858926,
      "tokens_seen": 65208320
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950651955867603,
      "loss": 2.3007,
      "theoretical_loss": 5.100524489120902,
      "tokens_seen": 65273856
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950551654964894,
      "loss": 2.3496,
      "theoretical_loss": 5.099776289542893,
      "tokens_seen": 65339392
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950451354062186,
      "loss": 2.1927,
      "theoretical_loss": 5.099029049925985,
      "tokens_seen": 65404928
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950351053159479,
      "loss": 2.3203,
      "theoretical_loss": 5.098282768078483,
      "tokens_seen": 65470464
    },
    {
      "epoch": 0.02,
      "objective/train/docs_used": 28596,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 2.443446636199951,
      "objective/train/theoretical_loss": 5.097537441815887,
      "objective/train/tokens_used": 85996000,
      "theoretical_loss": 5.097537441815887,
      "tokens_seen": 65536000
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000495025075225677,
      "loss": 2.4434,
      "theoretical_loss": 5.097537441815887,
      "tokens_seen": 65536000
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950150451354063,
      "loss": 2.2775,
      "theoretical_loss": 5.096793068960857,
      "tokens_seen": 65601536
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004950050150451354,
      "loss": 2.3824,
      "theoretical_loss": 5.096049647343182,
      "tokens_seen": 65667072
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949949849548646,
      "loss": 2.3286,
      "theoretical_loss": 5.095307174799752,
      "tokens_seen": 65732608
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949849548645938,
      "loss": 2.3691,
      "theoretical_loss": 5.094565649174524,
      "tokens_seen": 65798144
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000494974924774323,
      "loss": 2.4181,
      "theoretical_loss": 5.0938250683184965,
      "tokens_seen": 65863680
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949648946840522,
      "loss": 2.3307,
      "theoretical_loss": 5.093085430089674,
      "tokens_seen": 65929216
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949548645937814,
      "loss": 2.2772,
      "theoretical_loss": 5.092346732353046,
      "tokens_seen": 65994752
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949448345035105,
      "loss": 2.3994,
      "theoretical_loss": 5.091608972980545,
      "tokens_seen": 66060288
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949348044132397,
      "loss": 2.3946,
      "theoretical_loss": 5.090872149851029,
      "tokens_seen": 66125824
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949247743229689,
      "loss": 2.3083,
      "theoretical_loss": 5.090136260850245,
      "tokens_seen": 66191360
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949147442326981,
      "loss": 2.2954,
      "theoretical_loss": 5.089401303870801,
      "tokens_seen": 66256896
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004949047141424273,
      "loss": 2.4495,
      "theoretical_loss": 5.088667276812138,
      "tokens_seen": 66322432
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948946840521565,
      "loss": 2.3417,
      "theoretical_loss": 5.087934177580502,
      "tokens_seen": 66387968
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948846539618856,
      "loss": 2.3774,
      "theoretical_loss": 5.087202004088914,
      "tokens_seen": 66453504
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948746238716148,
      "loss": 2.1585,
      "theoretical_loss": 5.086470754257139,
      "tokens_seen": 66519040
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000494864593781344,
      "loss": 2.3398,
      "theoretical_loss": 5.0857404260116645,
      "tokens_seen": 66584576
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948545636910733,
      "loss": 2.3797,
      "theoretical_loss": 5.085011017285662,
      "tokens_seen": 66650112
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948445336008024,
      "loss": 2.1454,
      "theoretical_loss": 5.084282526018972,
      "tokens_seen": 66715648
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948345035105316,
      "loss": 2.2894,
      "theoretical_loss": 5.083554950158062,
      "tokens_seen": 66781184
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948244734202607,
      "loss": 2.2378,
      "theoretical_loss": 5.0828282876560085,
      "tokens_seen": 66846720
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.00049481444332999,
      "loss": 2.2096,
      "theoretical_loss": 5.0821025364724655,
      "tokens_seen": 66912256
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004948044132397192,
      "loss": 2.4102,
      "theoretical_loss": 5.081377694573638,
      "tokens_seen": 66977792
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947943831494484,
      "loss": 2.356,
      "theoretical_loss": 5.080653759932255,
      "tokens_seen": 67043328
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947843530591776,
      "loss": 2.2696,
      "theoretical_loss": 5.079930730527538,
      "tokens_seen": 67108864
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947743229689067,
      "loss": 2.3248,
      "theoretical_loss": 5.079208604345181,
      "tokens_seen": 67174400
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947642928786359,
      "loss": 2.3072,
      "theoretical_loss": 5.078487379377318,
      "tokens_seen": 67239936
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947542627883651,
      "loss": 2.3409,
      "theoretical_loss": 5.0777670536225,
      "tokens_seen": 67305472
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947442326980943,
      "loss": 2.2829,
      "theoretical_loss": 5.07704762508566,
      "tokens_seen": 67371008
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947342026078235,
      "loss": 2.2015,
      "theoretical_loss": 5.076329091778101,
      "tokens_seen": 67436544
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947241725175527,
      "loss": 2.2984,
      "theoretical_loss": 5.075611451717457,
      "tokens_seen": 67502080
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947141424272818,
      "loss": 2.373,
      "theoretical_loss": 5.0748947029276685,
      "tokens_seen": 67567616
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004947041123370111,
      "loss": 2.3976,
      "theoretical_loss": 5.074178843438963,
      "tokens_seen": 67633152
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946940822467402,
      "loss": 2.2343,
      "theoretical_loss": 5.073463871287823,
      "tokens_seen": 67698688
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946840521564695,
      "loss": 2.2468,
      "theoretical_loss": 5.07274978451696,
      "tokens_seen": 67764224
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946740220661987,
      "loss": 2.3619,
      "theoretical_loss": 5.072036581175293,
      "tokens_seen": 67829760
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946639919759278,
      "loss": 2.3001,
      "theoretical_loss": 5.071324259317921,
      "tokens_seen": 67895296
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000494653961885657,
      "loss": 2.3138,
      "theoretical_loss": 5.070612817006094,
      "tokens_seen": 67960832
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946439317953862,
      "loss": 2.3988,
      "theoretical_loss": 5.06990225230719,
      "tokens_seen": 68026368
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946339017051154,
      "loss": 2.2098,
      "theoretical_loss": 5.069192563294694,
      "tokens_seen": 68091904
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946238716148446,
      "loss": 2.2835,
      "theoretical_loss": 5.068483748048166,
      "tokens_seen": 68157440
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946138415245737,
      "loss": 2.2854,
      "theoretical_loss": 5.06777580465322,
      "tokens_seen": 68222976
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004946038114343029,
      "loss": 2.3323,
      "theoretical_loss": 5.067068731201498,
      "tokens_seen": 68288512
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945937813440321,
      "loss": 2.1743,
      "theoretical_loss": 5.066362525790646,
      "tokens_seen": 68354048
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945837512537613,
      "loss": 2.2769,
      "theoretical_loss": 5.065657186524287,
      "tokens_seen": 68419584
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945737211634905,
      "loss": 2.222,
      "theoretical_loss": 5.064952711512001,
      "tokens_seen": 68485120
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945636910732196,
      "loss": 2.1779,
      "theoretical_loss": 5.064249098869295,
      "tokens_seen": 68550656
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945536609829488,
      "loss": 2.2126,
      "theoretical_loss": 5.063546346717585,
      "tokens_seen": 68616192
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945436308926781,
      "loss": 2.3123,
      "theoretical_loss": 5.062844453184166,
      "tokens_seen": 68681728
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945336008024072,
      "loss": 2.1877,
      "theoretical_loss": 5.062143416402192,
      "tokens_seen": 68747264
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945235707121365,
      "loss": 2.3063,
      "theoretical_loss": 5.061443234510648,
      "tokens_seen": 68812800
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945135406218656,
      "loss": 2.3286,
      "theoretical_loss": 5.060743905654332,
      "tokens_seen": 68878336
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004945035105315948,
      "loss": 2.2457,
      "theoretical_loss": 5.0600454279838285,
      "tokens_seen": 68943872
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000494493480441324,
      "loss": 2.4018,
      "theoretical_loss": 5.059347799655483,
      "tokens_seen": 69009408
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944834503510532,
      "loss": 2.2948,
      "theoretical_loss": 5.05865101883138,
      "tokens_seen": 69074944
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944734202607824,
      "loss": 2.157,
      "theoretical_loss": 5.057955083679321,
      "tokens_seen": 69140480
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944633901705116,
      "loss": 2.3226,
      "theoretical_loss": 5.0572599923728,
      "tokens_seen": 69206016
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944533600802407,
      "loss": 2.1526,
      "theoretical_loss": 5.056565743090982,
      "tokens_seen": 69271552
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944433299899699,
      "loss": 2.3101,
      "theoretical_loss": 5.055872334018677,
      "tokens_seen": 69337088
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944332998996991,
      "loss": 2.1434,
      "theoretical_loss": 5.0551797633463185,
      "tokens_seen": 69402624
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944232698094283,
      "loss": 2.1923,
      "theoretical_loss": 5.054488029269946,
      "tokens_seen": 69468160
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944132397191575,
      "loss": 2.3458,
      "theoretical_loss": 5.053797129991171,
      "tokens_seen": 69533696
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004944032096288867,
      "loss": 2.2652,
      "theoretical_loss": 5.053107063717167,
      "tokens_seen": 69599232
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943931795386158,
      "loss": 2.3076,
      "theoretical_loss": 5.052417828660639,
      "tokens_seen": 69664768
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000494383149448345,
      "loss": 2.241,
      "theoretical_loss": 5.051729423039802,
      "tokens_seen": 69730304
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943731193580742,
      "loss": 2.3561,
      "theoretical_loss": 5.0510418450783625,
      "tokens_seen": 69795840
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943630892678035,
      "loss": 2.1866,
      "theoretical_loss": 5.050355093005495,
      "tokens_seen": 69861376
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943530591775326,
      "loss": 2.2731,
      "theoretical_loss": 5.049669165055816,
      "tokens_seen": 69926912
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943430290872618,
      "loss": 2.412,
      "theoretical_loss": 5.048984059469369,
      "tokens_seen": 69992448
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943329989969909,
      "loss": 2.2331,
      "theoretical_loss": 5.048299774491598,
      "tokens_seen": 70057984
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943229689067202,
      "loss": 2.4342,
      "theoretical_loss": 5.047616308373328,
      "tokens_seen": 70123520
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943129388164494,
      "loss": 2.2731,
      "theoretical_loss": 5.046933659370742,
      "tokens_seen": 70189056
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004943029087261786,
      "loss": 2.3647,
      "theoretical_loss": 5.046251825745361,
      "tokens_seen": 70254592
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942928786359078,
      "loss": 2.2917,
      "theoretical_loss": 5.0455708057640205,
      "tokens_seen": 70320128
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942828485456369,
      "loss": 2.3233,
      "theoretical_loss": 5.044890597698853,
      "tokens_seen": 70385664
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942728184553661,
      "loss": 2.1982,
      "theoretical_loss": 5.044211199827263,
      "tokens_seen": 70451200
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942627883650953,
      "loss": 2.323,
      "theoretical_loss": 5.04353261043191,
      "tokens_seen": 70516736
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942527582748245,
      "loss": 2.2108,
      "theoretical_loss": 5.0428548278006815,
      "tokens_seen": 70582272
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942427281845537,
      "loss": 2.2942,
      "theoretical_loss": 5.042177850226682,
      "tokens_seen": 70647808
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942326980942828,
      "loss": 2.2535,
      "theoretical_loss": 5.0415016760082,
      "tokens_seen": 70713344
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000494222668004012,
      "loss": 2.3064,
      "theoretical_loss": 5.040826303448698,
      "tokens_seen": 70778880
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942126379137412,
      "loss": 2.2708,
      "theoretical_loss": 5.040151730856788,
      "tokens_seen": 70844416
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004942026078234704,
      "loss": 2.2444,
      "theoretical_loss": 5.039477956546207,
      "tokens_seen": 70909952
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941925777331996,
      "loss": 2.2174,
      "theoretical_loss": 5.038804978835808,
      "tokens_seen": 70975488
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941825476429289,
      "loss": 2.2277,
      "theoretical_loss": 5.038132796049523,
      "tokens_seen": 71041024
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941725175526579,
      "loss": 2.2822,
      "theoretical_loss": 5.037461406516362,
      "tokens_seen": 71106560
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941624874623872,
      "loss": 2.2355,
      "theoretical_loss": 5.036790808570377,
      "tokens_seen": 71172096
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941524573721163,
      "loss": 2.2352,
      "theoretical_loss": 5.036121000550651,
      "tokens_seen": 71237632
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941424272818456,
      "loss": 2.2752,
      "theoretical_loss": 5.035451980801276,
      "tokens_seen": 71303168
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941323971915748,
      "loss": 2.2465,
      "theoretical_loss": 5.034783747671332,
      "tokens_seen": 71368704
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941223671013039,
      "loss": 2.2969,
      "theoretical_loss": 5.034116299514871,
      "tokens_seen": 71434240
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941123370110331,
      "loss": 2.2546,
      "theoretical_loss": 5.033449634690893,
      "tokens_seen": 71499776
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004941023069207623,
      "loss": 2.2427,
      "theoretical_loss": 5.032783751563327,
      "tokens_seen": 71565312
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940922768304915,
      "loss": 2.3104,
      "theoretical_loss": 5.032118648501017,
      "tokens_seen": 71630848
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940822467402207,
      "loss": 2.2619,
      "theoretical_loss": 5.031454323877698,
      "tokens_seen": 71696384
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940722166499498,
      "loss": 2.1628,
      "theoretical_loss": 5.030790776071976,
      "tokens_seen": 71761920
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000494062186559679,
      "loss": 2.2018,
      "theoretical_loss": 5.030128003467312,
      "tokens_seen": 71827456
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940521564694082,
      "loss": 2.2483,
      "theoretical_loss": 5.029466004452004,
      "tokens_seen": 71892992
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940421263791374,
      "loss": 2.2477,
      "theoretical_loss": 5.028804777419165,
      "tokens_seen": 71958528
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940320962888666,
      "loss": 2.2311,
      "theoretical_loss": 5.028144320766701,
      "tokens_seen": 72024064
    },
    {
      "epoch": 0.02,
      "objective/train/docs_used": 30805,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 2.1269428730010986,
      "objective/train/theoretical_loss": 5.0274846328973055,
      "objective/train/tokens_used": 92549600,
      "theoretical_loss": 5.0274846328973055,
      "tokens_seen": 72089600
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940220661985958,
      "loss": 2.1269,
      "theoretical_loss": 5.0274846328973055,
      "tokens_seen": 72089600
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940120361083249,
      "loss": 2.1901,
      "theoretical_loss": 5.0268257122184234,
      "tokens_seen": 72155136
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004940020060180542,
      "loss": 2.2205,
      "theoretical_loss": 5.026167557142247,
      "tokens_seen": 72220672
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939919759277834,
      "loss": 2.1194,
      "theoretical_loss": 5.02551016608569,
      "tokens_seen": 72286208
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939819458375126,
      "loss": 2.1322,
      "theoretical_loss": 5.024853537470369,
      "tokens_seen": 72351744
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939719157472418,
      "loss": 2.2992,
      "theoretical_loss": 5.02419766972259,
      "tokens_seen": 72417280
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493961885656971,
      "loss": 2.1431,
      "theoretical_loss": 5.023542561273327,
      "tokens_seen": 72482816
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939518555667001,
      "loss": 2.234,
      "theoretical_loss": 5.022888210558206,
      "tokens_seen": 72548352
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939418254764293,
      "loss": 2.1427,
      "theoretical_loss": 5.02223461601748,
      "tokens_seen": 72613888
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939317953861585,
      "loss": 2.2061,
      "theoretical_loss": 5.021581776096022,
      "tokens_seen": 72679424
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939217652958877,
      "loss": 2.2846,
      "theoretical_loss": 5.0209296892433,
      "tokens_seen": 72744960
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004939117352056169,
      "loss": 2.2847,
      "theoretical_loss": 5.020278353913362,
      "tokens_seen": 72810496
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493901705115346,
      "loss": 2.2064,
      "theoretical_loss": 5.019627768564816,
      "tokens_seen": 72876032
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938916750250752,
      "loss": 2.1363,
      "theoretical_loss": 5.018977931660814,
      "tokens_seen": 72941568
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938816449348044,
      "loss": 2.2605,
      "theoretical_loss": 5.018328841669037,
      "tokens_seen": 73007104
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938716148445337,
      "loss": 2.273,
      "theoretical_loss": 5.017680497061671,
      "tokens_seen": 73072640
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938615847542628,
      "loss": 2.2119,
      "theoretical_loss": 5.017032896315397,
      "tokens_seen": 73138176
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493851554663992,
      "loss": 2.1451,
      "theoretical_loss": 5.016386037911371,
      "tokens_seen": 73203712
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938415245737211,
      "loss": 2.3022,
      "theoretical_loss": 5.015739920335203,
      "tokens_seen": 73269248
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938314944834504,
      "loss": 2.1924,
      "theoretical_loss": 5.015094542076945,
      "tokens_seen": 73334784
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938214643931796,
      "loss": 2.1375,
      "theoretical_loss": 5.014449901631075,
      "tokens_seen": 73400320
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004938114343029088,
      "loss": 2.0961,
      "theoretical_loss": 5.013805997496473,
      "tokens_seen": 73465856
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493801404212638,
      "loss": 2.2507,
      "theoretical_loss": 5.013162828176412,
      "tokens_seen": 73531392
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937913741223671,
      "loss": 2.244,
      "theoretical_loss": 5.012520392178539,
      "tokens_seen": 73596928
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937813440320963,
      "loss": 2.2469,
      "theoretical_loss": 5.011878688014852,
      "tokens_seen": 73662464
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937713139418255,
      "loss": 2.0986,
      "theoretical_loss": 5.011237714201694,
      "tokens_seen": 73728000
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937612838515547,
      "loss": 2.1869,
      "theoretical_loss": 5.010597469259729,
      "tokens_seen": 73793536
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937512537612839,
      "loss": 2.3009,
      "theoretical_loss": 5.009957951713927,
      "tokens_seen": 73859072
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493741223671013,
      "loss": 2.2627,
      "theoretical_loss": 5.009319160093551,
      "tokens_seen": 73924608
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937311935807422,
      "loss": 2.2395,
      "theoretical_loss": 5.008681092932137,
      "tokens_seen": 73990144
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937211634904714,
      "loss": 2.262,
      "theoretical_loss": 5.008043748767477,
      "tokens_seen": 74055680
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937111334002006,
      "loss": 2.2076,
      "theoretical_loss": 5.007407126141608,
      "tokens_seen": 74121216
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004937011033099298,
      "loss": 2.2029,
      "theoretical_loss": 5.00677122360079,
      "tokens_seen": 74186752
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936910732196591,
      "loss": 2.1204,
      "theoretical_loss": 5.006136039695496,
      "tokens_seen": 74252288
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936810431293881,
      "loss": 2.1292,
      "theoretical_loss": 5.005501572980391,
      "tokens_seen": 74317824
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936710130391174,
      "loss": 2.1523,
      "theoretical_loss": 5.004867822014317,
      "tokens_seen": 74383360
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936609829488465,
      "loss": 2.1847,
      "theoretical_loss": 5.004234785360282,
      "tokens_seen": 74448896
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936509528585758,
      "loss": 2.2039,
      "theoretical_loss": 5.0036024615854355,
      "tokens_seen": 74514432
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493640922768305,
      "loss": 2.1777,
      "theoretical_loss": 5.002970849261065,
      "tokens_seen": 74579968
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936308926780341,
      "loss": 2.2428,
      "theoretical_loss": 5.002339946962568,
      "tokens_seen": 74645504
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936208625877633,
      "loss": 2.0622,
      "theoretical_loss": 5.001709753269443,
      "tokens_seen": 74711040
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936108324974925,
      "loss": 2.121,
      "theoretical_loss": 5.001080266765275,
      "tokens_seen": 74776576
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004936008024072217,
      "loss": 2.2151,
      "theoretical_loss": 5.0004514860377185,
      "tokens_seen": 74842112
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935907723169509,
      "loss": 2.0752,
      "theoretical_loss": 4.999823409678481,
      "tokens_seen": 74907648
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.00049358074222668,
      "loss": 2.2102,
      "theoretical_loss": 4.999196036283308,
      "tokens_seen": 74973184
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935707121364092,
      "loss": 2.231,
      "theoretical_loss": 4.9985693644519715,
      "tokens_seen": 75038720
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935606820461384,
      "loss": 2.1146,
      "theoretical_loss": 4.997943392788251,
      "tokens_seen": 75104256
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935506519558676,
      "loss": 2.0939,
      "theoretical_loss": 4.997318119899922,
      "tokens_seen": 75169792
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935406218655968,
      "loss": 2.1754,
      "theoretical_loss": 4.996693544398734,
      "tokens_seen": 75235328
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493530591775326,
      "loss": 2.2659,
      "theoretical_loss": 4.996069664900406,
      "tokens_seen": 75300864
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935205616850551,
      "loss": 2.2741,
      "theoretical_loss": 4.9954464800246035,
      "tokens_seen": 75366400
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935105315947844,
      "loss": 2.1876,
      "theoretical_loss": 4.994823988394928,
      "tokens_seen": 75431936
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004935005015045135,
      "loss": 2.2549,
      "theoretical_loss": 4.994202188638901,
      "tokens_seen": 75497472
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934904714142428,
      "loss": 2.2241,
      "theoretical_loss": 4.9935810793879485,
      "tokens_seen": 75563008
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934804413239719,
      "loss": 2.1223,
      "theoretical_loss": 4.992960659277389,
      "tokens_seen": 75628544
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934704112337011,
      "loss": 2.3319,
      "theoretical_loss": 4.992340926946417,
      "tokens_seen": 75694080
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934603811434303,
      "loss": 2.1456,
      "theoretical_loss": 4.991721881038091,
      "tokens_seen": 75759616
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934503510531595,
      "loss": 2.2143,
      "theoretical_loss": 4.991103520199314,
      "tokens_seen": 75825152
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934403209628887,
      "loss": 2.2714,
      "theoretical_loss": 4.990485843080824,
      "tokens_seen": 75890688
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934302908726179,
      "loss": 2.1172,
      "theoretical_loss": 4.989868848337181,
      "tokens_seen": 75956224
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493420260782347,
      "loss": 2.1441,
      "theoretical_loss": 4.989252534626749,
      "tokens_seen": 76021760
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934102306920762,
      "loss": 2.1678,
      "theoretical_loss": 4.988636900611683,
      "tokens_seen": 76087296
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004934002006018054,
      "loss": 2.1367,
      "theoretical_loss": 4.988021944957915,
      "tokens_seen": 76152832
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933901705115346,
      "loss": 2.2086,
      "theoretical_loss": 4.987407666335143,
      "tokens_seen": 76218368
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933801404212638,
      "loss": 2.1333,
      "theoretical_loss": 4.986794063416813,
      "tokens_seen": 76283904
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493370110330993,
      "loss": 2.0912,
      "theoretical_loss": 4.986181134880107,
      "tokens_seen": 76349440
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933600802407221,
      "loss": 2.2048,
      "theoretical_loss": 4.98556887940593,
      "tokens_seen": 76414976
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933500501504513,
      "loss": 2.1031,
      "theoretical_loss": 4.984957295678894,
      "tokens_seen": 76480512
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933400200601805,
      "loss": 2.1661,
      "theoretical_loss": 4.98434638238731,
      "tokens_seen": 76546048
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933299899699098,
      "loss": 2.2173,
      "theoretical_loss": 4.983736138223165,
      "tokens_seen": 76611584
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933199598796389,
      "loss": 2.2035,
      "theoretical_loss": 4.983126561882118,
      "tokens_seen": 76677120
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004933099297893682,
      "loss": 2.1082,
      "theoretical_loss": 4.982517652063482,
      "tokens_seen": 76742656
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932998996990972,
      "loss": 2.0813,
      "theoretical_loss": 4.981909407470209,
      "tokens_seen": 76808192
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932898696088265,
      "loss": 2.263,
      "theoretical_loss": 4.981301826808882,
      "tokens_seen": 76873728
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932798395185557,
      "loss": 2.1745,
      "theoretical_loss": 4.9806949087896975,
      "tokens_seen": 76939264
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932698094282849,
      "loss": 2.1893,
      "theoretical_loss": 4.980088652126453,
      "tokens_seen": 77004800
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932597793380141,
      "loss": 2.2214,
      "theoretical_loss": 4.9794830555365355,
      "tokens_seen": 77070336
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932497492477432,
      "loss": 2.1307,
      "theoretical_loss": 4.978878117740907,
      "tokens_seen": 77135872
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932397191574724,
      "loss": 2.2191,
      "theoretical_loss": 4.978273837464091,
      "tokens_seen": 77201408
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932296890672016,
      "loss": 1.9846,
      "theoretical_loss": 4.977670213434161,
      "tokens_seen": 77266944
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004932196589769308,
      "loss": 2.1291,
      "theoretical_loss": 4.977067244382729,
      "tokens_seen": 77332480
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.00049320962888666,
      "loss": 2.1953,
      "theoretical_loss": 4.976464929044928,
      "tokens_seen": 77398016
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931995987963893,
      "loss": 2.2092,
      "theoretical_loss": 4.975863266159403,
      "tokens_seen": 77463552
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931895687061183,
      "loss": 2.2813,
      "theoretical_loss": 4.975262254468299,
      "tokens_seen": 77529088
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931795386158476,
      "loss": 2.2739,
      "theoretical_loss": 4.9746618927172435,
      "tokens_seen": 77594624
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931695085255767,
      "loss": 2.063,
      "theoretical_loss": 4.9740621796553395,
      "tokens_seen": 77660160
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493159478435306,
      "loss": 2.0762,
      "theoretical_loss": 4.973463114035149,
      "tokens_seen": 77725696
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931494483450352,
      "loss": 2.193,
      "theoretical_loss": 4.972864694612684,
      "tokens_seen": 77791232
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931394182547643,
      "loss": 2.2024,
      "theoretical_loss": 4.972266920147391,
      "tokens_seen": 77856768
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931293881644935,
      "loss": 2.2308,
      "theoretical_loss": 4.971669789402139,
      "tokens_seen": 77922304
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931193580742227,
      "loss": 2.1278,
      "theoretical_loss": 4.971073301143207,
      "tokens_seen": 77987840
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004931093279839519,
      "loss": 2.2697,
      "theoretical_loss": 4.970477454140278,
      "tokens_seen": 78053376
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930992978936811,
      "loss": 2.1999,
      "theoretical_loss": 4.9698822471664155,
      "tokens_seen": 78118912
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930892678034102,
      "loss": 2.0518,
      "theoretical_loss": 4.96928767899806,
      "tokens_seen": 78184448
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930792377131394,
      "loss": 2.1648,
      "theoretical_loss": 4.9686937484150135,
      "tokens_seen": 78249984
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930692076228686,
      "loss": 2.18,
      "theoretical_loss": 4.96810045420043,
      "tokens_seen": 78315520
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930591775325978,
      "loss": 2.2146,
      "theoretical_loss": 4.967507795140797,
      "tokens_seen": 78381056
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000493049147442327,
      "loss": 2.3355,
      "theoretical_loss": 4.966915770025935,
      "tokens_seen": 78446592
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930391173520562,
      "loss": 2.1591,
      "theoretical_loss": 4.966324377648973,
      "tokens_seen": 78512128
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930290872617853,
      "loss": 2.2569,
      "theoretical_loss": 4.965733616806345,
      "tokens_seen": 78577664
    },
    {
      "epoch": 0.02,
      "objective/train/docs_used": 32925,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 2.164118766784668,
      "objective/train/theoretical_loss": 4.965143486297777,
      "objective/train/tokens_used": 99103200,
      "theoretical_loss": 4.965143486297777,
      "tokens_seen": 78643200
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930190571715146,
      "loss": 2.1641,
      "theoretical_loss": 4.965143486297777,
      "tokens_seen": 78643200
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004930090270812437,
      "loss": 2.2732,
      "theoretical_loss": 4.964553984926271,
      "tokens_seen": 78708736
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000492998996990973,
      "loss": 2.1673,
      "theoretical_loss": 4.963965111498098,
      "tokens_seen": 78774272
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929889669007021,
      "loss": 2.1181,
      "theoretical_loss": 4.963376864822784,
      "tokens_seen": 78839808
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929789368104313,
      "loss": 2.1407,
      "theoretical_loss": 4.962789243713102,
      "tokens_seen": 78905344
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929689067201605,
      "loss": 2.1306,
      "theoretical_loss": 4.962202246985054,
      "tokens_seen": 78970880
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929588766298897,
      "loss": 2.2538,
      "theoretical_loss": 4.9616158734578635,
      "tokens_seen": 79036416
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929488465396189,
      "loss": 2.1145,
      "theoretical_loss": 4.961030121953965,
      "tokens_seen": 79101952
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929388164493481,
      "loss": 2.2378,
      "theoretical_loss": 4.960444991298992,
      "tokens_seen": 79167488
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929287863590773,
      "loss": 2.0582,
      "theoretical_loss": 4.959860480321762,
      "tokens_seen": 79233024
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929187562688064,
      "loss": 2.1591,
      "theoretical_loss": 4.959276587854272,
      "tokens_seen": 79298560
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004929087261785356,
      "loss": 2.135,
      "theoretical_loss": 4.958693312731681,
      "tokens_seen": 79364096
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928986960882648,
      "loss": 2.0731,
      "theoretical_loss": 4.9581106537923,
      "tokens_seen": 79429632
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000492888665997994,
      "loss": 2.1841,
      "theoretical_loss": 4.957528609877587,
      "tokens_seen": 79495168
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928786359077232,
      "loss": 2.1317,
      "theoretical_loss": 4.9569471798321265,
      "tokens_seen": 79560704
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928686058174523,
      "loss": 2.2369,
      "theoretical_loss": 4.9563663625036245,
      "tokens_seen": 79626240
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928585757271815,
      "loss": 1.9386,
      "theoretical_loss": 4.955786156742898,
      "tokens_seen": 79691776
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928485456369107,
      "loss": 2.2234,
      "theoretical_loss": 4.955206561403859,
      "tokens_seen": 79757312
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.00049283851554664,
      "loss": 2.1232,
      "theoretical_loss": 4.954627575343509,
      "tokens_seen": 79822848
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928284854563691,
      "loss": 2.1773,
      "theoretical_loss": 4.954049197421925,
      "tokens_seen": 79888384
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928184553660984,
      "loss": 2.0577,
      "theoretical_loss": 4.953471426502249,
      "tokens_seen": 79953920
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004928084252758274,
      "loss": 2.1306,
      "theoretical_loss": 4.952894261450679,
      "tokens_seen": 80019456
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927983951855567,
      "loss": 2.0514,
      "theoretical_loss": 4.952317701136457,
      "tokens_seen": 80084992
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927883650952859,
      "loss": 2.108,
      "theoretical_loss": 4.9517417444318585,
      "tokens_seen": 80150528
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927783350050151,
      "loss": 2.0506,
      "theoretical_loss": 4.951166390212181,
      "tokens_seen": 80216064
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927683049147443,
      "loss": 2.1968,
      "theoretical_loss": 4.950591637355737,
      "tokens_seen": 80281600
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927582748244734,
      "loss": 2.0821,
      "theoretical_loss": 4.950017484743835,
      "tokens_seen": 80347136
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927482447342026,
      "loss": 2.0985,
      "theoretical_loss": 4.949443931260783,
      "tokens_seen": 80412672
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927382146439318,
      "loss": 2.1503,
      "theoretical_loss": 4.948870975793863,
      "tokens_seen": 80478208
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000492728184553661,
      "loss": 2.0076,
      "theoretical_loss": 4.9482986172333305,
      "tokens_seen": 80543744
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927181544633902,
      "loss": 2.1218,
      "theoretical_loss": 4.9477268544724,
      "tokens_seen": 80609280
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004927081243731193,
      "loss": 2.185,
      "theoretical_loss": 4.947155686407239,
      "tokens_seen": 80674816
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926980942828485,
      "loss": 2.1323,
      "theoretical_loss": 4.946585111936951,
      "tokens_seen": 80740352
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926880641925777,
      "loss": 2.1537,
      "theoretical_loss": 4.94601512996357,
      "tokens_seen": 80805888
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926780341023069,
      "loss": 1.9824,
      "theoretical_loss": 4.945445739392049,
      "tokens_seen": 80871424
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926680040120361,
      "loss": 2.1527,
      "theoretical_loss": 4.944876939130252,
      "tokens_seen": 80936960
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926579739217654,
      "loss": 2.0387,
      "theoretical_loss": 4.94430872808894,
      "tokens_seen": 81002496
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926479438314944,
      "loss": 2.1159,
      "theoretical_loss": 4.943741105181765,
      "tokens_seen": 81068032
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926379137412237,
      "loss": 2.0724,
      "theoretical_loss": 4.943174069325255,
      "tokens_seen": 81133568
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926278836509528,
      "loss": 2.1422,
      "theoretical_loss": 4.94260761943881,
      "tokens_seen": 81199104
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926178535606821,
      "loss": 2.1737,
      "theoretical_loss": 4.942041754444688,
      "tokens_seen": 81264640
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004926078234704113,
      "loss": 2.2328,
      "theoretical_loss": 4.941476473267996,
      "tokens_seen": 81330176
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925977933801404,
      "loss": 2.0911,
      "theoretical_loss": 4.940911774836682,
      "tokens_seen": 81395712
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925877632898696,
      "loss": 2.1547,
      "theoretical_loss": 4.940347658081521,
      "tokens_seen": 81461248
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925777331995988,
      "loss": 2.1057,
      "theoretical_loss": 4.939784121936112,
      "tokens_seen": 81526784
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.000492567703109328,
      "loss": 2.1664,
      "theoretical_loss": 4.9392211653368605,
      "tokens_seen": 81592320
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925576730190572,
      "loss": 2.1401,
      "theoretical_loss": 4.938658787222975,
      "tokens_seen": 81657856
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925476429287864,
      "loss": 2.1495,
      "theoretical_loss": 4.938096986536452,
      "tokens_seen": 81723392
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925376128385155,
      "loss": 2.0722,
      "theoretical_loss": 4.937535762222075,
      "tokens_seen": 81788928
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925275827482447,
      "loss": 2.1667,
      "theoretical_loss": 4.936975113227394,
      "tokens_seen": 81854464
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925175526579739,
      "loss": 2.1209,
      "theoretical_loss": 4.936415038502723,
      "tokens_seen": 81920000
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004925075225677031,
      "loss": 1.9699,
      "theoretical_loss": 4.93585553700113,
      "tokens_seen": 81985536
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004924974924774323,
      "loss": 2.1929,
      "theoretical_loss": 4.935296607678426,
      "tokens_seen": 82051072
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004924874623871615,
      "loss": 2.0563,
      "theoretical_loss": 4.934738249493156,
      "tokens_seen": 82116608
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004924774322968907,
      "loss": 2.1598,
      "theoretical_loss": 4.934180461406591,
      "tokens_seen": 82182144
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004924674022066199,
      "loss": 2.2073,
      "theoretical_loss": 4.933623242382714,
      "tokens_seen": 82247680
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004924573721163491,
      "loss": 2.1446,
      "theoretical_loss": 4.9330665913882195,
      "tokens_seen": 82313216
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004924473420260783,
      "loss": 2.0721,
      "theoretical_loss": 4.932510507392495,
      "tokens_seen": 82378752
    },
    {
      "epoch": 0.02,
      "learning_rate": 0.0004924373119358075,
      "loss": 2.0264,
      "theoretical_loss": 4.931954989367618,
      "tokens_seen": 82444288
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004924272818455366,
      "loss": 2.1647,
      "theoretical_loss": 4.931400036288343,
      "tokens_seen": 82509824
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004924172517552658,
      "loss": 2.1041,
      "theoretical_loss": 4.930845647132097,
      "tokens_seen": 82575360
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000492407221664995,
      "loss": 2.113,
      "theoretical_loss": 4.9302918208789634,
      "tokens_seen": 82640896
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923971915747242,
      "loss": 2.2273,
      "theoretical_loss": 4.929738556511681,
      "tokens_seen": 82706432
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923871614844534,
      "loss": 2.1854,
      "theoretical_loss": 4.929185853015629,
      "tokens_seen": 82771968
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923771313941825,
      "loss": 2.245,
      "theoretical_loss": 4.928633709378822,
      "tokens_seen": 82837504
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923671013039117,
      "loss": 2.1562,
      "theoretical_loss": 4.9280821245918975,
      "tokens_seen": 82903040
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923570712136409,
      "loss": 2.1155,
      "theoretical_loss": 4.92753109764811,
      "tokens_seen": 82968576
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923470411233702,
      "loss": 2.1415,
      "theoretical_loss": 4.92698062754332,
      "tokens_seen": 83034112
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923370110330993,
      "loss": 2.1494,
      "theoretical_loss": 4.9264307132759875,
      "tokens_seen": 83099648
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923269809428286,
      "loss": 2.137,
      "theoretical_loss": 4.92588135384716,
      "tokens_seen": 83165184
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923169508525576,
      "loss": 2.1065,
      "theoretical_loss": 4.925332548260469,
      "tokens_seen": 83230720
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004923069207622869,
      "loss": 2.1001,
      "theoretical_loss": 4.924784295522113,
      "tokens_seen": 83296256
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922968906720161,
      "loss": 2.2214,
      "theoretical_loss": 4.92423659464086,
      "tokens_seen": 83361792
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922868605817453,
      "loss": 2.0789,
      "theoretical_loss": 4.923689444628027,
      "tokens_seen": 83427328
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922768304914745,
      "loss": 2.1223,
      "theoretical_loss": 4.923142844497482,
      "tokens_seen": 83492864
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922668004012036,
      "loss": 2.0865,
      "theoretical_loss": 4.922596793265625,
      "tokens_seen": 83558400
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922567703109328,
      "loss": 2.0759,
      "theoretical_loss": 4.922051289951391,
      "tokens_seen": 83623936
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000492246740220662,
      "loss": 1.9821,
      "theoretical_loss": 4.921506333576232,
      "tokens_seen": 83689472
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922367101303912,
      "loss": 2.1117,
      "theoretical_loss": 4.920961923164114,
      "tokens_seen": 83755008
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922266800401204,
      "loss": 2.0669,
      "theoretical_loss": 4.920418057741504,
      "tokens_seen": 83820544
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922166499498495,
      "loss": 2.1313,
      "theoretical_loss": 4.919874736337368,
      "tokens_seen": 83886080
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004922066198595787,
      "loss": 2.047,
      "theoretical_loss": 4.9193319579831565,
      "tokens_seen": 83951616
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921965897693079,
      "loss": 2.1772,
      "theoretical_loss": 4.918789721712799,
      "tokens_seen": 84017152
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921865596790371,
      "loss": 2.1644,
      "theoretical_loss": 4.918248026562697,
      "tokens_seen": 84082688
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921765295887663,
      "loss": 2.1082,
      "theoretical_loss": 4.917706871571712,
      "tokens_seen": 84148224
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921664994984956,
      "loss": 2.1325,
      "theoretical_loss": 4.9171662557811615,
      "tokens_seen": 84213760
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921564694082246,
      "loss": 2.057,
      "theoretical_loss": 4.916626178234807,
      "tokens_seen": 84279296
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921464393179539,
      "loss": 2.1765,
      "theoretical_loss": 4.916086637978851,
      "tokens_seen": 84344832
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000492136409227683,
      "loss": 2.1234,
      "theoretical_loss": 4.915547634061921,
      "tokens_seen": 84410368
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921263791374123,
      "loss": 2.1376,
      "theoretical_loss": 4.91500916553507,
      "tokens_seen": 84475904
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921163490471415,
      "loss": 2.1241,
      "theoretical_loss": 4.914471231451762,
      "tokens_seen": 84541440
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004921063189568706,
      "loss": 1.9284,
      "theoretical_loss": 4.913933830867868,
      "tokens_seen": 84606976
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920962888665998,
      "loss": 2.0327,
      "theoretical_loss": 4.913396962841655,
      "tokens_seen": 84672512
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000492086258776329,
      "loss": 2.3124,
      "theoretical_loss": 4.9128606264337815,
      "tokens_seen": 84738048
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920762286860582,
      "loss": 2.1292,
      "theoretical_loss": 4.912324820707285,
      "tokens_seen": 84803584
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920661985957874,
      "loss": 2.1295,
      "theoretical_loss": 4.911789544727581,
      "tokens_seen": 84869120
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920561685055166,
      "loss": 2.052,
      "theoretical_loss": 4.911254797562448,
      "tokens_seen": 84934656
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920461384152457,
      "loss": 2.1822,
      "theoretical_loss": 4.910720578282021,
      "tokens_seen": 85000192
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920361083249749,
      "loss": 2.1352,
      "theoretical_loss": 4.91018688595879,
      "tokens_seen": 85065728
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920260782347041,
      "loss": 2.1774,
      "theoretical_loss": 4.909653719667584,
      "tokens_seen": 85131264
    },
    {
      "epoch": 0.03,
      "objective/train/docs_used": 35040,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 2.1233792304992676,
      "objective/train/theoretical_loss": 4.909121078485567,
      "objective/train/tokens_used": 105656800,
      "theoretical_loss": 4.909121078485567,
      "tokens_seen": 85196800
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920160481444333,
      "loss": 2.1234,
      "theoretical_loss": 4.909121078485567,
      "tokens_seen": 85196800
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004920060180541625,
      "loss": 2.1247,
      "theoretical_loss": 4.908588961492235,
      "tokens_seen": 85262336
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919959879638916,
      "loss": 2.1604,
      "theoretical_loss": 4.908057367769396,
      "tokens_seen": 85327872
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919859578736209,
      "loss": 2.0862,
      "theoretical_loss": 4.907526296401175,
      "tokens_seen": 85393408
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00049197592778335,
      "loss": 2.0173,
      "theoretical_loss": 4.906995746474001,
      "tokens_seen": 85458944
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919658976930793,
      "loss": 2.0216,
      "theoretical_loss": 4.9064657170766,
      "tokens_seen": 85524480
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919558676028084,
      "loss": 2.096,
      "theoretical_loss": 4.905936207299984,
      "tokens_seen": 85590016
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919458375125377,
      "loss": 2.1131,
      "theoretical_loss": 4.90540721623745,
      "tokens_seen": 85655552
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919358074222668,
      "loss": 2.1259,
      "theoretical_loss": 4.904878742984569,
      "tokens_seen": 85721088
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491925777331996,
      "loss": 1.9873,
      "theoretical_loss": 4.904350786639178,
      "tokens_seen": 85786624
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919157472417252,
      "loss": 2.188,
      "theoretical_loss": 4.903823346301374,
      "tokens_seen": 85852160
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004919057171514544,
      "loss": 2.0489,
      "theoretical_loss": 4.903296421073506,
      "tokens_seen": 85917696
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918956870611836,
      "loss": 1.9965,
      "theoretical_loss": 4.902770010060166,
      "tokens_seen": 85983232
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918856569709127,
      "loss": 1.941,
      "theoretical_loss": 4.902244112368188,
      "tokens_seen": 86048768
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918756268806419,
      "loss": 2.2463,
      "theoretical_loss": 4.901718727106631,
      "tokens_seen": 86114304
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918655967903711,
      "loss": 2.0415,
      "theoretical_loss": 4.90119385338678,
      "tokens_seen": 86179840
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918555667001003,
      "loss": 2.0044,
      "theoretical_loss": 4.900669490322134,
      "tokens_seen": 86245376
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918455366098295,
      "loss": 2.0793,
      "theoretical_loss": 4.900145637028402,
      "tokens_seen": 86310912
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918355065195586,
      "loss": 2.0977,
      "theoretical_loss": 4.899622292623493,
      "tokens_seen": 86376448
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918254764292878,
      "loss": 2.0806,
      "theoretical_loss": 4.8990994562275105,
      "tokens_seen": 86441984
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491815446339017,
      "loss": 2.1675,
      "theoretical_loss": 4.898577126962746,
      "tokens_seen": 86507520
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004918054162487463,
      "loss": 2.0425,
      "theoretical_loss": 4.898055303953669,
      "tokens_seen": 86573056
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917953861584754,
      "loss": 2.1296,
      "theoretical_loss": 4.897533986326922,
      "tokens_seen": 86638592
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917853560682047,
      "loss": 1.9654,
      "theoretical_loss": 4.897013173211316,
      "tokens_seen": 86704128
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917753259779337,
      "loss": 2.1258,
      "theoretical_loss": 4.896492863737818,
      "tokens_seen": 86769664
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491765295887663,
      "loss": 2.1427,
      "theoretical_loss": 4.895973057039548,
      "tokens_seen": 86835200
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917552657973922,
      "loss": 2.1031,
      "theoretical_loss": 4.89545375225177,
      "tokens_seen": 86900736
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917452357071214,
      "loss": 2.0335,
      "theoretical_loss": 4.894934948511889,
      "tokens_seen": 86966272
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917352056168506,
      "loss": 2.1119,
      "theoretical_loss": 4.894416644959437,
      "tokens_seen": 87031808
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917251755265797,
      "loss": 2.0974,
      "theoretical_loss": 4.893898840736071,
      "tokens_seen": 87097344
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917151454363089,
      "loss": 2.0003,
      "theoretical_loss": 4.8933815349855685,
      "tokens_seen": 87162880
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004917051153460381,
      "loss": 2.1434,
      "theoretical_loss": 4.892864726853814,
      "tokens_seen": 87228416
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916950852557673,
      "loss": 1.9951,
      "theoretical_loss": 4.892348415488799,
      "tokens_seen": 87293952
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916850551654965,
      "loss": 1.9451,
      "theoretical_loss": 4.891832600040609,
      "tokens_seen": 87359488
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916750250752258,
      "loss": 1.9834,
      "theoretical_loss": 4.891317279661422,
      "tokens_seen": 87425024
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916649949849548,
      "loss": 2.0154,
      "theoretical_loss": 4.890802453505498,
      "tokens_seen": 87490560
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916549648946841,
      "loss": 2.1385,
      "theoretical_loss": 4.890288120729174,
      "tokens_seen": 87556096
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916449348044132,
      "loss": 2.1864,
      "theoretical_loss": 4.88977428049086,
      "tokens_seen": 87621632
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916349047141425,
      "loss": 2.0317,
      "theoretical_loss": 4.889260931951026,
      "tokens_seen": 87687168
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916248746238717,
      "loss": 1.9711,
      "theoretical_loss": 4.888748074272201,
      "tokens_seen": 87752704
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004916148445336008,
      "loss": 1.9968,
      "theoretical_loss": 4.888235706618964,
      "tokens_seen": 87818240
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00049160481444333,
      "loss": 2.1577,
      "theoretical_loss": 4.887723828157939,
      "tokens_seen": 87883776
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915947843530592,
      "loss": 2.0515,
      "theoretical_loss": 4.8872124380577855,
      "tokens_seen": 87949312
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915847542627884,
      "loss": 2.0695,
      "theoretical_loss": 4.886701535489195,
      "tokens_seen": 88014848
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915747241725176,
      "loss": 2.0003,
      "theoretical_loss": 4.886191119624883,
      "tokens_seen": 88080384
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915646940822468,
      "loss": 2.098,
      "theoretical_loss": 4.885681189639584,
      "tokens_seen": 88145920
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915546639919759,
      "loss": 1.9971,
      "theoretical_loss": 4.885171744710044,
      "tokens_seen": 88211456
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915446339017051,
      "loss": 2.0769,
      "theoretical_loss": 4.884662784015012,
      "tokens_seen": 88276992
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915346038114343,
      "loss": 2.022,
      "theoretical_loss": 4.884154306735239,
      "tokens_seen": 88342528
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915245737211635,
      "loss": 2.0248,
      "theoretical_loss": 4.8836463120534646,
      "tokens_seen": 88408064
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915145436308927,
      "loss": 2.096,
      "theoretical_loss": 4.88313879915442,
      "tokens_seen": 88473600
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004915045135406218,
      "loss": 2.1072,
      "theoretical_loss": 4.882631767224812,
      "tokens_seen": 88539136
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914944834503511,
      "loss": 2.0428,
      "theoretical_loss": 4.882125215453321,
      "tokens_seen": 88604672
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914844533600802,
      "loss": 2.1578,
      "theoretical_loss": 4.881619143030598,
      "tokens_seen": 88670208
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914744232698095,
      "loss": 2.041,
      "theoretical_loss": 4.8811135491492506,
      "tokens_seen": 88735744
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914643931795386,
      "loss": 1.9902,
      "theoretical_loss": 4.880608433003846,
      "tokens_seen": 88801280
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914543630892679,
      "loss": 2.1021,
      "theoretical_loss": 4.880103793790896,
      "tokens_seen": 88866816
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491444332998997,
      "loss": 2.0728,
      "theoretical_loss": 4.87959963070886,
      "tokens_seen": 88932352
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914343029087262,
      "loss": 2.1668,
      "theoretical_loss": 4.879095942958127,
      "tokens_seen": 88997888
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914242728184554,
      "loss": 1.9746,
      "theoretical_loss": 4.878592729741024,
      "tokens_seen": 89063424
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914142427281846,
      "loss": 2.1348,
      "theoretical_loss": 4.878089990261797,
      "tokens_seen": 89128960
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004914042126379138,
      "loss": 2.0672,
      "theoretical_loss": 4.87758772372661,
      "tokens_seen": 89194496
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913941825476429,
      "loss": 2.1625,
      "theoretical_loss": 4.877085929343544,
      "tokens_seen": 89260032
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913841524573721,
      "loss": 2.0199,
      "theoretical_loss": 4.876584606322583,
      "tokens_seen": 89325568
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913741223671013,
      "loss": 2.0882,
      "theoretical_loss": 4.8760837538756086,
      "tokens_seen": 89391104
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913640922768305,
      "loss": 2.1276,
      "theoretical_loss": 4.875583371216404,
      "tokens_seen": 89456640
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913540621865597,
      "loss": 2.0044,
      "theoretical_loss": 4.875083457560633,
      "tokens_seen": 89522176
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913440320962888,
      "loss": 2.1861,
      "theoretical_loss": 4.874584012125847,
      "tokens_seen": 89587712
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491334002006018,
      "loss": 2.0887,
      "theoretical_loss": 4.874085034131472,
      "tokens_seen": 89653248
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913239719157472,
      "loss": 2.0242,
      "theoretical_loss": 4.873586522798803,
      "tokens_seen": 89718784
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913139418254765,
      "loss": 1.9965,
      "theoretical_loss": 4.873088477351005,
      "tokens_seen": 89784320
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004913039117352056,
      "loss": 2.0792,
      "theoretical_loss": 4.8725908970130964,
      "tokens_seen": 89849856
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912938816449349,
      "loss": 1.9767,
      "theoretical_loss": 4.872093781011952,
      "tokens_seen": 89915392
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912838515546639,
      "loss": 2.112,
      "theoretical_loss": 4.871597128576292,
      "tokens_seen": 89980928
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912738214643932,
      "loss": 2.0955,
      "theoretical_loss": 4.8711009389366815,
      "tokens_seen": 90046464
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912637913741224,
      "loss": 2.027,
      "theoretical_loss": 4.870605211325517,
      "tokens_seen": 90112000
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912537612838516,
      "loss": 2.1244,
      "theoretical_loss": 4.870109944977029,
      "tokens_seen": 90177536
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912437311935808,
      "loss": 1.9717,
      "theoretical_loss": 4.869615139127273,
      "tokens_seen": 90243072
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00049123370110331,
      "loss": 2.0491,
      "theoretical_loss": 4.869120793014117,
      "tokens_seen": 90308608
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912236710130391,
      "loss": 2.1397,
      "theoretical_loss": 4.868626905877251,
      "tokens_seen": 90374144
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912136409227683,
      "loss": 2.0805,
      "theoretical_loss": 4.8681334769581674,
      "tokens_seen": 90439680
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004912036108324975,
      "loss": 2.2005,
      "theoretical_loss": 4.867640505500161,
      "tokens_seen": 90505216
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911935807422267,
      "loss": 2.111,
      "theoretical_loss": 4.8671479907483235,
      "tokens_seen": 90570752
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911835506519559,
      "loss": 2.2621,
      "theoretical_loss": 4.866655931949537,
      "tokens_seen": 90636288
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491173520561685,
      "loss": 2.0405,
      "theoretical_loss": 4.86616432835247,
      "tokens_seen": 90701824
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911634904714142,
      "loss": 2.1037,
      "theoretical_loss": 4.865673179207572,
      "tokens_seen": 90767360
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911534603811434,
      "loss": 2.0913,
      "theoretical_loss": 4.865182483767063,
      "tokens_seen": 90832896
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911434302908726,
      "loss": 2.1038,
      "theoretical_loss": 4.864692241284933,
      "tokens_seen": 90898432
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911334002006019,
      "loss": 1.9921,
      "theoretical_loss": 4.864202451016939,
      "tokens_seen": 90963968
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911233701103309,
      "loss": 2.0402,
      "theoretical_loss": 4.863713112220592,
      "tokens_seen": 91029504
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911133400200602,
      "loss": 2.1095,
      "theoretical_loss": 4.8632242241551555,
      "tokens_seen": 91095040
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004911033099297893,
      "loss": 1.9758,
      "theoretical_loss": 4.862735786081642,
      "tokens_seen": 91160576
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910932798395186,
      "loss": 2.0456,
      "theoretical_loss": 4.862247797262806,
      "tokens_seen": 91226112
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910832497492478,
      "loss": 2.019,
      "theoretical_loss": 4.861760256963136,
      "tokens_seen": 91291648
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491073219658977,
      "loss": 1.9634,
      "theoretical_loss": 4.861273164448854,
      "tokens_seen": 91357184
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910631895687061,
      "loss": 2.0588,
      "theoretical_loss": 4.860786518987906,
      "tokens_seen": 91422720
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910531594784353,
      "loss": 2.1448,
      "theoretical_loss": 4.86030031984996,
      "tokens_seen": 91488256
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910431293881645,
      "loss": 2.1286,
      "theoretical_loss": 4.859814566306397,
      "tokens_seen": 91553792
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910330992978937,
      "loss": 2.14,
      "theoretical_loss": 4.859329257630311,
      "tokens_seen": 91619328
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910230692076229,
      "loss": 2.0569,
      "theoretical_loss": 4.858844393096497,
      "tokens_seen": 91684864
    },
    {
      "epoch": 0.03,
      "objective/train/docs_used": 37311,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.9995617866516113,
      "objective/train/theoretical_loss": 4.858359971981454,
      "objective/train/tokens_used": 112210400,
      "theoretical_loss": 4.858359971981454,
      "tokens_seen": 91750400
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000491013039117352,
      "loss": 1.9996,
      "theoretical_loss": 4.858359971981454,
      "tokens_seen": 91750400
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004910030090270812,
      "loss": 2.0487,
      "theoretical_loss": 4.85787599356337,
      "tokens_seen": 91815936
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909929789368104,
      "loss": 2.1417,
      "theoretical_loss": 4.857392457122128,
      "tokens_seen": 91881472
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909829488465397,
      "loss": 2.0129,
      "theoretical_loss": 4.856909361939288,
      "tokens_seen": 91947008
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909729187562688,
      "loss": 2.1536,
      "theoretical_loss": 4.856426707298096,
      "tokens_seen": 92012544
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909628886659981,
      "loss": 2.1186,
      "theoretical_loss": 4.8559444924834665,
      "tokens_seen": 92078080
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909528585757272,
      "loss": 2.0145,
      "theoretical_loss": 4.855462716781985,
      "tokens_seen": 92143616
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909428284854564,
      "loss": 2.0809,
      "theoretical_loss": 4.854981379481901,
      "tokens_seen": 92209152
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909327983951856,
      "loss": 2.0199,
      "theoretical_loss": 4.854500479873119,
      "tokens_seen": 92274688
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909227683049148,
      "loss": 2.1202,
      "theoretical_loss": 4.854020017247203,
      "tokens_seen": 92340224
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490912738214644,
      "loss": 2.0001,
      "theoretical_loss": 4.853539990897358,
      "tokens_seen": 92405760
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004909027081243731,
      "loss": 2.0039,
      "theoretical_loss": 4.85306040011844,
      "tokens_seen": 92471296
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908926780341023,
      "loss": 2.1424,
      "theoretical_loss": 4.852581244206938,
      "tokens_seen": 92536832
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908826479438315,
      "loss": 1.9771,
      "theoretical_loss": 4.852102522460975,
      "tokens_seen": 92602368
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908726178535607,
      "loss": 2.1384,
      "theoretical_loss": 4.851624234180306,
      "tokens_seen": 92667904
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908625877632899,
      "loss": 2.0786,
      "theoretical_loss": 4.851146378666305,
      "tokens_seen": 92733440
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490852557673019,
      "loss": 2.1322,
      "theoretical_loss": 4.85066895522197,
      "tokens_seen": 92798976
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908425275827482,
      "loss": 2.1345,
      "theoretical_loss": 4.850191963151908,
      "tokens_seen": 92864512
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908324974924774,
      "loss": 2.0784,
      "theoretical_loss": 4.849715401762337,
      "tokens_seen": 92930048
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908224674022067,
      "loss": 2.1312,
      "theoretical_loss": 4.849239270361078,
      "tokens_seen": 92995584
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908124373119358,
      "loss": 2.0069,
      "theoretical_loss": 4.848763568257554,
      "tokens_seen": 93061120
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004908024072216651,
      "loss": 2.2564,
      "theoretical_loss": 4.848288294762779,
      "tokens_seen": 93126656
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907923771313941,
      "loss": 1.9697,
      "theoretical_loss": 4.847813449189358,
      "tokens_seen": 93192192
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907823470411234,
      "loss": 1.9511,
      "theoretical_loss": 4.847339030851482,
      "tokens_seen": 93257728
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907723169508526,
      "loss": 2.0402,
      "theoretical_loss": 4.84686503906492,
      "tokens_seen": 93323264
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907622868605818,
      "loss": 2.0508,
      "theoretical_loss": 4.846391473147019,
      "tokens_seen": 93388800
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490752256770311,
      "loss": 2.0351,
      "theoretical_loss": 4.8459183324166935,
      "tokens_seen": 93454336
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907422266800401,
      "loss": 2.0357,
      "theoretical_loss": 4.845445616194426,
      "tokens_seen": 93519872
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907321965897693,
      "loss": 2.0859,
      "theoretical_loss": 4.844973323802259,
      "tokens_seen": 93585408
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907221664994985,
      "loss": 2.0011,
      "theoretical_loss": 4.844501454563792,
      "tokens_seen": 93650944
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907121364092277,
      "loss": 1.9337,
      "theoretical_loss": 4.844030007804177,
      "tokens_seen": 93716480
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004907021063189569,
      "loss": 1.9603,
      "theoretical_loss": 4.843558982850113,
      "tokens_seen": 93782016
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490692076228686,
      "loss": 1.9579,
      "theoretical_loss": 4.84308837902984,
      "tokens_seen": 93847552
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906820461384152,
      "loss": 2.0262,
      "theoretical_loss": 4.842618195673138,
      "tokens_seen": 93913088
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906720160481444,
      "loss": 2.0647,
      "theoretical_loss": 4.84214843211132,
      "tokens_seen": 93978624
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906619859578736,
      "loss": 1.9281,
      "theoretical_loss": 4.841679087677226,
      "tokens_seen": 94044160
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906519558676028,
      "loss": 1.9502,
      "theoretical_loss": 4.841210161705223,
      "tokens_seen": 94109696
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906419257773321,
      "loss": 2.0093,
      "theoretical_loss": 4.840741653531195,
      "tokens_seen": 94175232
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906318956870611,
      "loss": 2.0562,
      "theoretical_loss": 4.840273562492545,
      "tokens_seen": 94240768
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906218655967904,
      "loss": 2.0915,
      "theoretical_loss": 4.839805887928181,
      "tokens_seen": 94306304
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906118355065195,
      "loss": 1.9565,
      "theoretical_loss": 4.839338629178522,
      "tokens_seen": 94371840
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004906018054162488,
      "loss": 2.1175,
      "theoretical_loss": 4.8388717855854875,
      "tokens_seen": 94437376
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490591775325978,
      "loss": 2.0234,
      "theoretical_loss": 4.838405356492494,
      "tokens_seen": 94502912
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905817452357072,
      "loss": 2.0031,
      "theoretical_loss": 4.83793934124445,
      "tokens_seen": 94568448
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905717151454363,
      "loss": 1.9908,
      "theoretical_loss": 4.837473739187754,
      "tokens_seen": 94633984
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905616850551655,
      "loss": 1.991,
      "theoretical_loss": 4.837008549670285,
      "tokens_seen": 94699520
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905516549648947,
      "loss": 2.1917,
      "theoretical_loss": 4.8365437720414075,
      "tokens_seen": 94765056
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905416248746239,
      "loss": 2.0002,
      "theoretical_loss": 4.836079405651956,
      "tokens_seen": 94830592
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905315947843531,
      "loss": 2.0427,
      "theoretical_loss": 4.835615449854238,
      "tokens_seen": 94896128
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905215646940822,
      "loss": 1.9388,
      "theoretical_loss": 4.8351519040020285,
      "tokens_seen": 94961664
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905115346038114,
      "loss": 2.0192,
      "theoretical_loss": 4.834688767450562,
      "tokens_seen": 95027200
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004905015045135406,
      "loss": 2.1357,
      "theoretical_loss": 4.8342260395565315,
      "tokens_seen": 95092736
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904914744232698,
      "loss": 1.9765,
      "theoretical_loss": 4.833763719678085,
      "tokens_seen": 95158272
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490481444332999,
      "loss": 1.9804,
      "theoretical_loss": 4.833301807174822,
      "tokens_seen": 95223808
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904714142427281,
      "loss": 1.965,
      "theoretical_loss": 4.83284030140778,
      "tokens_seen": 95289344
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904613841524574,
      "loss": 1.9206,
      "theoretical_loss": 4.832379201739442,
      "tokens_seen": 95354880
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904513540621865,
      "loss": 2.0361,
      "theoretical_loss": 4.831918507533728,
      "tokens_seen": 95420416
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904413239719158,
      "loss": 1.9951,
      "theoretical_loss": 4.831458218155989,
      "tokens_seen": 95485952
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904312938816449,
      "loss": 2.0652,
      "theoretical_loss": 4.830998332973005,
      "tokens_seen": 95551488
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904212637913742,
      "loss": 2.0869,
      "theoretical_loss": 4.830538851352976,
      "tokens_seen": 95617024
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904112337011033,
      "loss": 2.053,
      "theoretical_loss": 4.830079772665529,
      "tokens_seen": 95682560
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004904012036108325,
      "loss": 2.0737,
      "theoretical_loss": 4.829621096281702,
      "tokens_seen": 95748096
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903911735205617,
      "loss": 1.9785,
      "theoretical_loss": 4.8291628215739415,
      "tokens_seen": 95813632
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903811434302909,
      "loss": 2.0013,
      "theoretical_loss": 4.828704947916108,
      "tokens_seen": 95879168
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903711133400201,
      "loss": 1.9579,
      "theoretical_loss": 4.82824747468346,
      "tokens_seen": 95944704
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903610832497492,
      "loss": 2.0115,
      "theoretical_loss": 4.827790401252658,
      "tokens_seen": 96010240
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903510531594784,
      "loss": 2.0094,
      "theoretical_loss": 4.827333727001756,
      "tokens_seen": 96075776
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903410230692076,
      "loss": 1.9302,
      "theoretical_loss": 4.8268774513101995,
      "tokens_seen": 96141312
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903309929789368,
      "loss": 2.0819,
      "theoretical_loss": 4.82642157355882,
      "tokens_seen": 96206848
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490320962888666,
      "loss": 2.1995,
      "theoretical_loss": 4.825966093129834,
      "tokens_seen": 96272384
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903109327983952,
      "loss": 1.8997,
      "theoretical_loss": 4.825511009406833,
      "tokens_seen": 96337920
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004903009027081243,
      "loss": 2.0196,
      "theoretical_loss": 4.825056321774788,
      "tokens_seen": 96403456
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902908726178535,
      "loss": 2.1222,
      "theoretical_loss": 4.8246020296200385,
      "tokens_seen": 96468992
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902808425275828,
      "loss": 1.8181,
      "theoretical_loss": 4.82414813233029,
      "tokens_seen": 96534528
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902708124373119,
      "loss": 1.9756,
      "theoretical_loss": 4.823694629294609,
      "tokens_seen": 96600064
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902607823470412,
      "loss": 2.0206,
      "theoretical_loss": 4.823241519903428,
      "tokens_seen": 96665600
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902507522567703,
      "loss": 1.972,
      "theoretical_loss": 4.8227888035485265,
      "tokens_seen": 96731136
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902407221664995,
      "loss": 2.0247,
      "theoretical_loss": 4.82233647962304,
      "tokens_seen": 96796672
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902306920762287,
      "loss": 2.0095,
      "theoretical_loss": 4.821884547521449,
      "tokens_seen": 96862208
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902206619859579,
      "loss": 2.0983,
      "theoretical_loss": 4.821433006639578,
      "tokens_seen": 96927744
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902106318956871,
      "loss": 1.9334,
      "theoretical_loss": 4.820981856374589,
      "tokens_seen": 96993280
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004902006018054163,
      "loss": 1.9602,
      "theoretical_loss": 4.8205310961249825,
      "tokens_seen": 97058816
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901905717151454,
      "loss": 2.0275,
      "theoretical_loss": 4.820080725290589,
      "tokens_seen": 97124352
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901805416248746,
      "loss": 1.9761,
      "theoretical_loss": 4.819630743272566,
      "tokens_seen": 97189888
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901705115346038,
      "loss": 1.9131,
      "theoretical_loss": 4.819181149473396,
      "tokens_seen": 97255424
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490160481444333,
      "loss": 2.0049,
      "theoretical_loss": 4.81873194329688,
      "tokens_seen": 97320960
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901504513540623,
      "loss": 2.0965,
      "theoretical_loss": 4.81828312414814,
      "tokens_seen": 97386496
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901404212637913,
      "loss": 1.9166,
      "theoretical_loss": 4.817834691433602,
      "tokens_seen": 97452032
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901303911735206,
      "loss": 2.0326,
      "theoretical_loss": 4.81738664456101,
      "tokens_seen": 97517568
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901203610832497,
      "loss": 2.0102,
      "theoretical_loss": 4.816938982939407,
      "tokens_seen": 97583104
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000490110330992979,
      "loss": 1.9796,
      "theoretical_loss": 4.816491705979138,
      "tokens_seen": 97648640
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004901003009027082,
      "loss": 1.9084,
      "theoretical_loss": 4.816044813091848,
      "tokens_seen": 97714176
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900902708124374,
      "loss": 2.0316,
      "theoretical_loss": 4.815598303690473,
      "tokens_seen": 97779712
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900802407221665,
      "loss": 2.0136,
      "theoretical_loss": 4.8151521771892405,
      "tokens_seen": 97845248
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900702106318957,
      "loss": 2.0799,
      "theoretical_loss": 4.814706433003665,
      "tokens_seen": 97910784
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900601805416249,
      "loss": 1.9634,
      "theoretical_loss": 4.8142610705505415,
      "tokens_seen": 97976320
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900501504513541,
      "loss": 2.0644,
      "theoretical_loss": 4.813816089247945,
      "tokens_seen": 98041856
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900401203610833,
      "loss": 1.9693,
      "theoretical_loss": 4.813371488515227,
      "tokens_seen": 98107392
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900300902708124,
      "loss": 1.9867,
      "theoretical_loss": 4.812927267773008,
      "tokens_seen": 98172928
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900200601805416,
      "loss": 1.98,
      "theoretical_loss": 4.812483426443181,
      "tokens_seen": 98238464
    },
    {
      "epoch": 0.03,
      "objective/train/docs_used": 39367,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.9390530586242676,
      "objective/train/theoretical_loss": 4.812039963948898,
      "objective/train/tokens_used": 118764000,
      "theoretical_loss": 4.812039963948898,
      "tokens_seen": 98304000
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004900100300902708,
      "loss": 1.9391,
      "theoretical_loss": 4.812039963948898,
      "tokens_seen": 98304000
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00049,
      "loss": 1.8742,
      "theoretical_loss": 4.811596879714575,
      "tokens_seen": 98369536
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899899699097292,
      "loss": 2.0593,
      "theoretical_loss": 4.811154173165886,
      "tokens_seen": 98435072
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899799398194583,
      "loss": 2.0749,
      "theoretical_loss": 4.810711843729758,
      "tokens_seen": 98500608
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899699097291876,
      "loss": 1.8922,
      "theoretical_loss": 4.810269890834364,
      "tokens_seen": 98566144
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899598796389167,
      "loss": 2.0376,
      "theoretical_loss": 4.809828313909129,
      "tokens_seen": 98631680
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489949849548646,
      "loss": 1.969,
      "theoretical_loss": 4.809387112384721,
      "tokens_seen": 98697216
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899398194583751,
      "loss": 2.0255,
      "theoretical_loss": 4.808946285693043,
      "tokens_seen": 98762752
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899297893681044,
      "loss": 1.9935,
      "theoretical_loss": 4.808505833267237,
      "tokens_seen": 98828288
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899197592778335,
      "loss": 2.073,
      "theoretical_loss": 4.808065754541676,
      "tokens_seen": 98893824
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004899097291875627,
      "loss": 2.004,
      "theoretical_loss": 4.807626048951965,
      "tokens_seen": 98959360
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898996990972919,
      "loss": 2.0435,
      "theoretical_loss": 4.807186715934931,
      "tokens_seen": 99024896
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898896690070211,
      "loss": 1.9631,
      "theoretical_loss": 4.806747754928622,
      "tokens_seen": 99090432
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898796389167503,
      "loss": 1.8743,
      "theoretical_loss": 4.806309165372311,
      "tokens_seen": 99155968
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898696088264794,
      "loss": 1.8929,
      "theoretical_loss": 4.805870946706479,
      "tokens_seen": 99221504
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898595787362086,
      "loss": 2.0986,
      "theoretical_loss": 4.805433098372822,
      "tokens_seen": 99287040
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898495486459378,
      "loss": 1.9697,
      "theoretical_loss": 4.8049956198142425,
      "tokens_seen": 99352576
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489839518555667,
      "loss": 2.0133,
      "theoretical_loss": 4.804558510474852,
      "tokens_seen": 99418112
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898294884653962,
      "loss": 2.0534,
      "theoretical_loss": 4.804121769799959,
      "tokens_seen": 99483648
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898194583751254,
      "loss": 2.1085,
      "theoretical_loss": 4.8036853972360705,
      "tokens_seen": 99549184
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004898094282848545,
      "loss": 2.054,
      "theoretical_loss": 4.80324939223089,
      "tokens_seen": 99614720
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897993981945837,
      "loss": 2.0756,
      "theoretical_loss": 4.802813754233311,
      "tokens_seen": 99680256
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489789368104313,
      "loss": 1.9673,
      "theoretical_loss": 4.802378482693417,
      "tokens_seen": 99745792
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897793380140421,
      "loss": 2.0998,
      "theoretical_loss": 4.801943577062472,
      "tokens_seen": 99811328
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897693079237714,
      "loss": 2.0359,
      "theoretical_loss": 4.801509036792925,
      "tokens_seen": 99876864
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897592778335005,
      "loss": 2.0676,
      "theoretical_loss": 4.801074861338401,
      "tokens_seen": 99942400
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897492477432297,
      "loss": 2.0502,
      "theoretical_loss": 4.800641050153703,
      "tokens_seen": 100007936
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897392176529589,
      "loss": 1.938,
      "theoretical_loss": 4.800207602694801,
      "tokens_seen": 100073472
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897291875626881,
      "loss": 1.9505,
      "theoretical_loss": 4.7997745184188325,
      "tokens_seen": 100139008
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897191574724173,
      "loss": 2.0647,
      "theoretical_loss": 4.799341796784106,
      "tokens_seen": 100204544
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004897091273821465,
      "loss": 1.9867,
      "theoretical_loss": 4.798909437250086,
      "tokens_seen": 100270080
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896990972918756,
      "loss": 1.9599,
      "theoretical_loss": 4.798477439277397,
      "tokens_seen": 100335616
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896890672016048,
      "loss": 2.1037,
      "theoretical_loss": 4.7980458023278185,
      "tokens_seen": 100401152
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489679037111334,
      "loss": 2.0612,
      "theoretical_loss": 4.797614525864282,
      "tokens_seen": 100466688
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896690070210632,
      "loss": 2.0592,
      "theoretical_loss": 4.797183609350869,
      "tokens_seen": 100532224
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896589769307924,
      "loss": 1.8391,
      "theoretical_loss": 4.796753052252802,
      "tokens_seen": 100597760
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896489468405215,
      "loss": 2.0621,
      "theoretical_loss": 4.79632285403645,
      "tokens_seen": 100663296
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896389167502507,
      "loss": 1.943,
      "theoretical_loss": 4.795893014169323,
      "tokens_seen": 100728832
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896288866599799,
      "loss": 2.0364,
      "theoretical_loss": 4.795463532120058,
      "tokens_seen": 100794368
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896188565697091,
      "loss": 1.987,
      "theoretical_loss": 4.795034407358435,
      "tokens_seen": 100859904
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004896088264794384,
      "loss": 1.9827,
      "theoretical_loss": 4.794605639355357,
      "tokens_seen": 100925440
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895987963891674,
      "loss": 2.1293,
      "theoretical_loss": 4.794177227582855,
      "tokens_seen": 100990976
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895887662988967,
      "loss": 1.9927,
      "theoretical_loss": 4.793749171514085,
      "tokens_seen": 101056512
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895787362086259,
      "loss": 2.0081,
      "theoretical_loss": 4.793321470623321,
      "tokens_seen": 101122048
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895687061183551,
      "loss": 1.824,
      "theoretical_loss": 4.792894124385955,
      "tokens_seen": 101187584
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895586760280843,
      "loss": 1.9916,
      "theoretical_loss": 4.792467132278494,
      "tokens_seen": 101253120
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895486459378135,
      "loss": 1.87,
      "theoretical_loss": 4.792040493778553,
      "tokens_seen": 101318656
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895386158475426,
      "loss": 1.957,
      "theoretical_loss": 4.791614208364859,
      "tokens_seen": 101384192
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895285857572718,
      "loss": 2.045,
      "theoretical_loss": 4.791188275517239,
      "tokens_seen": 101449728
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489518555667001,
      "loss": 1.9424,
      "theoretical_loss": 4.7907626947166255,
      "tokens_seen": 101515264
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004895085255767302,
      "loss": 2.0361,
      "theoretical_loss": 4.790337465445049,
      "tokens_seen": 101580800
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894984954864594,
      "loss": 2.0644,
      "theoretical_loss": 4.7899125871856345,
      "tokens_seen": 101646336
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894884653961885,
      "loss": 2.0409,
      "theoretical_loss": 4.789488059422599,
      "tokens_seen": 101711872
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894784353059178,
      "loss": 2.0091,
      "theoretical_loss": 4.789063881641251,
      "tokens_seen": 101777408
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894684052156469,
      "loss": 2.0709,
      "theoretical_loss": 4.7886400533279865,
      "tokens_seen": 101842944
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894583751253762,
      "loss": 1.9995,
      "theoretical_loss": 4.788216573970281,
      "tokens_seen": 101908480
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894483450351053,
      "loss": 2.0221,
      "theoretical_loss": 4.787793443056694,
      "tokens_seen": 101974016
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894383149448346,
      "loss": 1.9002,
      "theoretical_loss": 4.787370660076862,
      "tokens_seen": 102039552
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894282848545637,
      "loss": 1.9934,
      "theoretical_loss": 4.786948224521495,
      "tokens_seen": 102105088
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894182547642929,
      "loss": 1.9146,
      "theoretical_loss": 4.786526135882378,
      "tokens_seen": 102170624
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004894082246740221,
      "loss": 1.8959,
      "theoretical_loss": 4.786104393652359,
      "tokens_seen": 102236160
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893981945837513,
      "loss": 1.9353,
      "theoretical_loss": 4.785682997325358,
      "tokens_seen": 102301696
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893881644934805,
      "loss": 1.8316,
      "theoretical_loss": 4.7852619463963535,
      "tokens_seen": 102367232
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893781344032096,
      "loss": 1.9414,
      "theoretical_loss": 4.784841240361389,
      "tokens_seen": 102432768
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893681043129388,
      "loss": 1.8898,
      "theoretical_loss": 4.784420878717558,
      "tokens_seen": 102498304
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489358074222668,
      "loss": 1.9671,
      "theoretical_loss": 4.7840008609630145,
      "tokens_seen": 102563840
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893480441323972,
      "loss": 1.9324,
      "theoretical_loss": 4.783581186596962,
      "tokens_seen": 102629376
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893380140421264,
      "loss": 2.019,
      "theoretical_loss": 4.78316185511965,
      "tokens_seen": 102694912
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893279839518556,
      "loss": 2.0515,
      "theoretical_loss": 4.782742866032379,
      "tokens_seen": 102760448
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893179538615847,
      "loss": 1.9997,
      "theoretical_loss": 4.782324218837486,
      "tokens_seen": 102825984
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004893079237713139,
      "loss": 1.9576,
      "theoretical_loss": 4.781905913038351,
      "tokens_seen": 102891520
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892978936810432,
      "loss": 1.9689,
      "theoretical_loss": 4.781487948139393,
      "tokens_seen": 102957056
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892878635907723,
      "loss": 1.8418,
      "theoretical_loss": 4.7810703236460625,
      "tokens_seen": 103022592
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892778335005016,
      "loss": 1.9675,
      "theoretical_loss": 4.780653039064843,
      "tokens_seen": 103088128
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892678034102307,
      "loss": 1.9622,
      "theoretical_loss": 4.780236093903245,
      "tokens_seen": 103153664
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892577733199599,
      "loss": 1.9644,
      "theoretical_loss": 4.779819487669805,
      "tokens_seen": 103219200
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892477432296891,
      "loss": 1.9448,
      "theoretical_loss": 4.779403219874085,
      "tokens_seen": 103284736
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892377131394183,
      "loss": 1.9252,
      "theoretical_loss": 4.778987290026665,
      "tokens_seen": 103350272
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892276830491475,
      "loss": 2.0622,
      "theoretical_loss": 4.778571697639142,
      "tokens_seen": 103415808
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892176529588767,
      "loss": 1.9658,
      "theoretical_loss": 4.778156442224132,
      "tokens_seen": 103481344
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004892076228686058,
      "loss": 1.9222,
      "theoretical_loss": 4.7777415232952585,
      "tokens_seen": 103546880
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489197592778335,
      "loss": 2.0588,
      "theoretical_loss": 4.777326940367155,
      "tokens_seen": 103612416
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891875626880642,
      "loss": 1.9882,
      "theoretical_loss": 4.776912692955463,
      "tokens_seen": 103677952
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891775325977934,
      "loss": 1.9161,
      "theoretical_loss": 4.776498780576826,
      "tokens_seen": 103743488
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891675025075226,
      "loss": 1.9563,
      "theoretical_loss": 4.776085202748893,
      "tokens_seen": 103809024
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891574724172517,
      "loss": 1.9099,
      "theoretical_loss": 4.775671958990305,
      "tokens_seen": 103874560
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891474423269809,
      "loss": 1.9497,
      "theoretical_loss": 4.775259048820702,
      "tokens_seen": 103940096
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891374122367101,
      "loss": 2.0207,
      "theoretical_loss": 4.7748464717607195,
      "tokens_seen": 104005632
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891273821464393,
      "loss": 1.8974,
      "theoretical_loss": 4.774434227331979,
      "tokens_seen": 104071168
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891173520561686,
      "loss": 1.9033,
      "theoretical_loss": 4.774022315057092,
      "tokens_seen": 104136704
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004891073219658976,
      "loss": 1.9784,
      "theoretical_loss": 4.773610734459654,
      "tokens_seen": 104202240
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890972918756269,
      "loss": 1.9077,
      "theoretical_loss": 4.773199485064243,
      "tokens_seen": 104267776
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890872617853561,
      "loss": 2.0249,
      "theoretical_loss": 4.772788566396418,
      "tokens_seen": 104333312
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890772316950853,
      "loss": 1.8958,
      "theoretical_loss": 4.772377977982714,
      "tokens_seen": 104398848
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890672016048145,
      "loss": 1.9854,
      "theoretical_loss": 4.771967719350641,
      "tokens_seen": 104464384
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890571715145437,
      "loss": 1.9168,
      "theoretical_loss": 4.77155779002868,
      "tokens_seen": 104529920
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890471414242728,
      "loss": 1.9704,
      "theoretical_loss": 4.771148189546282,
      "tokens_seen": 104595456
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000489037111334002,
      "loss": 1.9475,
      "theoretical_loss": 4.770738917433864,
      "tokens_seen": 104660992
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890270812437312,
      "loss": 1.978,
      "theoretical_loss": 4.770329973222809,
      "tokens_seen": 104726528
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890170511534604,
      "loss": 1.9856,
      "theoretical_loss": 4.769921356445458,
      "tokens_seen": 104792064
    },
    {
      "epoch": 0.03,
      "objective/train/docs_used": 41950,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.939455270767212,
      "objective/train/theoretical_loss": 4.769513066635114,
      "objective/train/tokens_used": 125317600,
      "theoretical_loss": 4.769513066635114,
      "tokens_seen": 104857600
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004890070210631896,
      "loss": 1.9395,
      "theoretical_loss": 4.769513066635114,
      "tokens_seen": 104857600
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889969909729187,
      "loss": 2.0015,
      "theoretical_loss": 4.769105103326036,
      "tokens_seen": 104923136
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889869608826479,
      "loss": 1.9566,
      "theoretical_loss": 4.768697466053435,
      "tokens_seen": 104988672
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889769307923771,
      "loss": 1.9899,
      "theoretical_loss": 4.768290154353474,
      "tokens_seen": 105054208
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889669007021063,
      "loss": 1.981,
      "theoretical_loss": 4.767883167763267,
      "tokens_seen": 105119744
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889568706118355,
      "loss": 1.9831,
      "theoretical_loss": 4.76747650582087,
      "tokens_seen": 105185280
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889468405215647,
      "loss": 1.9398,
      "theoretical_loss": 4.767070168065285,
      "tokens_seen": 105250816
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889368104312939,
      "loss": 2.1282,
      "theoretical_loss": 4.766664154036456,
      "tokens_seen": 105316352
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488926780341023,
      "loss": 1.9051,
      "theoretical_loss": 4.766258463275265,
      "tokens_seen": 105381888
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889167502507523,
      "loss": 1.9142,
      "theoretical_loss": 4.7658530953235285,
      "tokens_seen": 105447424
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004889067201604815,
      "loss": 1.9082,
      "theoretical_loss": 4.765448049723998,
      "tokens_seen": 105512960
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888966900702107,
      "loss": 1.9869,
      "theoretical_loss": 4.765043326020358,
      "tokens_seen": 105578496
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888866599799398,
      "loss": 2.0015,
      "theoretical_loss": 4.764638923757217,
      "tokens_seen": 105644032
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488876629889669,
      "loss": 1.8595,
      "theoretical_loss": 4.764234842480114,
      "tokens_seen": 105709568
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888665997993982,
      "loss": 1.9631,
      "theoretical_loss": 4.7638310817355105,
      "tokens_seen": 105775104
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888565697091274,
      "loss": 1.9487,
      "theoretical_loss": 4.763427641070789,
      "tokens_seen": 105840640
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888465396188566,
      "loss": 1.9081,
      "theoretical_loss": 4.76302452003425,
      "tokens_seen": 105906176
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888365095285858,
      "loss": 1.9737,
      "theoretical_loss": 4.7626217181751125,
      "tokens_seen": 105971712
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888264794383149,
      "loss": 2.0367,
      "theoretical_loss": 4.762219235043508,
      "tokens_seen": 106037248
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888164493480441,
      "loss": 1.9758,
      "theoretical_loss": 4.761817070190481,
      "tokens_seen": 106102784
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004888064192577733,
      "loss": 1.8977,
      "theoretical_loss": 4.761415223167982,
      "tokens_seen": 106168320
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004887963891675025,
      "loss": 2.0073,
      "theoretical_loss": 4.761013693528874,
      "tokens_seen": 106233856
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004887863590772317,
      "loss": 2.0818,
      "theoretical_loss": 4.760612480826917,
      "tokens_seen": 106299392
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488776328986961,
      "loss": 1.8585,
      "theoretical_loss": 4.76021158461678,
      "tokens_seen": 106364928
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048876629889669,
      "loss": 1.9823,
      "theoretical_loss": 4.759811004454027,
      "tokens_seen": 106430464
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004887562688064193,
      "loss": 2.0922,
      "theoretical_loss": 4.759410739895122,
      "tokens_seen": 106496000
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004887462387161484,
      "loss": 1.8748,
      "theoretical_loss": 4.759010790497422,
      "tokens_seen": 106561536
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004887362086258777,
      "loss": 2.1316,
      "theoretical_loss": 4.758611155819178,
      "tokens_seen": 106627072
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004887261785356069,
      "loss": 1.9492,
      "theoretical_loss": 4.758211835419531,
      "tokens_seen": 106692608
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488716148445336,
      "loss": 1.9544,
      "theoretical_loss": 4.757812828858508,
      "tokens_seen": 106758144
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004887061183550652,
      "loss": 1.8081,
      "theoretical_loss": 4.757414135697024,
      "tokens_seen": 106823680
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886960882647944,
      "loss": 1.9574,
      "theoretical_loss": 4.757015755496877,
      "tokens_seen": 106889216
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886860581745236,
      "loss": 1.9519,
      "theoretical_loss": 4.756617687820743,
      "tokens_seen": 106954752
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886760280842528,
      "loss": 1.9635,
      "theoretical_loss": 4.756219932232181,
      "tokens_seen": 107020288
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886659979939819,
      "loss": 1.8409,
      "theoretical_loss": 4.755822488295621,
      "tokens_seen": 107085824
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886559679037111,
      "loss": 1.9061,
      "theoretical_loss": 4.755425355576373,
      "tokens_seen": 107151360
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886459378134403,
      "loss": 1.9733,
      "theoretical_loss": 4.755028533640614,
      "tokens_seen": 107216896
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886359077231695,
      "loss": 2.0097,
      "theoretical_loss": 4.754632022055392,
      "tokens_seen": 107282432
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886258776328988,
      "loss": 1.8909,
      "theoretical_loss": 4.754235820388624,
      "tokens_seen": 107347968
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886158475426278,
      "loss": 2.0542,
      "theoretical_loss": 4.7538399282090875,
      "tokens_seen": 107413504
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004886058174523571,
      "loss": 1.8928,
      "theoretical_loss": 4.753444345086428,
      "tokens_seen": 107479040
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885957873620863,
      "loss": 1.8925,
      "theoretical_loss": 4.753049070591146,
      "tokens_seen": 107544576
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885857572718155,
      "loss": 1.8874,
      "theoretical_loss": 4.752654104294605,
      "tokens_seen": 107610112
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885757271815447,
      "loss": 1.8673,
      "theoretical_loss": 4.752259445769022,
      "tokens_seen": 107675648
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885656970912739,
      "loss": 1.9436,
      "theoretical_loss": 4.751865094587465,
      "tokens_seen": 107741184
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488555667001003,
      "loss": 1.875,
      "theoretical_loss": 4.75147105032386,
      "tokens_seen": 107806720
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885456369107322,
      "loss": 1.8484,
      "theoretical_loss": 4.751077312552976,
      "tokens_seen": 107872256
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885356068204614,
      "loss": 1.8976,
      "theoretical_loss": 4.750683880850433,
      "tokens_seen": 107937792
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885255767301906,
      "loss": 1.9501,
      "theoretical_loss": 4.750290754792694,
      "tokens_seen": 108003328
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004885155466399198,
      "loss": 2.0331,
      "theoretical_loss": 4.749897933957065,
      "tokens_seen": 108068864
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488505516549649,
      "loss": 2.0907,
      "theoretical_loss": 4.749505417921692,
      "tokens_seen": 108134400
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884954864593781,
      "loss": 1.8641,
      "theoretical_loss": 4.7491132062655605,
      "tokens_seen": 108199936
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884854563691073,
      "loss": 1.9954,
      "theoretical_loss": 4.748721298568491,
      "tokens_seen": 108265472
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884754262788365,
      "loss": 1.8518,
      "theoretical_loss": 4.748329694411137,
      "tokens_seen": 108331008
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884653961885657,
      "loss": 1.8827,
      "theoretical_loss": 4.747938393374987,
      "tokens_seen": 108396544
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884553660982949,
      "loss": 1.9275,
      "theoretical_loss": 4.747547395042355,
      "tokens_seen": 108462080
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884453360080241,
      "loss": 2.005,
      "theoretical_loss": 4.747156698996388,
      "tokens_seen": 108527616
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884353059177532,
      "loss": 1.9894,
      "theoretical_loss": 4.746766304821053,
      "tokens_seen": 108593152
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884252758274825,
      "loss": 1.9102,
      "theoretical_loss": 4.746376212101142,
      "tokens_seen": 108658688
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884152457372117,
      "loss": 1.9535,
      "theoretical_loss": 4.745986420422267,
      "tokens_seen": 108724224
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004884052156469409,
      "loss": 1.9021,
      "theoretical_loss": 4.745596929370863,
      "tokens_seen": 108789760
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048839518555667,
      "loss": 1.8553,
      "theoretical_loss": 4.745207738534177,
      "tokens_seen": 108855296
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883851554663992,
      "loss": 1.959,
      "theoretical_loss": 4.744818847500274,
      "tokens_seen": 108920832
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883751253761284,
      "loss": 1.8581,
      "theoretical_loss": 4.744430255858029,
      "tokens_seen": 108986368
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883650952858576,
      "loss": 2.0283,
      "theoretical_loss": 4.744041963197132,
      "tokens_seen": 109051904
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883550651955868,
      "loss": 1.8863,
      "theoretical_loss": 4.743653969108076,
      "tokens_seen": 109117440
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488345035105316,
      "loss": 1.9648,
      "theoretical_loss": 4.743266273182163,
      "tokens_seen": 109182976
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883350050150451,
      "loss": 1.8861,
      "theoretical_loss": 4.742878875011501,
      "tokens_seen": 109248512
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883249749247743,
      "loss": 2.0269,
      "theoretical_loss": 4.742491774188997,
      "tokens_seen": 109314048
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883149448345035,
      "loss": 1.9284,
      "theoretical_loss": 4.742104970308359,
      "tokens_seen": 109379584
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004883049147442327,
      "loss": 1.8513,
      "theoretical_loss": 4.741718462964095,
      "tokens_seen": 109445120
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004882948846539619,
      "loss": 2.0056,
      "theoretical_loss": 4.741332251751509,
      "tokens_seen": 109510656
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004882848545636911,
      "loss": 1.8808,
      "theoretical_loss": 4.740946336266697,
      "tokens_seen": 109576192
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004882748244734203,
      "loss": 2.0007,
      "theoretical_loss": 4.740560716106549,
      "tokens_seen": 109641728
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048826479438314946,
      "loss": 1.9326,
      "theoretical_loss": 4.740175390868742,
      "tokens_seen": 109707264
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048825476429287864,
      "loss": 1.8977,
      "theoretical_loss": 4.739790360151744,
      "tokens_seen": 109772800
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004882447342026078,
      "loss": 1.9338,
      "theoretical_loss": 4.73940562355481,
      "tokens_seen": 109838336
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488234704112337,
      "loss": 1.853,
      "theoretical_loss": 4.739021180677976,
      "tokens_seen": 109903872
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048822467402206624,
      "loss": 1.8793,
      "theoretical_loss": 4.73863703112206,
      "tokens_seen": 109969408
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048821464393179536,
      "loss": 1.8576,
      "theoretical_loss": 4.738253174488662,
      "tokens_seen": 110034944
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004882046138415246,
      "loss": 1.9319,
      "theoretical_loss": 4.73786961038016,
      "tokens_seen": 110100480
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004881945837512537,
      "loss": 1.8831,
      "theoretical_loss": 4.737486338399704,
      "tokens_seen": 110166016
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048818455366098296,
      "loss": 1.8807,
      "theoretical_loss": 4.737103358151225,
      "tokens_seen": 110231552
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048817452357071214,
      "loss": 1.8573,
      "theoretical_loss": 4.7367206692394195,
      "tokens_seen": 110297088
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004881644934804413,
      "loss": 1.8728,
      "theoretical_loss": 4.736338271269759,
      "tokens_seen": 110362624
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004881544633901705,
      "loss": 1.9958,
      "theoretical_loss": 4.735956163848478,
      "tokens_seen": 110428160
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048814443329989974,
      "loss": 1.9372,
      "theoretical_loss": 4.735574346582582,
      "tokens_seen": 110493696
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048813440320962887,
      "loss": 1.8903,
      "theoretical_loss": 4.735192819079838,
      "tokens_seen": 110559232
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004881243731193581,
      "loss": 1.9246,
      "theoretical_loss": 4.734811580948779,
      "tokens_seen": 110624768
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048811434302908723,
      "loss": 1.8653,
      "theoretical_loss": 4.734430631798692,
      "tokens_seen": 110690304
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048810431293881646,
      "loss": 1.817,
      "theoretical_loss": 4.734049971239628,
      "tokens_seen": 110755840
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048809428284854564,
      "loss": 2.0557,
      "theoretical_loss": 4.7336695988823925,
      "tokens_seen": 110821376
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004880842527582748,
      "loss": 1.9908,
      "theoretical_loss": 4.733289514338546,
      "tokens_seen": 110886912
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000488074222668004,
      "loss": 1.9495,
      "theoretical_loss": 4.7329097172204,
      "tokens_seen": 110952448
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004880641925777332,
      "loss": 1.9937,
      "theoretical_loss": 4.73253020714102,
      "tokens_seen": 111017984
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048805416248746237,
      "loss": 1.9273,
      "theoretical_loss": 4.732150983714217,
      "tokens_seen": 111083520
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004880441323971916,
      "loss": 1.9939,
      "theoretical_loss": 4.731772046554552,
      "tokens_seen": 111149056
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048803410230692073,
      "loss": 1.8339,
      "theoretical_loss": 4.731393395277331,
      "tokens_seen": 111214592
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048802407221664997,
      "loss": 1.7365,
      "theoretical_loss": 4.731015029498598,
      "tokens_seen": 111280128
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048801404212637915,
      "loss": 1.8778,
      "theoretical_loss": 4.730636948835148,
      "tokens_seen": 111345664
    },
    {
      "epoch": 0.03,
      "objective/train/docs_used": 43938,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.883754849433899,
      "objective/train/theoretical_loss": 4.730259152904507,
      "objective/train/tokens_used": 131871200,
      "theoretical_loss": 4.730259152904507,
      "tokens_seen": 111411200
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048800401203610833,
      "loss": 1.8838,
      "theoretical_loss": 4.730259152904507,
      "tokens_seen": 111411200
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004879939819458375,
      "loss": 1.9713,
      "theoretical_loss": 4.7298816413249405,
      "tokens_seen": 111476736
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004879839518555667,
      "loss": 1.9552,
      "theoretical_loss": 4.729504413715454,
      "tokens_seen": 111542272
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004879739217652959,
      "loss": 1.9043,
      "theoretical_loss": 4.729127469695783,
      "tokens_seen": 111607808
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004879638916750251,
      "loss": 1.9121,
      "theoretical_loss": 4.728750808886394,
      "tokens_seen": 111673344
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004879538615847543,
      "loss": 1.8055,
      "theoretical_loss": 4.72837443090849,
      "tokens_seen": 111738880
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048794383149448347,
      "loss": 1.9948,
      "theoretical_loss": 4.727998335383996,
      "tokens_seen": 111804416
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048793380140421265,
      "loss": 1.9527,
      "theoretical_loss": 4.727622521935563,
      "tokens_seen": 111869952
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048792377131394183,
      "loss": 1.9548,
      "theoretical_loss": 4.7272469901865755,
      "tokens_seen": 111935488
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048791374122367107,
      "loss": 1.9622,
      "theoretical_loss": 4.726871739761132,
      "tokens_seen": 112001024
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004879037111334002,
      "loss": 1.8764,
      "theoretical_loss": 4.726496770284056,
      "tokens_seen": 112066560
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048789368104312943,
      "loss": 1.8703,
      "theoretical_loss": 4.726122081380891,
      "tokens_seen": 112132096
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048788365095285856,
      "loss": 2.0317,
      "theoretical_loss": 4.725747672677894,
      "tokens_seen": 112197632
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004878736208625878,
      "loss": 1.9434,
      "theoretical_loss": 4.725373543802043,
      "tokens_seen": 112263168
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048786359077231697,
      "loss": 1.7732,
      "theoretical_loss": 4.724999694381027,
      "tokens_seen": 112328704
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048785356068204615,
      "loss": 1.9136,
      "theoretical_loss": 4.724626124043247,
      "tokens_seen": 112394240
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048784353059177533,
      "loss": 1.9536,
      "theoretical_loss": 4.724252832417817,
      "tokens_seen": 112459776
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048783350050150457,
      "loss": 1.8435,
      "theoretical_loss": 4.723879819134558,
      "tokens_seen": 112525312
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004878234704112337,
      "loss": 1.9659,
      "theoretical_loss": 4.7235070838239945,
      "tokens_seen": 112590848
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048781344032096293,
      "loss": 2.0204,
      "theoretical_loss": 4.723134626117363,
      "tokens_seen": 112656384
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048780341023069206,
      "loss": 1.9667,
      "theoretical_loss": 4.722762445646598,
      "tokens_seen": 112721920
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004877933801404213,
      "loss": 1.8643,
      "theoretical_loss": 4.722390542044339,
      "tokens_seen": 112787456
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004877833500501505,
      "loss": 1.8968,
      "theoretical_loss": 4.722018914943924,
      "tokens_seen": 112852992
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048777331995987966,
      "loss": 1.7484,
      "theoretical_loss": 4.721647563979385,
      "tokens_seen": 112918528
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048776328986960884,
      "loss": 1.7761,
      "theoretical_loss": 4.72127648878546,
      "tokens_seen": 112984064
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000487753259779338,
      "loss": 1.8907,
      "theoretical_loss": 4.720905688997572,
      "tokens_seen": 113049600
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004877432296890672,
      "loss": 1.876,
      "theoretical_loss": 4.720535164251842,
      "tokens_seen": 113115136
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048773319959879644,
      "loss": 1.8224,
      "theoretical_loss": 4.720164914185084,
      "tokens_seen": 113180672
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048772316950852556,
      "loss": 1.9786,
      "theoretical_loss": 4.719794938434794,
      "tokens_seen": 113246208
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004877131394182548,
      "loss": 1.776,
      "theoretical_loss": 4.7194252366391645,
      "tokens_seen": 113311744
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004877031093279839,
      "loss": 1.8818,
      "theoretical_loss": 4.719055808437068,
      "tokens_seen": 113377280
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048769307923771316,
      "loss": 1.8529,
      "theoretical_loss": 4.718686653468065,
      "tokens_seen": 113442816
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048768304914744234,
      "loss": 2.0731,
      "theoretical_loss": 4.718317771372398,
      "tokens_seen": 113508352
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004876730190571715,
      "loss": 1.9557,
      "theoretical_loss": 4.7179491617909886,
      "tokens_seen": 113573888
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004876629889669007,
      "loss": 1.8754,
      "theoretical_loss": 4.717580824365439,
      "tokens_seen": 113639424
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048765295887662994,
      "loss": 1.8583,
      "theoretical_loss": 4.71721275873803,
      "tokens_seen": 113704960
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048764292878635907,
      "loss": 1.9478,
      "theoretical_loss": 4.716844964551717,
      "tokens_seen": 113770496
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004876328986960883,
      "loss": 1.8152,
      "theoretical_loss": 4.716477441450131,
      "tokens_seen": 113836032
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048762286860581743,
      "loss": 1.8014,
      "theoretical_loss": 4.716110189077575,
      "tokens_seen": 113901568
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048761283851554666,
      "loss": 1.9336,
      "theoretical_loss": 4.715743207079022,
      "tokens_seen": 113967104
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048760280842527584,
      "loss": 1.9649,
      "theoretical_loss": 4.715376495100118,
      "tokens_seen": 114032640
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.000487592778335005,
      "loss": 1.8805,
      "theoretical_loss": 4.7150100527871714,
      "tokens_seen": 114098176
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004875827482447342,
      "loss": 1.8411,
      "theoretical_loss": 4.714643879787161,
      "tokens_seen": 114163712
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004875727181544634,
      "loss": 1.9827,
      "theoretical_loss": 4.714277975747729,
      "tokens_seen": 114229248
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048756268806419257,
      "loss": 2.0285,
      "theoretical_loss": 4.7139123403171785,
      "tokens_seen": 114294784
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004875526579739218,
      "loss": 1.8734,
      "theoretical_loss": 4.713546973144476,
      "tokens_seen": 114360320
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048754262788365093,
      "loss": 1.8501,
      "theoretical_loss": 4.713181873879248,
      "tokens_seen": 114425856
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048753259779338017,
      "loss": 1.9365,
      "theoretical_loss": 4.712817042171776,
      "tokens_seen": 114491392
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048752256770310935,
      "loss": 1.9356,
      "theoretical_loss": 4.712452477673001,
      "tokens_seen": 114556928
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048751253761283853,
      "loss": 1.8787,
      "theoretical_loss": 4.712088180034517,
      "tokens_seen": 114622464
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004875025075225677,
      "loss": 1.9469,
      "theoretical_loss": 4.711724148908571,
      "tokens_seen": 114688000
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004874924774322969,
      "loss": 1.8859,
      "theoretical_loss": 4.711360383948064,
      "tokens_seen": 114753536
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048748244734202607,
      "loss": 2.0778,
      "theoretical_loss": 4.710996884806542,
      "tokens_seen": 114819072
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004874724172517553,
      "loss": 1.94,
      "theoretical_loss": 4.710633651138206,
      "tokens_seen": 114884608
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048746238716148443,
      "loss": 1.8465,
      "theoretical_loss": 4.710270682597898,
      "tokens_seen": 114950144
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048745235707121367,
      "loss": 1.9177,
      "theoretical_loss": 4.709907978841109,
      "tokens_seen": 115015680
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004874423269809428,
      "loss": 1.9623,
      "theoretical_loss": 4.709545539523971,
      "tokens_seen": 115081216
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048743229689067203,
      "loss": 2.0389,
      "theoretical_loss": 4.709183364303258,
      "tokens_seen": 115146752
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004874222668004012,
      "loss": 2.0074,
      "theoretical_loss": 4.708821452836388,
      "tokens_seen": 115212288
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004874122367101304,
      "loss": 1.9126,
      "theoretical_loss": 4.708459804781414,
      "tokens_seen": 115277824
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.0004874022066198596,
      "loss": 1.789,
      "theoretical_loss": 4.708098419797031,
      "tokens_seen": 115343360
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048739217652958876,
      "loss": 1.8596,
      "theoretical_loss": 4.707737297542563,
      "tokens_seen": 115408896
    },
    {
      "epoch": 0.03,
      "learning_rate": 0.00048738214643931794,
      "loss": 1.9428,
      "theoretical_loss": 4.707376437677974,
      "tokens_seen": 115474432
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048737211634904717,
      "loss": 1.8474,
      "theoretical_loss": 4.707015839863859,
      "tokens_seen": 115539968
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004873620862587763,
      "loss": 1.7625,
      "theoretical_loss": 4.706655503761443,
      "tokens_seen": 115605504
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048735205616850553,
      "loss": 1.8683,
      "theoretical_loss": 4.706295429032584,
      "tokens_seen": 115671040
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004873420260782347,
      "loss": 1.8714,
      "theoretical_loss": 4.705935615339763,
      "tokens_seen": 115736576
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004873319959879639,
      "loss": 1.9019,
      "theoretical_loss": 4.705576062346094,
      "tokens_seen": 115802112
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004873219658976931,
      "loss": 1.8584,
      "theoretical_loss": 4.70521676971531,
      "tokens_seen": 115867648
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048731193580742226,
      "loss": 2.0371,
      "theoretical_loss": 4.704857737111773,
      "tokens_seen": 115933184
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048730190571715144,
      "loss": 2.0036,
      "theoretical_loss": 4.704498964200463,
      "tokens_seen": 115998720
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004872918756268807,
      "loss": 1.9444,
      "theoretical_loss": 4.70414045064698,
      "tokens_seen": 116064256
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004872818455366098,
      "loss": 1.9559,
      "theoretical_loss": 4.703782196117549,
      "tokens_seen": 116129792
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048727181544633904,
      "loss": 1.8907,
      "theoretical_loss": 4.703424200279007,
      "tokens_seen": 116195328
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048726178535606816,
      "loss": 1.9197,
      "theoretical_loss": 4.703066462798809,
      "tokens_seen": 116260864
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004872517552657974,
      "loss": 1.9064,
      "theoretical_loss": 4.7027089833450235,
      "tokens_seen": 116326400
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004872417251755266,
      "loss": 1.7998,
      "theoretical_loss": 4.7023517615863355,
      "tokens_seen": 116391936
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048723169508525576,
      "loss": 1.9247,
      "theoretical_loss": 4.701994797192038,
      "tokens_seen": 116457472
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000487221664994985,
      "loss": 2.0064,
      "theoretical_loss": 4.701638089832034,
      "tokens_seen": 116523008
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004872116349047141,
      "loss": 1.9803,
      "theoretical_loss": 4.701281639176839,
      "tokens_seen": 116588544
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048720160481444336,
      "loss": 1.8123,
      "theoretical_loss": 4.700925444897575,
      "tokens_seen": 116654080
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048719157472417254,
      "loss": 1.9272,
      "theoretical_loss": 4.700569506665965,
      "tokens_seen": 116719616
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004871815446339017,
      "loss": 2.0213,
      "theoretical_loss": 4.700213824154341,
      "tokens_seen": 116785152
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004871715145436309,
      "loss": 1.8994,
      "theoretical_loss": 4.699858397035637,
      "tokens_seen": 116850688
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048716148445336014,
      "loss": 1.9617,
      "theoretical_loss": 4.699503224983388,
      "tokens_seen": 116916224
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048715145436308927,
      "loss": 1.9449,
      "theoretical_loss": 4.699148307671729,
      "tokens_seen": 116981760
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004871414242728185,
      "loss": 1.8961,
      "theoretical_loss": 4.698793644775394,
      "tokens_seen": 117047296
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048713139418254763,
      "loss": 1.8284,
      "theoretical_loss": 4.698439235969713,
      "tokens_seen": 117112832
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048712136409227686,
      "loss": 1.9678,
      "theoretical_loss": 4.698085080930612,
      "tokens_seen": 117178368
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048711133400200604,
      "loss": 1.8314,
      "theoretical_loss": 4.697731179334614,
      "tokens_seen": 117243904
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004871013039117352,
      "loss": 1.9785,
      "theoretical_loss": 4.69737753085883,
      "tokens_seen": 117309440
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004870912738214644,
      "loss": 1.8402,
      "theoretical_loss": 4.697024135180968,
      "tokens_seen": 117374976
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004870812437311936,
      "loss": 1.9013,
      "theoretical_loss": 4.696670991979321,
      "tokens_seen": 117440512
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048707121364092277,
      "loss": 1.8638,
      "theoretical_loss": 4.696318100932773,
      "tokens_seen": 117506048
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000487061183550652,
      "loss": 1.7986,
      "theoretical_loss": 4.695965461720796,
      "tokens_seen": 117571584
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048705115346038113,
      "loss": 1.8988,
      "theoretical_loss": 4.695613074023446,
      "tokens_seen": 117637120
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048704112337011037,
      "loss": 1.8711,
      "theoretical_loss": 4.695260937521364,
      "tokens_seen": 117702656
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048703109327983955,
      "loss": 1.8923,
      "theoretical_loss": 4.694909051895775,
      "tokens_seen": 117768192
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048702106318956873,
      "loss": 1.8696,
      "theoretical_loss": 4.694557416828484,
      "tokens_seen": 117833728
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004870110330992979,
      "loss": 1.8432,
      "theoretical_loss": 4.694206032001879,
      "tokens_seen": 117899264
    },
    {
      "epoch": 0.04,
      "objective/train/docs_used": 46098,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.7685916423797607,
      "objective/train/theoretical_loss": 4.693854897098923,
      "objective/train/tokens_used": 138424800,
      "theoretical_loss": 4.693854897098923,
      "tokens_seen": 117964800
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004870010030090271,
      "loss": 1.7686,
      "theoretical_loss": 4.693854897098923,
      "tokens_seen": 117964800
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048699097291875627,
      "loss": 1.8655,
      "theoretical_loss": 4.693504011803159,
      "tokens_seen": 118030336
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004869809428284855,
      "loss": 1.9106,
      "theoretical_loss": 4.6931533757987065,
      "tokens_seen": 118095872
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048697091273821463,
      "loss": 1.8286,
      "theoretical_loss": 4.692802988770258,
      "tokens_seen": 118161408
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048696088264794387,
      "loss": 1.8832,
      "theoretical_loss": 4.692452850403081,
      "tokens_seen": 118226944
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000486950852557673,
      "loss": 1.8324,
      "theoretical_loss": 4.692102960383014,
      "tokens_seen": 118292480
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048694082246740223,
      "loss": 1.8462,
      "theoretical_loss": 4.691753318396467,
      "tokens_seen": 118358016
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004869307923771314,
      "loss": 1.8098,
      "theoretical_loss": 4.691403924130418,
      "tokens_seen": 118423552
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004869207622868606,
      "loss": 1.8506,
      "theoretical_loss": 4.691054777272415,
      "tokens_seen": 118489088
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004869107321965898,
      "loss": 1.9311,
      "theoretical_loss": 4.69070587751057,
      "tokens_seen": 118554624
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048690070210631896,
      "loss": 1.9316,
      "theoretical_loss": 4.690357224533564,
      "tokens_seen": 118620160
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048689067201604814,
      "loss": 1.9266,
      "theoretical_loss": 4.690008818030638,
      "tokens_seen": 118685696
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048688064192577737,
      "loss": 1.9771,
      "theoretical_loss": 4.689660657691598,
      "tokens_seen": 118751232
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004868706118355065,
      "loss": 1.8333,
      "theoretical_loss": 4.689312743206811,
      "tokens_seen": 118816768
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048686058174523573,
      "loss": 1.7828,
      "theoretical_loss": 4.688965074267203,
      "tokens_seen": 118882304
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004868505516549649,
      "loss": 1.8812,
      "theoretical_loss": 4.688617650564259,
      "tokens_seen": 118947840
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004868405215646941,
      "loss": 1.8032,
      "theoretical_loss": 4.688270471790023,
      "tokens_seen": 119013376
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004868304914744233,
      "loss": 1.8614,
      "theoretical_loss": 4.687923537637094,
      "tokens_seen": 119078912
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048682046138415246,
      "loss": 1.7308,
      "theoretical_loss": 4.687576847798622,
      "tokens_seen": 119144448
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048681043129388164,
      "loss": 1.8712,
      "theoretical_loss": 4.687230401968319,
      "tokens_seen": 119209984
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004868004012036109,
      "loss": 1.7719,
      "theoretical_loss": 4.68688419984044,
      "tokens_seen": 119275520
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048679037111334,
      "loss": 1.8059,
      "theoretical_loss": 4.686538241109796,
      "tokens_seen": 119341056
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048678034102306924,
      "loss": 2.0086,
      "theoretical_loss": 4.686192525471746,
      "tokens_seen": 119406592
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048677031093279836,
      "loss": 1.8938,
      "theoretical_loss": 4.685847052622199,
      "tokens_seen": 119472128
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004867602808425276,
      "loss": 1.9711,
      "theoretical_loss": 4.685501822257608,
      "tokens_seen": 119537664
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004867502507522568,
      "loss": 1.8215,
      "theoretical_loss": 4.685156834074972,
      "tokens_seen": 119603200
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048674022066198596,
      "loss": 1.8835,
      "theoretical_loss": 4.684812087771839,
      "tokens_seen": 119668736
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048673019057171514,
      "loss": 1.8971,
      "theoretical_loss": 4.684467583046292,
      "tokens_seen": 119734272
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004867201604814443,
      "loss": 1.7488,
      "theoretical_loss": 4.6841233195969645,
      "tokens_seen": 119799808
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004867101303911735,
      "loss": 1.9161,
      "theoretical_loss": 4.683779297123024,
      "tokens_seen": 119865344
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048670010030090274,
      "loss": 1.9148,
      "theoretical_loss": 4.683435515324181,
      "tokens_seen": 119930880
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048669007021063187,
      "loss": 1.9671,
      "theoretical_loss": 4.683091973900682,
      "tokens_seen": 119996416
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004866800401203611,
      "loss": 1.857,
      "theoretical_loss": 4.682748672553313,
      "tokens_seen": 120061952
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004866700100300903,
      "loss": 1.9248,
      "theoretical_loss": 4.68240561098339,
      "tokens_seen": 120127488
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048665997993981947,
      "loss": 1.9014,
      "theoretical_loss": 4.68206278889277,
      "tokens_seen": 120193024
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048664994984954865,
      "loss": 1.7759,
      "theoretical_loss": 4.681720205983839,
      "tokens_seen": 120258560
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048663991975927783,
      "loss": 1.8978,
      "theoretical_loss": 4.681377861959516,
      "tokens_seen": 120324096
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000486629889669007,
      "loss": 1.898,
      "theoretical_loss": 4.681035756523249,
      "tokens_seen": 120389632
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048661985957873624,
      "loss": 1.8427,
      "theoretical_loss": 4.680693889379018,
      "tokens_seen": 120455168
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048660982948846537,
      "loss": 1.8931,
      "theoretical_loss": 4.680352260231329,
      "tokens_seen": 120520704
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004865997993981946,
      "loss": 1.946,
      "theoretical_loss": 4.680010868785216,
      "tokens_seen": 120586240
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048658976930792373,
      "loss": 1.7712,
      "theoretical_loss": 4.679669714746238,
      "tokens_seen": 120651776
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048657973921765297,
      "loss": 1.7077,
      "theoretical_loss": 4.679328797820478,
      "tokens_seen": 120717312
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048656970912738215,
      "loss": 1.9106,
      "theoretical_loss": 4.678988117714544,
      "tokens_seen": 120782848
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048655967903711133,
      "loss": 1.8652,
      "theoretical_loss": 4.678647674135563,
      "tokens_seen": 120848384
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004865496489468405,
      "loss": 1.8552,
      "theoretical_loss": 4.6783074667911855,
      "tokens_seen": 120913920
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048653961885656975,
      "loss": 1.944,
      "theoretical_loss": 4.677967495389581,
      "tokens_seen": 120979456
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004865295887662989,
      "loss": 2.0142,
      "theoretical_loss": 4.677627759639435,
      "tokens_seen": 121044992
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004865195586760281,
      "loss": 1.8771,
      "theoretical_loss": 4.677288259249954,
      "tokens_seen": 121110528
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048650952858575724,
      "loss": 1.962,
      "theoretical_loss": 4.676948993930857,
      "tokens_seen": 121176064
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048649949849548647,
      "loss": 1.9614,
      "theoretical_loss": 4.67660996339238,
      "tokens_seen": 121241600
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048648946840521565,
      "loss": 1.7654,
      "theoretical_loss": 4.676271167345272,
      "tokens_seen": 121307136
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048647943831494483,
      "loss": 1.8455,
      "theoretical_loss": 4.675932605500794,
      "tokens_seen": 121372672
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048646940822467407,
      "loss": 1.8346,
      "theoretical_loss": 4.675594277570718,
      "tokens_seen": 121438208
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004864593781344032,
      "loss": 1.8674,
      "theoretical_loss": 4.675256183267327,
      "tokens_seen": 121503744
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048644934804413243,
      "loss": 1.9108,
      "theoretical_loss": 4.674918322303411,
      "tokens_seen": 121569280
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004864393179538616,
      "loss": 1.7317,
      "theoretical_loss": 4.6745806943922705,
      "tokens_seen": 121634816
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004864292878635908,
      "loss": 1.8869,
      "theoretical_loss": 4.67424329924771,
      "tokens_seen": 121700352
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048641925777332,
      "loss": 1.9483,
      "theoretical_loss": 4.673906136584041,
      "tokens_seen": 121765888
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048640922768304916,
      "loss": 1.8465,
      "theoretical_loss": 4.673569206116078,
      "tokens_seen": 121831424
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048639919759277834,
      "loss": 1.7927,
      "theoretical_loss": 4.6732325075591366,
      "tokens_seen": 121896960
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048638916750250757,
      "loss": 1.9358,
      "theoretical_loss": 4.67289604062904,
      "tokens_seen": 121962496
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004863791374122367,
      "loss": 1.8412,
      "theoretical_loss": 4.672559805042107,
      "tokens_seen": 122028032
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048636910732196593,
      "loss": 1.9348,
      "theoretical_loss": 4.672223800515159,
      "tokens_seen": 122093568
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004863590772316951,
      "loss": 1.8225,
      "theoretical_loss": 4.671888026765512,
      "tokens_seen": 122159104
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004863490471414243,
      "loss": 1.8579,
      "theoretical_loss": 4.6715524835109825,
      "tokens_seen": 122224640
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004863390170511535,
      "loss": 1.9074,
      "theoretical_loss": 4.671217170469884,
      "tokens_seen": 122290176
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048632898696088266,
      "loss": 2.0151,
      "theoretical_loss": 4.67088208736102,
      "tokens_seen": 122355712
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048631895687061184,
      "loss": 1.8724,
      "theoretical_loss": 4.670547233903694,
      "tokens_seen": 122421248
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004863089267803411,
      "loss": 1.9724,
      "theoretical_loss": 4.670212609817698,
      "tokens_seen": 122486784
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004862988966900702,
      "loss": 1.7825,
      "theoretical_loss": 4.669878214823316,
      "tokens_seen": 122552320
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048628886659979944,
      "loss": 1.9157,
      "theoretical_loss": 4.669544048641325,
      "tokens_seen": 122617856
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048627883650952857,
      "loss": 1.9691,
      "theoretical_loss": 4.669210110992989,
      "tokens_seen": 122683392
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004862688064192578,
      "loss": 1.9617,
      "theoretical_loss": 4.668876401600059,
      "tokens_seen": 122748928
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000486258776328987,
      "loss": 1.8913,
      "theoretical_loss": 4.668542920184779,
      "tokens_seen": 122814464
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048624874623871616,
      "loss": 1.9454,
      "theoretical_loss": 4.6682096664698705,
      "tokens_seen": 122880000
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048623871614844534,
      "loss": 1.7958,
      "theoretical_loss": 4.667876640178546,
      "tokens_seen": 122945536
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004862286860581745,
      "loss": 1.8823,
      "theoretical_loss": 4.667543841034502,
      "tokens_seen": 123011072
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004862186559679037,
      "loss": 1.8478,
      "theoretical_loss": 4.667211268761914,
      "tokens_seen": 123076608
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048620862587763294,
      "loss": 1.894,
      "theoretical_loss": 4.66687892308544,
      "tokens_seen": 123142144
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048619859578736207,
      "loss": 1.9033,
      "theoretical_loss": 4.6665468037302205,
      "tokens_seen": 123207680
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004861885656970913,
      "loss": 1.8551,
      "theoretical_loss": 4.666214910421875,
      "tokens_seen": 123273216
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004861785356068205,
      "loss": 1.8672,
      "theoretical_loss": 4.665883242886498,
      "tokens_seen": 123338752
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048616850551654967,
      "loss": 1.855,
      "theoretical_loss": 4.6655518008506665,
      "tokens_seen": 123404288
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048615847542627885,
      "loss": 1.8783,
      "theoretical_loss": 4.665220584041428,
      "tokens_seen": 123469824
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048614844533600803,
      "loss": 1.9911,
      "theoretical_loss": 4.664889592186309,
      "tokens_seen": 123535360
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004861384152457372,
      "loss": 1.8096,
      "theoretical_loss": 4.6645588250133105,
      "tokens_seen": 123600896
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048612838515546644,
      "loss": 1.8595,
      "theoretical_loss": 4.664228282250902,
      "tokens_seen": 123666432
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048611835506519557,
      "loss": 2.0012,
      "theoretical_loss": 4.663897963628029,
      "tokens_seen": 123731968
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004861083249749248,
      "loss": 1.8217,
      "theoretical_loss": 4.6635678688741065,
      "tokens_seen": 123797504
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048609829488465393,
      "loss": 1.8626,
      "theoretical_loss": 4.663237997719017,
      "tokens_seen": 123863040
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048608826479438317,
      "loss": 1.7647,
      "theoretical_loss": 4.662908349893116,
      "tokens_seen": 123928576
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048607823470411235,
      "loss": 1.8756,
      "theoretical_loss": 4.662578925127223,
      "tokens_seen": 123994112
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048606820461384153,
      "loss": 1.8094,
      "theoretical_loss": 4.662249723152624,
      "tokens_seen": 124059648
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004860581745235707,
      "loss": 1.8188,
      "theoretical_loss": 4.661920743701073,
      "tokens_seen": 124125184
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048604814443329995,
      "loss": 1.8861,
      "theoretical_loss": 4.661591986504786,
      "tokens_seen": 124190720
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004860381143430291,
      "loss": 1.8918,
      "theoretical_loss": 4.661263451296444,
      "tokens_seen": 124256256
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004860280842527583,
      "loss": 1.8968,
      "theoretical_loss": 4.660935137809188,
      "tokens_seen": 124321792
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048601805416248744,
      "loss": 2.0212,
      "theoretical_loss": 4.660607045776624,
      "tokens_seen": 124387328
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048600802407221667,
      "loss": 1.8052,
      "theoretical_loss": 4.660279174932814,
      "tokens_seen": 124452864
    },
    {
      "epoch": 0.04,
      "objective/train/docs_used": 48145,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.7313852310180664,
      "objective/train/theoretical_loss": 4.659951525012284,
      "objective/train/tokens_used": 144978400,
      "theoretical_loss": 4.659951525012284,
      "tokens_seen": 124518400
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048599799398194585,
      "loss": 1.7314,
      "theoretical_loss": 4.659951525012284,
      "tokens_seen": 124518400
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048598796389167503,
      "loss": 1.8511,
      "theoretical_loss": 4.6596240957500115,
      "tokens_seen": 124583936
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004859779338014042,
      "loss": 1.7875,
      "theoretical_loss": 4.659296886881438,
      "tokens_seen": 124649472
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004859679037111334,
      "loss": 1.8199,
      "theoretical_loss": 4.658969898142456,
      "tokens_seen": 124715008
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004859578736208626,
      "loss": 1.7879,
      "theoretical_loss": 4.658643129269416,
      "tokens_seen": 124780544
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004859478435305918,
      "loss": 1.8034,
      "theoretical_loss": 4.658316579999122,
      "tokens_seen": 124846080
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048593781344032094,
      "loss": 1.8994,
      "theoretical_loss": 4.65799025006883,
      "tokens_seen": 124911616
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004859277833500502,
      "loss": 1.8366,
      "theoretical_loss": 4.65766413921625,
      "tokens_seen": 124977152
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004859177532597793,
      "loss": 1.7422,
      "theoretical_loss": 4.657338247179538,
      "tokens_seen": 125042688
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048590772316950854,
      "loss": 1.8754,
      "theoretical_loss": 4.657012573697307,
      "tokens_seen": 125108224
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858976930792377,
      "loss": 1.8494,
      "theoretical_loss": 4.656687118508616,
      "tokens_seen": 125173760
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858876629889669,
      "loss": 1.9288,
      "theoretical_loss": 4.656361881352968,
      "tokens_seen": 125239296
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858776328986961,
      "loss": 1.8388,
      "theoretical_loss": 4.656036861970319,
      "tokens_seen": 125304832
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858676028084253,
      "loss": 1.8188,
      "theoretical_loss": 4.655712060101068,
      "tokens_seen": 125370368
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048585757271815444,
      "loss": 1.8998,
      "theoretical_loss": 4.65538747548606,
      "tokens_seen": 125435904
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858475426278837,
      "loss": 1.8621,
      "theoretical_loss": 4.655063107866582,
      "tokens_seen": 125501440
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858375125376128,
      "loss": 1.8228,
      "theoretical_loss": 4.654738956984366,
      "tokens_seen": 125566976
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048582748244734204,
      "loss": 1.8959,
      "theoretical_loss": 4.654415022581585,
      "tokens_seen": 125632512
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858174523570712,
      "loss": 1.8978,
      "theoretical_loss": 4.654091304400853,
      "tokens_seen": 125698048
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004858074222668004,
      "loss": 1.8368,
      "theoretical_loss": 4.653767802185225,
      "tokens_seen": 125763584
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004857973921765296,
      "loss": 1.8871,
      "theoretical_loss": 4.653444515678195,
      "tokens_seen": 125829120
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048578736208625877,
      "loss": 1.8522,
      "theoretical_loss": 4.653121444623693,
      "tokens_seen": 125894656
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048577733199598795,
      "loss": 1.8452,
      "theoretical_loss": 4.652798588766088,
      "tokens_seen": 125960192
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004857673019057172,
      "loss": 1.8159,
      "theoretical_loss": 4.652475947850185,
      "tokens_seen": 126025728
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004857572718154463,
      "loss": 1.8289,
      "theoretical_loss": 4.652153521621223,
      "tokens_seen": 126091264
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048574724172517554,
      "loss": 1.8,
      "theoretical_loss": 4.651831309824875,
      "tokens_seen": 126156800
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048573721163490467,
      "loss": 1.7793,
      "theoretical_loss": 4.65150931220725,
      "tokens_seen": 126222336
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004857271815446339,
      "loss": 1.8302,
      "theoretical_loss": 4.651187528514887,
      "tokens_seen": 126287872
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048571715145436314,
      "loss": 1.8306,
      "theoretical_loss": 4.650865958494755,
      "tokens_seen": 126353408
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048570712136409227,
      "loss": 1.8134,
      "theoretical_loss": 4.650544601894257,
      "tokens_seen": 126418944
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004856970912738215,
      "loss": 1.9234,
      "theoretical_loss": 4.650223458461221,
      "tokens_seen": 126484480
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004856870611835507,
      "loss": 1.8237,
      "theoretical_loss": 4.649902527943908,
      "tokens_seen": 126550016
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048567703109327987,
      "loss": 1.802,
      "theoretical_loss": 4.649581810091003,
      "tokens_seen": 126615552
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048566700100300905,
      "loss": 1.8873,
      "theoretical_loss": 4.649261304651619,
      "tokens_seen": 126681088
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048565697091273823,
      "loss": 1.7575,
      "theoretical_loss": 4.6489410113752925,
      "tokens_seen": 126746624
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004856469408224674,
      "loss": 1.8599,
      "theoretical_loss": 4.6486209300119885,
      "tokens_seen": 126812160
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048563691073219664,
      "loss": 1.9242,
      "theoretical_loss": 4.648301060312093,
      "tokens_seen": 126877696
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048562688064192577,
      "loss": 1.9104,
      "theoretical_loss": 4.647981402026417,
      "tokens_seen": 126943232
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000485616850551655,
      "loss": 1.8707,
      "theoretical_loss": 4.647661954906188,
      "tokens_seen": 127008768
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048560682046138413,
      "loss": 2.0345,
      "theoretical_loss": 4.647342718703062,
      "tokens_seen": 127074304
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048559679037111337,
      "loss": 1.8317,
      "theoretical_loss": 4.647023693169107,
      "tokens_seen": 127139840
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048558676028084255,
      "loss": 1.8608,
      "theoretical_loss": 4.646704878056816,
      "tokens_seen": 127205376
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048557673019057173,
      "loss": 1.8589,
      "theoretical_loss": 4.6463862731191,
      "tokens_seen": 127270912
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004855667001003009,
      "loss": 1.8767,
      "theoretical_loss": 4.6460678781092835,
      "tokens_seen": 127336448
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048555667001003015,
      "loss": 1.9232,
      "theoretical_loss": 4.6457496927811075,
      "tokens_seen": 127401984
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004855466399197593,
      "loss": 1.8361,
      "theoretical_loss": 4.645431716888734,
      "tokens_seen": 127467520
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004855366098294885,
      "loss": 1.8122,
      "theoretical_loss": 4.645113950186732,
      "tokens_seen": 127533056
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048552657973921764,
      "loss": 1.8189,
      "theoretical_loss": 4.64479639243009,
      "tokens_seen": 127598592
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048551654964894687,
      "loss": 1.8251,
      "theoretical_loss": 4.644479043374204,
      "tokens_seen": 127664128
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048550651955867605,
      "loss": 1.939,
      "theoretical_loss": 4.644161902774886,
      "tokens_seen": 127729664
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048549648946840523,
      "loss": 1.8066,
      "theoretical_loss": 4.643844970388358,
      "tokens_seen": 127795200
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004854864593781344,
      "loss": 1.8871,
      "theoretical_loss": 4.6435282459712495,
      "tokens_seen": 127860736
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004854764292878636,
      "loss": 1.7621,
      "theoretical_loss": 4.643211729280601,
      "tokens_seen": 127926272
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004854663991975928,
      "loss": 1.9415,
      "theoretical_loss": 4.64289542007386,
      "tokens_seen": 127991808
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000485456369107322,
      "loss": 1.8213,
      "theoretical_loss": 4.642579318108883,
      "tokens_seen": 128057344
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048544633901705114,
      "loss": 1.7988,
      "theoretical_loss": 4.642263423143932,
      "tokens_seen": 128122880
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004854363089267804,
      "loss": 1.9235,
      "theoretical_loss": 4.641947734937673,
      "tokens_seen": 128188416
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004854262788365095,
      "loss": 1.9792,
      "theoretical_loss": 4.641632253249179,
      "tokens_seen": 128253952
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048541624874623874,
      "loss": 1.7746,
      "theoretical_loss": 4.641316977837924,
      "tokens_seen": 128319488
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004854062186559679,
      "loss": 2.0094,
      "theoretical_loss": 4.641001908463787,
      "tokens_seen": 128385024
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004853961885656971,
      "loss": 1.9284,
      "theoretical_loss": 4.6406870448870485,
      "tokens_seen": 128450560
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004853861584754263,
      "loss": 1.7573,
      "theoretical_loss": 4.64037238686839,
      "tokens_seen": 128516096
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004853761283851555,
      "loss": 1.8937,
      "theoretical_loss": 4.640057934168891,
      "tokens_seen": 128581632
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048536609829488464,
      "loss": 1.8561,
      "theoretical_loss": 4.639743686550034,
      "tokens_seen": 128647168
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004853560682046139,
      "loss": 1.7966,
      "theoretical_loss": 4.639429643773697,
      "tokens_seen": 128712704
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000485346038114343,
      "loss": 1.8861,
      "theoretical_loss": 4.639115805602156,
      "tokens_seen": 128778240
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048533600802407224,
      "loss": 1.9131,
      "theoretical_loss": 4.638802171798086,
      "tokens_seen": 128843776
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004853259779338014,
      "loss": 1.9339,
      "theoretical_loss": 4.638488742124554,
      "tokens_seen": 128909312
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004853159478435306,
      "loss": 1.9627,
      "theoretical_loss": 4.638175516345027,
      "tokens_seen": 128974848
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004853059177532598,
      "loss": 1.8574,
      "theoretical_loss": 4.637862494223359,
      "tokens_seen": 129040384
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048529588766298897,
      "loss": 1.9053,
      "theoretical_loss": 4.637549675523806,
      "tokens_seen": 129105920
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048528585757271815,
      "loss": 1.8185,
      "theoretical_loss": 4.637237060011007,
      "tokens_seen": 129171456
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004852758274824474,
      "loss": 1.8483,
      "theoretical_loss": 4.636924647450002,
      "tokens_seen": 129236992
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004852657973921765,
      "loss": 1.9443,
      "theoretical_loss": 4.636612437606212,
      "tokens_seen": 129302528
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048525576730190574,
      "loss": 1.882,
      "theoretical_loss": 4.636300430245457,
      "tokens_seen": 129368064
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048524573721163487,
      "loss": 1.7879,
      "theoretical_loss": 4.63598862513394,
      "tokens_seen": 129433600
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004852357071213641,
      "loss": 1.8994,
      "theoretical_loss": 4.635677022038254,
      "tokens_seen": 129499136
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004852256770310933,
      "loss": 1.7526,
      "theoretical_loss": 4.63536562072538,
      "tokens_seen": 129564672
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048521564694082247,
      "loss": 1.988,
      "theoretical_loss": 4.635054420962684,
      "tokens_seen": 129630208
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048520561685055165,
      "loss": 1.8358,
      "theoretical_loss": 4.634743422517918,
      "tokens_seen": 129695744
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004851955867602809,
      "loss": 1.8861,
      "theoretical_loss": 4.634432625159221,
      "tokens_seen": 129761280
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048518555667001,
      "loss": 1.8338,
      "theoretical_loss": 4.634122028655112,
      "tokens_seen": 129826816
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048517552657973925,
      "loss": 1.8733,
      "theoretical_loss": 4.633811632774496,
      "tokens_seen": 129892352
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004851654964894684,
      "loss": 1.8227,
      "theoretical_loss": 4.633501437286659,
      "tokens_seen": 129957888
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004851554663991976,
      "loss": 1.8785,
      "theoretical_loss": 4.633191441961272,
      "tokens_seen": 130023424
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004851454363089268,
      "loss": 1.8948,
      "theoretical_loss": 4.63288164656838,
      "tokens_seen": 130088960
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048513540621865597,
      "loss": 1.8487,
      "theoretical_loss": 4.632572050878415,
      "tokens_seen": 130154496
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048512537612838515,
      "loss": 1.9065,
      "theoretical_loss": 4.632262654662181,
      "tokens_seen": 130220032
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048511534603811433,
      "loss": 1.8871,
      "theoretical_loss": 4.631953457690868,
      "tokens_seen": 130285568
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004851053159478435,
      "loss": 1.9835,
      "theoretical_loss": 4.631644459736036,
      "tokens_seen": 130351104
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048509528585757275,
      "loss": 1.8814,
      "theoretical_loss": 4.631335660569626,
      "tokens_seen": 130416640
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004850852557673019,
      "loss": 1.7472,
      "theoretical_loss": 4.631027059963953,
      "tokens_seen": 130482176
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004850752256770311,
      "loss": 1.8954,
      "theoretical_loss": 4.630718657691709,
      "tokens_seen": 130547712
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048506519558676024,
      "loss": 1.7044,
      "theoretical_loss": 4.630410453525958,
      "tokens_seen": 130613248
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004850551654964895,
      "loss": 1.961,
      "theoretical_loss": 4.630102447240138,
      "tokens_seen": 130678784
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048504513540621866,
      "loss": 1.8332,
      "theoretical_loss": 4.629794638608059,
      "tokens_seen": 130744320
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048503510531594784,
      "loss": 1.891,
      "theoretical_loss": 4.629487027403905,
      "tokens_seen": 130809856
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000485025075225677,
      "loss": 1.813,
      "theoretical_loss": 4.629179613402228,
      "tokens_seen": 130875392
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048501504513540625,
      "loss": 1.8149,
      "theoretical_loss": 4.628872396377953,
      "tokens_seen": 130940928
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004850050150451354,
      "loss": 1.8197,
      "theoretical_loss": 4.628565376106371,
      "tokens_seen": 131006464
    },
    {
      "epoch": 0.04,
      "objective/train/docs_used": 50313,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.923002004623413,
      "objective/train/theoretical_loss": 4.628258552363146,
      "objective/train/tokens_used": 151532000,
      "theoretical_loss": 4.628258552363146,
      "tokens_seen": 131072000
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004849949849548646,
      "loss": 1.923,
      "theoretical_loss": 4.628258552363146,
      "tokens_seen": 131072000
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004849849548645938,
      "loss": 1.8847,
      "theoretical_loss": 4.627951924924305,
      "tokens_seen": 131137536
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000484974924774323,
      "loss": 1.8368,
      "theoretical_loss": 4.627645493566245,
      "tokens_seen": 131203072
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004849648946840522,
      "loss": 1.885,
      "theoretical_loss": 4.62733925806573,
      "tokens_seen": 131268608
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048495486459378134,
      "loss": 1.6864,
      "theoretical_loss": 4.627033218199886,
      "tokens_seen": 131334144
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004849448345035106,
      "loss": 1.9636,
      "theoretical_loss": 4.626727373746206,
      "tokens_seen": 131399680
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004849348044132397,
      "loss": 1.7448,
      "theoretical_loss": 4.626421724482549,
      "tokens_seen": 131465216
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048492477432296894,
      "loss": 1.8339,
      "theoretical_loss": 4.626116270187131,
      "tokens_seen": 131530752
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004849147442326981,
      "loss": 1.8051,
      "theoretical_loss": 4.625811010638538,
      "tokens_seen": 131596288
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004849047141424273,
      "loss": 1.7613,
      "theoretical_loss": 4.62550594561571,
      "tokens_seen": 131661824
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004848946840521565,
      "loss": 1.7443,
      "theoretical_loss": 4.625201074897952,
      "tokens_seen": 131727360
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004848846539618857,
      "loss": 1.8532,
      "theoretical_loss": 4.62489639826493,
      "tokens_seen": 131792896
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048487462387161484,
      "loss": 1.9105,
      "theoretical_loss": 4.6245919154966675,
      "tokens_seen": 131858432
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004848645937813441,
      "loss": 1.8055,
      "theoretical_loss": 4.624287626373545,
      "tokens_seen": 131923968
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004848545636910732,
      "loss": 1.744,
      "theoretical_loss": 4.623983530676304,
      "tokens_seen": 131989504
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048484453360080244,
      "loss": 1.8964,
      "theoretical_loss": 4.62367962818604,
      "tokens_seen": 132055040
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004848345035105316,
      "loss": 1.9329,
      "theoretical_loss": 4.623375918684207,
      "tokens_seen": 132120576
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004848244734202608,
      "loss": 1.8333,
      "theoretical_loss": 4.623072401952614,
      "tokens_seen": 132186112
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048481444332999,
      "loss": 1.9359,
      "theoretical_loss": 4.622769077773423,
      "tokens_seen": 132251648
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048480441323971917,
      "loss": 1.9188,
      "theoretical_loss": 4.622465945929152,
      "tokens_seen": 132317184
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048479438314944835,
      "loss": 1.8695,
      "theoretical_loss": 4.622163006202671,
      "tokens_seen": 132382720
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004847843530591776,
      "loss": 1.8167,
      "theoretical_loss": 4.621860258377203,
      "tokens_seen": 132448256
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004847743229689067,
      "loss": 1.8948,
      "theoretical_loss": 4.621557702236323,
      "tokens_seen": 132513792
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048476429287863594,
      "loss": 1.7682,
      "theoretical_loss": 4.621255337563955,
      "tokens_seen": 132579328
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048475426278836507,
      "loss": 1.7677,
      "theoretical_loss": 4.620953164144376,
      "tokens_seen": 132644864
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004847442326980943,
      "loss": 1.897,
      "theoretical_loss": 4.620651181762212,
      "tokens_seen": 132710400
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004847342026078235,
      "loss": 1.8839,
      "theoretical_loss": 4.620349390202436,
      "tokens_seen": 132775936
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048472417251755267,
      "loss": 1.8815,
      "theoretical_loss": 4.6200477892503695,
      "tokens_seen": 132841472
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048471414242728185,
      "loss": 1.8369,
      "theoretical_loss": 4.619746378691682,
      "tokens_seen": 132907008
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004847041123370111,
      "loss": 1.8222,
      "theoretical_loss": 4.61944515831239,
      "tokens_seen": 132972544
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004846940822467402,
      "loss": 1.8281,
      "theoretical_loss": 4.6191441278988545,
      "tokens_seen": 133038080
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048468405215646945,
      "loss": 1.8685,
      "theoretical_loss": 4.618843287237782,
      "tokens_seen": 133103616
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004846740220661986,
      "loss": 1.9123,
      "theoretical_loss": 4.618542636116224,
      "tokens_seen": 133169152
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004846639919759278,
      "loss": 1.9168,
      "theoretical_loss": 4.618242174321575,
      "tokens_seen": 133234688
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000484653961885657,
      "loss": 1.8067,
      "theoretical_loss": 4.617941901641573,
      "tokens_seen": 133300224
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048464393179538617,
      "loss": 1.9052,
      "theoretical_loss": 4.617641817864296,
      "tokens_seen": 133365760
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048463390170511535,
      "loss": 1.8276,
      "theoretical_loss": 4.617341922778168,
      "tokens_seen": 133431296
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048462387161484453,
      "loss": 1.8493,
      "theoretical_loss": 4.617042216171949,
      "tokens_seen": 133496832
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004846138415245737,
      "loss": 1.8258,
      "theoretical_loss": 4.616742697834742,
      "tokens_seen": 133562368
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048460381143430295,
      "loss": 1.7767,
      "theoretical_loss": 4.616443367555988,
      "tokens_seen": 133627904
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004845937813440321,
      "loss": 1.861,
      "theoretical_loss": 4.616144225125465,
      "tokens_seen": 133693440
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004845837512537613,
      "loss": 1.7781,
      "theoretical_loss": 4.615845270333294,
      "tokens_seen": 133758976
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048457372116349044,
      "loss": 1.9046,
      "theoretical_loss": 4.615546502969929,
      "tokens_seen": 133824512
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004845636910732197,
      "loss": 1.96,
      "theoretical_loss": 4.61524792282616,
      "tokens_seen": 133890048
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048455366098294886,
      "loss": 1.6903,
      "theoretical_loss": 4.614949529693115,
      "tokens_seen": 133955584
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048454363089267804,
      "loss": 1.7302,
      "theoretical_loss": 4.614651323362257,
      "tokens_seen": 134021120
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004845336008024072,
      "loss": 2.0291,
      "theoretical_loss": 4.614353303625382,
      "tokens_seen": 134086656
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048452357071213645,
      "loss": 1.6713,
      "theoretical_loss": 4.6140554702746215,
      "tokens_seen": 134152192
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004845135406218656,
      "loss": 1.8453,
      "theoretical_loss": 4.613757823102437,
      "tokens_seen": 134217728
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004845035105315948,
      "loss": 1.7873,
      "theoretical_loss": 4.613460361901627,
      "tokens_seen": 134283264
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048449348044132394,
      "loss": 1.9111,
      "theoretical_loss": 4.613163086465315,
      "tokens_seen": 134348800
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004844834503510532,
      "loss": 1.9124,
      "theoretical_loss": 4.612865996586962,
      "tokens_seen": 134414336
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048447342026078236,
      "loss": 1.9071,
      "theoretical_loss": 4.612569092060355,
      "tokens_seen": 134479872
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048446339017051154,
      "loss": 1.8615,
      "theoretical_loss": 4.612272372679611,
      "tokens_seen": 134545408
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004844533600802407,
      "loss": 1.8381,
      "theoretical_loss": 4.611975838239179,
      "tokens_seen": 134610944
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004844433299899699,
      "loss": 1.9749,
      "theoretical_loss": 4.611679488533832,
      "tokens_seen": 134676480
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004844332998996991,
      "loss": 1.7919,
      "theoretical_loss": 4.611383323358671,
      "tokens_seen": 134742016
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004844232698094283,
      "loss": 1.9334,
      "theoretical_loss": 4.61108734250913,
      "tokens_seen": 134807552
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048441323971915745,
      "loss": 1.8072,
      "theoretical_loss": 4.610791545780959,
      "tokens_seen": 134873088
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004844032096288867,
      "loss": 1.8379,
      "theoretical_loss": 4.610495932970241,
      "tokens_seen": 134938624
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048439317953861586,
      "loss": 1.7636,
      "theoretical_loss": 4.61020050387338,
      "tokens_seen": 135004160
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048438314944834504,
      "loss": 1.7679,
      "theoretical_loss": 4.609905258287107,
      "tokens_seen": 135069696
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004843731193580742,
      "loss": 1.8717,
      "theoretical_loss": 4.609610196008473,
      "tokens_seen": 135135232
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004843630892678034,
      "loss": 1.8004,
      "theoretical_loss": 4.609315316834855,
      "tokens_seen": 135200768
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004843530591775326,
      "loss": 1.8199,
      "theoretical_loss": 4.60902062056395,
      "tokens_seen": 135266304
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004843430290872618,
      "loss": 1.8594,
      "theoretical_loss": 4.608726106993776,
      "tokens_seen": 135331840
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048433299899699095,
      "loss": 1.8978,
      "theoretical_loss": 4.608431775922673,
      "tokens_seen": 135397376
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004843229689067202,
      "loss": 1.8885,
      "theoretical_loss": 4.608137627149302,
      "tokens_seen": 135462912
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004843129388164493,
      "loss": 1.7615,
      "theoretical_loss": 4.607843660472642,
      "tokens_seen": 135528448
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048430290872617855,
      "loss": 1.9639,
      "theoretical_loss": 4.607549875691989,
      "tokens_seen": 135593984
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048429287863590773,
      "loss": 1.7679,
      "theoretical_loss": 4.607256272606961,
      "tokens_seen": 135659520
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004842828485456369,
      "loss": 1.7231,
      "theoretical_loss": 4.606962851017489,
      "tokens_seen": 135725056
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004842728184553661,
      "loss": 1.8231,
      "theoretical_loss": 4.606669610723825,
      "tokens_seen": 135790592
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048426278836509527,
      "loss": 1.7791,
      "theoretical_loss": 4.606376551526536,
      "tokens_seen": 135856128
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048425275827482445,
      "loss": 1.8827,
      "theoretical_loss": 4.6060836732265,
      "tokens_seen": 135921664
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004842427281845537,
      "loss": 1.7902,
      "theoretical_loss": 4.605790975624917,
      "tokens_seen": 135987200
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048423269809428287,
      "loss": 1.7309,
      "theoretical_loss": 4.605498458523296,
      "tokens_seen": 136052736
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048422266800401205,
      "loss": 1.9133,
      "theoretical_loss": 4.605206121723461,
      "tokens_seen": 136118272
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004842126379137413,
      "loss": 1.773,
      "theoretical_loss": 4.604913965027551,
      "tokens_seen": 136183808
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004842026078234704,
      "loss": 1.8526,
      "theoretical_loss": 4.604621988238012,
      "tokens_seen": 136249344
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048419257773319965,
      "loss": 1.7805,
      "theoretical_loss": 4.604330191157608,
      "tokens_seen": 136314880
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004841825476429288,
      "loss": 1.7719,
      "theoretical_loss": 4.604038573589408,
      "tokens_seen": 136380416
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000484172517552658,
      "loss": 1.7112,
      "theoretical_loss": 4.603747135336796,
      "tokens_seen": 136445952
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004841624874623872,
      "loss": 1.7289,
      "theoretical_loss": 4.603455876203463,
      "tokens_seen": 136511488
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048415245737211637,
      "loss": 1.8543,
      "theoretical_loss": 4.603164795993409,
      "tokens_seen": 136577024
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048414242728184555,
      "loss": 1.8558,
      "theoretical_loss": 4.602873894510945,
      "tokens_seen": 136642560
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048413239719157473,
      "loss": 1.758,
      "theoretical_loss": 4.602583171560686,
      "tokens_seen": 136708096
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004841223671013039,
      "loss": 1.8703,
      "theoretical_loss": 4.602292626947556,
      "tokens_seen": 136773632
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048411233701103315,
      "loss": 1.8083,
      "theoretical_loss": 4.602002260476787,
      "tokens_seen": 136839168
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004841023069207623,
      "loss": 1.8135,
      "theoretical_loss": 4.601712071953914,
      "tokens_seen": 136904704
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004840922768304915,
      "loss": 1.7938,
      "theoretical_loss": 4.601422061184778,
      "tokens_seen": 136970240
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048408224674022064,
      "loss": 1.8855,
      "theoretical_loss": 4.601132227975527,
      "tokens_seen": 137035776
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004840722166499499,
      "loss": 1.9022,
      "theoretical_loss": 4.60084257213261,
      "tokens_seen": 137101312
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048406218655967906,
      "loss": 1.8712,
      "theoretical_loss": 4.600553093462781,
      "tokens_seen": 137166848
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048405215646940824,
      "loss": 1.6639,
      "theoretical_loss": 4.600263791773097,
      "tokens_seen": 137232384
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004840421263791374,
      "loss": 1.795,
      "theoretical_loss": 4.599974666870914,
      "tokens_seen": 137297920
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048403209628886665,
      "loss": 1.7986,
      "theoretical_loss": 4.599685718563894,
      "tokens_seen": 137363456
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004840220661985958,
      "loss": 1.9247,
      "theoretical_loss": 4.599396946659997,
      "tokens_seen": 137428992
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000484012036108325,
      "loss": 1.7798,
      "theoretical_loss": 4.5991083509674855,
      "tokens_seen": 137494528
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048400200601805414,
      "loss": 1.9445,
      "theoretical_loss": 4.598819931294919,
      "tokens_seen": 137560064
    },
    {
      "epoch": 0.04,
      "objective/train/docs_used": 52427,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.81913423538208,
      "objective/train/theoretical_loss": 4.598531687451157,
      "objective/train/tokens_used": 158085600,
      "theoretical_loss": 4.598531687451157,
      "tokens_seen": 137625600
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004839919759277834,
      "loss": 1.8191,
      "theoretical_loss": 4.598531687451157,
      "tokens_seen": 137625600
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048398194583751256,
      "loss": 1.757,
      "theoretical_loss": 4.598243619245359,
      "tokens_seen": 137691136
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048397191574724174,
      "loss": 1.6585,
      "theoretical_loss": 4.59795572648698,
      "tokens_seen": 137756672
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004839618856569709,
      "loss": 1.8531,
      "theoretical_loss": 4.597668008985774,
      "tokens_seen": 137822208
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004839518555667001,
      "loss": 1.8406,
      "theoretical_loss": 4.59738046655179,
      "tokens_seen": 137887744
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004839418254764293,
      "loss": 1.8908,
      "theoretical_loss": 4.597093098995377,
      "tokens_seen": 137953280
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004839317953861585,
      "loss": 1.7186,
      "theoretical_loss": 4.596805906127173,
      "tokens_seen": 138018816
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048392176529588765,
      "loss": 1.9036,
      "theoretical_loss": 4.596518887758117,
      "tokens_seen": 138084352
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004839117352056169,
      "loss": 1.8253,
      "theoretical_loss": 4.596232043699438,
      "tokens_seen": 138149888
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048390170511534606,
      "loss": 1.8311,
      "theoretical_loss": 4.59594537376266,
      "tokens_seen": 138215424
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048389167502507524,
      "loss": 1.8624,
      "theoretical_loss": 4.595658877759602,
      "tokens_seen": 138280960
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004838816449348044,
      "loss": 1.7954,
      "theoretical_loss": 4.595372555502371,
      "tokens_seen": 138346496
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004838716148445336,
      "loss": 1.8476,
      "theoretical_loss": 4.59508640680337,
      "tokens_seen": 138412032
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004838615847542628,
      "loss": 1.8393,
      "theoretical_loss": 4.594800431475292,
      "tokens_seen": 138477568
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000483851554663992,
      "loss": 1.8494,
      "theoretical_loss": 4.594514629331121,
      "tokens_seen": 138543104
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048384152457372115,
      "loss": 1.7508,
      "theoretical_loss": 4.594229000184128,
      "tokens_seen": 138608640
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004838314944834504,
      "loss": 1.7463,
      "theoretical_loss": 4.593943543847878,
      "tokens_seen": 138674176
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004838214643931795,
      "loss": 1.853,
      "theoretical_loss": 4.5936582601362215,
      "tokens_seen": 138739712
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048381143430290875,
      "loss": 1.8598,
      "theoretical_loss": 4.593373148863301,
      "tokens_seen": 138805248
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048380140421263793,
      "loss": 1.7682,
      "theoretical_loss": 4.593088209843543,
      "tokens_seen": 138870784
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004837913741223671,
      "loss": 1.754,
      "theoretical_loss": 4.592803442891663,
      "tokens_seen": 138936320
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004837813440320963,
      "loss": 1.7331,
      "theoretical_loss": 4.592518847822661,
      "tokens_seen": 139001856
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048377131394182547,
      "loss": 1.7286,
      "theoretical_loss": 4.592234424451828,
      "tokens_seen": 139067392
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048376128385155465,
      "loss": 1.9229,
      "theoretical_loss": 4.591950172594734,
      "tokens_seen": 139132928
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004837512537612839,
      "loss": 1.8873,
      "theoretical_loss": 4.591666092067238,
      "tokens_seen": 139198464
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000483741223671013,
      "loss": 1.7803,
      "theoretical_loss": 4.591382182685484,
      "tokens_seen": 139264000
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048373119358074225,
      "loss": 1.8844,
      "theoretical_loss": 4.591098444265896,
      "tokens_seen": 139329536
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048372116349047143,
      "loss": 1.8467,
      "theoretical_loss": 4.590814876625183,
      "tokens_seen": 139395072
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004837111334002006,
      "loss": 1.9091,
      "theoretical_loss": 4.590531479580338,
      "tokens_seen": 139460608
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004837011033099298,
      "loss": 1.7583,
      "theoretical_loss": 4.5902482529486335,
      "tokens_seen": 139526144
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000483691073219659,
      "loss": 1.8787,
      "theoretical_loss": 4.589965196547625,
      "tokens_seen": 139591680
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048368104312938816,
      "loss": 1.8116,
      "theoretical_loss": 4.5896823101951485,
      "tokens_seen": 139657216
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004836710130391174,
      "loss": 1.8409,
      "theoretical_loss": 4.58939959370932,
      "tokens_seen": 139722752
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004836609829488465,
      "loss": 1.869,
      "theoretical_loss": 4.5891170469085365,
      "tokens_seen": 139788288
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048365095285857575,
      "loss": 1.7727,
      "theoretical_loss": 4.588834669611472,
      "tokens_seen": 139853824
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004836409227683049,
      "loss": 1.7481,
      "theoretical_loss": 4.5885524616370805,
      "tokens_seen": 139919360
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004836308926780341,
      "loss": 1.8399,
      "theoretical_loss": 4.5882704228045945,
      "tokens_seen": 139984896
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004836208625877633,
      "loss": 1.7261,
      "theoretical_loss": 4.587988552933523,
      "tokens_seen": 140050432
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004836108324974925,
      "loss": 1.8107,
      "theoretical_loss": 4.587706851843652,
      "tokens_seen": 140115968
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048360080240722166,
      "loss": 1.811,
      "theoretical_loss": 4.587425319355044,
      "tokens_seen": 140181504
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048359077231695084,
      "loss": 1.8287,
      "theoretical_loss": 4.587143955288038,
      "tokens_seen": 140247040
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048358074222668,
      "loss": 1.8071,
      "theoretical_loss": 4.586862759463248,
      "tokens_seen": 140312576
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048357071213640926,
      "loss": 1.8073,
      "theoretical_loss": 4.586581731701562,
      "tokens_seen": 140378112
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004835606820461384,
      "loss": 1.8015,
      "theoretical_loss": 4.586300871824143,
      "tokens_seen": 140443648
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004835506519558676,
      "loss": 1.9318,
      "theoretical_loss": 4.586020179652427,
      "tokens_seen": 140509184
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004835406218655968,
      "loss": 1.7527,
      "theoretical_loss": 4.585739655008123,
      "tokens_seen": 140574720
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000483530591775326,
      "loss": 1.8619,
      "theoretical_loss": 4.585459297713215,
      "tokens_seen": 140640256
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048352056168505516,
      "loss": 2.0527,
      "theoretical_loss": 4.585179107589955,
      "tokens_seen": 140705792
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048351053159478434,
      "loss": 1.8208,
      "theoretical_loss": 4.58489908446087,
      "tokens_seen": 140771328
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004835005015045135,
      "loss": 1.8487,
      "theoretical_loss": 4.584619228148755,
      "tokens_seen": 140836864
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048349047141424276,
      "loss": 1.7595,
      "theoretical_loss": 4.584339538476678,
      "tokens_seen": 140902400
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048348044132397194,
      "loss": 2.0286,
      "theoretical_loss": 4.5840600152679745,
      "tokens_seen": 140967936
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004834704112337011,
      "loss": 1.8206,
      "theoretical_loss": 4.583780658346252,
      "tokens_seen": 141033472
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004834603811434303,
      "loss": 1.9006,
      "theoretical_loss": 4.583501467535383,
      "tokens_seen": 141099008
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004834503510531595,
      "loss": 1.8225,
      "theoretical_loss": 4.583222442659514,
      "tokens_seen": 141164544
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004834403209628887,
      "loss": 1.7685,
      "theoretical_loss": 4.5829435835430505,
      "tokens_seen": 141230080
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048343029087261785,
      "loss": 1.7759,
      "theoretical_loss": 4.582664890010674,
      "tokens_seen": 141295616
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004834202607823471,
      "loss": 1.9727,
      "theoretical_loss": 4.582386361887329,
      "tokens_seen": 141361152
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048341023069207626,
      "loss": 1.8091,
      "theoretical_loss": 4.582107998998225,
      "tokens_seen": 141426688
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048340020060180544,
      "loss": 1.7578,
      "theoretical_loss": 4.581829801168839,
      "tokens_seen": 141492224
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004833901705115346,
      "loss": 1.9184,
      "theoretical_loss": 4.5815517682249105,
      "tokens_seen": 141557760
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004833801404212638,
      "loss": 1.72,
      "theoretical_loss": 4.581273899992447,
      "tokens_seen": 141623296
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000483370110330993,
      "loss": 1.7496,
      "theoretical_loss": 4.580996196297718,
      "tokens_seen": 141688832
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004833600802407222,
      "loss": 1.7503,
      "theoretical_loss": 4.580718656967257,
      "tokens_seen": 141754368
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048335005015045135,
      "loss": 1.7931,
      "theoretical_loss": 4.580441281827858,
      "tokens_seen": 141819904
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004833400200601806,
      "loss": 1.9049,
      "theoretical_loss": 4.580164070706584,
      "tokens_seen": 141885440
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004833299899699097,
      "loss": 1.8619,
      "theoretical_loss": 4.579887023430752,
      "tokens_seen": 141950976
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048331995987963895,
      "loss": 1.9389,
      "theoretical_loss": 4.579610139827945,
      "tokens_seen": 142016512
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048330992978936813,
      "loss": 1.9172,
      "theoretical_loss": 4.579333419726007,
      "tokens_seen": 142082048
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004832998996990973,
      "loss": 1.8421,
      "theoretical_loss": 4.579056862953039,
      "tokens_seen": 142147584
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004832898696088265,
      "loss": 1.8095,
      "theoretical_loss": 4.578780469337407,
      "tokens_seen": 142213120
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048327983951855567,
      "loss": 1.746,
      "theoretical_loss": 4.5785042387077315,
      "tokens_seen": 142278656
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048326980942828485,
      "loss": 1.7968,
      "theoretical_loss": 4.578228170892896,
      "tokens_seen": 142344192
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004832597793380141,
      "loss": 1.7632,
      "theoretical_loss": 4.577952265722038,
      "tokens_seen": 142409728
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004832497492477432,
      "loss": 2.0199,
      "theoretical_loss": 4.5776765230245555,
      "tokens_seen": 142475264
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048323971915747245,
      "loss": 1.7573,
      "theoretical_loss": 4.5774009426301046,
      "tokens_seen": 142540800
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048322968906720163,
      "loss": 1.7993,
      "theoretical_loss": 4.577125524368595,
      "tokens_seen": 142606336
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004832196589769308,
      "loss": 1.7256,
      "theoretical_loss": 4.5768502680701975,
      "tokens_seen": 142671872
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048320962888666,
      "loss": 1.7602,
      "theoretical_loss": 4.576575173565334,
      "tokens_seen": 142737408
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004831995987963892,
      "loss": 1.7971,
      "theoretical_loss": 4.5763002406846836,
      "tokens_seen": 142802944
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048318956870611836,
      "loss": 1.7656,
      "theoretical_loss": 4.57602546925918,
      "tokens_seen": 142868480
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004831795386158476,
      "loss": 1.7236,
      "theoretical_loss": 4.575750859120014,
      "tokens_seen": 142934016
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004831695085255767,
      "loss": 1.7911,
      "theoretical_loss": 4.575476410098624,
      "tokens_seen": 142999552
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048315947843530595,
      "loss": 1.914,
      "theoretical_loss": 4.575202122026706,
      "tokens_seen": 143065088
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004831494483450351,
      "loss": 1.785,
      "theoretical_loss": 4.5749279947362105,
      "tokens_seen": 143130624
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004831394182547643,
      "loss": 1.8306,
      "theoretical_loss": 4.574654028059336,
      "tokens_seen": 143196160
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004831293881644935,
      "loss": 1.8023,
      "theoretical_loss": 4.574380221828535,
      "tokens_seen": 143261696
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004831193580742227,
      "loss": 1.6888,
      "theoretical_loss": 4.574106575876511,
      "tokens_seen": 143327232
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048310932798395186,
      "loss": 1.867,
      "theoretical_loss": 4.573833090036219,
      "tokens_seen": 143392768
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048309929789368104,
      "loss": 1.9313,
      "theoretical_loss": 4.573559764140864,
      "tokens_seen": 143458304
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004830892678034102,
      "loss": 1.7968,
      "theoretical_loss": 4.573286598023898,
      "tokens_seen": 143523840
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048307923771313946,
      "loss": 1.8067,
      "theoretical_loss": 4.573013591519029,
      "tokens_seen": 143589376
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004830692076228686,
      "loss": 1.8956,
      "theoretical_loss": 4.572740744460207,
      "tokens_seen": 143654912
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004830591775325978,
      "loss": 1.7567,
      "theoretical_loss": 4.572468056681634,
      "tokens_seen": 143720448
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000483049147442327,
      "loss": 1.8012,
      "theoretical_loss": 4.57219552801776,
      "tokens_seen": 143785984
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004830391173520562,
      "loss": 1.7659,
      "theoretical_loss": 4.57192315830328,
      "tokens_seen": 143851520
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048302908726178536,
      "loss": 1.9409,
      "theoretical_loss": 4.571650947373138,
      "tokens_seen": 143917056
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048301905717151454,
      "loss": 1.7954,
      "theoretical_loss": 4.571378895062525,
      "tokens_seen": 143982592
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004830090270812437,
      "loss": 1.7819,
      "theoretical_loss": 4.571107001206875,
      "tokens_seen": 144048128
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048299899699097296,
      "loss": 1.6938,
      "theoretical_loss": 4.570835265641872,
      "tokens_seen": 144113664
    },
    {
      "epoch": 0.04,
      "objective/train/docs_used": 54758,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.8936374187469482,
      "objective/train/theoretical_loss": 4.57056368820344,
      "objective/train/tokens_used": 164639200,
      "theoretical_loss": 4.57056368820344,
      "tokens_seen": 144179200
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004829889669007021,
      "loss": 1.8936,
      "theoretical_loss": 4.57056368820344,
      "tokens_seen": 144179200
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004829789368104313,
      "loss": 1.772,
      "theoretical_loss": 4.570292268727751,
      "tokens_seen": 144244736
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048296890672016045,
      "loss": 1.853,
      "theoretical_loss": 4.570021007051221,
      "tokens_seen": 144310272
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004829588766298897,
      "loss": 1.8815,
      "theoretical_loss": 4.569749903010507,
      "tokens_seen": 144375808
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048294884653961887,
      "loss": 1.9029,
      "theoretical_loss": 4.569478956442513,
      "tokens_seen": 144441344
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048293881644934805,
      "loss": 1.7855,
      "theoretical_loss": 4.569208167184382,
      "tokens_seen": 144506880
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048292878635907723,
      "loss": 1.9147,
      "theoretical_loss": 4.5689375350735,
      "tokens_seen": 144572416
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048291875626880646,
      "loss": 1.8141,
      "theoretical_loss": 4.568667059947496,
      "tokens_seen": 144637952
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004829087261785356,
      "loss": 1.7701,
      "theoretical_loss": 4.568396741644241,
      "tokens_seen": 144703488
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004828986960882648,
      "loss": 1.7594,
      "theoretical_loss": 4.568126580001843,
      "tokens_seen": 144769024
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048288866599799395,
      "loss": 1.7744,
      "theoretical_loss": 4.567856574858656,
      "tokens_seen": 144834560
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004828786359077232,
      "loss": 1.8311,
      "theoretical_loss": 4.567586726053266,
      "tokens_seen": 144900096
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048286860581745237,
      "loss": 1.8273,
      "theoretical_loss": 4.567317033424507,
      "tokens_seen": 144965632
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048285857572718155,
      "loss": 1.7841,
      "theoretical_loss": 4.567047496811445,
      "tokens_seen": 145031168
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048284854563691073,
      "loss": 1.8312,
      "theoretical_loss": 4.566778116053389,
      "tokens_seen": 145096704
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004828385155466399,
      "loss": 1.8487,
      "theoretical_loss": 4.566508890989883,
      "tokens_seen": 145162240
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004828284854563691,
      "loss": 1.609,
      "theoretical_loss": 4.566239821460712,
      "tokens_seen": 145227776
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048281845536609833,
      "loss": 1.9368,
      "theoretical_loss": 4.5659709073058945,
      "tokens_seen": 145293312
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048280842527582746,
      "loss": 1.8547,
      "theoretical_loss": 4.565702148365686,
      "tokens_seen": 145358848
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004827983951855567,
      "loss": 1.7557,
      "theoretical_loss": 4.56543354448058,
      "tokens_seen": 145424384
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004827883650952858,
      "loss": 1.9194,
      "theoretical_loss": 4.565165095491306,
      "tokens_seen": 145489920
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048277833500501505,
      "loss": 1.8802,
      "theoretical_loss": 4.5648968012388265,
      "tokens_seen": 145555456
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048276830491474423,
      "loss": 1.9043,
      "theoretical_loss": 4.56462866156434,
      "tokens_seen": 145620992
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004827582748244734,
      "loss": 1.7839,
      "theoretical_loss": 4.564360676309279,
      "tokens_seen": 145686528
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004827482447342026,
      "loss": 1.8837,
      "theoretical_loss": 4.564092845315312,
      "tokens_seen": 145752064
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048273821464393183,
      "loss": 1.9309,
      "theoretical_loss": 4.563825168424337,
      "tokens_seen": 145817600
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000482728184553661,
      "loss": 1.795,
      "theoretical_loss": 4.563557645478488,
      "tokens_seen": 145883136
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004827181544633902,
      "loss": 1.8015,
      "theoretical_loss": 4.56329027632013,
      "tokens_seen": 145948672
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004827081243731194,
      "loss": 1.7802,
      "theoretical_loss": 4.563023060791862,
      "tokens_seen": 146014208
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048269809428284856,
      "loss": 1.8639,
      "theoretical_loss": 4.562755998736511,
      "tokens_seen": 146079744
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004826880641925778,
      "loss": 1.8695,
      "theoretical_loss": 4.562489089997141,
      "tokens_seen": 146145280
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004826780341023069,
      "loss": 1.8572,
      "theoretical_loss": 4.562222334417041,
      "tokens_seen": 146210816
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048266800401203615,
      "loss": 1.9141,
      "theoretical_loss": 4.561955731839734,
      "tokens_seen": 146276352
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004826579739217653,
      "loss": 1.8172,
      "theoretical_loss": 4.561689282108971,
      "tokens_seen": 146341888
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004826479438314945,
      "loss": 1.7483,
      "theoretical_loss": 4.561422985068733,
      "tokens_seen": 146407424
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004826379137412237,
      "loss": 1.7929,
      "theoretical_loss": 4.561156840563231,
      "tokens_seen": 146472960
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004826278836509529,
      "loss": 1.7663,
      "theoretical_loss": 4.560890848436902,
      "tokens_seen": 146538496
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048261785356068206,
      "loss": 1.8883,
      "theoretical_loss": 4.560625008534414,
      "tokens_seen": 146604032
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048260782347041124,
      "loss": 1.8569,
      "theoretical_loss": 4.560359320700662,
      "tokens_seen": 146669568
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004825977933801404,
      "loss": 1.8599,
      "theoretical_loss": 4.560093784780766,
      "tokens_seen": 146735104
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048258776328986966,
      "loss": 1.8156,
      "theoretical_loss": 4.559828400620075,
      "tokens_seen": 146800640
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004825777331995988,
      "loss": 1.7989,
      "theoretical_loss": 4.559563168064165,
      "tokens_seen": 146866176
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000482567703109328,
      "loss": 1.9035,
      "theoretical_loss": 4.559298086958837,
      "tokens_seen": 146931712
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004825576730190572,
      "loss": 1.8435,
      "theoretical_loss": 4.559033157150115,
      "tokens_seen": 146997248
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004825476429287864,
      "loss": 1.9129,
      "theoretical_loss": 4.5587683784842525,
      "tokens_seen": 147062784
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048253761283851556,
      "loss": 1.737,
      "theoretical_loss": 4.558503750807725,
      "tokens_seen": 147128320
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048252758274824474,
      "loss": 1.878,
      "theoretical_loss": 4.558239273967234,
      "tokens_seen": 147193856
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004825175526579739,
      "loss": 1.8733,
      "theoretical_loss": 4.5579749478097025,
      "tokens_seen": 147259392
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048250752256770316,
      "loss": 1.7475,
      "theoretical_loss": 4.557710772182278,
      "tokens_seen": 147324928
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004824974924774323,
      "loss": 1.8864,
      "theoretical_loss": 4.5574467469323325,
      "tokens_seen": 147390464
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004824874623871615,
      "loss": 1.8494,
      "theoretical_loss": 4.557182871907457,
      "tokens_seen": 147456000
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048247743229689065,
      "loss": 1.7087,
      "theoretical_loss": 4.556919146955469,
      "tokens_seen": 147521536
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004824674022066199,
      "loss": 1.7896,
      "theoretical_loss": 4.556655571924404,
      "tokens_seen": 147587072
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048245737211634907,
      "loss": 1.8043,
      "theoretical_loss": 4.556392146662521,
      "tokens_seen": 147652608
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048244734202607825,
      "loss": 1.834,
      "theoretical_loss": 4.556128871018297,
      "tokens_seen": 147718144
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048243731193580743,
      "loss": 1.844,
      "theoretical_loss": 4.555865744840434,
      "tokens_seen": 147783680
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048242728184553666,
      "loss": 1.7309,
      "theoretical_loss": 4.55560276797785,
      "tokens_seen": 147849216
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004824172517552658,
      "loss": 1.9319,
      "theoretical_loss": 4.5553399402796835,
      "tokens_seen": 147914752
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.000482407221664995,
      "loss": 1.8888,
      "theoretical_loss": 4.5550772615952955,
      "tokens_seen": 147980288
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048239719157472415,
      "loss": 1.7123,
      "theoretical_loss": 4.554814731774259,
      "tokens_seen": 148045824
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004823871614844534,
      "loss": 1.7996,
      "theoretical_loss": 4.554552350666373,
      "tokens_seen": 148111360
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048237713139418257,
      "loss": 1.8947,
      "theoretical_loss": 4.554290118121649,
      "tokens_seen": 148176896
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048236710130391175,
      "loss": 1.807,
      "theoretical_loss": 4.554028033990319,
      "tokens_seen": 148242432
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.00048235707121364093,
      "loss": 1.8226,
      "theoretical_loss": 4.5537660981228285,
      "tokens_seen": 148307968
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004823470411233701,
      "loss": 1.7233,
      "theoretical_loss": 4.553504310369844,
      "tokens_seen": 148373504
    },
    {
      "epoch": 0.04,
      "learning_rate": 0.0004823370110330993,
      "loss": 2.0141,
      "theoretical_loss": 4.553242670582245,
      "tokens_seen": 148439040
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048232698094282853,
      "loss": 1.8253,
      "theoretical_loss": 4.55298117861113,
      "tokens_seen": 148504576
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048231695085255766,
      "loss": 1.8617,
      "theoretical_loss": 4.55271983430781,
      "tokens_seen": 148570112
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004823069207622869,
      "loss": 1.7207,
      "theoretical_loss": 4.552458637523815,
      "tokens_seen": 148635648
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000482296890672016,
      "loss": 1.7779,
      "theoretical_loss": 4.552197588110882,
      "tokens_seen": 148701184
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048228686058174525,
      "loss": 1.8452,
      "theoretical_loss": 4.551936685920971,
      "tokens_seen": 148766720
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048227683049147443,
      "loss": 1.8776,
      "theoretical_loss": 4.551675930806251,
      "tokens_seen": 148832256
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004822668004012036,
      "loss": 1.8503,
      "theoretical_loss": 4.551415322619107,
      "tokens_seen": 148897792
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004822567703109328,
      "loss": 1.8684,
      "theoretical_loss": 4.551154861212133,
      "tokens_seen": 148963328
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048224674022066203,
      "loss": 1.8537,
      "theoretical_loss": 4.550894546438139,
      "tokens_seen": 149028864
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048223671013039116,
      "loss": 1.873,
      "theoretical_loss": 4.550634378150148,
      "tokens_seen": 149094400
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004822266800401204,
      "loss": 1.8285,
      "theoretical_loss": 4.550374356201392,
      "tokens_seen": 149159936
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004822166499498495,
      "loss": 1.7859,
      "theoretical_loss": 4.550114480445316,
      "tokens_seen": 149225472
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048220661985957876,
      "loss": 1.7875,
      "theoretical_loss": 4.549854750735575,
      "tokens_seen": 149291008
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048219658976930794,
      "loss": 1.7897,
      "theoretical_loss": 4.5495951669260375,
      "tokens_seen": 149356544
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004821865596790371,
      "loss": 1.8252,
      "theoretical_loss": 4.54933572887078,
      "tokens_seen": 149422080
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004821765295887663,
      "loss": 1.8642,
      "theoretical_loss": 4.5490764364240865,
      "tokens_seen": 149487616
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004821664994984955,
      "loss": 1.9531,
      "theoretical_loss": 4.548817289440455,
      "tokens_seen": 149553152
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048215646940822466,
      "loss": 1.8039,
      "theoretical_loss": 4.548558287774592,
      "tokens_seen": 149618688
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004821464393179539,
      "loss": 1.8515,
      "theoretical_loss": 4.548299431281409,
      "tokens_seen": 149684224
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000482136409227683,
      "loss": 1.7554,
      "theoretical_loss": 4.548040719816029,
      "tokens_seen": 149749760
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048212637913741226,
      "loss": 1.7434,
      "theoretical_loss": 4.547782153233783,
      "tokens_seen": 149815296
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004821163490471414,
      "loss": 1.8033,
      "theoretical_loss": 4.547523731390206,
      "tokens_seen": 149880832
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004821063189568706,
      "loss": 1.8636,
      "theoretical_loss": 4.547265454141046,
      "tokens_seen": 149946368
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004820962888665998,
      "loss": 1.7485,
      "theoretical_loss": 4.547007321342251,
      "tokens_seen": 150011904
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000482086258776329,
      "loss": 1.8457,
      "theoretical_loss": 4.546749332849982,
      "tokens_seen": 150077440
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048207622868605816,
      "loss": 1.6519,
      "theoretical_loss": 4.546491488520601,
      "tokens_seen": 150142976
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004820661985957874,
      "loss": 1.8672,
      "theoretical_loss": 4.546233788210679,
      "tokens_seen": 150208512
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048205616850551653,
      "loss": 1.8646,
      "theoretical_loss": 4.545976231776988,
      "tokens_seen": 150274048
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048204613841524576,
      "loss": 1.8121,
      "theoretical_loss": 4.545718819076509,
      "tokens_seen": 150339584
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004820361083249749,
      "loss": 1.8482,
      "theoretical_loss": 4.545461549966426,
      "tokens_seen": 150405120
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004820260782347041,
      "loss": 1.8493,
      "theoretical_loss": 4.545204424304126,
      "tokens_seen": 150470656
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004820160481444333,
      "loss": 1.8675,
      "theoretical_loss": 4.544947441947201,
      "tokens_seen": 150536192
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004820060180541625,
      "loss": 1.7135,
      "theoretical_loss": 4.544690602753445,
      "tokens_seen": 150601728
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048199598796389167,
      "loss": 1.8806,
      "theoretical_loss": 4.544433906580857,
      "tokens_seen": 150667264
    },
    {
      "epoch": 0.05,
      "objective/train/docs_used": 56873,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.7785301208496094,
      "objective/train/theoretical_loss": 4.544177353287637,
      "objective/train/tokens_used": 171192800,
      "theoretical_loss": 4.544177353287637,
      "tokens_seen": 150732800
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048198595787362085,
      "loss": 1.7785,
      "theoretical_loss": 4.544177353287637,
      "tokens_seen": 150732800
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004819759277833501,
      "loss": 1.901,
      "theoretical_loss": 4.543920942732187,
      "tokens_seen": 150798336
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048196589769307927,
      "loss": 1.8685,
      "theoretical_loss": 4.543664674773112,
      "tokens_seen": 150863872
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048195586760280845,
      "loss": 1.7792,
      "theoretical_loss": 4.543408549269218,
      "tokens_seen": 150929408
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048194583751253763,
      "loss": 1.7453,
      "theoretical_loss": 4.54315256607951,
      "tokens_seen": 150994944
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048193580742226686,
      "loss": 1.7985,
      "theoretical_loss": 4.542896725063195,
      "tokens_seen": 151060480
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000481925777331996,
      "loss": 1.8671,
      "theoretical_loss": 4.542641026079683,
      "tokens_seen": 151126016
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004819157472417252,
      "loss": 1.7404,
      "theoretical_loss": 4.542385468988581,
      "tokens_seen": 151191552
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048190571715145435,
      "loss": 1.754,
      "theoretical_loss": 4.542130053649695,
      "tokens_seen": 151257088
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004818956870611836,
      "loss": 1.8509,
      "theoretical_loss": 4.541874779923031,
      "tokens_seen": 151322624
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048188565697091277,
      "loss": 1.8253,
      "theoretical_loss": 4.541619647668796,
      "tokens_seen": 151388160
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048187562688064195,
      "loss": 1.8002,
      "theoretical_loss": 4.541364656747392,
      "tokens_seen": 151453696
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048186559679037113,
      "loss": 1.8278,
      "theoretical_loss": 4.541109807019422,
      "tokens_seen": 151519232
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004818555667001003,
      "loss": 1.7698,
      "theoretical_loss": 4.540855098345683,
      "tokens_seen": 151584768
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004818455366098295,
      "loss": 1.9249,
      "theoretical_loss": 4.540600530587175,
      "tokens_seen": 151650304
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048183550651955873,
      "loss": 1.8141,
      "theoretical_loss": 4.5403461036050885,
      "tokens_seen": 151715840
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048182547642928786,
      "loss": 1.8268,
      "theoretical_loss": 4.540091817260815,
      "tokens_seen": 151781376
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004818154463390171,
      "loss": 1.6884,
      "theoretical_loss": 4.539837671415941,
      "tokens_seen": 151846912
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004818054162487462,
      "loss": 1.7667,
      "theoretical_loss": 4.539583665932249,
      "tokens_seen": 151912448
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048179538615847545,
      "loss": 1.9719,
      "theoretical_loss": 4.539329800671718,
      "tokens_seen": 151977984
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048178535606820463,
      "loss": 1.7351,
      "theoretical_loss": 4.539076075496519,
      "tokens_seen": 152043520
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004817753259779338,
      "loss": 1.8199,
      "theoretical_loss": 4.538822490269021,
      "tokens_seen": 152109056
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000481765295887663,
      "loss": 1.853,
      "theoretical_loss": 4.538569044851785,
      "tokens_seen": 152174592
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048175526579739223,
      "loss": 1.816,
      "theoretical_loss": 4.538315739107571,
      "tokens_seen": 152240128
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048174523570712136,
      "loss": 1.9017,
      "theoretical_loss": 4.5380625728993245,
      "tokens_seen": 152305664
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004817352056168506,
      "loss": 1.7787,
      "theoretical_loss": 4.537809546090193,
      "tokens_seen": 152371200
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004817251755265797,
      "loss": 1.814,
      "theoretical_loss": 4.53755665854351,
      "tokens_seen": 152436736
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048171514543630896,
      "loss": 1.6619,
      "theoretical_loss": 4.537303910122807,
      "tokens_seen": 152502272
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048170511534603814,
      "loss": 1.7827,
      "theoretical_loss": 4.537051300691805,
      "tokens_seen": 152567808
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004816950852557673,
      "loss": 1.8222,
      "theoretical_loss": 4.5367988301144155,
      "tokens_seen": 152633344
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004816850551654965,
      "loss": 1.9672,
      "theoretical_loss": 4.536546498254746,
      "tokens_seen": 152698880
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004816750250752257,
      "loss": 1.8348,
      "theoretical_loss": 4.536294304977092,
      "tokens_seen": 152764416
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048166499498495486,
      "loss": 1.6739,
      "theoretical_loss": 4.536042250145941,
      "tokens_seen": 152829952
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004816549648946841,
      "loss": 1.7193,
      "theoretical_loss": 4.53579033362597,
      "tokens_seen": 152895488
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004816449348044132,
      "loss": 1.724,
      "theoretical_loss": 4.535538555282048,
      "tokens_seen": 152961024
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048163490471414246,
      "loss": 1.7331,
      "theoretical_loss": 4.535286914979232,
      "tokens_seen": 153026560
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004816248746238716,
      "loss": 1.8635,
      "theoretical_loss": 4.5350354125827685,
      "tokens_seen": 153092096
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004816148445336008,
      "loss": 1.6883,
      "theoretical_loss": 4.534784047958096,
      "tokens_seen": 153157632
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048160481444333,
      "loss": 1.7082,
      "theoretical_loss": 4.534532820970839,
      "tokens_seen": 153223168
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004815947843530592,
      "loss": 1.8293,
      "theoretical_loss": 4.534281731486812,
      "tokens_seen": 153288704
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048158475426278837,
      "loss": 1.8192,
      "theoretical_loss": 4.5340307793720145,
      "tokens_seen": 153354240
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004815747241725176,
      "loss": 1.8918,
      "theoretical_loss": 4.533779964492638,
      "tokens_seen": 153419776
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048156469408224673,
      "loss": 1.6845,
      "theoretical_loss": 4.533529286715059,
      "tokens_seen": 153485312
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048155466399197596,
      "loss": 1.6685,
      "theoretical_loss": 4.533278745905843,
      "tokens_seen": 153550848
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004815446339017051,
      "loss": 1.7774,
      "theoretical_loss": 4.533028341931738,
      "tokens_seen": 153616384
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004815346038114343,
      "loss": 1.7645,
      "theoretical_loss": 4.532778074659685,
      "tokens_seen": 153681920
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004815245737211635,
      "loss": 1.7468,
      "theoretical_loss": 4.532527943956804,
      "tokens_seen": 153747456
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004815145436308927,
      "loss": 1.8127,
      "theoretical_loss": 4.532277949690407,
      "tokens_seen": 153812992
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048150451354062187,
      "loss": 1.774,
      "theoretical_loss": 4.532028091727986,
      "tokens_seen": 153878528
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048149448345035105,
      "loss": 1.8718,
      "theoretical_loss": 4.531778369937222,
      "tokens_seen": 153944064
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048148445336008023,
      "loss": 1.6862,
      "theoretical_loss": 4.53152878418598,
      "tokens_seen": 154009600
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048147442326980947,
      "loss": 1.8103,
      "theoretical_loss": 4.531279334342306,
      "tokens_seen": 154075136
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004814643931795386,
      "loss": 1.7741,
      "theoretical_loss": 4.531030020274436,
      "tokens_seen": 154140672
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048145436308926783,
      "loss": 1.7492,
      "theoretical_loss": 4.530780841850783,
      "tokens_seen": 154206208
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048144433299899696,
      "loss": 1.7424,
      "theoretical_loss": 4.5305317989399505,
      "tokens_seen": 154271744
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004814343029087262,
      "loss": 1.8923,
      "theoretical_loss": 4.530282891410717,
      "tokens_seen": 154337280
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048142427281845537,
      "loss": 1.7417,
      "theoretical_loss": 4.530034119132052,
      "tokens_seen": 154402816
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048141424272818455,
      "loss": 1.8807,
      "theoretical_loss": 4.529785481973102,
      "tokens_seen": 154468352
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048140421263791373,
      "loss": 1.7182,
      "theoretical_loss": 4.529536979803195,
      "tokens_seen": 154533888
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048139418254764297,
      "loss": 1.7866,
      "theoretical_loss": 4.529288612491846,
      "tokens_seen": 154599424
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004813841524573721,
      "loss": 1.6929,
      "theoretical_loss": 4.5290403799087455,
      "tokens_seen": 154664960
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048137412236710133,
      "loss": 1.7288,
      "theoretical_loss": 4.528792281923769,
      "tokens_seen": 154730496
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048136409227683046,
      "loss": 1.7622,
      "theoretical_loss": 4.52854431840697,
      "tokens_seen": 154796032
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004813540621865597,
      "loss": 1.772,
      "theoretical_loss": 4.528296489228585,
      "tokens_seen": 154861568
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004813440320962889,
      "loss": 1.9459,
      "theoretical_loss": 4.528048794259028,
      "tokens_seen": 154927104
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048133400200601806,
      "loss": 1.9092,
      "theoretical_loss": 4.527801233368896,
      "tokens_seen": 154992640
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048132397191574724,
      "loss": 1.8465,
      "theoretical_loss": 4.527553806428962,
      "tokens_seen": 155058176
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004813139418254764,
      "loss": 1.6189,
      "theoretical_loss": 4.5273065133101795,
      "tokens_seen": 155123712
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004813039117352056,
      "loss": 1.8005,
      "theoretical_loss": 4.527059353883682,
      "tokens_seen": 155189248
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048129388164493483,
      "loss": 1.8269,
      "theoretical_loss": 4.526812328020778,
      "tokens_seen": 155254784
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048128385155466396,
      "loss": 1.6647,
      "theoretical_loss": 4.52656543559296,
      "tokens_seen": 155320320
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004812738214643932,
      "loss": 1.8599,
      "theoretical_loss": 4.526318676471891,
      "tokens_seen": 155385856
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004812637913741223,
      "loss": 1.6996,
      "theoretical_loss": 4.526072050529417,
      "tokens_seen": 155451392
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048125376128385156,
      "loss": 1.8563,
      "theoretical_loss": 4.52582555763756,
      "tokens_seen": 155516928
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048124373119358074,
      "loss": 1.7042,
      "theoretical_loss": 4.525579197668517,
      "tokens_seen": 155582464
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004812337011033099,
      "loss": 1.757,
      "theoretical_loss": 4.525332970494663,
      "tokens_seen": 155648000
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048122367101303916,
      "loss": 1.8005,
      "theoretical_loss": 4.525086875988549,
      "tokens_seen": 155713536
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048121364092276834,
      "loss": 1.7983,
      "theoretical_loss": 4.524840914022902,
      "tokens_seen": 155779072
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004812036108324975,
      "loss": 1.9513,
      "theoretical_loss": 4.524595084470625,
      "tokens_seen": 155844608
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004811935807422267,
      "loss": 1.6893,
      "theoretical_loss": 4.524349387204794,
      "tokens_seen": 155910144
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004811835506519559,
      "loss": 1.7949,
      "theoretical_loss": 4.524103822098664,
      "tokens_seen": 155975680
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048117352056168506,
      "loss": 1.8128,
      "theoretical_loss": 4.52385838902566,
      "tokens_seen": 156041216
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004811634904714143,
      "loss": 1.7737,
      "theoretical_loss": 4.523613087859386,
      "tokens_seen": 156106752
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004811534603811434,
      "loss": 1.718,
      "theoretical_loss": 4.523367918473614,
      "tokens_seen": 156172288
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048114343029087266,
      "loss": 1.8071,
      "theoretical_loss": 4.523122880742298,
      "tokens_seen": 156237824
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004811334002006018,
      "loss": 1.8388,
      "theoretical_loss": 4.522877974539556,
      "tokens_seen": 156303360
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000481123370110331,
      "loss": 1.9299,
      "theoretical_loss": 4.522633199739687,
      "tokens_seen": 156368896
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004811133400200602,
      "loss": 1.8169,
      "theoretical_loss": 4.522388556217157,
      "tokens_seen": 156434432
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004811033099297894,
      "loss": 1.7469,
      "theoretical_loss": 4.522144043846609,
      "tokens_seen": 156499968
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048109327983951857,
      "loss": 1.7873,
      "theoretical_loss": 4.521899662502856,
      "tokens_seen": 156565504
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004810832497492478,
      "loss": 1.7597,
      "theoretical_loss": 4.5216554120608805,
      "tokens_seen": 156631040
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048107321965897693,
      "loss": 1.8166,
      "theoretical_loss": 4.521411292395841,
      "tokens_seen": 156696576
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048106318956870616,
      "loss": 1.9367,
      "theoretical_loss": 4.521167303383065,
      "tokens_seen": 156762112
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004810531594784353,
      "loss": 1.8466,
      "theoretical_loss": 4.520923444898051,
      "tokens_seen": 156827648
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004810431293881645,
      "loss": 1.8292,
      "theoretical_loss": 4.520679716816467,
      "tokens_seen": 156893184
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004810330992978937,
      "loss": 1.7351,
      "theoretical_loss": 4.520436119014155,
      "tokens_seen": 156958720
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004810230692076229,
      "loss": 1.7591,
      "theoretical_loss": 4.520192651367121,
      "tokens_seen": 157024256
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048101303911735207,
      "loss": 1.87,
      "theoretical_loss": 4.519949313751547,
      "tokens_seen": 157089792
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048100300902708125,
      "loss": 1.8984,
      "theoretical_loss": 4.519706106043779,
      "tokens_seen": 157155328
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048099297893681043,
      "loss": 1.7165,
      "theoretical_loss": 4.519463028120338,
      "tokens_seen": 157220864
    },
    {
      "epoch": 0.05,
      "objective/train/docs_used": 58983,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.8067922592163086,
      "objective/train/theoretical_loss": 4.519220079857908,
      "objective/train/tokens_used": 177746400,
      "theoretical_loss": 4.519220079857908,
      "tokens_seen": 157286400
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048098294884653967,
      "loss": 1.8068,
      "theoretical_loss": 4.519220079857908,
      "tokens_seen": 157286400
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004809729187562688,
      "loss": 1.819,
      "theoretical_loss": 4.518977261133343,
      "tokens_seen": 157351936
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048096288866599803,
      "loss": 1.6797,
      "theoretical_loss": 4.518734571823668,
      "tokens_seen": 157417472
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048095285857572716,
      "loss": 1.7375,
      "theoretical_loss": 4.518492011806073,
      "tokens_seen": 157483008
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004809428284854564,
      "loss": 1.7527,
      "theoretical_loss": 4.518249580957917,
      "tokens_seen": 157548544
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048093279839518557,
      "loss": 1.8438,
      "theoretical_loss": 4.518007279156725,
      "tokens_seen": 157614080
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048092276830491475,
      "loss": 1.7523,
      "theoretical_loss": 4.5177651062801925,
      "tokens_seen": 157679616
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048091273821464393,
      "loss": 1.833,
      "theoretical_loss": 4.517523062206175,
      "tokens_seen": 157745152
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048090270812437317,
      "loss": 1.7489,
      "theoretical_loss": 4.517281146812701,
      "tokens_seen": 157810688
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004808926780341023,
      "loss": 1.661,
      "theoretical_loss": 4.517039359977961,
      "tokens_seen": 157876224
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048088264794383153,
      "loss": 1.7891,
      "theoretical_loss": 4.516797701580314,
      "tokens_seen": 157941760
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048087261785356066,
      "loss": 1.8851,
      "theoretical_loss": 4.516556171498284,
      "tokens_seen": 158007296
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004808625877632899,
      "loss": 1.8528,
      "theoretical_loss": 4.516314769610557,
      "tokens_seen": 158072832
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004808525576730191,
      "loss": 1.8368,
      "theoretical_loss": 4.516073495795988,
      "tokens_seen": 158138368
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048084252758274826,
      "loss": 1.6086,
      "theoretical_loss": 4.5158323499335955,
      "tokens_seen": 158203904
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048083249749247744,
      "loss": 1.802,
      "theoretical_loss": 4.515591331902561,
      "tokens_seen": 158269440
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004808224674022066,
      "loss": 1.76,
      "theoretical_loss": 4.515350441582231,
      "tokens_seen": 158334976
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004808124373119358,
      "loss": 1.856,
      "theoretical_loss": 4.515109678852117,
      "tokens_seen": 158400512
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048080240722166503,
      "loss": 1.9261,
      "theoretical_loss": 4.514869043591891,
      "tokens_seen": 158466048
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048079237713139416,
      "loss": 1.8655,
      "theoretical_loss": 4.514628535681391,
      "tokens_seen": 158531584
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004807823470411234,
      "loss": 1.7449,
      "theoretical_loss": 4.514388155000615,
      "tokens_seen": 158597120
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004807723169508525,
      "loss": 1.8303,
      "theoretical_loss": 4.5141479014297285,
      "tokens_seen": 158662656
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048076228686058176,
      "loss": 1.789,
      "theoretical_loss": 4.513907774849054,
      "tokens_seen": 158728192
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048075225677031094,
      "loss": 1.6523,
      "theoretical_loss": 4.513667775139078,
      "tokens_seen": 158793728
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004807422266800401,
      "loss": 1.8719,
      "theoretical_loss": 4.5134279021804495,
      "tokens_seen": 158859264
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004807321965897693,
      "loss": 1.7882,
      "theoretical_loss": 4.513188155853978,
      "tokens_seen": 158924800
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048072216649949854,
      "loss": 1.7802,
      "theoretical_loss": 4.512948536040636,
      "tokens_seen": 158990336
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048071213640922766,
      "loss": 1.8816,
      "theoretical_loss": 4.512709042621554,
      "tokens_seen": 159055872
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004807021063189569,
      "loss": 1.6325,
      "theoretical_loss": 4.512469675478026,
      "tokens_seen": 159121408
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000480692076228686,
      "loss": 1.8008,
      "theoretical_loss": 4.512230434491503,
      "tokens_seen": 159186944
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048068204613841526,
      "loss": 1.7445,
      "theoretical_loss": 4.511991319543599,
      "tokens_seen": 159252480
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048067201604814444,
      "loss": 1.8427,
      "theoretical_loss": 4.511752330516086,
      "tokens_seen": 159318016
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004806619859578736,
      "loss": 1.8523,
      "theoretical_loss": 4.5115134672908965,
      "tokens_seen": 159383552
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004806519558676028,
      "loss": 1.7966,
      "theoretical_loss": 4.511274729750123,
      "tokens_seen": 159449088
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000480641925777332,
      "loss": 1.7717,
      "theoretical_loss": 4.5110361177760145,
      "tokens_seen": 159514624
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048063189568706117,
      "loss": 1.6707,
      "theoretical_loss": 4.5107976312509805,
      "tokens_seen": 159580160
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004806218655967904,
      "loss": 1.7945,
      "theoretical_loss": 4.510559270057587,
      "tokens_seen": 159645696
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048061183550651953,
      "loss": 1.7047,
      "theoretical_loss": 4.51032103407856,
      "tokens_seen": 159711232
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048060180541624877,
      "loss": 1.6927,
      "theoretical_loss": 4.510082923196784,
      "tokens_seen": 159776768
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048059177532597795,
      "loss": 1.8062,
      "theoretical_loss": 4.5098449372952985,
      "tokens_seen": 159842304
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048058174523570713,
      "loss": 1.6627,
      "theoretical_loss": 4.5096070762573,
      "tokens_seen": 159907840
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004805717151454363,
      "loss": 1.7974,
      "theoretical_loss": 4.509369339966146,
      "tokens_seen": 159973376
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004805616850551655,
      "loss": 1.7575,
      "theoretical_loss": 4.509131728305347,
      "tokens_seen": 160038912
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048055165496489467,
      "loss": 1.8646,
      "theoretical_loss": 4.50889424115857,
      "tokens_seen": 160104448
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004805416248746239,
      "loss": 1.8404,
      "theoretical_loss": 4.50865687840964,
      "tokens_seen": 160169984
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048053159478435303,
      "loss": 1.7881,
      "theoretical_loss": 4.508419639942538,
      "tokens_seen": 160235520
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048052156469408227,
      "loss": 1.8251,
      "theoretical_loss": 4.5081825256413985,
      "tokens_seen": 160301056
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004805115346038114,
      "loss": 1.8363,
      "theoretical_loss": 4.507945535390512,
      "tokens_seen": 160366592
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048050150451354063,
      "loss": 1.781,
      "theoretical_loss": 4.507708669074326,
      "tokens_seen": 160432128
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004804914744232698,
      "loss": 1.6387,
      "theoretical_loss": 4.5074719265774394,
      "tokens_seen": 160497664
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000480481444332999,
      "loss": 1.9221,
      "theoretical_loss": 4.507235307784608,
      "tokens_seen": 160563200
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048047141424272823,
      "loss": 1.7409,
      "theoretical_loss": 4.5069988125807425,
      "tokens_seen": 160628736
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048046138415245736,
      "loss": 1.87,
      "theoretical_loss": 4.506762440850906,
      "tokens_seen": 160694272
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004804513540621866,
      "loss": 1.8124,
      "theoretical_loss": 4.506526192480315,
      "tokens_seen": 160759808
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048044132397191577,
      "loss": 1.8531,
      "theoretical_loss": 4.506290067354341,
      "tokens_seen": 160825344
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048043129388164495,
      "loss": 1.7425,
      "theoretical_loss": 4.506054065358508,
      "tokens_seen": 160890880
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048042126379137413,
      "loss": 1.7778,
      "theoretical_loss": 4.505818186378491,
      "tokens_seen": 160956416
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048041123370110337,
      "loss": 1.809,
      "theoretical_loss": 4.505582430300121,
      "tokens_seen": 161021952
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004804012036108325,
      "loss": 1.6901,
      "theoretical_loss": 4.505346797009381,
      "tokens_seen": 161087488
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048039117352056173,
      "loss": 1.7419,
      "theoretical_loss": 4.505111286392402,
      "tokens_seen": 161153024
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048038114343029086,
      "loss": 1.8605,
      "theoretical_loss": 4.50487589833547,
      "tokens_seen": 161218560
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004803711133400201,
      "loss": 1.8646,
      "theoretical_loss": 4.504640632725025,
      "tokens_seen": 161284096
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004803610832497493,
      "loss": 1.6297,
      "theoretical_loss": 4.504405489447654,
      "tokens_seen": 161349632
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048035105315947846,
      "loss": 1.7034,
      "theoretical_loss": 4.504170468390096,
      "tokens_seen": 161415168
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048034102306920764,
      "loss": 1.7302,
      "theoretical_loss": 4.503935569439242,
      "tokens_seen": 161480704
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004803309929789368,
      "loss": 1.6594,
      "theoretical_loss": 4.5037007924821335,
      "tokens_seen": 161546240
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000480320962888666,
      "loss": 1.7866,
      "theoretical_loss": 4.503466137405961,
      "tokens_seen": 161611776
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048031093279839523,
      "loss": 1.7318,
      "theoretical_loss": 4.503231604098065,
      "tokens_seen": 161677312
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048030090270812436,
      "loss": 1.7185,
      "theoretical_loss": 4.50299719244594,
      "tokens_seen": 161742848
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004802908726178536,
      "loss": 1.7792,
      "theoretical_loss": 4.502762902337222,
      "tokens_seen": 161808384
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004802808425275827,
      "loss": 1.7154,
      "theoretical_loss": 4.502528733659704,
      "tokens_seen": 161873920
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048027081243731196,
      "loss": 1.8172,
      "theoretical_loss": 4.502294686301323,
      "tokens_seen": 161939456
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048026078234704114,
      "loss": 1.8717,
      "theoretical_loss": 4.502060760150167,
      "tokens_seen": 162004992
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004802507522567703,
      "loss": 1.8119,
      "theoretical_loss": 4.501826955094472,
      "tokens_seen": 162070528
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004802407221664995,
      "loss": 1.6763,
      "theoretical_loss": 4.501593271022623,
      "tokens_seen": 162136064
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048023069207622874,
      "loss": 1.6446,
      "theoretical_loss": 4.501359707823149,
      "tokens_seen": 162201600
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048022066198595786,
      "loss": 1.7881,
      "theoretical_loss": 4.501126265384732,
      "tokens_seen": 162267136
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004802106318956871,
      "loss": 1.8034,
      "theoretical_loss": 4.500892943596199,
      "tokens_seen": 162332672
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048020060180541623,
      "loss": 1.849,
      "theoretical_loss": 4.500659742346524,
      "tokens_seen": 162398208
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048019057171514546,
      "loss": 1.7219,
      "theoretical_loss": 4.500426661524828,
      "tokens_seen": 162463744
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048018054162487464,
      "loss": 1.8243,
      "theoretical_loss": 4.500193701020379,
      "tokens_seen": 162529280
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004801705115346038,
      "loss": 1.7215,
      "theoretical_loss": 4.499960860722592,
      "tokens_seen": 162594816
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000480160481444333,
      "loss": 1.8008,
      "theoretical_loss": 4.499728140521025,
      "tokens_seen": 162660352
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004801504513540622,
      "loss": 1.8567,
      "theoretical_loss": 4.499495540305388,
      "tokens_seen": 162725888
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048014042126379137,
      "loss": 1.8054,
      "theoretical_loss": 4.49926305996553,
      "tokens_seen": 162791424
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004801303911735206,
      "loss": 1.6914,
      "theoretical_loss": 4.499030699391449,
      "tokens_seen": 162856960
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048012036108324973,
      "loss": 1.6238,
      "theoretical_loss": 4.49879845847329,
      "tokens_seen": 162922496
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048011033099297897,
      "loss": 1.8331,
      "theoretical_loss": 4.498566337101337,
      "tokens_seen": 162988032
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048010030090270815,
      "loss": 1.8609,
      "theoretical_loss": 4.4983343351660245,
      "tokens_seen": 163053568
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048009027081243733,
      "loss": 1.8399,
      "theoretical_loss": 4.498102452557928,
      "tokens_seen": 163119104
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004800802407221665,
      "loss": 1.7563,
      "theoretical_loss": 4.497870689167771,
      "tokens_seen": 163184640
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004800702106318957,
      "loss": 1.7608,
      "theoretical_loss": 4.497639044886412,
      "tokens_seen": 163250176
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048006018054162487,
      "loss": 1.8405,
      "theoretical_loss": 4.497407519604866,
      "tokens_seen": 163315712
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004800501504513541,
      "loss": 1.7513,
      "theoretical_loss": 4.49717611321428,
      "tokens_seen": 163381248
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048004012036108323,
      "loss": 1.7295,
      "theoretical_loss": 4.496944825605951,
      "tokens_seen": 163446784
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048003009027081247,
      "loss": 1.6611,
      "theoretical_loss": 4.496713656671317,
      "tokens_seen": 163512320
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004800200601805416,
      "loss": 1.7357,
      "theoretical_loss": 4.496482606301957,
      "tokens_seen": 163577856
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048001003009027083,
      "loss": 1.5804,
      "theoretical_loss": 4.496251674389596,
      "tokens_seen": 163643392
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00048,
      "loss": 1.7244,
      "theoretical_loss": 4.496020860826098,
      "tokens_seen": 163708928
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004799899699097292,
      "loss": 1.8658,
      "theoretical_loss": 4.49579016550347,
      "tokens_seen": 163774464
    },
    {
      "epoch": 0.05,
      "objective/train/docs_used": 60958,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.7809185981750488,
      "objective/train/theoretical_loss": 4.49555958831386,
      "objective/train/tokens_used": 184300000,
      "theoretical_loss": 4.49555958831386,
      "tokens_seen": 163840000
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004799799398194584,
      "loss": 1.7809,
      "theoretical_loss": 4.49555958831386,
      "tokens_seen": 163840000
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047996990972918756,
      "loss": 1.6815,
      "theoretical_loss": 4.49532912914956,
      "tokens_seen": 163905536
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047995987963891674,
      "loss": 1.7271,
      "theoretical_loss": 4.495098787903,
      "tokens_seen": 163971072
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047994984954864597,
      "loss": 1.8059,
      "theoretical_loss": 4.4948685644667545,
      "tokens_seen": 164036608
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004799398194583751,
      "loss": 1.7039,
      "theoretical_loss": 4.494638458733535,
      "tokens_seen": 164102144
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047992978936810433,
      "loss": 1.8323,
      "theoretical_loss": 4.494408470596195,
      "tokens_seen": 164167680
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004799197592778335,
      "loss": 1.7104,
      "theoretical_loss": 4.494178599947729,
      "tokens_seen": 164233216
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004799097291875627,
      "loss": 1.8078,
      "theoretical_loss": 4.4939488466812705,
      "tokens_seen": 164298752
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004798996990972919,
      "loss": 1.7664,
      "theoretical_loss": 4.493719210690093,
      "tokens_seen": 164364288
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047988966900702106,
      "loss": 1.7138,
      "theoretical_loss": 4.493489691867612,
      "tokens_seen": 164429824
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047987963891675024,
      "loss": 1.7937,
      "theoretical_loss": 4.493260290107379,
      "tokens_seen": 164495360
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004798696088264795,
      "loss": 1.716,
      "theoretical_loss": 4.493031005303084,
      "tokens_seen": 164560896
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004798595787362086,
      "loss": 1.6687,
      "theoretical_loss": 4.49280183734856,
      "tokens_seen": 164626432
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047984954864593784,
      "loss": 1.8047,
      "theoretical_loss": 4.492572786137774,
      "tokens_seen": 164691968
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047983951855566696,
      "loss": 1.8098,
      "theoretical_loss": 4.492343851564835,
      "tokens_seen": 164757504
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004798294884653962,
      "loss": 1.7211,
      "theoretical_loss": 4.492115033523987,
      "tokens_seen": 164823040
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004798194583751254,
      "loss": 1.7946,
      "theoretical_loss": 4.491886331909615,
      "tokens_seen": 164888576
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047980942828485456,
      "loss": 1.5909,
      "theoretical_loss": 4.491657746616241,
      "tokens_seen": 164954112
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047979939819458374,
      "loss": 1.7509,
      "theoretical_loss": 4.49142927753852,
      "tokens_seen": 165019648
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004797893681043129,
      "loss": 1.8321,
      "theoretical_loss": 4.491200924571251,
      "tokens_seen": 165085184
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004797793380140421,
      "loss": 1.7227,
      "theoretical_loss": 4.490972687609364,
      "tokens_seen": 165150720
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047976930792377134,
      "loss": 1.7344,
      "theoretical_loss": 4.4907445665479315,
      "tokens_seen": 165216256
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047975927783350047,
      "loss": 1.8264,
      "theoretical_loss": 4.490516561282157,
      "tokens_seen": 165281792
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004797492477432297,
      "loss": 1.7194,
      "theoretical_loss": 4.4902886717073835,
      "tokens_seen": 165347328
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004797392176529589,
      "loss": 1.7164,
      "theoretical_loss": 4.49006089771909,
      "tokens_seen": 165412864
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047972918756268807,
      "loss": 1.6982,
      "theoretical_loss": 4.489833239212888,
      "tokens_seen": 165478400
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004797191574724173,
      "loss": 1.9256,
      "theoretical_loss": 4.48960569608453,
      "tokens_seen": 165543936
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047970912738214643,
      "loss": 1.8143,
      "theoretical_loss": 4.489378268229897,
      "tokens_seen": 165609472
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047969909729187566,
      "loss": 1.6925,
      "theoretical_loss": 4.489150955545012,
      "tokens_seen": 165675008
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047968906720160484,
      "loss": 1.7285,
      "theoretical_loss": 4.488923757926031,
      "tokens_seen": 165740544
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000479679037111334,
      "loss": 1.7384,
      "theoretical_loss": 4.4886966752692405,
      "tokens_seen": 165806080
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004796690070210632,
      "loss": 1.7936,
      "theoretical_loss": 4.488469707471066,
      "tokens_seen": 165871616
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004796589769307924,
      "loss": 1.7665,
      "theoretical_loss": 4.488242854428064,
      "tokens_seen": 165937152
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047964894684052157,
      "loss": 1.7552,
      "theoretical_loss": 4.488016116036929,
      "tokens_seen": 166002688
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004796389167502508,
      "loss": 1.6894,
      "theoretical_loss": 4.487789492194485,
      "tokens_seen": 166068224
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047962888665997993,
      "loss": 1.778,
      "theoretical_loss": 4.487562982797693,
      "tokens_seen": 166133760
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047961885656970917,
      "loss": 1.6911,
      "theoretical_loss": 4.487336587743643,
      "tokens_seen": 166199296
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047960882647943835,
      "loss": 1.8122,
      "theoretical_loss": 4.487110306929562,
      "tokens_seen": 166264832
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047959879638916753,
      "loss": 1.8554,
      "theoretical_loss": 4.48688414025281,
      "tokens_seen": 166330368
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004795887662988967,
      "loss": 1.6982,
      "theoretical_loss": 4.486658087610875,
      "tokens_seen": 166395904
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004795787362086259,
      "loss": 1.8096,
      "theoretical_loss": 4.486432148901384,
      "tokens_seen": 166461440
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047956870611835507,
      "loss": 1.7395,
      "theoretical_loss": 4.48620632402209,
      "tokens_seen": 166526976
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004795586760280843,
      "loss": 1.7608,
      "theoretical_loss": 4.485980612870883,
      "tokens_seen": 166592512
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047954864593781343,
      "loss": 1.8281,
      "theoretical_loss": 4.48575501534578,
      "tokens_seen": 166658048
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047953861584754267,
      "loss": 1.662,
      "theoretical_loss": 4.485529531344932,
      "tokens_seen": 166723584
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004795285857572718,
      "loss": 1.8048,
      "theoretical_loss": 4.485304160766624,
      "tokens_seen": 166789120
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047951855566700103,
      "loss": 1.6771,
      "theoretical_loss": 4.485078903509266,
      "tokens_seen": 166854656
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004795085255767302,
      "loss": 1.6904,
      "theoretical_loss": 4.484853759471403,
      "tokens_seen": 166920192
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004794984954864594,
      "loss": 1.7241,
      "theoretical_loss": 4.484628728551711,
      "tokens_seen": 166985728
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004794884653961886,
      "loss": 1.7183,
      "theoretical_loss": 4.484403810648994,
      "tokens_seen": 167051264
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047947843530591776,
      "loss": 1.7106,
      "theoretical_loss": 4.484179005662186,
      "tokens_seen": 167116800
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047946840521564694,
      "loss": 1.827,
      "theoretical_loss": 4.483954313490354,
      "tokens_seen": 167182336
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047945837512537617,
      "loss": 1.6314,
      "theoretical_loss": 4.483729734032694,
      "tokens_seen": 167247872
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004794483450351053,
      "loss": 1.6948,
      "theoretical_loss": 4.483505267188528,
      "tokens_seen": 167313408
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047943831494483453,
      "loss": 1.8243,
      "theoretical_loss": 4.48328091285731,
      "tokens_seen": 167378944
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004794282848545637,
      "loss": 1.7652,
      "theoretical_loss": 4.483056670938625,
      "tokens_seen": 167444480
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004794182547642929,
      "loss": 1.7242,
      "theoretical_loss": 4.482832541332183,
      "tokens_seen": 167510016
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004794082246740221,
      "loss": 1.8529,
      "theoretical_loss": 4.482608523937824,
      "tokens_seen": 167575552
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047939819458375126,
      "loss": 1.676,
      "theoretical_loss": 4.4823846186555185,
      "tokens_seen": 167641088
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047938816449348044,
      "loss": 1.6837,
      "theoretical_loss": 4.482160825385363,
      "tokens_seen": 167706624
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004793781344032097,
      "loss": 1.899,
      "theoretical_loss": 4.481937144027583,
      "tokens_seen": 167772160
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004793681043129388,
      "loss": 1.7583,
      "theoretical_loss": 4.48171357448253,
      "tokens_seen": 167837696
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047935807422266804,
      "loss": 1.7972,
      "theoretical_loss": 4.481490116650686,
      "tokens_seen": 167903232
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047934804413239716,
      "loss": 1.7368,
      "theoretical_loss": 4.48126677043266,
      "tokens_seen": 167968768
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004793380140421264,
      "loss": 1.7969,
      "theoretical_loss": 4.481043535729183,
      "tokens_seen": 168034304
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004793279839518556,
      "loss": 1.7189,
      "theoretical_loss": 4.480820412441122,
      "tokens_seen": 168099840
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047931795386158476,
      "loss": 1.7506,
      "theoretical_loss": 4.4805974004694615,
      "tokens_seen": 168165376
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047930792377131394,
      "loss": 1.6918,
      "theoretical_loss": 4.48037449971532,
      "tokens_seen": 168230912
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004792978936810431,
      "loss": 1.7487,
      "theoretical_loss": 4.480151710079937,
      "tokens_seen": 168296448
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004792878635907723,
      "loss": 1.8405,
      "theoretical_loss": 4.479929031464682,
      "tokens_seen": 168361984
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047927783350050154,
      "loss": 1.6342,
      "theoretical_loss": 4.479706463771047,
      "tokens_seen": 168427520
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047926780341023067,
      "loss": 1.8045,
      "theoretical_loss": 4.479484006900652,
      "tokens_seen": 168493056
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004792577733199599,
      "loss": 1.8062,
      "theoretical_loss": 4.479261660755242,
      "tokens_seen": 168558592
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004792477432296891,
      "loss": 1.7573,
      "theoretical_loss": 4.479039425236687,
      "tokens_seen": 168624128
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047923771313941827,
      "loss": 1.8657,
      "theoretical_loss": 4.478817300246982,
      "tokens_seen": 168689664
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047922768304914745,
      "loss": 1.7128,
      "theoretical_loss": 4.478595285688247,
      "tokens_seen": 168755200
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047921765295887663,
      "loss": 1.7152,
      "theoretical_loss": 4.478373381462728,
      "tokens_seen": 168820736
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004792076228686058,
      "loss": 1.7462,
      "theoretical_loss": 4.478151587472791,
      "tokens_seen": 168886272
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047919759277833504,
      "loss": 1.7532,
      "theoretical_loss": 4.477929903620931,
      "tokens_seen": 168951808
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047918756268806417,
      "loss": 1.7588,
      "theoretical_loss": 4.477708329809766,
      "tokens_seen": 169017344
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004791775325977934,
      "loss": 1.7755,
      "theoretical_loss": 4.477486865942036,
      "tokens_seen": 169082880
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047916750250752253,
      "loss": 1.5928,
      "theoretical_loss": 4.477265511920607,
      "tokens_seen": 169148416
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047915747241725177,
      "loss": 1.7615,
      "theoretical_loss": 4.477044267648466,
      "tokens_seen": 169213952
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047914744232698095,
      "loss": 1.7971,
      "theoretical_loss": 4.476823133028725,
      "tokens_seen": 169279488
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047913741223671013,
      "loss": 1.7364,
      "theoretical_loss": 4.47660210796462,
      "tokens_seen": 169345024
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004791273821464393,
      "loss": 1.8278,
      "theoretical_loss": 4.476381192359504,
      "tokens_seen": 169410560
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047911735205616855,
      "loss": 1.7786,
      "theoretical_loss": 4.476160386116861,
      "tokens_seen": 169476096
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004791073219658977,
      "loss": 1.69,
      "theoretical_loss": 4.475939689140291,
      "tokens_seen": 169541632
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004790972918756269,
      "loss": 1.8098,
      "theoretical_loss": 4.475719101333519,
      "tokens_seen": 169607168
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047908726178535604,
      "loss": 1.7492,
      "theoretical_loss": 4.475498622600391,
      "tokens_seen": 169672704
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047907723169508527,
      "loss": 1.6377,
      "theoretical_loss": 4.475278252844875,
      "tokens_seen": 169738240
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047906720160481445,
      "loss": 1.7647,
      "theoretical_loss": 4.475057991971062,
      "tokens_seen": 169803776
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047905717151454363,
      "loss": 1.7809,
      "theoretical_loss": 4.474837839883162,
      "tokens_seen": 169869312
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004790471414242728,
      "loss": 1.835,
      "theoretical_loss": 4.474617796485507,
      "tokens_seen": 169934848
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000479037111334002,
      "loss": 1.6561,
      "theoretical_loss": 4.474397861682552,
      "tokens_seen": 170000384
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004790270812437312,
      "loss": 1.6679,
      "theoretical_loss": 4.474178035378869,
      "tokens_seen": 170065920
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004790170511534604,
      "loss": 1.6517,
      "theoretical_loss": 4.473958317479154,
      "tokens_seen": 170131456
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047900702106318954,
      "loss": 1.82,
      "theoretical_loss": 4.473738707888221,
      "tokens_seen": 170196992
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004789969909729188,
      "loss": 1.7443,
      "theoretical_loss": 4.473519206511006,
      "tokens_seen": 170262528
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004789869608826479,
      "loss": 1.9164,
      "theoretical_loss": 4.473299813252565,
      "tokens_seen": 170328064
    },
    {
      "epoch": 0.05,
      "objective/train/docs_used": 63049,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.612995982170105,
      "objective/train/theoretical_loss": 4.473080528018071,
      "objective/train/tokens_used": 190853600,
      "theoretical_loss": 4.473080528018071,
      "tokens_seen": 170393600
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047897693079237714,
      "loss": 1.613,
      "theoretical_loss": 4.473080528018071,
      "tokens_seen": 170393600
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047896690070210637,
      "loss": 1.7287,
      "theoretical_loss": 4.4728613507128205,
      "tokens_seen": 170459136
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004789568706118355,
      "loss": 1.6257,
      "theoretical_loss": 4.472642281242226,
      "tokens_seen": 170524672
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047894684052156473,
      "loss": 1.7309,
      "theoretical_loss": 4.472423319511822,
      "tokens_seen": 170590208
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004789368104312939,
      "loss": 1.7301,
      "theoretical_loss": 4.472204465427261,
      "tokens_seen": 170655744
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004789267803410231,
      "loss": 1.7257,
      "theoretical_loss": 4.471985718894312,
      "tokens_seen": 170721280
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004789167502507523,
      "loss": 1.6335,
      "theoretical_loss": 4.471767079818866,
      "tokens_seen": 170786816
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047890672016048146,
      "loss": 1.7068,
      "theoretical_loss": 4.471548548106932,
      "tokens_seen": 170852352
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047889669007021064,
      "loss": 1.7133,
      "theoretical_loss": 4.471330123664634,
      "tokens_seen": 170917888
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004788866599799399,
      "loss": 1.6693,
      "theoretical_loss": 4.471111806398218,
      "tokens_seen": 170983424
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000478876629889669,
      "loss": 1.6087,
      "theoretical_loss": 4.4708935962140455,
      "tokens_seen": 171048960
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047886659979939824,
      "loss": 1.735,
      "theoretical_loss": 4.4706754930185975,
      "tokens_seen": 171114496
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047885656970912736,
      "loss": 1.6153,
      "theoretical_loss": 4.47045749671847,
      "tokens_seen": 171180032
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004788465396188566,
      "loss": 1.7522,
      "theoretical_loss": 4.470239607220377,
      "tokens_seen": 171245568
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004788365095285858,
      "loss": 1.7333,
      "theoretical_loss": 4.470021824431152,
      "tokens_seen": 171311104
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047882647943831496,
      "loss": 1.7931,
      "theoretical_loss": 4.469804148257742,
      "tokens_seen": 171376640
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047881644934804414,
      "loss": 1.5728,
      "theoretical_loss": 4.469586578607213,
      "tokens_seen": 171442176
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004788064192577733,
      "loss": 1.9226,
      "theoretical_loss": 4.469369115386746,
      "tokens_seen": 171507712
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004787963891675025,
      "loss": 1.7366,
      "theoretical_loss": 4.46915175850364,
      "tokens_seen": 171573248
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047878635907723174,
      "loss": 1.9037,
      "theoretical_loss": 4.468934507865308,
      "tokens_seen": 171638784
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047877632898696087,
      "loss": 1.8194,
      "theoretical_loss": 4.46871736337928,
      "tokens_seen": 171704320
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004787662988966901,
      "loss": 1.6759,
      "theoretical_loss": 4.468500324953202,
      "tokens_seen": 171769856
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004787562688064193,
      "loss": 1.656,
      "theoretical_loss": 4.468283392494836,
      "tokens_seen": 171835392
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047874623871614847,
      "loss": 1.6941,
      "theoretical_loss": 4.468066565912057,
      "tokens_seen": 171900928
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047873620862587765,
      "loss": 1.7873,
      "theoretical_loss": 4.467849845112859,
      "tokens_seen": 171966464
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047872617853560683,
      "loss": 1.7772,
      "theoretical_loss": 4.467633230005347,
      "tokens_seen": 172032000
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000478716148445336,
      "loss": 1.8321,
      "theoretical_loss": 4.467416720497743,
      "tokens_seen": 172097536
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047870611835506524,
      "loss": 1.8337,
      "theoretical_loss": 4.467200316498385,
      "tokens_seen": 172163072
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047869608826479437,
      "loss": 1.8215,
      "theoretical_loss": 4.4669840179157205,
      "tokens_seen": 172228608
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004786860581745236,
      "loss": 1.7315,
      "theoretical_loss": 4.466767824658317,
      "tokens_seen": 172294144
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047867602808425273,
      "loss": 1.8665,
      "theoretical_loss": 4.466551736634852,
      "tokens_seen": 172359680
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047866599799398197,
      "loss": 1.6675,
      "theoretical_loss": 4.466335753754118,
      "tokens_seen": 172425216
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047865596790371115,
      "loss": 1.5588,
      "theoretical_loss": 4.466119875925022,
      "tokens_seen": 172490752
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047864593781344033,
      "loss": 1.7971,
      "theoretical_loss": 4.465904103056586,
      "tokens_seen": 172556288
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004786359077231695,
      "loss": 1.6724,
      "theoretical_loss": 4.465688435057938,
      "tokens_seen": 172621824
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047862587763289875,
      "loss": 1.9731,
      "theoretical_loss": 4.46547287183833,
      "tokens_seen": 172687360
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004786158475426279,
      "loss": 1.756,
      "theoretical_loss": 4.465257413307119,
      "tokens_seen": 172752896
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004786058174523571,
      "loss": 1.7943,
      "theoretical_loss": 4.465042059373776,
      "tokens_seen": 172818432
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047859578736208624,
      "loss": 1.7907,
      "theoretical_loss": 4.464826809947887,
      "tokens_seen": 172883968
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047858575727181547,
      "loss": 1.7817,
      "theoretical_loss": 4.464611664939149,
      "tokens_seen": 172949504
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047857572718154465,
      "loss": 1.651,
      "theoretical_loss": 4.46439662425737,
      "tokens_seen": 173015040
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047856569709127383,
      "loss": 1.7665,
      "theoretical_loss": 4.464181687812474,
      "tokens_seen": 173080576
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000478555667001003,
      "loss": 1.7801,
      "theoretical_loss": 4.4639668555144905,
      "tokens_seen": 173146112
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004785456369107322,
      "loss": 1.6035,
      "theoretical_loss": 4.463752127273567,
      "tokens_seen": 173211648
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004785356068204614,
      "loss": 1.6853,
      "theoretical_loss": 4.463537502999959,
      "tokens_seen": 173277184
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004785255767301906,
      "loss": 1.6825,
      "theoretical_loss": 4.4633229826040335,
      "tokens_seen": 173342720
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047851554663991974,
      "loss": 1.8461,
      "theoretical_loss": 4.46310856599627,
      "tokens_seen": 173408256
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000478505516549649,
      "loss": 1.6496,
      "theoretical_loss": 4.462894253087258,
      "tokens_seen": 173473792
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004784954864593781,
      "loss": 1.6845,
      "theoretical_loss": 4.462680043787699,
      "tokens_seen": 173539328
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047848545636910734,
      "loss": 1.7999,
      "theoretical_loss": 4.4624659380084015,
      "tokens_seen": 173604864
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004784754262788365,
      "loss": 1.7893,
      "theoretical_loss": 4.462251935660287,
      "tokens_seen": 173670400
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004784653961885657,
      "loss": 1.8149,
      "theoretical_loss": 4.46203803665439,
      "tokens_seen": 173735936
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004784553660982949,
      "loss": 1.7455,
      "theoretical_loss": 4.4618242409018505,
      "tokens_seen": 173801472
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004784453360080241,
      "loss": 1.6944,
      "theoretical_loss": 4.461610548313919,
      "tokens_seen": 173867008
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047843530591775324,
      "loss": 1.6902,
      "theoretical_loss": 4.461396958801959,
      "tokens_seen": 173932544
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004784252758274825,
      "loss": 1.6039,
      "theoretical_loss": 4.461183472277439,
      "tokens_seen": 173998080
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004784152457372116,
      "loss": 1.8179,
      "theoretical_loss": 4.460970088651941,
      "tokens_seen": 174063616
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047840521564694084,
      "loss": 1.7044,
      "theoretical_loss": 4.460756807837154,
      "tokens_seen": 174129152
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047839518555667,
      "loss": 1.8636,
      "theoretical_loss": 4.460543629744874,
      "tokens_seen": 174194688
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004783851554663992,
      "loss": 1.6604,
      "theoretical_loss": 4.460330554287011,
      "tokens_seen": 174260224
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004783751253761284,
      "loss": 1.8121,
      "theoretical_loss": 4.460117581375579,
      "tokens_seen": 174325760
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047836509528585756,
      "loss": 1.7273,
      "theoretical_loss": 4.459904710922704,
      "tokens_seen": 174391296
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047835506519558675,
      "loss": 1.6455,
      "theoretical_loss": 4.459691942840616,
      "tokens_seen": 174456832
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000478345035105316,
      "loss": 1.7535,
      "theoretical_loss": 4.459479277041657,
      "tokens_seen": 174522368
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004783350050150451,
      "loss": 1.7607,
      "theoretical_loss": 4.459266713438277,
      "tokens_seen": 174587904
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047832497492477434,
      "loss": 1.8568,
      "theoretical_loss": 4.459054251943029,
      "tokens_seen": 174653440
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047831494483450347,
      "loss": 1.6984,
      "theoretical_loss": 4.4588418924685795,
      "tokens_seen": 174718976
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004783049147442327,
      "loss": 1.6937,
      "theoretical_loss": 4.458629634927698,
      "tokens_seen": 174784512
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004782948846539619,
      "loss": 1.7505,
      "theoretical_loss": 4.458417479233265,
      "tokens_seen": 174850048
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047828485456369107,
      "loss": 1.8107,
      "theoretical_loss": 4.4582054252982655,
      "tokens_seen": 174915584
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047827482447342025,
      "loss": 1.6734,
      "theoretical_loss": 4.457993473035792,
      "tokens_seen": 174981120
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004782647943831495,
      "loss": 1.7339,
      "theoretical_loss": 4.457781622359043,
      "tokens_seen": 175046656
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004782547642928786,
      "loss": 1.8072,
      "theoretical_loss": 4.457569873181326,
      "tokens_seen": 175112192
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047824473420260785,
      "loss": 1.733,
      "theoretical_loss": 4.457358225416052,
      "tokens_seen": 175177728
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000478234704112337,
      "loss": 1.8371,
      "theoretical_loss": 4.4571466789767396,
      "tokens_seen": 175243264
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004782246740220662,
      "loss": 1.8057,
      "theoretical_loss": 4.456935233777013,
      "tokens_seen": 175308800
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047821464393179544,
      "loss": 1.6824,
      "theoretical_loss": 4.456723889730605,
      "tokens_seen": 175374336
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047820461384152457,
      "loss": 1.7608,
      "theoretical_loss": 4.456512646751349,
      "tokens_seen": 175439872
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004781945837512538,
      "loss": 1.8213,
      "theoretical_loss": 4.456301504753188,
      "tokens_seen": 175505408
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047818455366098293,
      "loss": 1.769,
      "theoretical_loss": 4.456090463650169,
      "tokens_seen": 175570944
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047817452357071217,
      "loss": 1.74,
      "theoretical_loss": 4.455879523356444,
      "tokens_seen": 175636480
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047816449348044135,
      "loss": 1.7685,
      "theoretical_loss": 4.4556686837862705,
      "tokens_seen": 175702016
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047815446339017053,
      "loss": 1.7059,
      "theoretical_loss": 4.455457944854011,
      "tokens_seen": 175767552
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004781444332998997,
      "loss": 1.6269,
      "theoretical_loss": 4.455247306474131,
      "tokens_seen": 175833088
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047813440320962895,
      "loss": 1.7285,
      "theoretical_loss": 4.455036768561204,
      "tokens_seen": 175898624
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004781243731193581,
      "loss": 1.7336,
      "theoretical_loss": 4.4548263310299046,
      "tokens_seen": 175964160
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004781143430290873,
      "loss": 1.6068,
      "theoretical_loss": 4.454615993795015,
      "tokens_seen": 176029696
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047810431293881644,
      "loss": 1.6793,
      "theoretical_loss": 4.454405756771415,
      "tokens_seen": 176095232
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047809428284854567,
      "loss": 1.821,
      "theoretical_loss": 4.454195619874096,
      "tokens_seen": 176160768
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047808425275827485,
      "loss": 1.6195,
      "theoretical_loss": 4.453985583018149,
      "tokens_seen": 176226304
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047807422266800403,
      "loss": 1.8008,
      "theoretical_loss": 4.4537756461187685,
      "tokens_seen": 176291840
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004780641925777332,
      "loss": 1.6837,
      "theoretical_loss": 4.453565809091254,
      "tokens_seen": 176357376
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004780541624874624,
      "loss": 1.6784,
      "theoretical_loss": 4.453356071851006,
      "tokens_seen": 176422912
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004780441323971916,
      "loss": 1.7011,
      "theoretical_loss": 4.453146434313531,
      "tokens_seen": 176488448
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004780341023069208,
      "loss": 1.6968,
      "theoretical_loss": 4.452936896394435,
      "tokens_seen": 176553984
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047802407221664994,
      "loss": 1.6761,
      "theoretical_loss": 4.452727458009431,
      "tokens_seen": 176619520
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004780140421263792,
      "loss": 1.6775,
      "theoretical_loss": 4.45251811907433,
      "tokens_seen": 176685056
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004780040120361083,
      "loss": 1.7273,
      "theoretical_loss": 4.452308879505047,
      "tokens_seen": 176750592
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047799398194583754,
      "loss": 1.7243,
      "theoretical_loss": 4.452099739217601,
      "tokens_seen": 176816128
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004779839518555667,
      "loss": 1.7251,
      "theoretical_loss": 4.451890698128112,
      "tokens_seen": 176881664
    },
    {
      "epoch": 0.05,
      "objective/train/docs_used": 65168,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.7498310804367065,
      "objective/train/theoretical_loss": 4.4516817561528015,
      "objective/train/tokens_used": 197407200,
      "theoretical_loss": 4.4516817561528015,
      "tokens_seen": 176947200
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004779739217652959,
      "loss": 1.7498,
      "theoretical_loss": 4.4516817561528015,
      "tokens_seen": 176947200
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004779638916750251,
      "loss": 1.725,
      "theoretical_loss": 4.451472913207992,
      "tokens_seen": 177012736
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004779538615847543,
      "loss": 1.792,
      "theoretical_loss": 4.451264169210107,
      "tokens_seen": 177078272
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047794383149448344,
      "loss": 1.7251,
      "theoretical_loss": 4.451055524075677,
      "tokens_seen": 177143808
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004779338014042127,
      "loss": 1.6974,
      "theoretical_loss": 4.450846977721326,
      "tokens_seen": 177209344
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004779237713139418,
      "loss": 1.7703,
      "theoretical_loss": 4.450638530063786,
      "tokens_seen": 177274880
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047791374122367104,
      "loss": 1.6115,
      "theoretical_loss": 4.450430181019884,
      "tokens_seen": 177340416
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004779037111334002,
      "loss": 1.6904,
      "theoretical_loss": 4.450221930506553,
      "tokens_seen": 177405952
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004778936810431294,
      "loss": 1.8135,
      "theoretical_loss": 4.450013778440822,
      "tokens_seen": 177471488
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004778836509528586,
      "loss": 1.7007,
      "theoretical_loss": 4.449805724739824,
      "tokens_seen": 177537024
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047787362086258776,
      "loss": 1.705,
      "theoretical_loss": 4.449597769320791,
      "tokens_seen": 177602560
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047786359077231695,
      "loss": 1.8815,
      "theoretical_loss": 4.4493899121010525,
      "tokens_seen": 177668096
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004778535606820462,
      "loss": 1.7297,
      "theoretical_loss": 4.449182152998044,
      "tokens_seen": 177733632
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004778435305917753,
      "loss": 1.8631,
      "theoretical_loss": 4.448974491929297,
      "tokens_seen": 177799168
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047783350050150454,
      "loss": 1.7396,
      "theoretical_loss": 4.448766928812441,
      "tokens_seen": 177864704
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047782347041123367,
      "loss": 1.7323,
      "theoretical_loss": 4.448559463565209,
      "tokens_seen": 177930240
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004778134403209629,
      "loss": 1.847,
      "theoretical_loss": 4.44835209610543,
      "tokens_seen": 177995776
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004778034102306921,
      "loss": 1.6983,
      "theoretical_loss": 4.448144826351036,
      "tokens_seen": 178061312
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047779338014042127,
      "loss": 1.914,
      "theoretical_loss": 4.447937654220054,
      "tokens_seen": 178126848
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047778335005015045,
      "loss": 1.8075,
      "theoretical_loss": 4.447730579630612,
      "tokens_seen": 178192384
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004777733199598797,
      "loss": 1.8224,
      "theoretical_loss": 4.447523602500936,
      "tokens_seen": 178257920
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004777632898696088,
      "loss": 1.8417,
      "theoretical_loss": 4.447316722749351,
      "tokens_seen": 178323456
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047775325977933805,
      "loss": 1.7021,
      "theoretical_loss": 4.447109940294283,
      "tokens_seen": 178388992
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004777432296890672,
      "loss": 1.8369,
      "theoretical_loss": 4.44690325505425,
      "tokens_seen": 178454528
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004777331995987964,
      "loss": 1.7979,
      "theoretical_loss": 4.446696666947874,
      "tokens_seen": 178520064
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004777231695085256,
      "loss": 1.7361,
      "theoretical_loss": 4.446490175893872,
      "tokens_seen": 178585600
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047771313941825477,
      "loss": 1.7703,
      "theoretical_loss": 4.44628378181106,
      "tokens_seen": 178651136
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047770310932798395,
      "loss": 1.6391,
      "theoretical_loss": 4.4460774846183515,
      "tokens_seen": 178716672
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047769307923771313,
      "loss": 1.5855,
      "theoretical_loss": 4.445871284234757,
      "tokens_seen": 178782208
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004776830491474423,
      "loss": 1.6121,
      "theoretical_loss": 4.445665180579383,
      "tokens_seen": 178847744
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047767301905717155,
      "loss": 1.7709,
      "theoretical_loss": 4.445459173571438,
      "tokens_seen": 178913280
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004776629889669007,
      "loss": 1.6917,
      "theoretical_loss": 4.445253263130223,
      "tokens_seen": 178978816
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004776529588766299,
      "loss": 1.6998,
      "theoretical_loss": 4.445047449175136,
      "tokens_seen": 179044352
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047764292878635904,
      "loss": 1.8016,
      "theoretical_loss": 4.444841731625674,
      "tokens_seen": 179109888
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004776328986960883,
      "loss": 1.6096,
      "theoretical_loss": 4.444636110401431,
      "tokens_seen": 179175424
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047762286860581746,
      "loss": 1.7269,
      "theoretical_loss": 4.444430585422094,
      "tokens_seen": 179240960
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047761283851554664,
      "loss": 1.6843,
      "theoretical_loss": 4.444225156607449,
      "tokens_seen": 179306496
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004776028084252758,
      "loss": 1.708,
      "theoretical_loss": 4.444019823877378,
      "tokens_seen": 179372032
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047759277833500505,
      "loss": 1.7278,
      "theoretical_loss": 4.4438145871518575,
      "tokens_seen": 179437568
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004775827482447342,
      "loss": 1.7896,
      "theoretical_loss": 4.443609446350962,
      "tokens_seen": 179503104
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004775727181544634,
      "loss": 1.594,
      "theoretical_loss": 4.44340440139486,
      "tokens_seen": 179568640
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047756268806419254,
      "loss": 1.5673,
      "theoretical_loss": 4.443199452203816,
      "tokens_seen": 179634176
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004775526579739218,
      "loss": 1.7592,
      "theoretical_loss": 4.442994598698189,
      "tokens_seen": 179699712
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047754262788365096,
      "loss": 1.6337,
      "theoretical_loss": 4.4427898407984365,
      "tokens_seen": 179765248
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047753259779338014,
      "loss": 1.7348,
      "theoretical_loss": 4.442585178425107,
      "tokens_seen": 179830784
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004775225677031093,
      "loss": 1.7543,
      "theoretical_loss": 4.442380611498846,
      "tokens_seen": 179896320
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004775125376128385,
      "loss": 1.5934,
      "theoretical_loss": 4.442176139940393,
      "tokens_seen": 179961856
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004775025075225677,
      "loss": 1.5477,
      "theoretical_loss": 4.441971763670585,
      "tokens_seen": 180027392
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004774924774322969,
      "loss": 1.7321,
      "theoretical_loss": 4.441767482610349,
      "tokens_seen": 180092928
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047748244734202605,
      "loss": 1.7134,
      "theoretical_loss": 4.441563296680709,
      "tokens_seen": 180158464
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004774724172517553,
      "loss": 1.5456,
      "theoretical_loss": 4.441359205802783,
      "tokens_seen": 180224000
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004774623871614845,
      "loss": 1.7301,
      "theoretical_loss": 4.441155209897782,
      "tokens_seen": 180289536
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047745235707121364,
      "loss": 1.6971,
      "theoretical_loss": 4.440951308887014,
      "tokens_seen": 180355072
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004774423269809429,
      "loss": 1.727,
      "theoretical_loss": 4.440747502691876,
      "tokens_seen": 180420608
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.000477432296890672,
      "loss": 1.6409,
      "theoretical_loss": 4.440543791233862,
      "tokens_seen": 180486144
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047742226680040124,
      "loss": 1.5749,
      "theoretical_loss": 4.440340174434558,
      "tokens_seen": 180551680
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004774122367101304,
      "loss": 1.7374,
      "theoretical_loss": 4.440136652215646,
      "tokens_seen": 180617216
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004774022066198596,
      "loss": 1.6844,
      "theoretical_loss": 4.439933224498898,
      "tokens_seen": 180682752
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004773921765295888,
      "loss": 1.7412,
      "theoretical_loss": 4.43972989120618,
      "tokens_seen": 180748288
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047738214643931797,
      "loss": 1.823,
      "theoretical_loss": 4.439526652259451,
      "tokens_seen": 180813824
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047737211634904715,
      "loss": 1.7207,
      "theoretical_loss": 4.439323507580761,
      "tokens_seen": 180879360
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004773620862587764,
      "loss": 1.7035,
      "theoretical_loss": 4.439120457092258,
      "tokens_seen": 180944896
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004773520561685055,
      "loss": 1.6929,
      "theoretical_loss": 4.438917500716178,
      "tokens_seen": 181010432
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047734202607823474,
      "loss": 1.6945,
      "theoretical_loss": 4.438714638374849,
      "tokens_seen": 181075968
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047733199598796387,
      "loss": 1.5623,
      "theoretical_loss": 4.438511869990693,
      "tokens_seen": 181141504
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004773219658976931,
      "loss": 1.8958,
      "theoretical_loss": 4.438309195486223,
      "tokens_seen": 181207040
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004773119358074223,
      "loss": 1.5306,
      "theoretical_loss": 4.438106614784045,
      "tokens_seen": 181272576
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047730190571715147,
      "loss": 1.7725,
      "theoretical_loss": 4.437904127806856,
      "tokens_seen": 181338112
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.00047729187562688065,
      "loss": 1.7175,
      "theoretical_loss": 4.437701734477445,
      "tokens_seen": 181403648
    },
    {
      "epoch": 0.05,
      "learning_rate": 0.0004772818455366099,
      "loss": 1.7251,
      "theoretical_loss": 4.437499434718692,
      "tokens_seen": 181469184
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000477271815446339,
      "loss": 1.5896,
      "theoretical_loss": 4.437297228453567,
      "tokens_seen": 181534720
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047726178535606825,
      "loss": 1.7008,
      "theoretical_loss": 4.4370951156051355,
      "tokens_seen": 181600256
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004772517552657974,
      "loss": 1.7909,
      "theoretical_loss": 4.43689309609655,
      "tokens_seen": 181665792
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004772417251755266,
      "loss": 1.6407,
      "theoretical_loss": 4.436691169851055,
      "tokens_seen": 181731328
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004772316950852558,
      "loss": 1.7499,
      "theoretical_loss": 4.436489336791985,
      "tokens_seen": 181796864
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047722166499498497,
      "loss": 1.7612,
      "theoretical_loss": 4.436287596842769,
      "tokens_seen": 181862400
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047721163490471415,
      "loss": 1.7539,
      "theoretical_loss": 4.4360859499269205,
      "tokens_seen": 181927936
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047720160481444333,
      "loss": 1.7139,
      "theoretical_loss": 4.435884395968047,
      "tokens_seen": 181993472
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004771915747241725,
      "loss": 1.7272,
      "theoretical_loss": 4.435682934889847,
      "tokens_seen": 182059008
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047718154463390175,
      "loss": 1.5762,
      "theoretical_loss": 4.435481566616108,
      "tokens_seen": 182124544
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004771715145436309,
      "loss": 1.6247,
      "theoretical_loss": 4.435280291070705,
      "tokens_seen": 182190080
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004771614844533601,
      "loss": 1.8234,
      "theoretical_loss": 4.435079108177606,
      "tokens_seen": 182255616
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047715145436308924,
      "loss": 1.5731,
      "theoretical_loss": 4.434878017860869,
      "tokens_seen": 182321152
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004771414242728185,
      "loss": 1.6187,
      "theoretical_loss": 4.434677020044637,
      "tokens_seen": 182386688
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047713139418254766,
      "loss": 1.6562,
      "theoretical_loss": 4.4344761146531475,
      "tokens_seen": 182452224
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047712136409227684,
      "loss": 1.6009,
      "theoretical_loss": 4.434275301610725,
      "tokens_seen": 182517760
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000477111334002006,
      "loss": 1.6947,
      "theoretical_loss": 4.434074580841784,
      "tokens_seen": 182583296
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047710130391173525,
      "loss": 1.8254,
      "theoretical_loss": 4.433873952270826,
      "tokens_seen": 182648832
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004770912738214644,
      "loss": 1.6615,
      "theoretical_loss": 4.433673415822443,
      "tokens_seen": 182714368
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004770812437311936,
      "loss": 1.7286,
      "theoretical_loss": 4.433472971421315,
      "tokens_seen": 182779904
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047707121364092274,
      "loss": 1.7337,
      "theoretical_loss": 4.433272618992213,
      "tokens_seen": 182845440
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000477061183550652,
      "loss": 1.7718,
      "theoretical_loss": 4.433072358459991,
      "tokens_seen": 182910976
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047705115346038116,
      "loss": 1.7258,
      "theoretical_loss": 4.432872189749596,
      "tokens_seen": 182976512
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047704112337011034,
      "loss": 1.7333,
      "theoretical_loss": 4.432672112786063,
      "tokens_seen": 183042048
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004770310932798395,
      "loss": 1.8044,
      "theoretical_loss": 4.4324721274945125,
      "tokens_seen": 183107584
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004770210631895687,
      "loss": 1.7046,
      "theoretical_loss": 4.432272233800154,
      "tokens_seen": 183173120
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004770110330992979,
      "loss": 1.6611,
      "theoretical_loss": 4.432072431628286,
      "tokens_seen": 183238656
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004770010030090271,
      "loss": 1.6755,
      "theoretical_loss": 4.431872720904292,
      "tokens_seen": 183304192
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047699097291875625,
      "loss": 1.7404,
      "theoretical_loss": 4.4316731015536455,
      "tokens_seen": 183369728
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004769809428284855,
      "loss": 1.6978,
      "theoretical_loss": 4.431473573501906,
      "tokens_seen": 183435264
    },
    {
      "epoch": 0.06,
      "objective/train/docs_used": 67310,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.6464353799819946,
      "objective/train/theoretical_loss": 4.431274136674721,
      "objective/train/tokens_used": 203960800,
      "theoretical_loss": 4.431274136674721,
      "tokens_seen": 183500800
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047697091273821466,
      "loss": 1.6464,
      "theoretical_loss": 4.431274136674721,
      "tokens_seen": 183500800
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047696088264794384,
      "loss": 1.7336,
      "theoretical_loss": 4.431074790997823,
      "tokens_seen": 183566336
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000476950852557673,
      "loss": 1.6763,
      "theoretical_loss": 4.430875536397036,
      "tokens_seen": 183631872
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004769408224674022,
      "loss": 1.6404,
      "theoretical_loss": 4.430676372798265,
      "tokens_seen": 183697408
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004769307923771314,
      "loss": 1.7569,
      "theoretical_loss": 4.430477300127507,
      "tokens_seen": 183762944
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004769207622868606,
      "loss": 1.6198,
      "theoretical_loss": 4.43027831831084,
      "tokens_seen": 183828480
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047691073219658975,
      "loss": 1.7369,
      "theoretical_loss": 4.430079427274435,
      "tokens_seen": 183894016
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000476900702106319,
      "loss": 1.7197,
      "theoretical_loss": 4.429880626944543,
      "tokens_seen": 183959552
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004768906720160481,
      "loss": 1.5479,
      "theoretical_loss": 4.429681917247506,
      "tokens_seen": 184025088
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047688064192577735,
      "loss": 1.5874,
      "theoretical_loss": 4.429483298109749,
      "tokens_seen": 184090624
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047687061183550653,
      "loss": 1.6731,
      "theoretical_loss": 4.429284769457784,
      "tokens_seen": 184156160
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004768605817452357,
      "loss": 1.6444,
      "theoretical_loss": 4.429086331218208,
      "tokens_seen": 184221696
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004768505516549649,
      "loss": 1.7389,
      "theoretical_loss": 4.428887983317706,
      "tokens_seen": 184287232
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047684052156469407,
      "loss": 1.6605,
      "theoretical_loss": 4.4286897256830455,
      "tokens_seen": 184352768
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047683049147442325,
      "loss": 1.6393,
      "theoretical_loss": 4.428491558241081,
      "tokens_seen": 184418304
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004768204613841525,
      "loss": 1.6301,
      "theoretical_loss": 4.428293480918751,
      "tokens_seen": 184483840
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004768104312938816,
      "loss": 1.6353,
      "theoretical_loss": 4.428095493643081,
      "tokens_seen": 184549376
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047680040120361085,
      "loss": 1.7261,
      "theoretical_loss": 4.427897596341181,
      "tokens_seen": 184614912
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047679037111334003,
      "loss": 1.6342,
      "theoretical_loss": 4.427699788940243,
      "tokens_seen": 184680448
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004767803410230692,
      "loss": 1.7992,
      "theoretical_loss": 4.427502071367549,
      "tokens_seen": 184745984
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004767703109327984,
      "loss": 1.6338,
      "theoretical_loss": 4.42730444355046,
      "tokens_seen": 184811520
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004767602808425276,
      "loss": 1.6789,
      "theoretical_loss": 4.4271069054164265,
      "tokens_seen": 184877056
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047675025075225676,
      "loss": 1.7461,
      "theoretical_loss": 4.426909456892979,
      "tokens_seen": 184942592
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000476740220661986,
      "loss": 1.7002,
      "theoretical_loss": 4.426712097907735,
      "tokens_seen": 185008128
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004767301905717151,
      "loss": 1.7813,
      "theoretical_loss": 4.426514828388394,
      "tokens_seen": 185073664
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047672016048144435,
      "loss": 1.6505,
      "theoretical_loss": 4.426317648262743,
      "tokens_seen": 185139200
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047671013039117353,
      "loss": 1.7994,
      "theoretical_loss": 4.426120557458649,
      "tokens_seen": 185204736
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004767001003009027,
      "loss": 1.6959,
      "theoretical_loss": 4.425923555904065,
      "tokens_seen": 185270272
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047669007021063195,
      "loss": 1.6857,
      "theoretical_loss": 4.4257266435270255,
      "tokens_seen": 185335808
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004766800401203611,
      "loss": 1.7661,
      "theoretical_loss": 4.425529820255651,
      "tokens_seen": 185401344
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004766700100300903,
      "loss": 1.6937,
      "theoretical_loss": 4.425333086018144,
      "tokens_seen": 185466880
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047665997993981944,
      "loss": 1.6598,
      "theoretical_loss": 4.425136440742788,
      "tokens_seen": 185532416
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004766499498495487,
      "loss": 1.7798,
      "theoretical_loss": 4.424939884357956,
      "tokens_seen": 185597952
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047663991975927786,
      "loss": 1.5757,
      "theoretical_loss": 4.424743416792096,
      "tokens_seen": 185663488
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047662988966900704,
      "loss": 1.6458,
      "theoretical_loss": 4.424547037973745,
      "tokens_seen": 185729024
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004766198595787362,
      "loss": 1.7501,
      "theoretical_loss": 4.424350747831518,
      "tokens_seen": 185794560
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047660982948846545,
      "loss": 1.6542,
      "theoretical_loss": 4.424154546294117,
      "tokens_seen": 185860096
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004765997993981946,
      "loss": 1.7114,
      "theoretical_loss": 4.4239584332903235,
      "tokens_seen": 185925632
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004765897693079238,
      "loss": 1.7033,
      "theoretical_loss": 4.423762408749001,
      "tokens_seen": 185991168
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047657973921765294,
      "loss": 1.7597,
      "theoretical_loss": 4.423566472599099,
      "tokens_seen": 186056704
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004765697091273822,
      "loss": 1.6484,
      "theoretical_loss": 4.423370624769643,
      "tokens_seen": 186122240
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047655967903711136,
      "loss": 1.7257,
      "theoretical_loss": 4.423174865189747,
      "tokens_seen": 186187776
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047654964894684054,
      "loss": 1.6253,
      "theoretical_loss": 4.422979193788601,
      "tokens_seen": 186253312
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004765396188565697,
      "loss": 1.7131,
      "theoretical_loss": 4.422783610495481,
      "tokens_seen": 186318848
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004765295887662989,
      "loss": 1.6566,
      "theoretical_loss": 4.422588115239742,
      "tokens_seen": 186384384
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004765195586760281,
      "loss": 1.7212,
      "theoretical_loss": 4.422392707950824,
      "tokens_seen": 186449920
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004765095285857573,
      "loss": 1.7293,
      "theoretical_loss": 4.42219738855824,
      "tokens_seen": 186515456
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047649949849548645,
      "loss": 1.7989,
      "theoretical_loss": 4.422002156991597,
      "tokens_seen": 186580992
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004764894684052157,
      "loss": 1.5972,
      "theoretical_loss": 4.421807013180571,
      "tokens_seen": 186646528
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047647943831494486,
      "loss": 1.7723,
      "theoretical_loss": 4.421611957054925,
      "tokens_seen": 186712064
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047646940822467404,
      "loss": 1.734,
      "theoretical_loss": 4.421416988544503,
      "tokens_seen": 186777600
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004764593781344032,
      "loss": 1.6655,
      "theoretical_loss": 4.4212221075792275,
      "tokens_seen": 186843136
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004764493480441324,
      "loss": 1.5681,
      "theoretical_loss": 4.421027314089103,
      "tokens_seen": 186908672
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004764393179538616,
      "loss": 1.5462,
      "theoretical_loss": 4.420832608004215,
      "tokens_seen": 186974208
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004764292878635908,
      "loss": 1.6334,
      "theoretical_loss": 4.420637989254726,
      "tokens_seen": 187039744
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047641925777331995,
      "loss": 1.5918,
      "theoretical_loss": 4.420443457770885,
      "tokens_seen": 187105280
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004764092276830492,
      "loss": 1.7094,
      "theoretical_loss": 4.420249013483014,
      "tokens_seen": 187170816
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004763991975927783,
      "loss": 1.6885,
      "theoretical_loss": 4.42005465632152,
      "tokens_seen": 187236352
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047638916750250755,
      "loss": 1.8075,
      "theoretical_loss": 4.419860386216888,
      "tokens_seen": 187301888
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047637913741223673,
      "loss": 1.7565,
      "theoretical_loss": 4.419666203099683,
      "tokens_seen": 187367424
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004763691073219659,
      "loss": 1.6631,
      "theoretical_loss": 4.41947210690055,
      "tokens_seen": 187432960
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004763590772316951,
      "loss": 1.7498,
      "theoretical_loss": 4.419278097550212,
      "tokens_seen": 187498496
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047634904714142427,
      "loss": 1.7091,
      "theoretical_loss": 4.419084174979473,
      "tokens_seen": 187564032
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047633901705115345,
      "loss": 1.6653,
      "theoretical_loss": 4.4188903391192165,
      "tokens_seen": 187629568
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004763289869608827,
      "loss": 1.625,
      "theoretical_loss": 4.418696589900405,
      "tokens_seen": 187695104
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004763189568706118,
      "loss": 1.7331,
      "theoretical_loss": 4.418502927254078,
      "tokens_seen": 187760640
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047630892678034105,
      "loss": 1.9348,
      "theoretical_loss": 4.418309351111356,
      "tokens_seen": 187826176
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047629889669007023,
      "loss": 1.7017,
      "theoretical_loss": 4.418115861403439,
      "tokens_seen": 187891712
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004762888665997994,
      "loss": 1.7398,
      "theoretical_loss": 4.417922458061603,
      "tokens_seen": 187957248
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004762788365095286,
      "loss": 1.7237,
      "theoretical_loss": 4.417729141017205,
      "tokens_seen": 188022784
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004762688064192578,
      "loss": 1.6839,
      "theoretical_loss": 4.4175359102016785,
      "tokens_seen": 188088320
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047625877632898696,
      "loss": 1.7805,
      "theoretical_loss": 4.417342765546538,
      "tokens_seen": 188153856
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004762487462387162,
      "loss": 1.762,
      "theoretical_loss": 4.417149706983373,
      "tokens_seen": 188219392
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004762387161484453,
      "loss": 1.7029,
      "theoretical_loss": 4.416956734443854,
      "tokens_seen": 188284928
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047622868605817455,
      "loss": 1.7188,
      "theoretical_loss": 4.416763847859728,
      "tokens_seen": 188350464
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004762186559679037,
      "loss": 1.7876,
      "theoretical_loss": 4.41657104716282,
      "tokens_seen": 188416000
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004762086258776329,
      "loss": 1.607,
      "theoretical_loss": 4.416378332285031,
      "tokens_seen": 188481536
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004761985957873621,
      "loss": 1.7126,
      "theoretical_loss": 4.4161857031583445,
      "tokens_seen": 188547072
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004761885656970913,
      "loss": 1.723,
      "theoretical_loss": 4.415993159714818,
      "tokens_seen": 188612608
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047617853560682046,
      "loss": 1.7741,
      "theoretical_loss": 4.415800701886584,
      "tokens_seen": 188678144
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047616850551654964,
      "loss": 1.748,
      "theoretical_loss": 4.415608329605859,
      "tokens_seen": 188743680
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004761584754262788,
      "loss": 1.6657,
      "theoretical_loss": 4.415416042804931,
      "tokens_seen": 188809216
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047614844533600806,
      "loss": 1.8331,
      "theoretical_loss": 4.415223841416167,
      "tokens_seen": 188874752
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004761384152457372,
      "loss": 1.727,
      "theoretical_loss": 4.415031725372011,
      "tokens_seen": 188940288
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004761283851554664,
      "loss": 1.6712,
      "theoretical_loss": 4.414839694604985,
      "tokens_seen": 189005824
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004761183550651956,
      "loss": 1.7444,
      "theoretical_loss": 4.414647749047685,
      "tokens_seen": 189071360
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004761083249749248,
      "loss": 1.88,
      "theoretical_loss": 4.414455888632786,
      "tokens_seen": 189136896
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047609829488465396,
      "loss": 1.6062,
      "theoretical_loss": 4.414264113293038,
      "tokens_seen": 189202432
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047608826479438314,
      "loss": 1.651,
      "theoretical_loss": 4.41407242296127,
      "tokens_seen": 189267968
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004760782347041123,
      "loss": 1.7561,
      "theoretical_loss": 4.413880817570382,
      "tokens_seen": 189333504
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047606820461384156,
      "loss": 1.6977,
      "theoretical_loss": 4.413689297053356,
      "tokens_seen": 189399040
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004760581745235707,
      "loss": 1.8027,
      "theoretical_loss": 4.413497861343247,
      "tokens_seen": 189464576
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004760481444332999,
      "loss": 1.7703,
      "theoretical_loss": 4.413306510373185,
      "tokens_seen": 189530112
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047603811434302905,
      "loss": 1.6735,
      "theoretical_loss": 4.41311524407638,
      "tokens_seen": 189595648
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004760280842527583,
      "loss": 1.7536,
      "theoretical_loss": 4.412924062386112,
      "tokens_seen": 189661184
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047601805416248746,
      "loss": 1.7267,
      "theoretical_loss": 4.412732965235742,
      "tokens_seen": 189726720
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047600802407221665,
      "loss": 1.7677,
      "theoretical_loss": 4.412541952558703,
      "tokens_seen": 189792256
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004759979939819458,
      "loss": 1.6069,
      "theoretical_loss": 4.412351024288504,
      "tokens_seen": 189857792
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047598796389167506,
      "loss": 1.6886,
      "theoretical_loss": 4.412160180358731,
      "tokens_seen": 189923328
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004759779338014042,
      "loss": 1.6479,
      "theoretical_loss": 4.411969420703042,
      "tokens_seen": 189988864
    },
    {
      "epoch": 0.06,
      "objective/train/docs_used": 69528,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.630781650543213,
      "objective/train/theoretical_loss": 4.411778745255174,
      "objective/train/tokens_used": 210514400,
      "theoretical_loss": 4.411778745255174,
      "tokens_seen": 190054400
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004759679037111334,
      "loss": 1.6308,
      "theoretical_loss": 4.411778745255174,
      "tokens_seen": 190054400
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004759578736208626,
      "loss": 1.5921,
      "theoretical_loss": 4.411588153948935,
      "tokens_seen": 190119936
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004759478435305918,
      "loss": 1.6475,
      "theoretical_loss": 4.411397646718211,
      "tokens_seen": 190185472
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475937813440321,
      "loss": 1.651,
      "theoretical_loss": 4.411207223496962,
      "tokens_seen": 190251008
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047592778335005015,
      "loss": 1.678,
      "theoretical_loss": 4.41101688421922,
      "tokens_seen": 190316544
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004759177532597794,
      "loss": 1.6743,
      "theoretical_loss": 4.410826628819094,
      "tokens_seen": 190382080
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004759077231695085,
      "loss": 1.697,
      "theoretical_loss": 4.410636457230767,
      "tokens_seen": 190447616
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047589769307923775,
      "loss": 1.6142,
      "theoretical_loss": 4.410446369388497,
      "tokens_seen": 190513152
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047588766298896693,
      "loss": 1.715,
      "theoretical_loss": 4.410256365226614,
      "tokens_seen": 190578688
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004758776328986961,
      "loss": 1.7684,
      "theoretical_loss": 4.410066444679524,
      "tokens_seen": 190644224
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004758676028084253,
      "loss": 1.7098,
      "theoretical_loss": 4.409876607681706,
      "tokens_seen": 190709760
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047585757271815447,
      "loss": 1.7705,
      "theoretical_loss": 4.409686854167714,
      "tokens_seen": 190775296
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047584754262788365,
      "loss": 1.7135,
      "theoretical_loss": 4.4094971840721735,
      "tokens_seen": 190840832
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004758375125376129,
      "loss": 1.7032,
      "theoretical_loss": 4.409307597329786,
      "tokens_seen": 190906368
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475827482447342,
      "loss": 1.7358,
      "theoretical_loss": 4.409118093875324,
      "tokens_seen": 190971904
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047581745235707125,
      "loss": 1.6251,
      "theoretical_loss": 4.408928673643636,
      "tokens_seen": 191037440
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047580742226680043,
      "loss": 1.7068,
      "theoretical_loss": 4.408739336569644,
      "tokens_seen": 191102976
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004757973921765296,
      "loss": 1.7425,
      "theoretical_loss": 4.408550082588339,
      "tokens_seen": 191168512
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004757873620862588,
      "loss": 1.7602,
      "theoretical_loss": 4.408360911634789,
      "tokens_seen": 191234048
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475777331995988,
      "loss": 1.6369,
      "theoretical_loss": 4.408171823644135,
      "tokens_seen": 191299584
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047576730190571716,
      "loss": 1.6391,
      "theoretical_loss": 4.407982818551589,
      "tokens_seen": 191365120
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004757572718154464,
      "loss": 1.7,
      "theoretical_loss": 4.407793896292437,
      "tokens_seen": 191430656
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004757472417251755,
      "loss": 1.8005,
      "theoretical_loss": 4.407605056802035,
      "tokens_seen": 191496192
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047573721163490475,
      "loss": 1.678,
      "theoretical_loss": 4.407416300015816,
      "tokens_seen": 191561728
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004757271815446339,
      "loss": 1.7627,
      "theoretical_loss": 4.407227625869283,
      "tokens_seen": 191627264
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004757171514543631,
      "loss": 1.7804,
      "theoretical_loss": 4.407039034298011,
      "tokens_seen": 191692800
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004757071213640923,
      "loss": 1.6663,
      "theoretical_loss": 4.4068505252376475,
      "tokens_seen": 191758336
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004756970912738215,
      "loss": 1.7109,
      "theoretical_loss": 4.406662098623913,
      "tokens_seen": 191823872
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047568706118355066,
      "loss": 1.7324,
      "theoretical_loss": 4.406473754392598,
      "tokens_seen": 191889408
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047567703109327984,
      "loss": 1.7412,
      "theoretical_loss": 4.406285492479569,
      "tokens_seen": 191954944
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475667001003009,
      "loss": 1.7767,
      "theoretical_loss": 4.406097312820759,
      "tokens_seen": 192020480
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047565697091273826,
      "loss": 1.685,
      "theoretical_loss": 4.4059092153521755,
      "tokens_seen": 192086016
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004756469408224674,
      "loss": 1.7304,
      "theoretical_loss": 4.405721200009898,
      "tokens_seen": 192151552
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004756369107321966,
      "loss": 1.698,
      "theoretical_loss": 4.405533266730077,
      "tokens_seen": 192217088
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004756268806419258,
      "loss": 1.8248,
      "theoretical_loss": 4.405345415448934,
      "tokens_seen": 192282624
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475616850551655,
      "loss": 1.7393,
      "theoretical_loss": 4.405157646102762,
      "tokens_seen": 192348160
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047560682046138416,
      "loss": 1.5189,
      "theoretical_loss": 4.404969958627927,
      "tokens_seen": 192413696
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047559679037111334,
      "loss": 1.6795,
      "theoretical_loss": 4.4047823529608605,
      "tokens_seen": 192479232
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004755867602808425,
      "loss": 1.6969,
      "theoretical_loss": 4.404594829038071,
      "tokens_seen": 192544768
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047557673019057176,
      "loss": 1.6159,
      "theoretical_loss": 4.404407386796137,
      "tokens_seen": 192610304
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004755667001003009,
      "loss": 1.7389,
      "theoretical_loss": 4.404220026171704,
      "tokens_seen": 192675840
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004755566700100301,
      "loss": 1.6058,
      "theoretical_loss": 4.404032747101493,
      "tokens_seen": 192741376
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047554663991975925,
      "loss": 1.7103,
      "theoretical_loss": 4.4038455495222895,
      "tokens_seen": 192806912
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004755366098294885,
      "loss": 1.7304,
      "theoretical_loss": 4.403658433370957,
      "tokens_seen": 192872448
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047552657973921766,
      "loss": 1.765,
      "theoretical_loss": 4.403471398584422,
      "tokens_seen": 192937984
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047551654964894685,
      "loss": 1.5815,
      "theoretical_loss": 4.403284445099688,
      "tokens_seen": 193003520
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047550651955867603,
      "loss": 1.7174,
      "theoretical_loss": 4.403097572853823,
      "tokens_seen": 193069056
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047549648946840526,
      "loss": 1.7876,
      "theoretical_loss": 4.402910781783968,
      "tokens_seen": 193134592
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004754864593781344,
      "loss": 1.5594,
      "theoretical_loss": 4.4027240718273335,
      "tokens_seen": 193200128
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004754764292878636,
      "loss": 1.6854,
      "theoretical_loss": 4.4025374429212,
      "tokens_seen": 193265664
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047546639919759275,
      "loss": 1.7455,
      "theoretical_loss": 4.402350895002916,
      "tokens_seen": 193331200
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475456369107322,
      "loss": 1.7373,
      "theoretical_loss": 4.402164428009904,
      "tokens_seen": 193396736
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047544633901705117,
      "loss": 1.6638,
      "theoretical_loss": 4.40197804187965,
      "tokens_seen": 193462272
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047543630892678035,
      "loss": 1.7279,
      "theoretical_loss": 4.401791736549714,
      "tokens_seen": 193527808
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047542627883650953,
      "loss": 1.6307,
      "theoretical_loss": 4.401605511957724,
      "tokens_seen": 193593344
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004754162487462387,
      "loss": 1.7655,
      "theoretical_loss": 4.401419368041377,
      "tokens_seen": 193658880
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004754062186559679,
      "loss": 1.7902,
      "theoretical_loss": 4.401233304738438,
      "tokens_seen": 193724416
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047539618856569713,
      "loss": 1.6667,
      "theoretical_loss": 4.401047321986745,
      "tokens_seen": 193789952
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047538615847542625,
      "loss": 1.7821,
      "theoretical_loss": 4.4008614197242,
      "tokens_seen": 193855488
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004753761283851555,
      "loss": 1.7186,
      "theoretical_loss": 4.400675597888777,
      "tokens_seen": 193921024
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004753660982948846,
      "loss": 1.6591,
      "theoretical_loss": 4.400489856418518,
      "tokens_seen": 193986560
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047535606820461385,
      "loss": 1.7764,
      "theoretical_loss": 4.4003041952515325,
      "tokens_seen": 194052096
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047534603811434303,
      "loss": 1.6949,
      "theoretical_loss": 4.400118614326001,
      "tokens_seen": 194117632
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004753360080240722,
      "loss": 1.7069,
      "theoretical_loss": 4.39993311358017,
      "tokens_seen": 194183168
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004753259779338014,
      "loss": 1.8548,
      "theoretical_loss": 4.399747692952355,
      "tokens_seen": 194248704
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047531594784353063,
      "loss": 1.687,
      "theoretical_loss": 4.399562352380941,
      "tokens_seen": 194314240
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047530591775325976,
      "loss": 1.5938,
      "theoretical_loss": 4.399377091804379,
      "tokens_seen": 194379776
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475295887662989,
      "loss": 1.7877,
      "theoretical_loss": 4.399191911161191,
      "tokens_seen": 194445312
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004752858575727181,
      "loss": 1.7664,
      "theoretical_loss": 4.399006810389963,
      "tokens_seen": 194510848
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047527582748244736,
      "loss": 1.6756,
      "theoretical_loss": 4.398821789429354,
      "tokens_seen": 194576384
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047526579739217654,
      "loss": 1.6588,
      "theoretical_loss": 4.398636848218084,
      "tokens_seen": 194641920
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004752557673019057,
      "loss": 1.7992,
      "theoretical_loss": 4.398451986694948,
      "tokens_seen": 194707456
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004752457372116349,
      "loss": 1.6939,
      "theoretical_loss": 4.398267204798803,
      "tokens_seen": 194772992
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004752357071213641,
      "loss": 1.6229,
      "theoretical_loss": 4.398082502468577,
      "tokens_seen": 194838528
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047522567703109326,
      "loss": 1.662,
      "theoretical_loss": 4.397897879643262,
      "tokens_seen": 194904064
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004752156469408225,
      "loss": 1.6397,
      "theoretical_loss": 4.39771333626192,
      "tokens_seen": 194969600
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004752056168505517,
      "loss": 1.6809,
      "theoretical_loss": 4.397528872263679,
      "tokens_seen": 195035136
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047519558676028086,
      "loss": 1.6879,
      "theoretical_loss": 4.397344487587736,
      "tokens_seen": 195100672
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047518555667001004,
      "loss": 1.6678,
      "theoretical_loss": 4.3971601821733515,
      "tokens_seen": 195166208
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004751755265797392,
      "loss": 1.698,
      "theoretical_loss": 4.396975955959856,
      "tokens_seen": 195231744
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047516549648946846,
      "loss": 1.7001,
      "theoretical_loss": 4.396791808886643,
      "tokens_seen": 195297280
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004751554663991976,
      "loss": 1.6938,
      "theoretical_loss": 4.396607740893179,
      "tokens_seen": 195362816
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004751454363089268,
      "loss": 1.6342,
      "theoretical_loss": 4.396423751918991,
      "tokens_seen": 195428352
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000475135406218656,
      "loss": 1.7219,
      "theoretical_loss": 4.396239841903674,
      "tokens_seen": 195493888
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004751253761283852,
      "loss": 1.8272,
      "theoretical_loss": 4.396056010786893,
      "tokens_seen": 195559424
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047511534603811436,
      "loss": 1.8049,
      "theoretical_loss": 4.3958722585083745,
      "tokens_seen": 195624960
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047510531594784354,
      "loss": 1.6354,
      "theoretical_loss": 4.395688585007913,
      "tokens_seen": 195690496
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004750952858575727,
      "loss": 1.6455,
      "theoretical_loss": 4.395504990225371,
      "tokens_seen": 195756032
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047508525576730196,
      "loss": 1.6337,
      "theoretical_loss": 4.395321474100673,
      "tokens_seen": 195821568
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004750752256770311,
      "loss": 1.6808,
      "theoretical_loss": 4.395138036573814,
      "tokens_seen": 195887104
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004750651955867603,
      "loss": 1.7584,
      "theoretical_loss": 4.3949546775848525,
      "tokens_seen": 195952640
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047505516549648945,
      "loss": 1.6874,
      "theoretical_loss": 4.394771397073912,
      "tokens_seen": 196018176
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004750451354062187,
      "loss": 1.6955,
      "theoretical_loss": 4.394588194981182,
      "tokens_seen": 196083712
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047503510531594787,
      "loss": 1.8327,
      "theoretical_loss": 4.394405071246919,
      "tokens_seen": 196149248
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047502507522567705,
      "loss": 1.5843,
      "theoretical_loss": 4.394222025811445,
      "tokens_seen": 196214784
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047501504513540623,
      "loss": 1.5918,
      "theoretical_loss": 4.394039058615144,
      "tokens_seen": 196280320
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047500501504513546,
      "loss": 1.7169,
      "theoretical_loss": 4.39385616959847,
      "tokens_seen": 196345856
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004749949849548646,
      "loss": 1.6742,
      "theoretical_loss": 4.393673358701939,
      "tokens_seen": 196411392
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004749849548645938,
      "loss": 1.7094,
      "theoretical_loss": 4.393490625866132,
      "tokens_seen": 196476928
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047497492477432295,
      "loss": 1.6241,
      "theoretical_loss": 4.393307971031697,
      "tokens_seen": 196542464
    },
    {
      "epoch": 0.06,
      "objective/train/docs_used": 71643,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.6485013961791992,
      "objective/train/theoretical_loss": 4.3931253941393456,
      "objective/train/tokens_used": 217068000,
      "theoretical_loss": 4.3931253941393456,
      "tokens_seen": 196608000
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004749648946840522,
      "loss": 1.6485,
      "theoretical_loss": 4.3931253941393456,
      "tokens_seen": 196608000
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047495486459378137,
      "loss": 1.5978,
      "theoretical_loss": 4.392942895129854,
      "tokens_seen": 196673536
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047494483450351055,
      "loss": 1.7179,
      "theoretical_loss": 4.392760473944064,
      "tokens_seen": 196739072
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047493480441323973,
      "loss": 1.7131,
      "theoretical_loss": 4.392578130522883,
      "tokens_seen": 196804608
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004749247743229689,
      "loss": 1.7326,
      "theoretical_loss": 4.392395864807279,
      "tokens_seen": 196870144
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004749147442326981,
      "loss": 1.5969,
      "theoretical_loss": 4.392213676738288,
      "tokens_seen": 196935680
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047490471414242733,
      "loss": 1.7349,
      "theoretical_loss": 4.3920315662570095,
      "tokens_seen": 197001216
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047489468405215646,
      "loss": 1.6411,
      "theoretical_loss": 4.391849533304607,
      "tokens_seen": 197066752
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004748846539618857,
      "loss": 1.759,
      "theoretical_loss": 4.391667577822308,
      "tokens_seen": 197132288
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004748746238716148,
      "loss": 1.6366,
      "theoretical_loss": 4.391485699751406,
      "tokens_seen": 197197824
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047486459378134405,
      "loss": 1.6976,
      "theoretical_loss": 4.391303899033253,
      "tokens_seen": 197263360
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047485456369107323,
      "loss": 1.6657,
      "theoretical_loss": 4.391122175609272,
      "tokens_seen": 197328896
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004748445336008024,
      "loss": 1.7964,
      "theoretical_loss": 4.390940529420946,
      "tokens_seen": 197394432
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004748345035105316,
      "loss": 1.6624,
      "theoretical_loss": 4.39075896040982,
      "tokens_seen": 197459968
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047482447342026083,
      "loss": 1.7026,
      "theoretical_loss": 4.390577468517508,
      "tokens_seen": 197525504
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047481444332998996,
      "loss": 1.722,
      "theoretical_loss": 4.390396053685682,
      "tokens_seen": 197591040
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004748044132397192,
      "loss": 1.6605,
      "theoretical_loss": 4.39021471585608,
      "tokens_seen": 197656576
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004747943831494483,
      "loss": 1.8008,
      "theoretical_loss": 4.390033454970504,
      "tokens_seen": 197722112
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047478435305917756,
      "loss": 1.7111,
      "theoretical_loss": 4.389852270970818,
      "tokens_seen": 197787648
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047477432296890674,
      "loss": 1.6327,
      "theoretical_loss": 4.389671163798949,
      "tokens_seen": 197853184
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004747642928786359,
      "loss": 1.8443,
      "theoretical_loss": 4.3894901333968885,
      "tokens_seen": 197918720
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004747542627883651,
      "loss": 1.6181,
      "theoretical_loss": 4.38930917970669,
      "tokens_seen": 197984256
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004747442326980943,
      "loss": 1.635,
      "theoretical_loss": 4.3891283026704695,
      "tokens_seen": 198049792
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047473420260782346,
      "loss": 1.7347,
      "theoretical_loss": 4.388947502230407,
      "tokens_seen": 198115328
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004747241725175527,
      "loss": 1.6304,
      "theoretical_loss": 4.388766778328744,
      "tokens_seen": 198180864
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004747141424272818,
      "loss": 1.7211,
      "theoretical_loss": 4.388586130907786,
      "tokens_seen": 198246400
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047470411233701106,
      "loss": 1.6395,
      "theoretical_loss": 4.388405559909899,
      "tokens_seen": 198311936
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746940822467402,
      "loss": 1.5567,
      "theoretical_loss": 4.3882250652775125,
      "tokens_seen": 198377472
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746840521564694,
      "loss": 1.8314,
      "theoretical_loss": 4.38804464695312,
      "tokens_seen": 198443008
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746740220661986,
      "loss": 1.6446,
      "theoretical_loss": 4.387864304879275,
      "tokens_seen": 198508544
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746639919759278,
      "loss": 1.7221,
      "theoretical_loss": 4.387684038998595,
      "tokens_seen": 198574080
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047465396188565696,
      "loss": 1.6275,
      "theoretical_loss": 4.387503849253757,
      "tokens_seen": 198639616
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746439317953862,
      "loss": 1.845,
      "theoretical_loss": 4.387323735587502,
      "tokens_seen": 198705152
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746339017051153,
      "loss": 1.7083,
      "theoretical_loss": 4.387143697942634,
      "tokens_seen": 198770688
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047462387161484456,
      "loss": 1.8133,
      "theoretical_loss": 4.386963736262016,
      "tokens_seen": 198836224
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746138415245737,
      "loss": 1.6538,
      "theoretical_loss": 4.386783850488575,
      "tokens_seen": 198901760
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004746038114343029,
      "loss": 1.7351,
      "theoretical_loss": 4.386604040565299,
      "tokens_seen": 198967296
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004745937813440321,
      "loss": 1.7573,
      "theoretical_loss": 4.386424306435236,
      "tokens_seen": 199032832
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004745837512537613,
      "loss": 1.6949,
      "theoretical_loss": 4.386244648041498,
      "tokens_seen": 199098368
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047457372116349047,
      "loss": 1.8357,
      "theoretical_loss": 4.386065065327258,
      "tokens_seen": 199163904
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047456369107321965,
      "loss": 1.7039,
      "theoretical_loss": 4.385885558235747,
      "tokens_seen": 199229440
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047455366098294883,
      "loss": 1.7301,
      "theoretical_loss": 4.385706126710264,
      "tokens_seen": 199294976
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047454363089267807,
      "loss": 1.662,
      "theoretical_loss": 4.385526770694161,
      "tokens_seen": 199360512
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004745336008024072,
      "loss": 1.6383,
      "theoretical_loss": 4.385347490130858,
      "tokens_seen": 199426048
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047452357071213643,
      "loss": 1.7105,
      "theoretical_loss": 4.385168284963832,
      "tokens_seen": 199491584
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047451354062186555,
      "loss": 1.7493,
      "theoretical_loss": 4.384989155136621,
      "tokens_seen": 199557120
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004745035105315948,
      "loss": 1.7319,
      "theoretical_loss": 4.384810100592826,
      "tokens_seen": 199622656
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047449348044132397,
      "loss": 1.6968,
      "theoretical_loss": 4.384631121276108,
      "tokens_seen": 199688192
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047448345035105315,
      "loss": 1.7133,
      "theoretical_loss": 4.384452217130187,
      "tokens_seen": 199753728
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004744734202607824,
      "loss": 1.7143,
      "theoretical_loss": 4.384273388098845,
      "tokens_seen": 199819264
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047446339017051157,
      "loss": 1.7352,
      "theoretical_loss": 4.384094634125924,
      "tokens_seen": 199884800
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047445336008024075,
      "loss": 1.7933,
      "theoretical_loss": 4.383915955155326,
      "tokens_seen": 199950336
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047444332998996993,
      "loss": 1.6532,
      "theoretical_loss": 4.383737351131016,
      "tokens_seen": 200015872
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004744332998996991,
      "loss": 1.6392,
      "theoretical_loss": 4.383558821997014,
      "tokens_seen": 200081408
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004744232698094283,
      "loss": 1.6745,
      "theoretical_loss": 4.383380367697406,
      "tokens_seen": 200146944
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047441323971915753,
      "loss": 1.7927,
      "theoretical_loss": 4.383201988176333,
      "tokens_seen": 200212480
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047440320962888666,
      "loss": 1.6263,
      "theoretical_loss": 4.383023683377999,
      "tokens_seen": 200278016
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004743931795386159,
      "loss": 1.62,
      "theoretical_loss": 4.382845453246668,
      "tokens_seen": 200343552
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000474383149448345,
      "loss": 1.7297,
      "theoretical_loss": 4.382667297726661,
      "tokens_seen": 200409088
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047437311935807425,
      "loss": 1.6233,
      "theoretical_loss": 4.3824892167623615,
      "tokens_seen": 200474624
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047436308926780343,
      "loss": 1.6796,
      "theoretical_loss": 4.382311210298212,
      "tokens_seen": 200540160
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004743530591775326,
      "loss": 1.6365,
      "theoretical_loss": 4.3821332782787135,
      "tokens_seen": 200605696
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004743430290872618,
      "loss": 1.6299,
      "theoretical_loss": 4.381955420648428,
      "tokens_seen": 200671232
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047433299899699103,
      "loss": 1.6092,
      "theoretical_loss": 4.381777637351974,
      "tokens_seen": 200736768
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047432296890672016,
      "loss": 1.6513,
      "theoretical_loss": 4.381599928334033,
      "tokens_seen": 200802304
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004743129388164494,
      "loss": 1.8157,
      "theoretical_loss": 4.381422293539345,
      "tokens_seen": 200867840
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004743029087261785,
      "loss": 1.7597,
      "theoretical_loss": 4.381244732912706,
      "tokens_seen": 200933376
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047429287863590776,
      "loss": 1.8113,
      "theoretical_loss": 4.381067246398975,
      "tokens_seen": 200998912
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047428284854563694,
      "loss": 1.633,
      "theoretical_loss": 4.380889833943066,
      "tokens_seen": 201064448
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004742728184553661,
      "loss": 1.7446,
      "theoretical_loss": 4.380712495489957,
      "tokens_seen": 201129984
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004742627883650953,
      "loss": 1.6783,
      "theoretical_loss": 4.380535230984679,
      "tokens_seen": 201195520
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004742527582748245,
      "loss": 1.7962,
      "theoretical_loss": 4.380358040372325,
      "tokens_seen": 201261056
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047424272818455366,
      "loss": 1.71,
      "theoretical_loss": 4.380180923598047,
      "tokens_seen": 201326592
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004742326980942829,
      "loss": 1.7686,
      "theoretical_loss": 4.380003880607055,
      "tokens_seen": 201392128
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000474222668004012,
      "loss": 1.7917,
      "theoretical_loss": 4.379826911344617,
      "tokens_seen": 201457664
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047421263791374126,
      "loss": 1.8697,
      "theoretical_loss": 4.3796500157560585,
      "tokens_seen": 201523200
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004742026078234704,
      "loss": 1.8006,
      "theoretical_loss": 4.379473193786765,
      "tokens_seen": 201588736
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004741925777331996,
      "loss": 1.6182,
      "theoretical_loss": 4.37929644538218,
      "tokens_seen": 201654272
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004741825476429288,
      "loss": 1.7702,
      "theoretical_loss": 4.379119770487805,
      "tokens_seen": 201719808
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000474172517552658,
      "loss": 1.7026,
      "theoretical_loss": 4.378943169049198,
      "tokens_seen": 201785344
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047416248746238716,
      "loss": 1.8505,
      "theoretical_loss": 4.378766641011978,
      "tokens_seen": 201850880
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004741524573721164,
      "loss": 1.6167,
      "theoretical_loss": 4.378590186321819,
      "tokens_seen": 201916416
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004741424272818455,
      "loss": 1.7054,
      "theoretical_loss": 4.378413804924454,
      "tokens_seen": 201981952
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047413239719157476,
      "loss": 1.6778,
      "theoretical_loss": 4.378237496765674,
      "tokens_seen": 202047488
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004741223671013039,
      "loss": 1.6169,
      "theoretical_loss": 4.378061261791328,
      "tokens_seen": 202113024
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004741123370110331,
      "loss": 1.78,
      "theoretical_loss": 4.377885099947321,
      "tokens_seen": 202178560
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004741023069207623,
      "loss": 1.7308,
      "theoretical_loss": 4.3777090111796175,
      "tokens_seen": 202244096
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004740922768304915,
      "loss": 1.6266,
      "theoretical_loss": 4.377532995434238,
      "tokens_seen": 202309632
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047408224674022067,
      "loss": 1.6789,
      "theoretical_loss": 4.37735705265726,
      "tokens_seen": 202375168
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047407221664994985,
      "loss": 1.7368,
      "theoretical_loss": 4.3771811827948195,
      "tokens_seen": 202440704
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047406218655967903,
      "loss": 1.7704,
      "theoretical_loss": 4.37700538579311,
      "tokens_seen": 202506240
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047405215646940827,
      "loss": 1.714,
      "theoretical_loss": 4.37682966159838,
      "tokens_seen": 202571776
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004740421263791374,
      "loss": 1.6895,
      "theoretical_loss": 4.376654010156939,
      "tokens_seen": 202637312
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047403209628886663,
      "loss": 1.6766,
      "theoretical_loss": 4.376478431415148,
      "tokens_seen": 202702848
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047402206619859575,
      "loss": 1.6281,
      "theoretical_loss": 4.376302925319427,
      "tokens_seen": 202768384
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000474012036108325,
      "loss": 1.5336,
      "theoretical_loss": 4.3761274918162565,
      "tokens_seen": 202833920
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047400200601805417,
      "loss": 1.6753,
      "theoretical_loss": 4.375952130852169,
      "tokens_seen": 202899456
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047399197592778335,
      "loss": 1.7043,
      "theoretical_loss": 4.375776842373755,
      "tokens_seen": 202964992
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047398194583751253,
      "loss": 1.6718,
      "theoretical_loss": 4.375601626327662,
      "tokens_seen": 203030528
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047397191574724177,
      "loss": 1.5794,
      "theoretical_loss": 4.375426482660595,
      "tokens_seen": 203096064
    },
    {
      "epoch": 0.06,
      "objective/train/docs_used": 73746,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.6328281164169312,
      "objective/train/theoretical_loss": 4.375251411319312,
      "objective/train/tokens_used": 223621600,
      "theoretical_loss": 4.375251411319312,
      "tokens_seen": 203161600
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004739618856569709,
      "loss": 1.6328,
      "theoretical_loss": 4.375251411319312,
      "tokens_seen": 203161600
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047395185556670013,
      "loss": 1.5731,
      "theoretical_loss": 4.375076412250632,
      "tokens_seen": 203227136
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047394182547642926,
      "loss": 1.7699,
      "theoretical_loss": 4.374901485401426,
      "tokens_seen": 203292672
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004739317953861585,
      "loss": 1.6733,
      "theoretical_loss": 4.374726630718624,
      "tokens_seen": 203358208
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004739217652958877,
      "loss": 1.7371,
      "theoretical_loss": 4.37455184814921,
      "tokens_seen": 203423744
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047391173520561686,
      "loss": 1.6915,
      "theoretical_loss": 4.374377137640225,
      "tokens_seen": 203489280
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047390170511534604,
      "loss": 1.7364,
      "theoretical_loss": 4.374202499138768,
      "tokens_seen": 203554816
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004738916750250752,
      "loss": 1.8405,
      "theoretical_loss": 4.374027932591989,
      "tokens_seen": 203620352
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004738816449348044,
      "loss": 1.6641,
      "theoretical_loss": 4.373853437947099,
      "tokens_seen": 203685888
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047387161484453363,
      "loss": 1.7331,
      "theoretical_loss": 4.37367901515136,
      "tokens_seen": 203751424
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047386158475426276,
      "loss": 1.6472,
      "theoretical_loss": 4.373504664152094,
      "tokens_seen": 203816960
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000473851554663992,
      "loss": 1.7481,
      "theoretical_loss": 4.373330384896676,
      "tokens_seen": 203882496
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004738415245737211,
      "loss": 1.589,
      "theoretical_loss": 4.373156177332536,
      "tokens_seen": 203948032
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047383149448345036,
      "loss": 1.7867,
      "theoretical_loss": 4.372982041407161,
      "tokens_seen": 204013568
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047382146439317954,
      "loss": 1.7214,
      "theoretical_loss": 4.372807977068092,
      "tokens_seen": 204079104
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004738114343029087,
      "loss": 1.6845,
      "theoretical_loss": 4.372633984262928,
      "tokens_seen": 204144640
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004738014042126379,
      "loss": 1.6498,
      "theoretical_loss": 4.372460062939318,
      "tokens_seen": 204210176
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047379137412236714,
      "loss": 1.8238,
      "theoretical_loss": 4.372286213044972,
      "tokens_seen": 204275712
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047378134403209626,
      "loss": 1.8384,
      "theoretical_loss": 4.37211243452765,
      "tokens_seen": 204341248
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004737713139418255,
      "loss": 1.6361,
      "theoretical_loss": 4.37193872733517,
      "tokens_seen": 204406784
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004737612838515546,
      "loss": 1.6287,
      "theoretical_loss": 4.371765091415404,
      "tokens_seen": 204472320
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047375125376128386,
      "loss": 1.7928,
      "theoretical_loss": 4.371591526716279,
      "tokens_seen": 204537856
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047374122367101304,
      "loss": 1.6559,
      "theoretical_loss": 4.371418033185777,
      "tokens_seen": 204603392
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004737311935807422,
      "loss": 1.712,
      "theoretical_loss": 4.3712446107719325,
      "tokens_seen": 204668928
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047372116349047146,
      "loss": 1.7427,
      "theoretical_loss": 4.371071259422838,
      "tokens_seen": 204734464
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004737111334002006,
      "loss": 1.6917,
      "theoretical_loss": 4.370897979086636,
      "tokens_seen": 204800000
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004737011033099298,
      "loss": 1.794,
      "theoretical_loss": 4.370724769711529,
      "tokens_seen": 204865536
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000473691073219659,
      "loss": 1.6722,
      "theoretical_loss": 4.370551631245769,
      "tokens_seen": 204931072
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004736810431293882,
      "loss": 1.7157,
      "theoretical_loss": 4.370378563637667,
      "tokens_seen": 204996608
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047367101303911736,
      "loss": 1.5986,
      "theoretical_loss": 4.3702055668355815,
      "tokens_seen": 205062144
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004736609829488466,
      "loss": 1.851,
      "theoretical_loss": 4.370032640787931,
      "tokens_seen": 205127680
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004736509528585757,
      "loss": 1.6265,
      "theoretical_loss": 4.369859785443188,
      "tokens_seen": 205193216
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047364092276830496,
      "loss": 1.7101,
      "theoretical_loss": 4.369687000749873,
      "tokens_seen": 205258752
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004736308926780341,
      "loss": 1.5672,
      "theoretical_loss": 4.3695142866565675,
      "tokens_seen": 205324288
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004736208625877633,
      "loss": 1.6643,
      "theoretical_loss": 4.369341643111902,
      "tokens_seen": 205389824
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004736108324974925,
      "loss": 1.7756,
      "theoretical_loss": 4.369169070064563,
      "tokens_seen": 205455360
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004736008024072217,
      "loss": 1.6164,
      "theoretical_loss": 4.368996567463292,
      "tokens_seen": 205520896
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047359077231695087,
      "loss": 1.5541,
      "theoretical_loss": 4.3688241352568795,
      "tokens_seen": 205586432
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047358074222668005,
      "loss": 1.5937,
      "theoretical_loss": 4.368651773394173,
      "tokens_seen": 205651968
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047357071213640923,
      "loss": 1.729,
      "theoretical_loss": 4.368479481824075,
      "tokens_seen": 205717504
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047356068204613847,
      "loss": 1.6476,
      "theoretical_loss": 4.368307260495536,
      "tokens_seen": 205783040
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004735506519558676,
      "loss": 1.7187,
      "theoretical_loss": 4.368135109357564,
      "tokens_seen": 205848576
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047354062186559683,
      "loss": 1.7552,
      "theoretical_loss": 4.36796302835922,
      "tokens_seen": 205914112
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047353059177532595,
      "loss": 1.598,
      "theoretical_loss": 4.367791017449618,
      "tokens_seen": 205979648
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004735205616850552,
      "loss": 1.6893,
      "theoretical_loss": 4.367619076577923,
      "tokens_seen": 206045184
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047351053159478437,
      "loss": 1.7252,
      "theoretical_loss": 4.367447205693354,
      "tokens_seen": 206110720
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047350050150451355,
      "loss": 1.714,
      "theoretical_loss": 4.367275404745186,
      "tokens_seen": 206176256
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047349047141424273,
      "loss": 1.662,
      "theoretical_loss": 4.367103673682742,
      "tokens_seen": 206241792
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047348044132397197,
      "loss": 1.6681,
      "theoretical_loss": 4.3669320124554,
      "tokens_seen": 206307328
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004734704112337011,
      "loss": 1.7176,
      "theoretical_loss": 4.366760421012592,
      "tokens_seen": 206372864
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047346038114343033,
      "loss": 1.6956,
      "theoretical_loss": 4.366588899303801,
      "tokens_seen": 206438400
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047345035105315946,
      "loss": 1.5418,
      "theoretical_loss": 4.366417447278565,
      "tokens_seen": 206503936
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004734403209628887,
      "loss": 1.705,
      "theoretical_loss": 4.366246064886468,
      "tokens_seen": 206569472
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004734302908726179,
      "loss": 1.6957,
      "theoretical_loss": 4.3660747520771555,
      "tokens_seen": 206635008
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047342026078234706,
      "loss": 1.8361,
      "theoretical_loss": 4.36590350880032,
      "tokens_seen": 206700544
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047341023069207624,
      "loss": 1.7051,
      "theoretical_loss": 4.365732335005706,
      "tokens_seen": 206766080
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004734002006018054,
      "loss": 1.6915,
      "theoretical_loss": 4.365561230643112,
      "tokens_seen": 206831616
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004733901705115346,
      "loss": 1.7838,
      "theoretical_loss": 4.365390195662389,
      "tokens_seen": 206897152
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047338014042126383,
      "loss": 1.5782,
      "theoretical_loss": 4.365219230013438,
      "tokens_seen": 206962688
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047337011033099296,
      "loss": 1.7425,
      "theoretical_loss": 4.3650483336462145,
      "tokens_seen": 207028224
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004733600802407222,
      "loss": 1.6428,
      "theoretical_loss": 4.364877506510723,
      "tokens_seen": 207093760
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004733500501504513,
      "loss": 1.845,
      "theoretical_loss": 4.3647067485570235,
      "tokens_seen": 207159296
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047334002006018056,
      "loss": 1.8067,
      "theoretical_loss": 4.364536059735224,
      "tokens_seen": 207224832
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047332998996990974,
      "loss": 1.7402,
      "theoretical_loss": 4.364365439995488,
      "tokens_seen": 207290368
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004733199598796389,
      "loss": 1.7063,
      "theoretical_loss": 4.3641948892880285,
      "tokens_seen": 207355904
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004733099297893681,
      "loss": 1.6653,
      "theoretical_loss": 4.364024407563109,
      "tokens_seen": 207421440
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047329989969909734,
      "loss": 1.9352,
      "theoretical_loss": 4.363853994771048,
      "tokens_seen": 207486976
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047328986960882646,
      "loss": 1.6466,
      "theoretical_loss": 4.363683650862212,
      "tokens_seen": 207552512
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004732798395185557,
      "loss": 1.7031,
      "theoretical_loss": 4.36351337578702,
      "tokens_seen": 207618048
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004732698094282848,
      "loss": 1.6082,
      "theoretical_loss": 4.363343169495945,
      "tokens_seen": 207683584
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047325977933801406,
      "loss": 1.6621,
      "theoretical_loss": 4.363173031939506,
      "tokens_seen": 207749120
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047324974924774324,
      "loss": 1.6587,
      "theoretical_loss": 4.363002963068277,
      "tokens_seen": 207814656
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004732397191574724,
      "loss": 1.6744,
      "theoretical_loss": 4.362832962832883,
      "tokens_seen": 207880192
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004732296890672016,
      "loss": 1.6817,
      "theoretical_loss": 4.362663031183999,
      "tokens_seen": 207945728
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004732196589769308,
      "loss": 1.7567,
      "theoretical_loss": 4.36249316807235,
      "tokens_seen": 208011264
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047320962888665997,
      "loss": 1.7762,
      "theoretical_loss": 4.3623233734487155,
      "tokens_seen": 208076800
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004731995987963892,
      "loss": 1.6746,
      "theoretical_loss": 4.362153647263921,
      "tokens_seen": 208142336
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047318956870611833,
      "loss": 1.5891,
      "theoretical_loss": 4.361983989468847,
      "tokens_seen": 208207872
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047317953861584757,
      "loss": 1.7683,
      "theoretical_loss": 4.3618144000144214,
      "tokens_seen": 208273408
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047316950852557675,
      "loss": 1.8169,
      "theoretical_loss": 4.361644878851626,
      "tokens_seen": 208338944
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047315947843530593,
      "loss": 1.7573,
      "theoretical_loss": 4.36147542593149,
      "tokens_seen": 208404480
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004731494483450351,
      "loss": 1.6673,
      "theoretical_loss": 4.361306041205095,
      "tokens_seen": 208470016
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004731394182547643,
      "loss": 1.7347,
      "theoretical_loss": 4.361136724623573,
      "tokens_seen": 208535552
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047312938816449347,
      "loss": 1.8285,
      "theoretical_loss": 4.360967476138105,
      "tokens_seen": 208601088
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004731193580742227,
      "loss": 1.7959,
      "theoretical_loss": 4.360798295699925,
      "tokens_seen": 208666624
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047310932798395183,
      "loss": 1.618,
      "theoretical_loss": 4.360629183260313,
      "tokens_seen": 208732160
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047309929789368107,
      "loss": 1.7257,
      "theoretical_loss": 4.360460138770604,
      "tokens_seen": 208797696
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004730892678034102,
      "loss": 1.834,
      "theoretical_loss": 4.360291162182179,
      "tokens_seen": 208863232
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047307923771313943,
      "loss": 1.7906,
      "theoretical_loss": 4.360122253446472,
      "tokens_seen": 208928768
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004730692076228686,
      "loss": 1.7627,
      "theoretical_loss": 4.359953412514965,
      "tokens_seen": 208994304
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004730591775325978,
      "loss": 1.7239,
      "theoretical_loss": 4.359784639339191,
      "tokens_seen": 209059840
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000473049147442327,
      "loss": 1.6198,
      "theoretical_loss": 4.359615933870732,
      "tokens_seen": 209125376
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047303911735205615,
      "loss": 1.6903,
      "theoretical_loss": 4.359447296061219,
      "tokens_seen": 209190912
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047302908726178534,
      "loss": 1.6609,
      "theoretical_loss": 4.359278725862336,
      "tokens_seen": 209256448
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047301905717151457,
      "loss": 1.8451,
      "theoretical_loss": 4.359110223225814,
      "tokens_seen": 209321984
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004730090270812437,
      "loss": 1.8209,
      "theoretical_loss": 4.358941788103433,
      "tokens_seen": 209387520
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047299899699097293,
      "loss": 1.6712,
      "theoretical_loss": 4.358773420447024,
      "tokens_seen": 209453056
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004729889669007021,
      "loss": 1.8364,
      "theoretical_loss": 4.358605120208469,
      "tokens_seen": 209518592
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004729789368104313,
      "loss": 1.5983,
      "theoretical_loss": 4.358436887339694,
      "tokens_seen": 209584128
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047296890672016053,
      "loss": 1.6242,
      "theoretical_loss": 4.35826872179268,
      "tokens_seen": 209649664
    },
    {
      "epoch": 0.06,
      "objective/train/docs_used": 76100,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.6441030502319336,
      "objective/train/theoretical_loss": 4.358100623519453,
      "objective/train/tokens_used": 230175200,
      "theoretical_loss": 4.358100623519453,
      "tokens_seen": 209715200
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047295887662988966,
      "loss": 1.6441,
      "theoretical_loss": 4.358100623519453,
      "tokens_seen": 209715200
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004729488465396189,
      "loss": 1.7789,
      "theoretical_loss": 4.357932592472092,
      "tokens_seen": 209780736
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004729388164493481,
      "loss": 1.746,
      "theoretical_loss": 4.357764628602721,
      "tokens_seen": 209846272
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047292878635907726,
      "loss": 1.732,
      "theoretical_loss": 4.357596731863517,
      "tokens_seen": 209911808
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047291875626880644,
      "loss": 1.8003,
      "theoretical_loss": 4.357428902206704,
      "tokens_seen": 209977344
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004729087261785356,
      "loss": 1.6343,
      "theoretical_loss": 4.357261139584553,
      "tokens_seen": 210042880
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004728986960882648,
      "loss": 1.6378,
      "theoretical_loss": 4.357093443949388,
      "tokens_seen": 210108416
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047288866599799403,
      "loss": 1.696,
      "theoretical_loss": 4.356925815253579,
      "tokens_seen": 210173952
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047287863590772316,
      "loss": 1.5958,
      "theoretical_loss": 4.356758253449544,
      "tokens_seen": 210239488
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004728686058174524,
      "loss": 1.675,
      "theoretical_loss": 4.356590758489753,
      "tokens_seen": 210305024
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004728585757271815,
      "loss": 1.6287,
      "theoretical_loss": 4.356423330326722,
      "tokens_seen": 210370560
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047284854563691076,
      "loss": 1.6161,
      "theoretical_loss": 4.356255968913015,
      "tokens_seen": 210436096
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047283851554663994,
      "loss": 1.5756,
      "theoretical_loss": 4.356088674201246,
      "tokens_seen": 210501632
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004728284854563691,
      "loss": 1.7385,
      "theoretical_loss": 4.355921446144077,
      "tokens_seen": 210567168
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004728184553660983,
      "loss": 1.7302,
      "theoretical_loss": 4.355754284694218,
      "tokens_seen": 210632704
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047280842527582754,
      "loss": 1.7232,
      "theoretical_loss": 4.355587189804427,
      "tokens_seen": 210698240
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047279839518555666,
      "loss": 1.7142,
      "theoretical_loss": 4.355420161427512,
      "tokens_seen": 210763776
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004727883650952859,
      "loss": 1.8022,
      "theoretical_loss": 4.355253199516326,
      "tokens_seen": 210829312
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000472778335005015,
      "loss": 1.6397,
      "theoretical_loss": 4.355086304023773,
      "tokens_seen": 210894848
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047276830491474426,
      "loss": 1.6853,
      "theoretical_loss": 4.354919474902804,
      "tokens_seen": 210960384
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047275827482447344,
      "loss": 1.5427,
      "theoretical_loss": 4.354752712106417,
      "tokens_seen": 211025920
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004727482447342026,
      "loss": 1.8085,
      "theoretical_loss": 4.354586015587659,
      "tokens_seen": 211091456
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004727382146439318,
      "loss": 1.6453,
      "theoretical_loss": 4.354419385299623,
      "tokens_seen": 211156992
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000472728184553661,
      "loss": 1.732,
      "theoretical_loss": 4.354252821195453,
      "tokens_seen": 211222528
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047271815446339017,
      "loss": 1.6246,
      "theoretical_loss": 4.354086323228338,
      "tokens_seen": 211288064
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004727081243731194,
      "loss": 1.6213,
      "theoretical_loss": 4.353919891351516,
      "tokens_seen": 211353600
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047269809428284853,
      "loss": 1.633,
      "theoretical_loss": 4.35375352551827,
      "tokens_seen": 211419136
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047268806419257777,
      "loss": 1.7245,
      "theoretical_loss": 4.353587225681935,
      "tokens_seen": 211484672
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047267803410230695,
      "loss": 1.7277,
      "theoretical_loss": 4.35342099179589,
      "tokens_seen": 211550208
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047266800401203613,
      "loss": 1.5899,
      "theoretical_loss": 4.353254823813561,
      "tokens_seen": 211615744
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004726579739217653,
      "loss": 1.689,
      "theoretical_loss": 4.353088721688424,
      "tokens_seen": 211681280
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004726479438314945,
      "loss": 1.6636,
      "theoretical_loss": 4.352922685374001,
      "tokens_seen": 211746816
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047263791374122367,
      "loss": 1.5342,
      "theoretical_loss": 4.352756714823859,
      "tokens_seen": 211812352
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004726278836509529,
      "loss": 1.5968,
      "theoretical_loss": 4.352590809991616,
      "tokens_seen": 211877888
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047261785356068203,
      "loss": 1.6727,
      "theoretical_loss": 4.352424970830935,
      "tokens_seen": 211943424
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047260782347041127,
      "loss": 1.7924,
      "theoretical_loss": 4.352259197295525,
      "tokens_seen": 212008960
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004725977933801404,
      "loss": 1.6243,
      "theoretical_loss": 4.352093489339143,
      "tokens_seen": 212074496
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047258776328986963,
      "loss": 1.8025,
      "theoretical_loss": 4.351927846915595,
      "tokens_seen": 212140032
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004725777331995988,
      "loss": 1.6607,
      "theoretical_loss": 4.35176226997873,
      "tokens_seen": 212205568
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000472567703109328,
      "loss": 1.7345,
      "theoretical_loss": 4.351596758482445,
      "tokens_seen": 212271104
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004725576730190572,
      "loss": 1.7064,
      "theoretical_loss": 4.351431312380684,
      "tokens_seen": 212336640
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047254764292878636,
      "loss": 1.7381,
      "theoretical_loss": 4.351265931627439,
      "tokens_seen": 212402176
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047253761283851554,
      "loss": 1.7067,
      "theoretical_loss": 4.351100616176747,
      "tokens_seen": 212467712
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047252758274824477,
      "loss": 1.72,
      "theoretical_loss": 4.350935365982691,
      "tokens_seen": 212533248
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004725175526579739,
      "loss": 1.7205,
      "theoretical_loss": 4.350770180999402,
      "tokens_seen": 212598784
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047250752256770313,
      "loss": 1.6189,
      "theoretical_loss": 4.3506050611810565,
      "tokens_seen": 212664320
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004724974924774323,
      "loss": 1.6163,
      "theoretical_loss": 4.350440006481877,
      "tokens_seen": 212729856
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004724874623871615,
      "loss": 1.6596,
      "theoretical_loss": 4.350275016856132,
      "tokens_seen": 212795392
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004724774322968907,
      "loss": 1.7955,
      "theoretical_loss": 4.350110092258138,
      "tokens_seen": 212860928
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047246740220661986,
      "loss": 1.5901,
      "theoretical_loss": 4.349945232642256,
      "tokens_seen": 212926464
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047245737211634904,
      "loss": 1.6597,
      "theoretical_loss": 4.3497804379628935,
      "tokens_seen": 212992000
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004724473420260783,
      "loss": 1.7338,
      "theoretical_loss": 4.349615708174504,
      "tokens_seen": 213057536
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004724373119358074,
      "loss": 1.7039,
      "theoretical_loss": 4.3494510432315865,
      "tokens_seen": 213123072
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047242728184553664,
      "loss": 1.6191,
      "theoretical_loss": 4.349286443088687,
      "tokens_seen": 213188608
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047241725175526576,
      "loss": 1.6165,
      "theoretical_loss": 4.349121907700396,
      "tokens_seen": 213254144
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000472407221664995,
      "loss": 1.6867,
      "theoretical_loss": 4.348957437021351,
      "tokens_seen": 213319680
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004723971915747242,
      "loss": 1.6532,
      "theoretical_loss": 4.348793031006235,
      "tokens_seen": 213385216
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047238716148445336,
      "loss": 1.5672,
      "theoretical_loss": 4.348628689609775,
      "tokens_seen": 213450752
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047237713139418254,
      "loss": 1.6633,
      "theoretical_loss": 4.348464412786746,
      "tokens_seen": 213516288
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004723671013039117,
      "loss": 1.6047,
      "theoretical_loss": 4.348300200491966,
      "tokens_seen": 213581824
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004723570712136409,
      "loss": 1.6902,
      "theoretical_loss": 4.348136052680301,
      "tokens_seen": 213647360
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047234704112337014,
      "loss": 1.6778,
      "theoretical_loss": 4.347971969306662,
      "tokens_seen": 213712896
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047233701103309927,
      "loss": 1.7415,
      "theoretical_loss": 4.347807950326002,
      "tokens_seen": 213778432
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004723269809428285,
      "loss": 1.6728,
      "theoretical_loss": 4.347643995693325,
      "tokens_seen": 213843968
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004723169508525577,
      "loss": 1.6351,
      "theoretical_loss": 4.347480105363674,
      "tokens_seen": 213909504
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047230692076228686,
      "loss": 1.717,
      "theoretical_loss": 4.3473162792921425,
      "tokens_seen": 213975040
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047229689067201605,
      "loss": 1.7668,
      "theoretical_loss": 4.347152517433866,
      "tokens_seen": 214040576
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004722868605817452,
      "loss": 1.6364,
      "theoretical_loss": 4.346988819744026,
      "tokens_seen": 214106112
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.0004722768304914744,
      "loss": 1.7232,
      "theoretical_loss": 4.346825186177848,
      "tokens_seen": 214171648
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047226680040120364,
      "loss": 1.6856,
      "theoretical_loss": 4.346661616690605,
      "tokens_seen": 214237184
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047225677031093277,
      "loss": 1.6396,
      "theoretical_loss": 4.346498111237612,
      "tokens_seen": 214302720
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.000472246740220662,
      "loss": 1.6808,
      "theoretical_loss": 4.346334669774231,
      "tokens_seen": 214368256
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047223671013039113,
      "loss": 1.624,
      "theoretical_loss": 4.346171292255867,
      "tokens_seen": 214433792
    },
    {
      "epoch": 0.06,
      "learning_rate": 0.00047222668004012037,
      "loss": 1.6005,
      "theoretical_loss": 4.34600797863797,
      "tokens_seen": 214499328
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004722166499498496,
      "loss": 1.5495,
      "theoretical_loss": 4.345844728876036,
      "tokens_seen": 214564864
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047220661985957873,
      "loss": 1.6174,
      "theoretical_loss": 4.345681542925604,
      "tokens_seen": 214630400
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047219658976930797,
      "loss": 1.7752,
      "theoretical_loss": 4.345518420742259,
      "tokens_seen": 214695936
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047218655967903715,
      "loss": 1.515,
      "theoretical_loss": 4.345355362281628,
      "tokens_seen": 214761472
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047217652958876633,
      "loss": 1.7128,
      "theoretical_loss": 4.345192367499386,
      "tokens_seen": 214827008
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004721664994984955,
      "loss": 1.6003,
      "theoretical_loss": 4.3450294363512505,
      "tokens_seen": 214892544
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004721564694082247,
      "loss": 1.6076,
      "theoretical_loss": 4.34486656879298,
      "tokens_seen": 214958080
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047214643931795387,
      "loss": 1.7492,
      "theoretical_loss": 4.344703764780386,
      "tokens_seen": 215023616
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004721364092276831,
      "loss": 1.6559,
      "theoretical_loss": 4.344541024269312,
      "tokens_seen": 215089152
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047212637913741223,
      "loss": 1.6178,
      "theoretical_loss": 4.344378347215657,
      "tokens_seen": 215154688
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047211634904714147,
      "loss": 1.7038,
      "theoretical_loss": 4.344215733575357,
      "tokens_seen": 215220224
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004721063189568706,
      "loss": 1.5884,
      "theoretical_loss": 4.344053183304396,
      "tokens_seen": 215285760
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047209628886659983,
      "loss": 1.6951,
      "theoretical_loss": 4.343890696358798,
      "tokens_seen": 215351296
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000472086258776329,
      "loss": 1.6948,
      "theoretical_loss": 4.343728272694635,
      "tokens_seen": 215416832
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004720762286860582,
      "loss": 1.6829,
      "theoretical_loss": 4.34356591226802,
      "tokens_seen": 215482368
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004720661985957874,
      "loss": 1.5419,
      "theoretical_loss": 4.343403615035111,
      "tokens_seen": 215547904
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047205616850551656,
      "loss": 1.6362,
      "theoretical_loss": 4.343241380952109,
      "tokens_seen": 215613440
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047204613841524574,
      "loss": 1.6002,
      "theoretical_loss": 4.34307920997526,
      "tokens_seen": 215678976
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047203610832497497,
      "loss": 1.5883,
      "theoretical_loss": 4.34291710206085,
      "tokens_seen": 215744512
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004720260782347041,
      "loss": 1.7076,
      "theoretical_loss": 4.342755057165214,
      "tokens_seen": 215810048
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047201604814443333,
      "loss": 1.6726,
      "theoretical_loss": 4.342593075244728,
      "tokens_seen": 215875584
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004720060180541625,
      "loss": 1.5242,
      "theoretical_loss": 4.342431156255809,
      "tokens_seen": 215941120
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004719959879638917,
      "loss": 1.704,
      "theoretical_loss": 4.3422693001549195,
      "tokens_seen": 216006656
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004719859578736209,
      "loss": 1.5561,
      "theoretical_loss": 4.342107506898567,
      "tokens_seen": 216072192
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047197592778335006,
      "loss": 1.6553,
      "theoretical_loss": 4.3419457764433,
      "tokens_seen": 216137728
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047196589769307924,
      "loss": 1.729,
      "theoretical_loss": 4.34178410874571,
      "tokens_seen": 216203264
    },
    {
      "epoch": 0.07,
      "objective/train/docs_used": 78159,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.780550241470337,
      "objective/train/theoretical_loss": 4.341622503762434,
      "objective/train/tokens_used": 236728800,
      "theoretical_loss": 4.341622503762434,
      "tokens_seen": 216268800
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004719558676028085,
      "loss": 1.7806,
      "theoretical_loss": 4.341622503762434,
      "tokens_seen": 216268800
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004719458375125376,
      "loss": 1.7275,
      "theoretical_loss": 4.341460961450148,
      "tokens_seen": 216334336
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047193580742226684,
      "loss": 1.6989,
      "theoretical_loss": 4.341299481765575,
      "tokens_seen": 216399872
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047192577733199596,
      "loss": 1.7221,
      "theoretical_loss": 4.34113806466548,
      "tokens_seen": 216465408
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004719157472417252,
      "loss": 1.6869,
      "theoretical_loss": 4.340976710106671,
      "tokens_seen": 216530944
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004719057171514544,
      "loss": 1.6319,
      "theoretical_loss": 4.340815418045995,
      "tokens_seen": 216596480
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047189568706118356,
      "loss": 1.4672,
      "theoretical_loss": 4.340654188440349,
      "tokens_seen": 216662016
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047188565697091274,
      "loss": 1.5813,
      "theoretical_loss": 4.340493021246668,
      "tokens_seen": 216727552
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004718756268806419,
      "loss": 1.6639,
      "theoretical_loss": 4.3403319164219285,
      "tokens_seen": 216793088
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004718655967903711,
      "loss": 1.7011,
      "theoretical_loss": 4.340170873923155,
      "tokens_seen": 216858624
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047185556670010034,
      "loss": 1.6751,
      "theoretical_loss": 4.340009893707408,
      "tokens_seen": 216924160
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047184553660982947,
      "loss": 1.6108,
      "theoretical_loss": 4.339848975731796,
      "tokens_seen": 216989696
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004718355065195587,
      "loss": 1.6776,
      "theoretical_loss": 4.3396881199534665,
      "tokens_seen": 217055232
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004718254764292879,
      "loss": 1.6037,
      "theoretical_loss": 4.339527326329613,
      "tokens_seen": 217120768
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047181544633901706,
      "loss": 1.6951,
      "theoretical_loss": 4.3393665948174664,
      "tokens_seen": 217186304
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047180541624874625,
      "loss": 1.7043,
      "theoretical_loss": 4.339205925374305,
      "tokens_seen": 217251840
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004717953861584754,
      "loss": 1.553,
      "theoretical_loss": 4.339045317957446,
      "tokens_seen": 217317376
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004717853560682046,
      "loss": 1.5929,
      "theoretical_loss": 4.33888477252425,
      "tokens_seen": 217382912
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047177532597793384,
      "loss": 1.5894,
      "theoretical_loss": 4.33872428903212,
      "tokens_seen": 217448448
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047176529588766297,
      "loss": 1.5797,
      "theoretical_loss": 4.338563867438499,
      "tokens_seen": 217513984
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004717552657973922,
      "loss": 1.6958,
      "theoretical_loss": 4.338403507700877,
      "tokens_seen": 217579520
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047174523570712133,
      "loss": 1.6866,
      "theoretical_loss": 4.33824320977678,
      "tokens_seen": 217645056
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047173520561685057,
      "loss": 1.5967,
      "theoretical_loss": 4.33808297362378,
      "tokens_seen": 217710592
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047172517552657975,
      "loss": 1.7554,
      "theoretical_loss": 4.337922799199489,
      "tokens_seen": 217776128
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047171514543630893,
      "loss": 1.6713,
      "theoretical_loss": 4.337762686461561,
      "tokens_seen": 217841664
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004717051153460381,
      "loss": 1.632,
      "theoretical_loss": 4.337602635367694,
      "tokens_seen": 217907200
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047169508525576735,
      "loss": 1.6798,
      "theoretical_loss": 4.337442645875624,
      "tokens_seen": 217972736
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004716850551654965,
      "loss": 1.7238,
      "theoretical_loss": 4.337282717943132,
      "tokens_seen": 218038272
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004716750250752257,
      "loss": 1.7244,
      "theoretical_loss": 4.337122851528037,
      "tokens_seen": 218103808
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047166499498495484,
      "loss": 1.8052,
      "theoretical_loss": 4.336963046588204,
      "tokens_seen": 218169344
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047165496489468407,
      "loss": 1.7853,
      "theoretical_loss": 4.336803303081538,
      "tokens_seen": 218234880
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047164493480441325,
      "loss": 1.6675,
      "theoretical_loss": 4.336643620965982,
      "tokens_seen": 218300416
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047163490471414243,
      "loss": 1.7183,
      "theoretical_loss": 4.336484000199524,
      "tokens_seen": 218365952
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004716248746238716,
      "loss": 1.6492,
      "theoretical_loss": 4.336324440740195,
      "tokens_seen": 218431488
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004716148445336008,
      "loss": 1.7425,
      "theoretical_loss": 4.336164942546061,
      "tokens_seen": 218497024
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047160481444333,
      "loss": 1.6133,
      "theoretical_loss": 4.336005505575235,
      "tokens_seen": 218562560
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004715947843530592,
      "loss": 1.5355,
      "theoretical_loss": 4.335846129785869,
      "tokens_seen": 218628096
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047158475426278834,
      "loss": 1.6811,
      "theoretical_loss": 4.335686815136157,
      "tokens_seen": 218693632
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004715747241725176,
      "loss": 1.6029,
      "theoretical_loss": 4.335527561584333,
      "tokens_seen": 218759168
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004715646940822467,
      "loss": 1.7653,
      "theoretical_loss": 4.3353683690886715,
      "tokens_seen": 218824704
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047155466399197594,
      "loss": 1.6963,
      "theoretical_loss": 4.33520923760749,
      "tokens_seen": 218890240
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004715446339017051,
      "loss": 1.7052,
      "theoretical_loss": 4.335050167099145,
      "tokens_seen": 218955776
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004715346038114343,
      "loss": 1.7833,
      "theoretical_loss": 4.334891157522035,
      "tokens_seen": 219021312
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004715245737211635,
      "loss": 1.77,
      "theoretical_loss": 4.3347322088346,
      "tokens_seen": 219086848
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004715145436308927,
      "loss": 1.6526,
      "theoretical_loss": 4.33457332099532,
      "tokens_seen": 219152384
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047150451354062184,
      "loss": 1.6287,
      "theoretical_loss": 4.334414493962714,
      "tokens_seen": 219217920
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004714944834503511,
      "loss": 1.4384,
      "theoretical_loss": 4.334255727695344,
      "tokens_seen": 219283456
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004714844533600802,
      "loss": 1.6573,
      "theoretical_loss": 4.334097022151812,
      "tokens_seen": 219348992
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047147442326980944,
      "loss": 1.7136,
      "theoretical_loss": 4.33393837729076,
      "tokens_seen": 219414528
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004714643931795387,
      "loss": 1.6358,
      "theoretical_loss": 4.333779793070871,
      "tokens_seen": 219480064
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004714543630892678,
      "loss": 1.7299,
      "theoretical_loss": 4.33362126945087,
      "tokens_seen": 219545600
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047144433299899704,
      "loss": 1.5855,
      "theoretical_loss": 4.333462806389517,
      "tokens_seen": 219611136
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047143430290872616,
      "loss": 1.6896,
      "theoretical_loss": 4.33330440384562,
      "tokens_seen": 219676672
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004714242728184554,
      "loss": 1.6175,
      "theoretical_loss": 4.333146061778021,
      "tokens_seen": 219742208
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004714142427281846,
      "loss": 1.6625,
      "theoretical_loss": 4.332987780145606,
      "tokens_seen": 219807744
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047140421263791376,
      "loss": 1.5515,
      "theoretical_loss": 4.3328295589073,
      "tokens_seen": 219873280
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047139418254764294,
      "loss": 1.6688,
      "theoretical_loss": 4.332671398022067,
      "tokens_seen": 219938816
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004713841524573721,
      "loss": 1.574,
      "theoretical_loss": 4.332513297448912,
      "tokens_seen": 220004352
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004713741223671013,
      "loss": 1.7712,
      "theoretical_loss": 4.332355257146881,
      "tokens_seen": 220069888
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047136409227683054,
      "loss": 1.5652,
      "theoretical_loss": 4.3321972770750605,
      "tokens_seen": 220135424
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047135406218655967,
      "loss": 1.6822,
      "theoretical_loss": 4.332039357192572,
      "tokens_seen": 220200960
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004713440320962889,
      "loss": 1.6218,
      "theoretical_loss": 4.331881497458584,
      "tokens_seen": 220266496
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004713340020060181,
      "loss": 1.6435,
      "theoretical_loss": 4.3317236978323,
      "tokens_seen": 220332032
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047132397191574726,
      "loss": 1.6645,
      "theoretical_loss": 4.3315659582729635,
      "tokens_seen": 220397568
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047131394182547645,
      "loss": 1.6592,
      "theoretical_loss": 4.331408278739861,
      "tokens_seen": 220463104
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047130391173520563,
      "loss": 1.5912,
      "theoretical_loss": 4.331250659192316,
      "tokens_seen": 220528640
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004712938816449348,
      "loss": 1.7306,
      "theoretical_loss": 4.33109309958969,
      "tokens_seen": 220594176
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047128385155466404,
      "loss": 1.6679,
      "theoretical_loss": 4.330935599891389,
      "tokens_seen": 220659712
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047127382146439317,
      "loss": 1.756,
      "theoretical_loss": 4.330778160056855,
      "tokens_seen": 220725248
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004712637913741224,
      "loss": 1.6413,
      "theoretical_loss": 4.330620780045571,
      "tokens_seen": 220790784
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047125376128385153,
      "loss": 1.5314,
      "theoretical_loss": 4.330463459817057,
      "tokens_seen": 220856320
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047124373119358077,
      "loss": 1.7303,
      "theoretical_loss": 4.3303061993308765,
      "tokens_seen": 220921856
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047123370110330995,
      "loss": 1.6118,
      "theoretical_loss": 4.330148998546628,
      "tokens_seen": 220987392
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047122367101303913,
      "loss": 1.782,
      "theoretical_loss": 4.329991857423953,
      "tokens_seen": 221052928
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004712136409227683,
      "loss": 1.597,
      "theoretical_loss": 4.329834775922529,
      "tokens_seen": 221118464
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047120361083249755,
      "loss": 1.6891,
      "theoretical_loss": 4.329677754002074,
      "tokens_seen": 221184000
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004711935807422267,
      "loss": 1.6258,
      "theoretical_loss": 4.329520791622348,
      "tokens_seen": 221249536
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004711835506519559,
      "loss": 1.7106,
      "theoretical_loss": 4.329363888743145,
      "tokens_seen": 221315072
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047117352056168504,
      "loss": 1.5903,
      "theoretical_loss": 4.329207045324301,
      "tokens_seen": 221380608
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047116349047141427,
      "loss": 1.6666,
      "theoretical_loss": 4.3290502613256905,
      "tokens_seen": 221446144
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047115346038114345,
      "loss": 1.6321,
      "theoretical_loss": 4.328893536707228,
      "tokens_seen": 221511680
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047114343029087263,
      "loss": 1.6382,
      "theoretical_loss": 4.328736871428864,
      "tokens_seen": 221577216
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004711334002006018,
      "loss": 1.6197,
      "theoretical_loss": 4.328580265450592,
      "tokens_seen": 221642752
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000471123370110331,
      "loss": 1.7008,
      "theoretical_loss": 4.32842371873244,
      "tokens_seen": 221708288
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004711133400200602,
      "loss": 1.8077,
      "theoretical_loss": 4.328267231234476,
      "tokens_seen": 221773824
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004711033099297894,
      "loss": 1.818,
      "theoretical_loss": 4.328110802916811,
      "tokens_seen": 221839360
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047109327983951854,
      "loss": 1.614,
      "theoretical_loss": 4.327954433739588,
      "tokens_seen": 221904896
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004710832497492478,
      "loss": 1.5801,
      "theoretical_loss": 4.327798123662992,
      "tokens_seen": 221970432
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004710732196589769,
      "loss": 1.5769,
      "theoretical_loss": 4.327641872647248,
      "tokens_seen": 222035968
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047106318956870614,
      "loss": 1.7131,
      "theoretical_loss": 4.327485680652615,
      "tokens_seen": 222101504
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004710531594784353,
      "loss": 1.6222,
      "theoretical_loss": 4.327329547639396,
      "tokens_seen": 222167040
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004710431293881645,
      "loss": 1.8042,
      "theoretical_loss": 4.327173473567927,
      "tokens_seen": 222232576
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004710330992978937,
      "loss": 1.7638,
      "theoretical_loss": 4.327017458398587,
      "tokens_seen": 222298112
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004710230692076229,
      "loss": 1.7115,
      "theoretical_loss": 4.32686150209179,
      "tokens_seen": 222363648
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047101303911735204,
      "loss": 1.5477,
      "theoretical_loss": 4.32670560460799,
      "tokens_seen": 222429184
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004710030090270813,
      "loss": 1.507,
      "theoretical_loss": 4.326549765907679,
      "tokens_seen": 222494720
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004709929789368104,
      "loss": 1.6688,
      "theoretical_loss": 4.326393985951386,
      "tokens_seen": 222560256
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047098294884653964,
      "loss": 1.7306,
      "theoretical_loss": 4.326238264699679,
      "tokens_seen": 222625792
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004709729187562688,
      "loss": 1.669,
      "theoretical_loss": 4.326082602113164,
      "tokens_seen": 222691328
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470962888665998,
      "loss": 1.5845,
      "theoretical_loss": 4.325926998152487,
      "tokens_seen": 222756864
    },
    {
      "epoch": 0.07,
      "objective/train/docs_used": 80178,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.788330316543579,
      "objective/train/theoretical_loss": 4.325771452778328,
      "objective/train/tokens_used": 243282400,
      "theoretical_loss": 4.325771452778328,
      "tokens_seen": 222822400
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004709528585757272,
      "loss": 1.7883,
      "theoretical_loss": 4.325771452778328,
      "tokens_seen": 222822400
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047094282848545636,
      "loss": 1.5304,
      "theoretical_loss": 4.325615965951408,
      "tokens_seen": 222887936
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047093279839518555,
      "loss": 1.6959,
      "theoretical_loss": 4.325460537632483,
      "tokens_seen": 222953472
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004709227683049148,
      "loss": 1.6,
      "theoretical_loss": 4.325305167782352,
      "tokens_seen": 223019008
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004709127382146439,
      "loss": 1.6555,
      "theoretical_loss": 4.325149856361845,
      "tokens_seen": 223084544
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047090270812437314,
      "loss": 1.8043,
      "theoretical_loss": 4.3249946033318345,
      "tokens_seen": 223150080
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047089267803410227,
      "loss": 1.5875,
      "theoretical_loss": 4.32483940865323,
      "tokens_seen": 223215616
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004708826479438315,
      "loss": 1.6008,
      "theoretical_loss": 4.324684272286978,
      "tokens_seen": 223281152
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004708726178535607,
      "loss": 1.6227,
      "theoretical_loss": 4.324529194194062,
      "tokens_seen": 223346688
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047086258776328987,
      "loss": 1.6847,
      "theoretical_loss": 4.324374174335503,
      "tokens_seen": 223412224
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047085255767301905,
      "loss": 1.6542,
      "theoretical_loss": 4.324219212672363,
      "tokens_seen": 223477760
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004708425275827483,
      "loss": 1.6818,
      "theoretical_loss": 4.324064309165734,
      "tokens_seen": 223543296
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004708324974924774,
      "loss": 1.5817,
      "theoretical_loss": 4.3239094637767534,
      "tokens_seen": 223608832
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047082246740220665,
      "loss": 1.6674,
      "theoretical_loss": 4.323754676466592,
      "tokens_seen": 223674368
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004708124373119358,
      "loss": 1.6984,
      "theoretical_loss": 4.323599947196458,
      "tokens_seen": 223739904
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470802407221665,
      "loss": 1.6408,
      "theoretical_loss": 4.323445275927597,
      "tokens_seen": 223805440
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004707923771313942,
      "loss": 1.6517,
      "theoretical_loss": 4.323290662621292,
      "tokens_seen": 223870976
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047078234704112337,
      "loss": 1.65,
      "theoretical_loss": 4.323136107238865,
      "tokens_seen": 223936512
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047077231695085255,
      "loss": 1.773,
      "theoretical_loss": 4.322981609741671,
      "tokens_seen": 224002048
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047076228686058173,
      "loss": 1.7198,
      "theoretical_loss": 4.322827170091106,
      "tokens_seen": 224067584
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004707522567703109,
      "loss": 1.5997,
      "theoretical_loss": 4.322672788248601,
      "tokens_seen": 224133120
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047074222668004015,
      "loss": 1.7063,
      "theoretical_loss": 4.3225184641756265,
      "tokens_seen": 224198656
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004707321965897693,
      "loss": 1.6956,
      "theoretical_loss": 4.322364197833684,
      "tokens_seen": 224264192
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004707221664994985,
      "loss": 1.6344,
      "theoretical_loss": 4.322209989184319,
      "tokens_seen": 224329728
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047071213640922775,
      "loss": 1.6372,
      "theoretical_loss": 4.32205583818911,
      "tokens_seen": 224395264
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004707021063189569,
      "loss": 1.7245,
      "theoretical_loss": 4.321901744809672,
      "tokens_seen": 224460800
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004706920762286861,
      "loss": 1.6972,
      "theoretical_loss": 4.321747709007658,
      "tokens_seen": 224526336
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047068204613841524,
      "loss": 1.7142,
      "theoretical_loss": 4.321593730744759,
      "tokens_seen": 224591872
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047067201604814447,
      "loss": 1.6321,
      "theoretical_loss": 4.3214398099826985,
      "tokens_seen": 224657408
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047066198595787365,
      "loss": 1.7144,
      "theoretical_loss": 4.321285946683242,
      "tokens_seen": 224722944
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047065195586760283,
      "loss": 1.5371,
      "theoretical_loss": 4.321132140808186,
      "tokens_seen": 224788480
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470641925777332,
      "loss": 1.6966,
      "theoretical_loss": 4.320978392319368,
      "tokens_seen": 224854016
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004706318956870612,
      "loss": 1.6032,
      "theoretical_loss": 4.320824701178661,
      "tokens_seen": 224919552
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004706218655967904,
      "loss": 1.7367,
      "theoretical_loss": 4.320671067347972,
      "tokens_seen": 224985088
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004706118355065196,
      "loss": 1.5905,
      "theoretical_loss": 4.320517490789246,
      "tokens_seen": 225050624
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047060180541624874,
      "loss": 1.6503,
      "theoretical_loss": 4.320363971464466,
      "tokens_seen": 225116160
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470591775325978,
      "loss": 1.5495,
      "theoretical_loss": 4.320210509335649,
      "tokens_seen": 225181696
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004705817452357071,
      "loss": 1.6634,
      "theoretical_loss": 4.320057104364848,
      "tokens_seen": 225247232
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047057171514543634,
      "loss": 1.6408,
      "theoretical_loss": 4.3199037565141545,
      "tokens_seen": 225312768
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004705616850551655,
      "loss": 1.7285,
      "theoretical_loss": 4.319750465745694,
      "tokens_seen": 225378304
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004705516549648947,
      "loss": 1.6031,
      "theoretical_loss": 4.31959723202163,
      "tokens_seen": 225443840
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004705416248746239,
      "loss": 1.6341,
      "theoretical_loss": 4.319444055304161,
      "tokens_seen": 225509376
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004705315947843531,
      "loss": 1.7268,
      "theoretical_loss": 4.319290935555521,
      "tokens_seen": 225574912
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047052156469408224,
      "loss": 1.718,
      "theoretical_loss": 4.319137872737979,
      "tokens_seen": 225640448
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004705115346038115,
      "loss": 1.6615,
      "theoretical_loss": 4.318984866813844,
      "tokens_seen": 225705984
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004705015045135406,
      "loss": 1.7245,
      "theoretical_loss": 4.318831917745458,
      "tokens_seen": 225771520
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047049147442326984,
      "loss": 1.5771,
      "theoretical_loss": 4.318679025495197,
      "tokens_seen": 225837056
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470481444332999,
      "loss": 1.6884,
      "theoretical_loss": 4.318526190025478,
      "tokens_seen": 225902592
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004704714142427282,
      "loss": 1.7245,
      "theoretical_loss": 4.318373411298749,
      "tokens_seen": 225968128
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004704613841524574,
      "loss": 1.7348,
      "theoretical_loss": 4.318220689277496,
      "tokens_seen": 226033664
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047045135406218656,
      "loss": 1.6608,
      "theoretical_loss": 4.318068023924241,
      "tokens_seen": 226099200
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047044132397191575,
      "loss": 1.5501,
      "theoretical_loss": 4.317915415201538,
      "tokens_seen": 226164736
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470431293881645,
      "loss": 1.6777,
      "theoretical_loss": 4.317762863071982,
      "tokens_seen": 226230272
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004704212637913741,
      "loss": 1.5972,
      "theoretical_loss": 4.317610367498201,
      "tokens_seen": 226295808
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047041123370110334,
      "loss": 1.5992,
      "theoretical_loss": 4.317457928442856,
      "tokens_seen": 226361344
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047040120361083247,
      "loss": 1.6915,
      "theoretical_loss": 4.317305545868648,
      "tokens_seen": 226426880
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004703911735205617,
      "loss": 1.7051,
      "theoretical_loss": 4.317153219738311,
      "tokens_seen": 226492416
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004703811434302909,
      "loss": 1.6766,
      "theoretical_loss": 4.317000950014615,
      "tokens_seen": 226557952
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047037111334002007,
      "loss": 1.6355,
      "theoretical_loss": 4.316848736660363,
      "tokens_seen": 226623488
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047036108324974925,
      "loss": 1.5476,
      "theoretical_loss": 4.316696579638396,
      "tokens_seen": 226689024
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004703510531594785,
      "loss": 1.7255,
      "theoretical_loss": 4.316544478911592,
      "tokens_seen": 226754560
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004703410230692076,
      "loss": 1.6556,
      "theoretical_loss": 4.316392434442858,
      "tokens_seen": 226820096
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047033099297893685,
      "loss": 1.6814,
      "theoretical_loss": 4.316240446195142,
      "tokens_seen": 226885632
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470320962888666,
      "loss": 1.581,
      "theoretical_loss": 4.3160885141314225,
      "tokens_seen": 226951168
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004703109327983952,
      "loss": 1.7563,
      "theoretical_loss": 4.315936638214718,
      "tokens_seen": 227016704
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004703009027081244,
      "loss": 1.6904,
      "theoretical_loss": 4.315784818408079,
      "tokens_seen": 227082240
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047029087261785357,
      "loss": 1.6334,
      "theoretical_loss": 4.31563305467459,
      "tokens_seen": 227147776
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047028084252758275,
      "loss": 1.5787,
      "theoretical_loss": 4.315481346977374,
      "tokens_seen": 227213312
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047027081243731193,
      "loss": 1.6826,
      "theoretical_loss": 4.315329695279584,
      "tokens_seen": 227278848
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004702607823470411,
      "loss": 1.6222,
      "theoretical_loss": 4.315178099544413,
      "tokens_seen": 227344384
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047025075225677035,
      "loss": 1.6236,
      "theoretical_loss": 4.315026559735085,
      "tokens_seen": 227409920
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004702407221664995,
      "loss": 1.6054,
      "theoretical_loss": 4.314875075814861,
      "tokens_seen": 227475456
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004702306920762287,
      "loss": 1.5938,
      "theoretical_loss": 4.314723647747035,
      "tokens_seen": 227540992
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047022066198595784,
      "loss": 1.7325,
      "theoretical_loss": 4.314572275494937,
      "tokens_seen": 227606528
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004702106318956871,
      "loss": 1.6397,
      "theoretical_loss": 4.3144209590219305,
      "tokens_seen": 227672064
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047020060180541626,
      "loss": 1.6341,
      "theoretical_loss": 4.314269698291415,
      "tokens_seen": 227737600
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047019057171514544,
      "loss": 1.6361,
      "theoretical_loss": 4.3141184932668235,
      "tokens_seen": 227803136
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004701805416248746,
      "loss": 1.7022,
      "theoretical_loss": 4.3139673439116235,
      "tokens_seen": 227868672
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047017051153460385,
      "loss": 1.7159,
      "theoretical_loss": 4.313816250189317,
      "tokens_seen": 227934208
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000470160481444333,
      "loss": 1.7054,
      "theoretical_loss": 4.313665212063441,
      "tokens_seen": 227999744
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004701504513540622,
      "loss": 1.6214,
      "theoretical_loss": 4.313514229497566,
      "tokens_seen": 228065280
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047014042126379134,
      "loss": 1.5169,
      "theoretical_loss": 4.313363302455299,
      "tokens_seen": 228130816
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004701303911735206,
      "loss": 1.6834,
      "theoretical_loss": 4.313212430900277,
      "tokens_seen": 228196352
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047012036108324976,
      "loss": 1.6724,
      "theoretical_loss": 4.313061614796176,
      "tokens_seen": 228261888
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047011033099297894,
      "loss": 1.7233,
      "theoretical_loss": 4.312910854106702,
      "tokens_seen": 228327424
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004701003009027081,
      "loss": 1.6262,
      "theoretical_loss": 4.3127601487956,
      "tokens_seen": 228392960
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004700902708124373,
      "loss": 1.6585,
      "theoretical_loss": 4.312609498826644,
      "tokens_seen": 228458496
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004700802407221665,
      "loss": 1.6472,
      "theoretical_loss": 4.312458904163645,
      "tokens_seen": 228524032
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004700702106318957,
      "loss": 1.6255,
      "theoretical_loss": 4.312308364770448,
      "tokens_seen": 228589568
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047006018054162484,
      "loss": 1.6551,
      "theoretical_loss": 4.312157880610931,
      "tokens_seen": 228655104
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004700501504513541,
      "loss": 1.5812,
      "theoretical_loss": 4.312007451649006,
      "tokens_seen": 228720640
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047004012036108326,
      "loss": 1.755,
      "theoretical_loss": 4.31185707784862,
      "tokens_seen": 228786176
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047003009027081244,
      "loss": 1.5334,
      "theoretical_loss": 4.311706759173753,
      "tokens_seen": 228851712
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004700200601805416,
      "loss": 1.7213,
      "theoretical_loss": 4.311556495588419,
      "tokens_seen": 228917248
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004700100300902708,
      "loss": 1.443,
      "theoretical_loss": 4.3114062870566645,
      "tokens_seen": 228982784
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00047,
      "loss": 1.6439,
      "theoretical_loss": 4.311256133542573,
      "tokens_seen": 229048320
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004699899699097292,
      "loss": 1.5446,
      "theoretical_loss": 4.311106035010259,
      "tokens_seen": 229113856
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046997993981945835,
      "loss": 1.6475,
      "theoretical_loss": 4.310955991423871,
      "tokens_seen": 229179392
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004699699097291876,
      "loss": 1.6612,
      "theoretical_loss": 4.310806002747592,
      "tokens_seen": 229244928
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046995987963891676,
      "loss": 1.704,
      "theoretical_loss": 4.310656068945637,
      "tokens_seen": 229310464
    },
    {
      "epoch": 0.07,
      "objective/train/docs_used": 82233,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.5841166973114014,
      "objective/train/theoretical_loss": 4.310506189982257,
      "objective/train/tokens_used": 249836000,
      "theoretical_loss": 4.310506189982257,
      "tokens_seen": 229376000
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046994984954864595,
      "loss": 1.5841,
      "theoretical_loss": 4.310506189982257,
      "tokens_seen": 229376000
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004699398194583752,
      "loss": 1.5275,
      "theoretical_loss": 4.310356365821734,
      "tokens_seen": 229441536
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004699297893681043,
      "loss": 1.7371,
      "theoretical_loss": 4.310206596428387,
      "tokens_seen": 229507072
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046991975927783354,
      "loss": 1.6589,
      "theoretical_loss": 4.310056881766561,
      "tokens_seen": 229572608
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046990972918756267,
      "loss": 1.679,
      "theoretical_loss": 4.309907221800645,
      "tokens_seen": 229638144
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004698996990972919,
      "loss": 1.7108,
      "theoretical_loss": 4.309757616495053,
      "tokens_seen": 229703680
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004698896690070211,
      "loss": 1.5922,
      "theoretical_loss": 4.309608065814234,
      "tokens_seen": 229769216
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046987963891675027,
      "loss": 1.685,
      "theoretical_loss": 4.309458569722673,
      "tokens_seen": 229834752
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046986960882647945,
      "loss": 1.626,
      "theoretical_loss": 4.309309128184886,
      "tokens_seen": 229900288
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004698595787362087,
      "loss": 1.6669,
      "theoretical_loss": 4.309159741165422,
      "tokens_seen": 229965824
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004698495486459378,
      "loss": 1.4715,
      "theoretical_loss": 4.309010408628865,
      "tokens_seen": 230031360
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046983951855566705,
      "loss": 1.7478,
      "theoretical_loss": 4.308861130539829,
      "tokens_seen": 230096896
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004698294884653962,
      "loss": 1.7168,
      "theoretical_loss": 4.308711906862965,
      "tokens_seen": 230162432
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004698194583751254,
      "loss": 1.641,
      "theoretical_loss": 4.308562737562953,
      "tokens_seen": 230227968
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004698094282848546,
      "loss": 1.5585,
      "theoretical_loss": 4.30841362260451,
      "tokens_seen": 230293504
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046979939819458377,
      "loss": 1.5649,
      "theoretical_loss": 4.308264561952381,
      "tokens_seen": 230359040
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046978936810431295,
      "loss": 1.7568,
      "theoretical_loss": 4.30811555557135,
      "tokens_seen": 230424576
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046977933801404213,
      "loss": 1.6528,
      "theoretical_loss": 4.307966603426227,
      "tokens_seen": 230490112
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004697693079237713,
      "loss": 1.7011,
      "theoretical_loss": 4.307817705481861,
      "tokens_seen": 230555648
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046975927783350055,
      "loss": 1.7065,
      "theoretical_loss": 4.307668861703131,
      "tokens_seen": 230621184
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004697492477432297,
      "loss": 1.6531,
      "theoretical_loss": 4.307520072054947,
      "tokens_seen": 230686720
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004697392176529589,
      "loss": 1.7086,
      "theoretical_loss": 4.307371336502254,
      "tokens_seen": 230752256
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046972918756268804,
      "loss": 1.8095,
      "theoretical_loss": 4.307222655010031,
      "tokens_seen": 230817792
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004697191574724173,
      "loss": 1.6533,
      "theoretical_loss": 4.307074027543287,
      "tokens_seen": 230883328
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046970912738214646,
      "loss": 1.6376,
      "theoretical_loss": 4.3069254540670645,
      "tokens_seen": 230948864
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046969909729187564,
      "loss": 1.6238,
      "theoretical_loss": 4.306776934546436,
      "tokens_seen": 231014400
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004696890672016048,
      "loss": 1.6832,
      "theoretical_loss": 4.306628468946512,
      "tokens_seen": 231079936
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046967903711133405,
      "loss": 1.7458,
      "theoretical_loss": 4.306480057232431,
      "tokens_seen": 231145472
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004696690070210632,
      "loss": 1.6402,
      "theoretical_loss": 4.306331699369366,
      "tokens_seen": 231211008
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004696589769307924,
      "loss": 1.6599,
      "theoretical_loss": 4.30618339532252,
      "tokens_seen": 231276544
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046964894684052154,
      "loss": 1.6054,
      "theoretical_loss": 4.306035145057132,
      "tokens_seen": 231342080
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004696389167502508,
      "loss": 1.6204,
      "theoretical_loss": 4.30588694853847,
      "tokens_seen": 231407616
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046962888665997996,
      "loss": 1.5792,
      "theoretical_loss": 4.305738805731836,
      "tokens_seen": 231473152
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046961885656970914,
      "loss": 1.66,
      "theoretical_loss": 4.305590716602563,
      "tokens_seen": 231538688
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004696088264794383,
      "loss": 1.6428,
      "theoretical_loss": 4.305442681116018,
      "tokens_seen": 231604224
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004695987963891675,
      "loss": 1.5289,
      "theoretical_loss": 4.305294699237598,
      "tokens_seen": 231669760
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004695887662988967,
      "loss": 1.6861,
      "theoretical_loss": 4.305146770932734,
      "tokens_seen": 231735296
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004695787362086259,
      "loss": 1.5829,
      "theoretical_loss": 4.304998896166888,
      "tokens_seen": 231800832
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046956870611835505,
      "loss": 1.5688,
      "theoretical_loss": 4.304851074905554,
      "tokens_seen": 231866368
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004695586760280843,
      "loss": 1.7554,
      "theoretical_loss": 4.304703307114258,
      "tokens_seen": 231931904
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046954864593781346,
      "loss": 1.7325,
      "theoretical_loss": 4.304555592758559,
      "tokens_seen": 231997440
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046953861584754264,
      "loss": 1.6765,
      "theoretical_loss": 4.304407931804047,
      "tokens_seen": 232062976
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004695285857572718,
      "loss": 1.7923,
      "theoretical_loss": 4.304260324216344,
      "tokens_seen": 232128512
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000469518555667001,
      "loss": 1.6413,
      "theoretical_loss": 4.304112769961102,
      "tokens_seen": 232194048
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004695085255767302,
      "loss": 1.5912,
      "theoretical_loss": 4.303965269004008,
      "tokens_seen": 232259584
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004694984954864594,
      "loss": 1.7672,
      "theoretical_loss": 4.30381782131078,
      "tokens_seen": 232325120
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046948846539618855,
      "loss": 1.6832,
      "theoretical_loss": 4.303670426847166,
      "tokens_seen": 232390656
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004694784353059178,
      "loss": 1.8237,
      "theoretical_loss": 4.303523085578946,
      "tokens_seen": 232456192
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004694684052156469,
      "loss": 1.6877,
      "theoretical_loss": 4.303375797471935,
      "tokens_seen": 232521728
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046945837512537615,
      "loss": 1.6506,
      "theoretical_loss": 4.303228562491974,
      "tokens_seen": 232587264
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004694483450351053,
      "loss": 1.6925,
      "theoretical_loss": 4.303081380604939,
      "tokens_seen": 232652800
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004694383149448345,
      "loss": 1.6091,
      "theoretical_loss": 4.302934251776739,
      "tokens_seen": 232718336
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004694282848545637,
      "loss": 1.5427,
      "theoretical_loss": 4.302787175973311,
      "tokens_seen": 232783872
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046941825476429287,
      "loss": 1.7286,
      "theoretical_loss": 4.302640153160625,
      "tokens_seen": 232849408
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046940822467402205,
      "loss": 1.6394,
      "theoretical_loss": 4.302493183304683,
      "tokens_seen": 232914944
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004693981945837513,
      "loss": 1.6264,
      "theoretical_loss": 4.302346266371517,
      "tokens_seen": 232980480
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004693881644934804,
      "loss": 1.5978,
      "theoretical_loss": 4.302199402327191,
      "tokens_seen": 233046016
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046937813440320965,
      "loss": 1.7265,
      "theoretical_loss": 4.302052591137802,
      "tokens_seen": 233111552
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046936810431293883,
      "loss": 1.5314,
      "theoretical_loss": 4.301905832769474,
      "tokens_seen": 233177088
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000469358074222668,
      "loss": 1.6503,
      "theoretical_loss": 4.301759127188367,
      "tokens_seen": 233242624
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004693480441323972,
      "loss": 1.7648,
      "theoretical_loss": 4.301612474360669,
      "tokens_seen": 233308160
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004693380140421264,
      "loss": 1.6616,
      "theoretical_loss": 4.301465874252601,
      "tokens_seen": 233373696
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046932798395185555,
      "loss": 1.7291,
      "theoretical_loss": 4.301319326830413,
      "tokens_seen": 233439232
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004693179538615848,
      "loss": 1.4438,
      "theoretical_loss": 4.301172832060389,
      "tokens_seen": 233504768
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004693079237713139,
      "loss": 1.6655,
      "theoretical_loss": 4.3010263899088415,
      "tokens_seen": 233570304
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046929789368104315,
      "loss": 1.7359,
      "theoretical_loss": 4.300880000342114,
      "tokens_seen": 233635840
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004692878635907723,
      "loss": 1.6956,
      "theoretical_loss": 4.300733663326583,
      "tokens_seen": 233701376
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004692778335005015,
      "loss": 1.5324,
      "theoretical_loss": 4.300587378828655,
      "tokens_seen": 233766912
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004692678034102307,
      "loss": 1.715,
      "theoretical_loss": 4.300441146814766,
      "tokens_seen": 233832448
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004692577733199599,
      "loss": 1.5575,
      "theoretical_loss": 4.300294967251386,
      "tokens_seen": 233897984
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046924774322968906,
      "loss": 1.7439,
      "theoretical_loss": 4.300148840105011,
      "tokens_seen": 233963520
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046923771313941824,
      "loss": 1.7361,
      "theoretical_loss": 4.300002765342173,
      "tokens_seen": 234029056
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004692276830491474,
      "loss": 1.6633,
      "theoretical_loss": 4.299856742929431,
      "tokens_seen": 234094592
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046921765295887666,
      "loss": 1.6794,
      "theoretical_loss": 4.299710772833377,
      "tokens_seen": 234160128
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046920762286860584,
      "loss": 1.6497,
      "theoretical_loss": 4.299564855020631,
      "tokens_seen": 234225664
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000469197592778335,
      "loss": 1.652,
      "theoretical_loss": 4.299418989457848,
      "tokens_seen": 234291200
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046918756268806425,
      "loss": 1.5975,
      "theoretical_loss": 4.299273176111709,
      "tokens_seen": 234356736
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004691775325977934,
      "loss": 1.5804,
      "theoretical_loss": 4.299127414948927,
      "tokens_seen": 234422272
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004691675025075226,
      "loss": 1.7612,
      "theoretical_loss": 4.298981705936248,
      "tokens_seen": 234487808
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046915747241725174,
      "loss": 1.5565,
      "theoretical_loss": 4.298836049040444,
      "tokens_seen": 234553344
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000469147442326981,
      "loss": 1.618,
      "theoretical_loss": 4.298690444228322,
      "tokens_seen": 234618880
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046913741223671016,
      "loss": 1.6228,
      "theoretical_loss": 4.298544891466717,
      "tokens_seen": 234684416
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046912738214643934,
      "loss": 1.5623,
      "theoretical_loss": 4.298399390722493,
      "tokens_seen": 234749952
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004691173520561685,
      "loss": 1.6855,
      "theoretical_loss": 4.298253941962548,
      "tokens_seen": 234815488
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004691073219658977,
      "loss": 1.6778,
      "theoretical_loss": 4.2981085451538075,
      "tokens_seen": 234881024
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004690972918756269,
      "loss": 1.6426,
      "theoretical_loss": 4.297963200263228,
      "tokens_seen": 234946560
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004690872617853561,
      "loss": 1.591,
      "theoretical_loss": 4.297817907257797,
      "tokens_seen": 235012096
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046907723169508525,
      "loss": 1.5884,
      "theoretical_loss": 4.29767266610453,
      "tokens_seen": 235077632
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004690672016048145,
      "loss": 1.6701,
      "theoretical_loss": 4.297527476770476,
      "tokens_seen": 235143168
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046905717151454366,
      "loss": 1.6627,
      "theoretical_loss": 4.297382339222711,
      "tokens_seen": 235208704
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046904714142427284,
      "loss": 1.7325,
      "theoretical_loss": 4.297237253428342,
      "tokens_seen": 235274240
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000469037111334002,
      "loss": 1.6429,
      "theoretical_loss": 4.297092219354509,
      "tokens_seen": 235339776
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004690270812437312,
      "loss": 1.5416,
      "theoretical_loss": 4.296947236968376,
      "tokens_seen": 235405312
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004690170511534604,
      "loss": 1.7203,
      "theoretical_loss": 4.296802306237143,
      "tokens_seen": 235470848
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004690070210631896,
      "loss": 1.7249,
      "theoretical_loss": 4.296657427128036,
      "tokens_seen": 235536384
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046899699097291875,
      "loss": 1.6673,
      "theoretical_loss": 4.296512599608311,
      "tokens_seen": 235601920
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000468986960882648,
      "loss": 1.7111,
      "theoretical_loss": 4.296367823645259,
      "tokens_seen": 235667456
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004689769307923771,
      "loss": 1.67,
      "theoretical_loss": 4.296223099206193,
      "tokens_seen": 235732992
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046896690070210635,
      "loss": 1.6303,
      "theoretical_loss": 4.296078426258462,
      "tokens_seen": 235798528
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046895687061183553,
      "loss": 1.6188,
      "theoretical_loss": 4.295933804769442,
      "tokens_seen": 235864064
    },
    {
      "epoch": 0.07,
      "objective/train/docs_used": 84344,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.755774736404419,
      "objective/train/theoretical_loss": 4.295789234706538,
      "objective/train/tokens_used": 256389600,
      "theoretical_loss": 4.295789234706538,
      "tokens_seen": 235929600
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004689468405215647,
      "loss": 1.7558,
      "theoretical_loss": 4.295789234706538,
      "tokens_seen": 235929600
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004689368104312939,
      "loss": 1.5739,
      "theoretical_loss": 4.295644716037188,
      "tokens_seen": 235995136
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046892678034102307,
      "loss": 1.7346,
      "theoretical_loss": 4.295500248728856,
      "tokens_seen": 236060672
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046891675025075225,
      "loss": 1.6179,
      "theoretical_loss": 4.295355832749038,
      "tokens_seen": 236126208
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004689067201604815,
      "loss": 1.5908,
      "theoretical_loss": 4.295211468065258,
      "tokens_seen": 236191744
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004688966900702106,
      "loss": 1.6717,
      "theoretical_loss": 4.295067154645071,
      "tokens_seen": 236257280
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046888665997993985,
      "loss": 1.6822,
      "theoretical_loss": 4.294922892456061,
      "tokens_seen": 236322816
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046887662988966903,
      "loss": 1.5867,
      "theoretical_loss": 4.294778681465841,
      "tokens_seen": 236388352
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004688665997993982,
      "loss": 1.5419,
      "theoretical_loss": 4.294634521642053,
      "tokens_seen": 236453888
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004688565697091274,
      "loss": 1.7156,
      "theoretical_loss": 4.294490412952371,
      "tokens_seen": 236519424
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004688465396188566,
      "loss": 1.6734,
      "theoretical_loss": 4.294346355364494,
      "tokens_seen": 236584960
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046883650952858575,
      "loss": 1.6191,
      "theoretical_loss": 4.294202348846156,
      "tokens_seen": 236650496
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000468826479438315,
      "loss": 1.6788,
      "theoretical_loss": 4.294058393365114,
      "tokens_seen": 236716032
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004688164493480441,
      "loss": 1.7016,
      "theoretical_loss": 4.293914488889161,
      "tokens_seen": 236781568
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046880641925777335,
      "loss": 1.6879,
      "theoretical_loss": 4.293770635386112,
      "tokens_seen": 236847104
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004687963891675025,
      "loss": 1.6477,
      "theoretical_loss": 4.293626832823818,
      "tokens_seen": 236912640
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004687863590772317,
      "loss": 1.6425,
      "theoretical_loss": 4.293483081170153,
      "tokens_seen": 236978176
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004687763289869609,
      "loss": 1.5735,
      "theoretical_loss": 4.293339380393027,
      "tokens_seen": 237043712
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004687662988966901,
      "loss": 1.5506,
      "theoretical_loss": 4.293195730460372,
      "tokens_seen": 237109248
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046875626880641926,
      "loss": 1.6322,
      "theoretical_loss": 4.293052131340154,
      "tokens_seen": 237174784
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046874623871614844,
      "loss": 1.6562,
      "theoretical_loss": 4.292908583000365,
      "tokens_seen": 237240320
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004687362086258776,
      "loss": 1.7418,
      "theoretical_loss": 4.29276508540903,
      "tokens_seen": 237305856
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046872617853560686,
      "loss": 1.6667,
      "theoretical_loss": 4.292621638534198,
      "tokens_seen": 237371392
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000468716148445336,
      "loss": 1.5536,
      "theoretical_loss": 4.29247824234395,
      "tokens_seen": 237436928
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004687061183550652,
      "loss": 1.5904,
      "theoretical_loss": 4.292334896806397,
      "tokens_seen": 237502464
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004686960882647944,
      "loss": 1.6678,
      "theoretical_loss": 4.292191601889673,
      "tokens_seen": 237568000
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004686860581745236,
      "loss": 1.8251,
      "theoretical_loss": 4.2920483575619475,
      "tokens_seen": 237633536
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046867602808425276,
      "loss": 1.6438,
      "theoretical_loss": 4.291905163791417,
      "tokens_seen": 237699072
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046866599799398194,
      "loss": 1.7013,
      "theoretical_loss": 4.291762020546304,
      "tokens_seen": 237764608
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004686559679037111,
      "loss": 1.7096,
      "theoretical_loss": 4.291618927794862,
      "tokens_seen": 237830144
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046864593781344036,
      "loss": 1.5797,
      "theoretical_loss": 4.291475885505374,
      "tokens_seen": 237895680
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004686359077231695,
      "loss": 1.7083,
      "theoretical_loss": 4.291332893646149,
      "tokens_seen": 237961216
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004686258776328987,
      "loss": 1.5958,
      "theoretical_loss": 4.291189952185527,
      "tokens_seen": 238026752
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046861584754262785,
      "loss": 1.5346,
      "theoretical_loss": 4.291047061091875,
      "tokens_seen": 238092288
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004686058174523571,
      "loss": 1.6391,
      "theoretical_loss": 4.290904220333591,
      "tokens_seen": 238157824
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046859578736208626,
      "loss": 1.6721,
      "theoretical_loss": 4.2907614298790975,
      "tokens_seen": 238223360
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046858575727181545,
      "loss": 1.5258,
      "theoretical_loss": 4.290618689696848,
      "tokens_seen": 238288896
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004685757271815446,
      "loss": 1.5559,
      "theoretical_loss": 4.290475999755326,
      "tokens_seen": 238354432
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004685656970912738,
      "loss": 1.634,
      "theoretical_loss": 4.29033336002304,
      "tokens_seen": 238419968
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000468555667001003,
      "loss": 1.5404,
      "theoretical_loss": 4.290190770468529,
      "tokens_seen": 238485504
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004685456369107322,
      "loss": 1.7315,
      "theoretical_loss": 4.290048231060361,
      "tokens_seen": 238551040
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046853560682046135,
      "loss": 1.745,
      "theoretical_loss": 4.289905741767129,
      "tokens_seen": 238616576
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004685255767301906,
      "loss": 1.7764,
      "theoretical_loss": 4.289763302557457,
      "tokens_seen": 238682112
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046851554663991977,
      "loss": 1.6127,
      "theoretical_loss": 4.289620913399998,
      "tokens_seen": 238747648
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046850551654964895,
      "loss": 1.6324,
      "theoretical_loss": 4.2894785742634305,
      "tokens_seen": 238813184
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046849548645937813,
      "loss": 1.6084,
      "theoretical_loss": 4.289336285116463,
      "tokens_seen": 238878720
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004684854563691073,
      "loss": 1.681,
      "theoretical_loss": 4.289194045927832,
      "tokens_seen": 238944256
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004684754262788365,
      "loss": 1.637,
      "theoretical_loss": 4.289051856666303,
      "tokens_seen": 239009792
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046846539618856573,
      "loss": 1.638,
      "theoretical_loss": 4.288909717300667,
      "tokens_seen": 239075328
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004684553660982949,
      "loss": 1.5042,
      "theoretical_loss": 4.288767627799745,
      "tokens_seen": 239140864
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004684453360080241,
      "loss": 1.619,
      "theoretical_loss": 4.288625588132385,
      "tokens_seen": 239206400
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046843530591775327,
      "loss": 1.6282,
      "theoretical_loss": 4.288483598267465,
      "tokens_seen": 239271936
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046842527582748245,
      "loss": 1.6635,
      "theoretical_loss": 4.288341658173888,
      "tokens_seen": 239337472
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004684152457372117,
      "loss": 1.7333,
      "theoretical_loss": 4.288199767820587,
      "tokens_seen": 239403008
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004684052156469408,
      "loss": 1.5981,
      "theoretical_loss": 4.2880579271765225,
      "tokens_seen": 239468544
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046839518555667005,
      "loss": 1.7539,
      "theoretical_loss": 4.287916136210682,
      "tokens_seen": 239534080
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046838515546639923,
      "loss": 1.6216,
      "theoretical_loss": 4.287774394892082,
      "tokens_seen": 239599616
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004683751253761284,
      "loss": 1.5476,
      "theoretical_loss": 4.287632703189766,
      "tokens_seen": 239665152
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004683650952858576,
      "loss": 1.5417,
      "theoretical_loss": 4.2874910610728065,
      "tokens_seen": 239730688
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004683550651955868,
      "loss": 1.612,
      "theoretical_loss": 4.287349468510302,
      "tokens_seen": 239796224
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046834503510531595,
      "loss": 1.5934,
      "theoretical_loss": 4.28720792547138,
      "tokens_seen": 239861760
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004683350050150452,
      "loss": 1.5537,
      "theoretical_loss": 4.287066431925194,
      "tokens_seen": 239927296
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004683249749247743,
      "loss": 1.6459,
      "theoretical_loss": 4.286924987840926,
      "tokens_seen": 239992832
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046831494483450355,
      "loss": 1.792,
      "theoretical_loss": 4.2867835931877885,
      "tokens_seen": 240058368
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004683049147442327,
      "loss": 1.6526,
      "theoretical_loss": 4.286642247935017,
      "tokens_seen": 240123904
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004682948846539619,
      "loss": 1.6636,
      "theoretical_loss": 4.286500952051876,
      "tokens_seen": 240189440
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004682848545636911,
      "loss": 1.6289,
      "theoretical_loss": 4.286359705507659,
      "tokens_seen": 240254976
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004682748244734203,
      "loss": 1.6549,
      "theoretical_loss": 4.286218508271686,
      "tokens_seen": 240320512
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046826479438314946,
      "loss": 1.6762,
      "theoretical_loss": 4.286077360313303,
      "tokens_seen": 240386048
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046825476429287864,
      "loss": 1.6946,
      "theoretical_loss": 4.285936261601887,
      "tokens_seen": 240451584
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004682447342026078,
      "loss": 1.6891,
      "theoretical_loss": 4.285795212106839,
      "tokens_seen": 240517120
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046823470411233706,
      "loss": 1.5571,
      "theoretical_loss": 4.2856542117975875,
      "tokens_seen": 240582656
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004682246740220662,
      "loss": 1.587,
      "theoretical_loss": 4.285513260643591,
      "tokens_seen": 240648192
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004682146439317954,
      "loss": 1.6215,
      "theoretical_loss": 4.285372358614332,
      "tokens_seen": 240713728
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004682046138415246,
      "loss": 1.6038,
      "theoretical_loss": 4.285231505679324,
      "tokens_seen": 240779264
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004681945837512538,
      "loss": 1.566,
      "theoretical_loss": 4.285090701808103,
      "tokens_seen": 240844800
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046818455366098296,
      "loss": 1.5861,
      "theoretical_loss": 4.284949946970236,
      "tokens_seen": 240910336
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046817452357071214,
      "loss": 1.6701,
      "theoretical_loss": 4.284809241135315,
      "tokens_seen": 240975872
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004681644934804413,
      "loss": 1.6024,
      "theoretical_loss": 4.284668584272962,
      "tokens_seen": 241041408
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046815446339017056,
      "loss": 1.6823,
      "theoretical_loss": 4.284527976352823,
      "tokens_seen": 241106944
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004681444332998997,
      "loss": 1.6291,
      "theoretical_loss": 4.284387417344572,
      "tokens_seen": 241172480
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004681344032096289,
      "loss": 1.6878,
      "theoretical_loss": 4.28424690721791,
      "tokens_seen": 241238016
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046812437311935805,
      "loss": 1.5864,
      "theoretical_loss": 4.284106445942565,
      "tokens_seen": 241303552
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004681143430290873,
      "loss": 1.6444,
      "theoretical_loss": 4.2839660334882925,
      "tokens_seen": 241369088
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046810431293881646,
      "loss": 1.6751,
      "theoretical_loss": 4.283825669824875,
      "tokens_seen": 241434624
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046809428284854565,
      "loss": 1.6191,
      "theoretical_loss": 4.28368535492212,
      "tokens_seen": 241500160
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004680842527582748,
      "loss": 1.5341,
      "theoretical_loss": 4.283545088749865,
      "tokens_seen": 241565696
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000468074222668004,
      "loss": 1.6325,
      "theoretical_loss": 4.2834048712779715,
      "tokens_seen": 241631232
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004680641925777332,
      "loss": 1.5189,
      "theoretical_loss": 4.28326470247633,
      "tokens_seen": 241696768
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004680541624874624,
      "loss": 1.6295,
      "theoretical_loss": 4.283124582314856,
      "tokens_seen": 241762304
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046804413239719155,
      "loss": 1.6733,
      "theoretical_loss": 4.282984510763493,
      "tokens_seen": 241827840
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004680341023069208,
      "loss": 1.5412,
      "theoretical_loss": 4.282844487792209,
      "tokens_seen": 241893376
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046802407221664997,
      "loss": 1.6214,
      "theoretical_loss": 4.282704513371002,
      "tokens_seen": 241958912
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046801404212637915,
      "loss": 1.6194,
      "theoretical_loss": 4.282564587469896,
      "tokens_seen": 242024448
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046800401203610833,
      "loss": 1.7048,
      "theoretical_loss": 4.282424710058938,
      "tokens_seen": 242089984
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004679939819458375,
      "loss": 1.5673,
      "theoretical_loss": 4.282284881108206,
      "tokens_seen": 242155520
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004679839518555667,
      "loss": 1.6071,
      "theoretical_loss": 4.282145100587802,
      "tokens_seen": 242221056
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046797392176529593,
      "loss": 1.4923,
      "theoretical_loss": 4.282005368467856,
      "tokens_seen": 242286592
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046796389167502505,
      "loss": 1.6374,
      "theoretical_loss": 4.2818656847185235,
      "tokens_seen": 242352128
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004679538615847543,
      "loss": 1.6029,
      "theoretical_loss": 4.281726049309987,
      "tokens_seen": 242417664
    },
    {
      "epoch": 0.07,
      "objective/train/docs_used": 86450,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.5382211208343506,
      "objective/train/theoretical_loss": 4.281586462212455,
      "objective/train/tokens_used": 262943200,
      "theoretical_loss": 4.281586462212455,
      "tokens_seen": 242483200
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004679438314944834,
      "loss": 1.5382,
      "theoretical_loss": 4.281586462212455,
      "tokens_seen": 242483200
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046793380140421265,
      "loss": 1.7163,
      "theoretical_loss": 4.281446923396162,
      "tokens_seen": 242548736
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046792377131394183,
      "loss": 1.6041,
      "theoretical_loss": 4.281307432831371,
      "tokens_seen": 242614272
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467913741223671,
      "loss": 1.6738,
      "theoretical_loss": 4.281167990488369,
      "tokens_seen": 242679808
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004679037111334002,
      "loss": 1.6232,
      "theoretical_loss": 4.281028596337469,
      "tokens_seen": 242745344
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046789368104312943,
      "loss": 1.5977,
      "theoretical_loss": 4.280889250349014,
      "tokens_seen": 242810880
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046788365095285856,
      "loss": 1.6378,
      "theoretical_loss": 4.280749952493368,
      "tokens_seen": 242876416
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004678736208625878,
      "loss": 1.6234,
      "theoretical_loss": 4.280610702740926,
      "tokens_seen": 242941952
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004678635907723169,
      "loss": 1.56,
      "theoretical_loss": 4.280471501062106,
      "tokens_seen": 243007488
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046785356068204616,
      "loss": 1.7424,
      "theoretical_loss": 4.280332347427353,
      "tokens_seen": 243073024
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046784353059177534,
      "loss": 1.7029,
      "theoretical_loss": 4.280193241807139,
      "tokens_seen": 243138560
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004678335005015045,
      "loss": 1.6013,
      "theoretical_loss": 4.280054184171963,
      "tokens_seen": 243204096
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004678234704112337,
      "loss": 1.4938,
      "theoretical_loss": 4.279915174492345,
      "tokens_seen": 243269632
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004678134403209629,
      "loss": 1.5767,
      "theoretical_loss": 4.279776212738838,
      "tokens_seen": 243335168
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046780341023069206,
      "loss": 1.7391,
      "theoretical_loss": 4.279637298882016,
      "tokens_seen": 243400704
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004677933801404213,
      "loss": 1.5946,
      "theoretical_loss": 4.27949843289248,
      "tokens_seen": 243466240
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004677833500501504,
      "loss": 1.6428,
      "theoretical_loss": 4.2793596147408595,
      "tokens_seen": 243531776
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046777331995987966,
      "loss": 1.6258,
      "theoretical_loss": 4.279220844397806,
      "tokens_seen": 243597312
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004677632898696088,
      "loss": 1.6246,
      "theoretical_loss": 4.279082121834001,
      "tokens_seen": 243662848
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467753259779338,
      "loss": 1.6924,
      "theoretical_loss": 4.278943447020148,
      "tokens_seen": 243728384
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004677432296890672,
      "loss": 1.6166,
      "theoretical_loss": 4.278804819926978,
      "tokens_seen": 243793920
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004677331995987964,
      "loss": 1.5911,
      "theoretical_loss": 4.278666240525249,
      "tokens_seen": 243859456
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046772316950852556,
      "loss": 1.7012,
      "theoretical_loss": 4.278527708785743,
      "tokens_seen": 243924992
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004677131394182548,
      "loss": 1.6446,
      "theoretical_loss": 4.278389224679268,
      "tokens_seen": 243990528
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467703109327984,
      "loss": 1.6201,
      "theoretical_loss": 4.27825078817666,
      "tokens_seen": 244056064
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046769307923771316,
      "loss": 1.6856,
      "theoretical_loss": 4.2781123992487755,
      "tokens_seen": 244121600
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046768304914744234,
      "loss": 1.5565,
      "theoretical_loss": 4.277974057866503,
      "tokens_seen": 244187136
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004676730190571715,
      "loss": 1.67,
      "theoretical_loss": 4.277835764000752,
      "tokens_seen": 244252672
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046766298896690076,
      "loss": 1.6529,
      "theoretical_loss": 4.277697517622459,
      "tokens_seen": 244318208
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004676529588766299,
      "loss": 1.5358,
      "theoretical_loss": 4.277559318702588,
      "tokens_seen": 244383744
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004676429287863591,
      "loss": 1.7143,
      "theoretical_loss": 4.277421167212125,
      "tokens_seen": 244449280
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046763289869608825,
      "loss": 1.6614,
      "theoretical_loss": 4.277283063122083,
      "tokens_seen": 244514816
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004676228686058175,
      "loss": 1.6744,
      "theoretical_loss": 4.277145006403503,
      "tokens_seen": 244580352
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046761283851554666,
      "loss": 1.6264,
      "theoretical_loss": 4.2770069970274465,
      "tokens_seen": 244645888
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046760280842527585,
      "loss": 1.5985,
      "theoretical_loss": 4.276869034965005,
      "tokens_seen": 244711424
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467592778335005,
      "loss": 1.7133,
      "theoretical_loss": 4.276731120187293,
      "tokens_seen": 244776960
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004675827482447342,
      "loss": 1.5948,
      "theoretical_loss": 4.2765932526654495,
      "tokens_seen": 244842496
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004675727181544634,
      "loss": 1.5984,
      "theoretical_loss": 4.276455432370643,
      "tokens_seen": 244908032
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004675626880641926,
      "loss": 1.7175,
      "theoretical_loss": 4.276317659274062,
      "tokens_seen": 244973568
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046755265797392175,
      "loss": 1.6681,
      "theoretical_loss": 4.276179933346924,
      "tokens_seen": 245039104
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467542627883651,
      "loss": 1.5698,
      "theoretical_loss": 4.27604225456047,
      "tokens_seen": 245104640
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046753259779338017,
      "loss": 1.5972,
      "theoretical_loss": 4.275904622885967,
      "tokens_seen": 245170176
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046752256770310935,
      "loss": 1.6562,
      "theoretical_loss": 4.275767038294708,
      "tokens_seen": 245235712
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046751253761283853,
      "loss": 1.5065,
      "theoretical_loss": 4.275629500758008,
      "tokens_seen": 245301248
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004675025075225677,
      "loss": 1.6949,
      "theoretical_loss": 4.27549201024721,
      "tokens_seen": 245366784
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004674924774322969,
      "loss": 1.6627,
      "theoretical_loss": 4.275354566733682,
      "tokens_seen": 245432320
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046748244734202613,
      "loss": 1.6851,
      "theoretical_loss": 4.2752171701888155,
      "tokens_seen": 245497856
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046747241725175525,
      "loss": 1.6309,
      "theoretical_loss": 4.275079820584029,
      "tokens_seen": 245563392
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004674623871614845,
      "loss": 1.6649,
      "theoretical_loss": 4.274942517890764,
      "tokens_seen": 245628928
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004674523570712136,
      "loss": 1.5509,
      "theoretical_loss": 4.2748052620804895,
      "tokens_seen": 245694464
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046744232698094285,
      "loss": 1.6057,
      "theoretical_loss": 4.274668053124696,
      "tokens_seen": 245760000
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046743229689067203,
      "loss": 1.7016,
      "theoretical_loss": 4.2745308909949005,
      "tokens_seen": 245825536
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004674222668004012,
      "loss": 1.8099,
      "theoretical_loss": 4.274393775662648,
      "tokens_seen": 245891072
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004674122367101304,
      "loss": 1.6927,
      "theoretical_loss": 4.274256707099502,
      "tokens_seen": 245956608
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046740220661985963,
      "loss": 1.5564,
      "theoretical_loss": 4.274119685277058,
      "tokens_seen": 246022144
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046739217652958876,
      "loss": 1.6739,
      "theoretical_loss": 4.273982710166931,
      "tokens_seen": 246087680
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467382146439318,
      "loss": 1.5793,
      "theoretical_loss": 4.273845781740762,
      "tokens_seen": 246153216
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004673721163490471,
      "loss": 1.7059,
      "theoretical_loss": 4.273708899970218,
      "tokens_seen": 246218752
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046736208625877636,
      "loss": 1.5683,
      "theoretical_loss": 4.273572064826991,
      "tokens_seen": 246284288
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046735205616850554,
      "loss": 1.6148,
      "theoretical_loss": 4.273435276282795,
      "tokens_seen": 246349824
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004673420260782347,
      "loss": 1.598,
      "theoretical_loss": 4.2732985343093715,
      "tokens_seen": 246415360
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004673319959879639,
      "loss": 1.6331,
      "theoretical_loss": 4.273161838878485,
      "tokens_seen": 246480896
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004673219658976931,
      "loss": 1.5689,
      "theoretical_loss": 4.273025189961926,
      "tokens_seen": 246546432
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046731193580742226,
      "loss": 1.4859,
      "theoretical_loss": 4.272888587531508,
      "tokens_seen": 246611968
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004673019057171515,
      "loss": 1.6214,
      "theoretical_loss": 4.272752031559071,
      "tokens_seen": 246677504
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004672918756268806,
      "loss": 1.6849,
      "theoretical_loss": 4.272615522016476,
      "tokens_seen": 246743040
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046728184553660986,
      "loss": 1.6329,
      "theoretical_loss": 4.272479058875614,
      "tokens_seen": 246808576
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467271815446339,
      "loss": 1.6543,
      "theoretical_loss": 4.272342642108396,
      "tokens_seen": 246874112
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004672617853560682,
      "loss": 1.6376,
      "theoretical_loss": 4.272206271686758,
      "tokens_seen": 246939648
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004672517552657974,
      "loss": 1.5646,
      "theoretical_loss": 4.272069947582662,
      "tokens_seen": 247005184
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004672417251755266,
      "loss": 1.713,
      "theoretical_loss": 4.271933669768094,
      "tokens_seen": 247070720
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046723169508525576,
      "loss": 1.6652,
      "theoretical_loss": 4.271797438215064,
      "tokens_seen": 247136256
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.000467221664994985,
      "loss": 1.6904,
      "theoretical_loss": 4.271661252895605,
      "tokens_seen": 247201792
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004672116349047141,
      "loss": 1.6339,
      "theoretical_loss": 4.271525113781777,
      "tokens_seen": 247267328
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.00046720160481444336,
      "loss": 1.6722,
      "theoretical_loss": 4.271389020845662,
      "tokens_seen": 247332864
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004671915747241725,
      "loss": 1.5824,
      "theoretical_loss": 4.27125297405937,
      "tokens_seen": 247398400
    },
    {
      "epoch": 0.07,
      "learning_rate": 0.0004671815446339017,
      "loss": 1.6921,
      "theoretical_loss": 4.271116973395028,
      "tokens_seen": 247463936
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004671715145436309,
      "loss": 1.6675,
      "theoretical_loss": 4.270981018824795,
      "tokens_seen": 247529472
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004671614844533601,
      "loss": 1.5799,
      "theoretical_loss": 4.270845110320851,
      "tokens_seen": 247595008
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046715145436308927,
      "loss": 1.5589,
      "theoretical_loss": 4.270709247855397,
      "tokens_seen": 247660544
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046714142427281845,
      "loss": 1.5892,
      "theoretical_loss": 4.270573431400663,
      "tokens_seen": 247726080
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046713139418254763,
      "loss": 1.6724,
      "theoretical_loss": 4.270437660928902,
      "tokens_seen": 247791616
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046712136409227686,
      "loss": 1.562,
      "theoretical_loss": 4.270301936412389,
      "tokens_seen": 247857152
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000467111334002006,
      "loss": 1.6385,
      "theoretical_loss": 4.2701662578234245,
      "tokens_seen": 247922688
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004671013039117352,
      "loss": 1.6011,
      "theoretical_loss": 4.270030625134334,
      "tokens_seen": 247988224
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046709127382146435,
      "loss": 1.6548,
      "theoretical_loss": 4.269895038317464,
      "tokens_seen": 248053760
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004670812437311936,
      "loss": 1.7404,
      "theoretical_loss": 4.269759497345188,
      "tokens_seen": 248119296
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046707121364092277,
      "loss": 1.5942,
      "theoretical_loss": 4.269624002189901,
      "tokens_seen": 248184832
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046706118355065195,
      "loss": 1.7231,
      "theoretical_loss": 4.269488552824024,
      "tokens_seen": 248250368
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046705115346038113,
      "loss": 1.8101,
      "theoretical_loss": 4.269353149220001,
      "tokens_seen": 248315904
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046704112337011037,
      "loss": 1.5538,
      "theoretical_loss": 4.2692177913503,
      "tokens_seen": 248381440
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004670310932798395,
      "loss": 1.6099,
      "theoretical_loss": 4.2690824791874125,
      "tokens_seen": 248446976
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046702106318956873,
      "loss": 1.5898,
      "theoretical_loss": 4.2689472127038535,
      "tokens_seen": 248512512
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046701103309929786,
      "loss": 1.6446,
      "theoretical_loss": 4.2688119918721625,
      "tokens_seen": 248578048
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004670010030090271,
      "loss": 1.7665,
      "theoretical_loss": 4.268676816664902,
      "tokens_seen": 248643584
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004669909729187563,
      "loss": 1.6282,
      "theoretical_loss": 4.26854168705466,
      "tokens_seen": 248709120
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046698094282848545,
      "loss": 1.6429,
      "theoretical_loss": 4.2684066030140455,
      "tokens_seen": 248774656
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046697091273821464,
      "loss": 1.6562,
      "theoretical_loss": 4.268271564515693,
      "tokens_seen": 248840192
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004669608826479438,
      "loss": 1.5805,
      "theoretical_loss": 4.26813657153226,
      "tokens_seen": 248905728
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046695085255767305,
      "loss": 1.6949,
      "theoretical_loss": 4.268001624036429,
      "tokens_seen": 248971264
    },
    {
      "epoch": 0.08,
      "objective/train/docs_used": 88571,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.6427204608917236,
      "objective/train/theoretical_loss": 4.267866722000902,
      "objective/train/tokens_used": 269496800,
      "theoretical_loss": 4.267866722000902,
      "tokens_seen": 249036800
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046694082246740223,
      "loss": 1.6427,
      "theoretical_loss": 4.267866722000902,
      "tokens_seen": 249036800
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004669307923771314,
      "loss": 1.5391,
      "theoretical_loss": 4.26773186539841,
      "tokens_seen": 249102336
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004669207622868606,
      "loss": 1.5337,
      "theoretical_loss": 4.267597054201705,
      "tokens_seen": 249167872
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046691073219658983,
      "loss": 1.71,
      "theoretical_loss": 4.267462288383561,
      "tokens_seen": 249233408
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046690070210631896,
      "loss": 1.7165,
      "theoretical_loss": 4.267327567916777,
      "tokens_seen": 249298944
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004668906720160482,
      "loss": 1.6934,
      "theoretical_loss": 4.267192892774176,
      "tokens_seen": 249364480
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004668806419257773,
      "loss": 1.661,
      "theoretical_loss": 4.267058262928604,
      "tokens_seen": 249430016
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046687061183550656,
      "loss": 1.7063,
      "theoretical_loss": 4.26692367835293,
      "tokens_seen": 249495552
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046686058174523574,
      "loss": 1.6906,
      "theoretical_loss": 4.266789139020045,
      "tokens_seen": 249561088
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004668505516549649,
      "loss": 1.6584,
      "theoretical_loss": 4.266654644902868,
      "tokens_seen": 249626624
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004668405215646941,
      "loss": 1.5907,
      "theoretical_loss": 4.266520195974336,
      "tokens_seen": 249692160
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004668304914744233,
      "loss": 1.604,
      "theoretical_loss": 4.266385792207412,
      "tokens_seen": 249757696
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046682046138415246,
      "loss": 1.7171,
      "theoretical_loss": 4.266251433575082,
      "tokens_seen": 249823232
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004668104312938817,
      "loss": 1.7418,
      "theoretical_loss": 4.266117120050355,
      "tokens_seen": 249888768
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004668004012036108,
      "loss": 1.646,
      "theoretical_loss": 4.265982851606263,
      "tokens_seen": 249954304
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046679037111334006,
      "loss": 1.521,
      "theoretical_loss": 4.265848628215862,
      "tokens_seen": 250019840
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004667803410230692,
      "loss": 1.6194,
      "theoretical_loss": 4.265714449852229,
      "tokens_seen": 250085376
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004667703109327984,
      "loss": 1.5504,
      "theoretical_loss": 4.265580316488467,
      "tokens_seen": 250150912
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004667602808425276,
      "loss": 1.6282,
      "theoretical_loss": 4.2654462280977015,
      "tokens_seen": 250216448
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004667502507522568,
      "loss": 1.5067,
      "theoretical_loss": 4.265312184653078,
      "tokens_seen": 250281984
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046674022066198596,
      "loss": 1.6648,
      "theoretical_loss": 4.2651781861277716,
      "tokens_seen": 250347520
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004667301905717152,
      "loss": 1.6977,
      "theoretical_loss": 4.265044232494972,
      "tokens_seen": 250413056
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004667201604814443,
      "loss": 1.68,
      "theoretical_loss": 4.264910323727898,
      "tokens_seen": 250478592
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046671013039117356,
      "loss": 1.6969,
      "theoretical_loss": 4.264776459799791,
      "tokens_seen": 250544128
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004667001003009027,
      "loss": 1.5883,
      "theoretical_loss": 4.264642640683911,
      "tokens_seen": 250609664
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004666900702106319,
      "loss": 1.5737,
      "theoretical_loss": 4.264508866353546,
      "tokens_seen": 250675200
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004666800401203611,
      "loss": 1.5613,
      "theoretical_loss": 4.264375136782004,
      "tokens_seen": 250740736
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004666700100300903,
      "loss": 1.6105,
      "theoretical_loss": 4.264241451942617,
      "tokens_seen": 250806272
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046665997993981947,
      "loss": 1.6347,
      "theoretical_loss": 4.264107811808739,
      "tokens_seen": 250871808
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046664994984954865,
      "loss": 1.5843,
      "theoretical_loss": 4.263974216353749,
      "tokens_seen": 250937344
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046663991975927783,
      "loss": 1.6132,
      "theoretical_loss": 4.2638406655510455,
      "tokens_seen": 251002880
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046662988966900706,
      "loss": 1.6059,
      "theoretical_loss": 4.263707159374051,
      "tokens_seen": 251068416
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004666198595787362,
      "loss": 1.6251,
      "theoretical_loss": 4.263573697796213,
      "tokens_seen": 251133952
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046660982948846543,
      "loss": 1.5595,
      "theoretical_loss": 4.263440280790999,
      "tokens_seen": 251199488
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046659979939819455,
      "loss": 1.6424,
      "theoretical_loss": 4.263306908331899,
      "tokens_seen": 251265024
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004665897693079238,
      "loss": 1.6041,
      "theoretical_loss": 4.2631735803924276,
      "tokens_seen": 251330560
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046657973921765297,
      "loss": 1.6578,
      "theoretical_loss": 4.263040296946122,
      "tokens_seen": 251396096
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046656970912738215,
      "loss": 1.5642,
      "theoretical_loss": 4.26290705796654,
      "tokens_seen": 251461632
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046655967903711133,
      "loss": 1.671,
      "theoretical_loss": 4.262773863427265,
      "tokens_seen": 251527168
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046654964894684057,
      "loss": 1.6613,
      "theoretical_loss": 4.262640713301899,
      "tokens_seen": 251592704
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004665396188565697,
      "loss": 1.8009,
      "theoretical_loss": 4.26250760756407,
      "tokens_seen": 251658240
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046652958876629893,
      "loss": 1.5478,
      "theoretical_loss": 4.262374546187428,
      "tokens_seen": 251723776
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046651955867602806,
      "loss": 1.6266,
      "theoretical_loss": 4.262241529145643,
      "tokens_seen": 251789312
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004665095285857573,
      "loss": 1.6343,
      "theoretical_loss": 4.262108556412411,
      "tokens_seen": 251854848
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004664994984954865,
      "loss": 1.7256,
      "theoretical_loss": 4.261975627961448,
      "tokens_seen": 251920384
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046648946840521565,
      "loss": 1.5428,
      "theoretical_loss": 4.2618427437664925,
      "tokens_seen": 251985920
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046647943831494484,
      "loss": 1.5383,
      "theoretical_loss": 4.261709903801307,
      "tokens_seen": 252051456
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000466469408224674,
      "loss": 1.5768,
      "theoretical_loss": 4.261577108039674,
      "tokens_seen": 252116992
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004664593781344032,
      "loss": 1.6207,
      "theoretical_loss": 4.261444356455402,
      "tokens_seen": 252182528
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046644934804413243,
      "loss": 1.7593,
      "theoretical_loss": 4.261311649022318,
      "tokens_seen": 252248064
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046643931795386156,
      "loss": 1.7134,
      "theoretical_loss": 4.261178985714273,
      "tokens_seen": 252313600
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004664292878635908,
      "loss": 1.5613,
      "theoretical_loss": 4.26104636650514,
      "tokens_seen": 252379136
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004664192577733199,
      "loss": 1.5237,
      "theoretical_loss": 4.260913791368815,
      "tokens_seen": 252444672
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046640922768304916,
      "loss": 1.765,
      "theoretical_loss": 4.260781260279216,
      "tokens_seen": 252510208
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046639919759277834,
      "loss": 1.705,
      "theoretical_loss": 4.260648773210281,
      "tokens_seen": 252575744
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004663891675025075,
      "loss": 1.5256,
      "theoretical_loss": 4.2605163301359745,
      "tokens_seen": 252641280
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004663791374122367,
      "loss": 1.6867,
      "theoretical_loss": 4.260383931030279,
      "tokens_seen": 252706816
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046636910732196594,
      "loss": 1.6921,
      "theoretical_loss": 4.2602515758672,
      "tokens_seen": 252772352
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046635907723169506,
      "loss": 1.6549,
      "theoretical_loss": 4.260119264620768,
      "tokens_seen": 252837888
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004663490471414243,
      "loss": 1.661,
      "theoretical_loss": 4.259986997265033,
      "tokens_seen": 252903424
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004663390170511534,
      "loss": 1.6566,
      "theoretical_loss": 4.259854773774066,
      "tokens_seen": 252968960
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046632898696088266,
      "loss": 1.6,
      "theoretical_loss": 4.259722594121963,
      "tokens_seen": 253034496
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046631895687061184,
      "loss": 1.6784,
      "theoretical_loss": 4.259590458282839,
      "tokens_seen": 253100032
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000466308926780341,
      "loss": 1.6265,
      "theoretical_loss": 4.259458366230835,
      "tokens_seen": 253165568
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004662988966900702,
      "loss": 1.652,
      "theoretical_loss": 4.2593263179401095,
      "tokens_seen": 253231104
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004662888665997994,
      "loss": 1.5747,
      "theoretical_loss": 4.259194313384846,
      "tokens_seen": 253296640
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046627883650952857,
      "loss": 1.5475,
      "theoretical_loss": 4.259062352539247,
      "tokens_seen": 253362176
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004662688064192578,
      "loss": 1.6357,
      "theoretical_loss": 4.258930435377541,
      "tokens_seen": 253427712
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046625877632898693,
      "loss": 1.4904,
      "theoretical_loss": 4.258798561873974,
      "tokens_seen": 253493248
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046624874623871616,
      "loss": 1.564,
      "theoretical_loss": 4.258666732002817,
      "tokens_seen": 253558784
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046623871614844535,
      "loss": 1.7031,
      "theoretical_loss": 4.258534945738362,
      "tokens_seen": 253624320
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004662286860581745,
      "loss": 1.6232,
      "theoretical_loss": 4.258403203054923,
      "tokens_seen": 253689856
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004662186559679037,
      "loss": 1.5496,
      "theoretical_loss": 4.258271503926833,
      "tokens_seen": 253755392
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004662086258776329,
      "loss": 1.6536,
      "theoretical_loss": 4.258139848328451,
      "tokens_seen": 253820928
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004661985957873621,
      "loss": 1.421,
      "theoretical_loss": 4.258008236234154,
      "tokens_seen": 253886464
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004661885656970913,
      "loss": 1.6167,
      "theoretical_loss": 4.257876667618344,
      "tokens_seen": 253952000
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004661785356068205,
      "loss": 1.5931,
      "theoretical_loss": 4.257745142455442,
      "tokens_seen": 254017536
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046616850551654967,
      "loss": 1.6404,
      "theoretical_loss": 4.257613660719892,
      "tokens_seen": 254083072
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046615847542627885,
      "loss": 1.5961,
      "theoretical_loss": 4.25748222238616,
      "tokens_seen": 254148608
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046614844533600803,
      "loss": 1.6271,
      "theoretical_loss": 4.2573508274287315,
      "tokens_seen": 254214144
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046613841524573727,
      "loss": 1.7808,
      "theoretical_loss": 4.257219475822116,
      "tokens_seen": 254279680
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004661283851554664,
      "loss": 1.6374,
      "theoretical_loss": 4.257088167540843,
      "tokens_seen": 254345216
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046611835506519563,
      "loss": 1.6647,
      "theoretical_loss": 4.256956902559465,
      "tokens_seen": 254410752
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046610832497492475,
      "loss": 1.5816,
      "theoretical_loss": 4.256825680852554,
      "tokens_seen": 254476288
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000466098294884654,
      "loss": 1.4886,
      "theoretical_loss": 4.256694502394704,
      "tokens_seen": 254541824
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046608826479438317,
      "loss": 1.5731,
      "theoretical_loss": 4.256563367160533,
      "tokens_seen": 254607360
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046607823470411235,
      "loss": 1.5797,
      "theoretical_loss": 4.256432275124676,
      "tokens_seen": 254672896
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046606820461384153,
      "loss": 1.6609,
      "theoretical_loss": 4.256301226261794,
      "tokens_seen": 254738432
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046605817452357077,
      "loss": 1.7096,
      "theoretical_loss": 4.256170220546565,
      "tokens_seen": 254803968
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004660481444332999,
      "loss": 1.6139,
      "theoretical_loss": 4.2560392579536925,
      "tokens_seen": 254869504
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046603811434302913,
      "loss": 1.5057,
      "theoretical_loss": 4.255908338457898,
      "tokens_seen": 254935040
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046602808425275826,
      "loss": 1.531,
      "theoretical_loss": 4.255777462033926,
      "tokens_seen": 255000576
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004660180541624875,
      "loss": 1.6759,
      "theoretical_loss": 4.255646628656542,
      "tokens_seen": 255066112
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004660080240722167,
      "loss": 1.5911,
      "theoretical_loss": 4.255515838300534,
      "tokens_seen": 255131648
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046599799398194586,
      "loss": 1.4791,
      "theoretical_loss": 4.255385090940708,
      "tokens_seen": 255197184
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046598796389167504,
      "loss": 1.6074,
      "theoretical_loss": 4.255254386551894,
      "tokens_seen": 255262720
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004659779338014042,
      "loss": 1.5908,
      "theoretical_loss": 4.255123725108943,
      "tokens_seen": 255328256
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004659679037111334,
      "loss": 1.536,
      "theoretical_loss": 4.254993106586725,
      "tokens_seen": 255393792
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046595787362086263,
      "loss": 1.7065,
      "theoretical_loss": 4.254862530960134,
      "tokens_seen": 255459328
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046594784353059176,
      "loss": 1.6832,
      "theoretical_loss": 4.254731998204083,
      "tokens_seen": 255524864
    },
    {
      "epoch": 0.08,
      "objective/train/docs_used": 91036,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.663879156112671,
      "objective/train/theoretical_loss": 4.254601508293508,
      "objective/train/tokens_used": 276050400,
      "theoretical_loss": 4.254601508293508,
      "tokens_seen": 255590400
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000465937813440321,
      "loss": 1.6639,
      "theoretical_loss": 4.254601508293508,
      "tokens_seen": 255590400
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004659277833500501,
      "loss": 1.6647,
      "theoretical_loss": 4.254471061203364,
      "tokens_seen": 255655936
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046591775325977936,
      "loss": 1.6462,
      "theoretical_loss": 4.254340656908628,
      "tokens_seen": 255721472
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046590772316950854,
      "loss": 1.6231,
      "theoretical_loss": 4.254210295384298,
      "tokens_seen": 255787008
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004658976930792377,
      "loss": 1.6414,
      "theoretical_loss": 4.254079976605394,
      "tokens_seen": 255852544
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004658876629889669,
      "loss": 1.5634,
      "theoretical_loss": 4.253949700546956,
      "tokens_seen": 255918080
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046587763289869614,
      "loss": 1.5767,
      "theoretical_loss": 4.2538194671840435,
      "tokens_seen": 255983616
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046586760280842526,
      "loss": 1.5595,
      "theoretical_loss": 4.25368927649174,
      "tokens_seen": 256049152
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004658575727181545,
      "loss": 1.5939,
      "theoretical_loss": 4.253559128445148,
      "tokens_seen": 256114688
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004658475426278836,
      "loss": 1.6016,
      "theoretical_loss": 4.253429023019391,
      "tokens_seen": 256180224
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046583751253761286,
      "loss": 1.6102,
      "theoretical_loss": 4.253298960189614,
      "tokens_seen": 256245760
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046582748244734204,
      "loss": 1.7422,
      "theoretical_loss": 4.253168939930982,
      "tokens_seen": 256311296
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004658174523570712,
      "loss": 1.4743,
      "theoretical_loss": 4.253038962218682,
      "tokens_seen": 256376832
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004658074222668004,
      "loss": 1.6465,
      "theoretical_loss": 4.25290902702792,
      "tokens_seen": 256442368
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004657973921765296,
      "loss": 1.5657,
      "theoretical_loss": 4.252779134333926,
      "tokens_seen": 256507904
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046578736208625877,
      "loss": 1.5969,
      "theoretical_loss": 4.252649284111946,
      "tokens_seen": 256573440
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000465777331995988,
      "loss": 1.6959,
      "theoretical_loss": 4.252519476337251,
      "tokens_seen": 256638976
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046576730190571713,
      "loss": 1.5025,
      "theoretical_loss": 4.252389710985131,
      "tokens_seen": 256704512
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046575727181544636,
      "loss": 1.5636,
      "theoretical_loss": 4.252259988030896,
      "tokens_seen": 256770048
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046574724172517555,
      "loss": 1.6956,
      "theoretical_loss": 4.252130307449878,
      "tokens_seen": 256835584
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004657372116349047,
      "loss": 1.7263,
      "theoretical_loss": 4.252000669217429,
      "tokens_seen": 256901120
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004657271815446339,
      "loss": 1.717,
      "theoretical_loss": 4.251871073308923,
      "tokens_seen": 256966656
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004657171514543631,
      "loss": 1.6376,
      "theoretical_loss": 4.251741519699751,
      "tokens_seen": 257032192
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046570712136409227,
      "loss": 1.5928,
      "theoretical_loss": 4.251612008365328,
      "tokens_seen": 257097728
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004656970912738215,
      "loss": 1.7049,
      "theoretical_loss": 4.2514825392810875,
      "tokens_seen": 257163264
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046568706118355063,
      "loss": 1.5393,
      "theoretical_loss": 4.251353112422486,
      "tokens_seen": 257228800
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046567703109327987,
      "loss": 1.704,
      "theoretical_loss": 4.251223727764999,
      "tokens_seen": 257294336
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000465667001003009,
      "loss": 1.5436,
      "theoretical_loss": 4.251094385284121,
      "tokens_seen": 257359872
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046565697091273823,
      "loss": 1.6296,
      "theoretical_loss": 4.25096508495537,
      "tokens_seen": 257425408
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004656469408224674,
      "loss": 1.5978,
      "theoretical_loss": 4.250835826754281,
      "tokens_seen": 257490944
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004656369107321966,
      "loss": 1.6545,
      "theoretical_loss": 4.2507066106564135,
      "tokens_seen": 257556480
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004656268806419258,
      "loss": 1.6596,
      "theoretical_loss": 4.250577436637344,
      "tokens_seen": 257622016
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046561685055165495,
      "loss": 1.5908,
      "theoretical_loss": 4.25044830467267,
      "tokens_seen": 257687552
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046560682046138414,
      "loss": 1.6246,
      "theoretical_loss": 4.250319214738011,
      "tokens_seen": 257753088
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046559679037111337,
      "loss": 1.5542,
      "theoretical_loss": 4.250190166809005,
      "tokens_seen": 257818624
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004655867602808425,
      "loss": 1.609,
      "theoretical_loss": 4.250061160861311,
      "tokens_seen": 257884160
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046557673019057173,
      "loss": 1.6945,
      "theoretical_loss": 4.249932196870608,
      "tokens_seen": 257949696
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004655667001003009,
      "loss": 1.4855,
      "theoretical_loss": 4.249803274812598,
      "tokens_seen": 258015232
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004655566700100301,
      "loss": 1.5611,
      "theoretical_loss": 4.249674394662998,
      "tokens_seen": 258080768
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004655466399197593,
      "loss": 1.5194,
      "theoretical_loss": 4.249545556397549,
      "tokens_seen": 258146304
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046553660982948846,
      "loss": 1.5624,
      "theoretical_loss": 4.249416759992011,
      "tokens_seen": 258211840
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046552657973921764,
      "loss": 1.6453,
      "theoretical_loss": 4.249288005422166,
      "tokens_seen": 258277376
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004655165496489469,
      "loss": 1.5314,
      "theoretical_loss": 4.249159292663812,
      "tokens_seen": 258342912
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000465506519558676,
      "loss": 1.6044,
      "theoretical_loss": 4.249030621692772,
      "tokens_seen": 258408448
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046549648946840524,
      "loss": 1.6186,
      "theoretical_loss": 4.248901992484885,
      "tokens_seen": 258473984
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046548645937813436,
      "loss": 1.614,
      "theoretical_loss": 4.248773405016014,
      "tokens_seen": 258539520
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004654764292878636,
      "loss": 1.6127,
      "theoretical_loss": 4.248644859262039,
      "tokens_seen": 258605056
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004654663991975928,
      "loss": 1.5387,
      "theoretical_loss": 4.248516355198861,
      "tokens_seen": 258670592
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046545636910732196,
      "loss": 1.6899,
      "theoretical_loss": 4.2483878928024,
      "tokens_seen": 258736128
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004654463390170512,
      "loss": 1.5314,
      "theoretical_loss": 4.248259472048598,
      "tokens_seen": 258801664
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004654363089267803,
      "loss": 1.5411,
      "theoretical_loss": 4.248131092913416,
      "tokens_seen": 258867200
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046542627883650956,
      "loss": 1.5502,
      "theoretical_loss": 4.248002755372836,
      "tokens_seen": 258932736
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046541624874623874,
      "loss": 1.5861,
      "theoretical_loss": 4.247874459402857,
      "tokens_seen": 258998272
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004654062186559679,
      "loss": 1.476,
      "theoretical_loss": 4.2477462049795,
      "tokens_seen": 259063808
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004653961885656971,
      "loss": 1.737,
      "theoretical_loss": 4.2476179920788075,
      "tokens_seen": 259129344
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046538615847542634,
      "loss": 1.5859,
      "theoretical_loss": 4.247489820676839,
      "tokens_seen": 259194880
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046537612838515546,
      "loss": 1.598,
      "theoretical_loss": 4.247361690749676,
      "tokens_seen": 259260416
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004653660982948847,
      "loss": 1.6199,
      "theoretical_loss": 4.2472336022734165,
      "tokens_seen": 259325952
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004653560682046138,
      "loss": 1.5644,
      "theoretical_loss": 4.2471055552241825,
      "tokens_seen": 259391488
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046534603811434306,
      "loss": 1.631,
      "theoretical_loss": 4.246977549578113,
      "tokens_seen": 259457024
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046533600802407224,
      "loss": 1.5937,
      "theoretical_loss": 4.246849585311368,
      "tokens_seen": 259522560
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004653259779338014,
      "loss": 1.6025,
      "theoretical_loss": 4.246721662400128,
      "tokens_seen": 259588096
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004653159478435306,
      "loss": 1.5987,
      "theoretical_loss": 4.246593780820589,
      "tokens_seen": 259653632
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004653059177532598,
      "loss": 1.6011,
      "theoretical_loss": 4.2464659405489735,
      "tokens_seen": 259719168
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046529588766298897,
      "loss": 1.7463,
      "theoretical_loss": 4.246338141561518,
      "tokens_seen": 259784704
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004652858575727182,
      "loss": 1.6466,
      "theoretical_loss": 4.24621038383448,
      "tokens_seen": 259850240
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046527582748244733,
      "loss": 1.6773,
      "theoretical_loss": 4.246082667344139,
      "tokens_seen": 259915776
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046526579739217656,
      "loss": 1.6527,
      "theoretical_loss": 4.245954992066792,
      "tokens_seen": 259981312
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046525576730190575,
      "loss": 1.6414,
      "theoretical_loss": 4.245827357978754,
      "tokens_seen": 260046848
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004652457372116349,
      "loss": 1.6938,
      "theoretical_loss": 4.245699765056365,
      "tokens_seen": 260112384
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004652357071213641,
      "loss": 1.6599,
      "theoretical_loss": 4.245572213275978,
      "tokens_seen": 260177920
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004652256770310933,
      "loss": 1.6577,
      "theoretical_loss": 4.245444702613971,
      "tokens_seen": 260243456
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046521564694082247,
      "loss": 1.599,
      "theoretical_loss": 4.245317233046738,
      "tokens_seen": 260308992
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004652056168505517,
      "loss": 1.5539,
      "theoretical_loss": 4.2451898045506935,
      "tokens_seen": 260374528
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046519558676028083,
      "loss": 1.5997,
      "theoretical_loss": 4.245062417102272,
      "tokens_seen": 260440064
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046518555667001007,
      "loss": 1.7595,
      "theoretical_loss": 4.244935070677927,
      "tokens_seen": 260505600
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004651755265797392,
      "loss": 1.5819,
      "theoretical_loss": 4.244807765254132,
      "tokens_seen": 260571136
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046516549648946843,
      "loss": 1.5433,
      "theoretical_loss": 4.244680500807378,
      "tokens_seen": 260636672
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004651554663991976,
      "loss": 1.5638,
      "theoretical_loss": 4.244553277314178,
      "tokens_seen": 260702208
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004651454363089268,
      "loss": 1.6902,
      "theoretical_loss": 4.244426094751063,
      "tokens_seen": 260767744
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000465135406218656,
      "loss": 1.6246,
      "theoretical_loss": 4.244298953094583,
      "tokens_seen": 260833280
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046512537612838515,
      "loss": 1.5959,
      "theoretical_loss": 4.244171852321308,
      "tokens_seen": 260898816
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046511534603811434,
      "loss": 1.5569,
      "theoretical_loss": 4.244044792407828,
      "tokens_seen": 260964352
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046510531594784357,
      "loss": 1.5289,
      "theoretical_loss": 4.24391777333075,
      "tokens_seen": 261029888
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004650952858575727,
      "loss": 1.6091,
      "theoretical_loss": 4.243790795066703,
      "tokens_seen": 261095424
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046508525576730193,
      "loss": 1.5646,
      "theoretical_loss": 4.243663857592332,
      "tokens_seen": 261160960
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004650752256770311,
      "loss": 1.6719,
      "theoretical_loss": 4.243536960884305,
      "tokens_seen": 261226496
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004650651955867603,
      "loss": 1.528,
      "theoretical_loss": 4.243410104919307,
      "tokens_seen": 261292032
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004650551654964895,
      "loss": 1.7019,
      "theoretical_loss": 4.243283289674042,
      "tokens_seen": 261357568
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046504513540621866,
      "loss": 1.654,
      "theoretical_loss": 4.243156515125234,
      "tokens_seen": 261423104
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046503510531594784,
      "loss": 1.4605,
      "theoretical_loss": 4.243029781249625,
      "tokens_seen": 261488640
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004650250752256771,
      "loss": 1.5202,
      "theoretical_loss": 4.2429030880239775,
      "tokens_seen": 261554176
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004650150451354062,
      "loss": 1.5816,
      "theoretical_loss": 4.242776435425072,
      "tokens_seen": 261619712
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046500501504513544,
      "loss": 1.538,
      "theoretical_loss": 4.24264982342971,
      "tokens_seen": 261685248
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046499498495486456,
      "loss": 1.519,
      "theoretical_loss": 4.242523252014709,
      "tokens_seen": 261750784
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004649849548645938,
      "loss": 1.6508,
      "theoretical_loss": 4.242396721156908,
      "tokens_seen": 261816320
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000464974924774323,
      "loss": 1.6,
      "theoretical_loss": 4.242270230833164,
      "tokens_seen": 261881856
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046496489468405216,
      "loss": 1.6578,
      "theoretical_loss": 4.242143781020353,
      "tokens_seen": 261947392
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046495486459378134,
      "loss": 1.5346,
      "theoretical_loss": 4.24201737169537,
      "tokens_seen": 262012928
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004649448345035105,
      "loss": 1.5172,
      "theoretical_loss": 4.24189100283513,
      "tokens_seen": 262078464
    },
    {
      "epoch": 0.08,
      "objective/train/docs_used": 93156,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.593793511390686,
      "objective/train/theoretical_loss": 4.241764674416565,
      "objective/train/tokens_used": 282604000,
      "theoretical_loss": 4.241764674416565,
      "tokens_seen": 262144000
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004649348044132397,
      "loss": 1.5938,
      "theoretical_loss": 4.241764674416565,
      "tokens_seen": 262144000
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046492477432296894,
      "loss": 1.7311,
      "theoretical_loss": 4.241638386416628,
      "tokens_seen": 262209536
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046491474423269807,
      "loss": 1.5854,
      "theoretical_loss": 4.241512138812288,
      "tokens_seen": 262275072
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004649047141424273,
      "loss": 1.6601,
      "theoretical_loss": 4.2413859315805365,
      "tokens_seen": 262340608
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004648946840521565,
      "loss": 1.6226,
      "theoretical_loss": 4.241259764698381,
      "tokens_seen": 262406144
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046488465396188566,
      "loss": 1.6233,
      "theoretical_loss": 4.24113363814285,
      "tokens_seen": 262471680
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046487462387161485,
      "loss": 1.5769,
      "theoretical_loss": 4.241007551890988,
      "tokens_seen": 262537216
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000464864593781344,
      "loss": 1.5207,
      "theoretical_loss": 4.2408815059198615,
      "tokens_seen": 262602752
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004648545636910732,
      "loss": 1.588,
      "theoretical_loss": 4.240755500206554,
      "tokens_seen": 262668288
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046484453360080244,
      "loss": 1.5962,
      "theoretical_loss": 4.240629534728167,
      "tokens_seen": 262733824
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046483450351053157,
      "loss": 1.483,
      "theoretical_loss": 4.240503609461822,
      "tokens_seen": 262799360
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004648244734202608,
      "loss": 1.5551,
      "theoretical_loss": 4.24037772438466,
      "tokens_seen": 262864896
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046481444332998993,
      "loss": 1.6628,
      "theoretical_loss": 4.240251879473839,
      "tokens_seen": 262930432
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046480441323971917,
      "loss": 1.4991,
      "theoretical_loss": 4.240126074706536,
      "tokens_seen": 262995968
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046479438314944835,
      "loss": 1.6549,
      "theoretical_loss": 4.240000310059948,
      "tokens_seen": 263061504
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046478435305917753,
      "loss": 1.5053,
      "theoretical_loss": 4.239874585511288,
      "tokens_seen": 263127040
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004647743229689067,
      "loss": 1.6742,
      "theoretical_loss": 4.239748901037791,
      "tokens_seen": 263192576
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046476429287863595,
      "loss": 1.6887,
      "theoretical_loss": 4.2396232566167065,
      "tokens_seen": 263258112
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004647542627883651,
      "loss": 1.5607,
      "theoretical_loss": 4.239497652225307,
      "tokens_seen": 263323648
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004647442326980943,
      "loss": 1.7754,
      "theoretical_loss": 4.23937208784088,
      "tokens_seen": 263389184
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046473420260782344,
      "loss": 1.6692,
      "theoretical_loss": 4.239246563440734,
      "tokens_seen": 263454720
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046472417251755267,
      "loss": 1.6039,
      "theoretical_loss": 4.239121079002194,
      "tokens_seen": 263520256
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004647141424272819,
      "loss": 1.6662,
      "theoretical_loss": 4.238995634502606,
      "tokens_seen": 263585792
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046470411233701103,
      "loss": 1.6033,
      "theoretical_loss": 4.238870229919331,
      "tokens_seen": 263651328
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046469408224674027,
      "loss": 1.5459,
      "theoretical_loss": 4.2387448652297515,
      "tokens_seen": 263716864
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004646840521564694,
      "loss": 1.5283,
      "theoretical_loss": 4.238619540411268,
      "tokens_seen": 263782400
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046467402206619863,
      "loss": 1.5763,
      "theoretical_loss": 4.238494255441296,
      "tokens_seen": 263847936
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004646639919759278,
      "loss": 1.4742,
      "theoretical_loss": 4.238369010297275,
      "tokens_seen": 263913472
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000464653961885657,
      "loss": 1.5847,
      "theoretical_loss": 4.238243804956658,
      "tokens_seen": 263979008
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004646439317953862,
      "loss": 1.6191,
      "theoretical_loss": 4.23811863939692,
      "tokens_seen": 264044544
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046463390170511535,
      "loss": 1.5905,
      "theoretical_loss": 4.237993513595552,
      "tokens_seen": 264110080
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046462387161484454,
      "loss": 1.5978,
      "theoretical_loss": 4.2378684275300635,
      "tokens_seen": 264175616
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046461384152457377,
      "loss": 1.6866,
      "theoretical_loss": 4.237743381177983,
      "tokens_seen": 264241152
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004646038114343029,
      "loss": 1.6499,
      "theoretical_loss": 4.237618374516858,
      "tokens_seen": 264306688
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046459378134403213,
      "loss": 1.5869,
      "theoretical_loss": 4.237493407524253,
      "tokens_seen": 264372224
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004645837512537613,
      "loss": 1.5484,
      "theoretical_loss": 4.23736848017775,
      "tokens_seen": 264437760
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004645737211634905,
      "loss": 1.6567,
      "theoretical_loss": 4.237243592454951,
      "tokens_seen": 264503296
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004645636910732197,
      "loss": 1.6786,
      "theoretical_loss": 4.2371187443334755,
      "tokens_seen": 264568832
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046455366098294886,
      "loss": 1.6235,
      "theoretical_loss": 4.236993935790962,
      "tokens_seen": 264634368
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046454363089267804,
      "loss": 1.6035,
      "theoretical_loss": 4.236869166805064,
      "tokens_seen": 264699904
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004645336008024073,
      "loss": 1.6571,
      "theoretical_loss": 4.236744437353458,
      "tokens_seen": 264765440
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004645235707121364,
      "loss": 1.5718,
      "theoretical_loss": 4.236619747413836,
      "tokens_seen": 264830976
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046451354062186564,
      "loss": 1.6778,
      "theoretical_loss": 4.236495096963906,
      "tokens_seen": 264896512
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046450351053159476,
      "loss": 1.4849,
      "theoretical_loss": 4.236370485981398,
      "tokens_seen": 264962048
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000464493480441324,
      "loss": 1.4913,
      "theoretical_loss": 4.236245914444058,
      "tokens_seen": 265027584
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004644834503510532,
      "loss": 1.5686,
      "theoretical_loss": 4.2361213823296495,
      "tokens_seen": 265093120
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046447342026078236,
      "loss": 1.4554,
      "theoretical_loss": 4.235996889615957,
      "tokens_seen": 265158656
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046446339017051154,
      "loss": 1.5567,
      "theoretical_loss": 4.235872436280779,
      "tokens_seen": 265224192
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004644533600802407,
      "loss": 1.581,
      "theoretical_loss": 4.235748022301935,
      "tokens_seen": 265289728
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004644433299899699,
      "loss": 1.5963,
      "theoretical_loss": 4.235623647657261,
      "tokens_seen": 265355264
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046443329989969914,
      "loss": 1.5408,
      "theoretical_loss": 4.235499312324611,
      "tokens_seen": 265420800
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046442326980942827,
      "loss": 1.6162,
      "theoretical_loss": 4.235375016281858,
      "tokens_seen": 265486336
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004644132397191575,
      "loss": 1.5419,
      "theoretical_loss": 4.235250759506892,
      "tokens_seen": 265551872
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004644032096288867,
      "loss": 1.623,
      "theoretical_loss": 4.235126541977621,
      "tokens_seen": 265617408
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046439317953861586,
      "loss": 1.6741,
      "theoretical_loss": 4.2350023636719705,
      "tokens_seen": 265682944
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046438314944834505,
      "loss": 1.6362,
      "theoretical_loss": 4.234878224567885,
      "tokens_seen": 265748480
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004643731193580742,
      "loss": 1.6803,
      "theoretical_loss": 4.2347541246433265,
      "tokens_seen": 265814016
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004643630892678034,
      "loss": 1.5811,
      "theoretical_loss": 4.234630063876273,
      "tokens_seen": 265879552
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046435305917753264,
      "loss": 1.5186,
      "theoretical_loss": 4.234506042244723,
      "tokens_seen": 265945088
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046434302908726177,
      "loss": 1.6235,
      "theoretical_loss": 4.234382059726691,
      "tokens_seen": 266010624
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000464332998996991,
      "loss": 1.5958,
      "theoretical_loss": 4.234258116300211,
      "tokens_seen": 266076160
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046432296890672013,
      "loss": 1.4996,
      "theoretical_loss": 4.234134211943332,
      "tokens_seen": 266141696
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046431293881644937,
      "loss": 1.682,
      "theoretical_loss": 4.234010346634123,
      "tokens_seen": 266207232
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046430290872617855,
      "loss": 1.7173,
      "theoretical_loss": 4.23388652035067,
      "tokens_seen": 266272768
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046429287863590773,
      "loss": 1.7731,
      "theoretical_loss": 4.233762733071076,
      "tokens_seen": 266338304
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004642828485456369,
      "loss": 1.5351,
      "theoretical_loss": 4.233638984773464,
      "tokens_seen": 266403840
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046427281845536615,
      "loss": 1.4576,
      "theoretical_loss": 4.2335152754359715,
      "tokens_seen": 266469376
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004642627883650953,
      "loss": 1.5726,
      "theoretical_loss": 4.233391605036756,
      "tokens_seen": 266534912
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004642527582748245,
      "loss": 1.5553,
      "theoretical_loss": 4.233267973553991,
      "tokens_seen": 266600448
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046424272818455364,
      "loss": 1.6545,
      "theoretical_loss": 4.233144380965869,
      "tokens_seen": 266665984
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046423269809428287,
      "loss": 1.5896,
      "theoretical_loss": 4.2330208272505985,
      "tokens_seen": 266731520
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046422266800401205,
      "loss": 1.5629,
      "theoretical_loss": 4.232897312386408,
      "tokens_seen": 266797056
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046421263791374123,
      "loss": 1.5448,
      "theoretical_loss": 4.232773836351541,
      "tokens_seen": 266862592
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004642026078234704,
      "loss": 1.572,
      "theoretical_loss": 4.2326503991242586,
      "tokens_seen": 266928128
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004641925777331996,
      "loss": 1.6177,
      "theoretical_loss": 4.232527000682843,
      "tokens_seen": 266993664
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004641825476429288,
      "loss": 1.5597,
      "theoretical_loss": 4.232403641005589,
      "tokens_seen": 267059200
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000464172517552658,
      "loss": 1.6241,
      "theoretical_loss": 4.232280320070812,
      "tokens_seen": 267124736
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046416248746238714,
      "loss": 1.7312,
      "theoretical_loss": 4.232157037856844,
      "tokens_seen": 267190272
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004641524573721164,
      "loss": 1.6406,
      "theoretical_loss": 4.232033794342033,
      "tokens_seen": 267255808
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004641424272818455,
      "loss": 1.6564,
      "theoretical_loss": 4.231910589504748,
      "tokens_seen": 267321344
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046413239719157474,
      "loss": 1.5288,
      "theoretical_loss": 4.2317874233233725,
      "tokens_seen": 267386880
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004641223671013039,
      "loss": 1.5996,
      "theoretical_loss": 4.231664295776307,
      "tokens_seen": 267452416
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004641123370110331,
      "loss": 1.5935,
      "theoretical_loss": 4.231541206841971,
      "tokens_seen": 267517952
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004641023069207623,
      "loss": 1.6367,
      "theoretical_loss": 4.2314181564988,
      "tokens_seen": 267583488
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004640922768304915,
      "loss": 1.6575,
      "theoretical_loss": 4.23129514472525,
      "tokens_seen": 267649024
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046408224674022064,
      "loss": 1.692,
      "theoretical_loss": 4.231172171499789,
      "tokens_seen": 267714560
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004640722166499499,
      "loss": 1.6785,
      "theoretical_loss": 4.231049236800907,
      "tokens_seen": 267780096
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000464062186559679,
      "loss": 1.5542,
      "theoretical_loss": 4.230926340607109,
      "tokens_seen": 267845632
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046405215646940824,
      "loss": 1.5605,
      "theoretical_loss": 4.230803482896918,
      "tokens_seen": 267911168
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004640421263791374,
      "loss": 1.5813,
      "theoretical_loss": 4.230680663648872,
      "tokens_seen": 267976704
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004640320962888666,
      "loss": 1.5908,
      "theoretical_loss": 4.230557882841531,
      "tokens_seen": 268042240
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004640220661985958,
      "loss": 1.555,
      "theoretical_loss": 4.2304351404534675,
      "tokens_seen": 268107776
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046401203610832496,
      "loss": 1.6376,
      "theoretical_loss": 4.230312436463272,
      "tokens_seen": 268173312
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046400200601805414,
      "loss": 1.7158,
      "theoretical_loss": 4.230189770849556,
      "tokens_seen": 268238848
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004639919759277834,
      "loss": 1.4873,
      "theoretical_loss": 4.230067143590943,
      "tokens_seen": 268304384
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004639819458375125,
      "loss": 1.5723,
      "theoretical_loss": 4.229944554666076,
      "tokens_seen": 268369920
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046397191574724174,
      "loss": 1.5488,
      "theoretical_loss": 4.229822004053617,
      "tokens_seen": 268435456
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004639618856569709,
      "loss": 1.6609,
      "theoretical_loss": 4.229699491732242,
      "tokens_seen": 268500992
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004639518555667001,
      "loss": 1.5395,
      "theoretical_loss": 4.2295770176806435,
      "tokens_seen": 268566528
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046394182547642934,
      "loss": 1.5472,
      "theoretical_loss": 4.229454581877535,
      "tokens_seen": 268632064
    },
    {
      "epoch": 0.08,
      "objective/train/docs_used": 95370,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.683305263519287,
      "objective/train/theoretical_loss": 4.229332184301644,
      "objective/train/tokens_used": 289157600,
      "theoretical_loss": 4.229332184301644,
      "tokens_seen": 268697600
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046393179538615847,
      "loss": 1.6833,
      "theoretical_loss": 4.229332184301644,
      "tokens_seen": 268697600
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004639217652958877,
      "loss": 1.5872,
      "theoretical_loss": 4.229209824931714,
      "tokens_seen": 268763136
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004639117352056169,
      "loss": 1.5541,
      "theoretical_loss": 4.22908750374651,
      "tokens_seen": 268828672
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046390170511534606,
      "loss": 1.6347,
      "theoretical_loss": 4.22896522072481,
      "tokens_seen": 268894208
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046389167502507525,
      "loss": 1.6456,
      "theoretical_loss": 4.22884297584541,
      "tokens_seen": 268959744
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004638816449348044,
      "loss": 1.6266,
      "theoretical_loss": 4.228720769087124,
      "tokens_seen": 269025280
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004638716148445336,
      "loss": 1.6065,
      "theoretical_loss": 4.22859860042878,
      "tokens_seen": 269090816
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046386158475426284,
      "loss": 1.6677,
      "theoretical_loss": 4.2284764698492285,
      "tokens_seen": 269156352
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046385155466399197,
      "loss": 1.6884,
      "theoretical_loss": 4.22835437732733,
      "tokens_seen": 269221888
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004638415245737212,
      "loss": 1.6335,
      "theoretical_loss": 4.228232322841967,
      "tokens_seen": 269287424
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046383149448345033,
      "loss": 1.6334,
      "theoretical_loss": 4.228110306372036,
      "tokens_seen": 269352960
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046382146439317957,
      "loss": 1.6268,
      "theoretical_loss": 4.227988327896453,
      "tokens_seen": 269418496
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046381143430290875,
      "loss": 1.5388,
      "theoretical_loss": 4.2278663873941476,
      "tokens_seen": 269484032
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046380140421263793,
      "loss": 1.7018,
      "theoretical_loss": 4.227744484844068,
      "tokens_seen": 269549568
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004637913741223671,
      "loss": 1.6215,
      "theoretical_loss": 4.227622620225182,
      "tokens_seen": 269615104
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046378134403209635,
      "loss": 1.6318,
      "theoretical_loss": 4.227500793516466,
      "tokens_seen": 269680640
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004637713139418255,
      "loss": 1.4506,
      "theoretical_loss": 4.227379004696923,
      "tokens_seen": 269746176
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004637612838515547,
      "loss": 1.6121,
      "theoretical_loss": 4.227257253745566,
      "tokens_seen": 269811712
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046375125376128384,
      "loss": 1.7304,
      "theoretical_loss": 4.227135540641426,
      "tokens_seen": 269877248
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046374122367101307,
      "loss": 1.6601,
      "theoretical_loss": 4.227013865363553,
      "tokens_seen": 269942784
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046373119358074225,
      "loss": 1.5396,
      "theoretical_loss": 4.226892227891012,
      "tokens_seen": 270008320
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046372116349047143,
      "loss": 1.6296,
      "theoretical_loss": 4.2267706282028845,
      "tokens_seen": 270073856
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004637111334002006,
      "loss": 1.5424,
      "theoretical_loss": 4.226649066278269,
      "tokens_seen": 270139392
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004637011033099298,
      "loss": 1.5319,
      "theoretical_loss": 4.226527542096282,
      "tokens_seen": 270204928
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000463691073219659,
      "loss": 1.4857,
      "theoretical_loss": 4.226406055636053,
      "tokens_seen": 270270464
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004636810431293882,
      "loss": 1.6566,
      "theoretical_loss": 4.226284606876731,
      "tokens_seen": 270336000
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046367101303911734,
      "loss": 1.5026,
      "theoretical_loss": 4.226163195797481,
      "tokens_seen": 270401536
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004636609829488466,
      "loss": 1.5896,
      "theoretical_loss": 4.226041822377486,
      "tokens_seen": 270467072
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004636509528585757,
      "loss": 1.6666,
      "theoretical_loss": 4.225920486595941,
      "tokens_seen": 270532608
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046364092276830494,
      "loss": 1.533,
      "theoretical_loss": 4.225799188432063,
      "tokens_seen": 270598144
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004636308926780341,
      "loss": 1.5879,
      "theoretical_loss": 4.225677927865083,
      "tokens_seen": 270663680
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004636208625877633,
      "loss": 1.7251,
      "theoretical_loss": 4.225556704874247,
      "tokens_seen": 270729216
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004636108324974925,
      "loss": 1.6074,
      "theoretical_loss": 4.22543551943882,
      "tokens_seen": 270794752
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004636008024072217,
      "loss": 1.6398,
      "theoretical_loss": 4.225314371538083,
      "tokens_seen": 270860288
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046359077231695084,
      "loss": 1.665,
      "theoretical_loss": 4.225193261151332,
      "tokens_seen": 270925824
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004635807422266801,
      "loss": 1.3801,
      "theoretical_loss": 4.22507218825788,
      "tokens_seen": 270991360
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004635707121364092,
      "loss": 1.5839,
      "theoretical_loss": 4.224951152837058,
      "tokens_seen": 271056896
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046356068204613844,
      "loss": 1.5276,
      "theoretical_loss": 4.2248301548682115,
      "tokens_seen": 271122432
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004635506519558676,
      "loss": 1.5717,
      "theoretical_loss": 4.2247091943307025,
      "tokens_seen": 271187968
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004635406218655968,
      "loss": 1.5735,
      "theoretical_loss": 4.224588271203911,
      "tokens_seen": 271253504
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000463530591775326,
      "loss": 1.4829,
      "theoretical_loss": 4.22446738546723,
      "tokens_seen": 271319040
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046352056168505516,
      "loss": 1.5386,
      "theoretical_loss": 4.224346537100074,
      "tokens_seen": 271384576
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046351053159478434,
      "loss": 1.5664,
      "theoretical_loss": 4.22422572608187,
      "tokens_seen": 271450112
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004635005015045136,
      "loss": 1.7108,
      "theoretical_loss": 4.224104952392061,
      "tokens_seen": 271515648
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004634904714142427,
      "loss": 1.5593,
      "theoretical_loss": 4.223984216010107,
      "tokens_seen": 271581184
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046348044132397194,
      "loss": 1.602,
      "theoretical_loss": 4.223863516915486,
      "tokens_seen": 271646720
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046347041123370107,
      "loss": 1.619,
      "theoretical_loss": 4.223742855087691,
      "tokens_seen": 271712256
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004634603811434303,
      "loss": 1.6261,
      "theoretical_loss": 4.223622230506231,
      "tokens_seen": 271777792
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004634503510531595,
      "loss": 1.6644,
      "theoretical_loss": 4.22350164315063,
      "tokens_seen": 271843328
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046344032096288867,
      "loss": 1.554,
      "theoretical_loss": 4.22338109300043,
      "tokens_seen": 271908864
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046343029087261785,
      "loss": 1.6538,
      "theoretical_loss": 4.22326058003519,
      "tokens_seen": 271974400
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004634202607823471,
      "loss": 1.5285,
      "theoretical_loss": 4.223140104234482,
      "tokens_seen": 272039936
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004634102306920762,
      "loss": 1.6027,
      "theoretical_loss": 4.2230196655778975,
      "tokens_seen": 272105472
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046340020060180545,
      "loss": 1.5141,
      "theoretical_loss": 4.222899264045042,
      "tokens_seen": 272171008
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046339017051153457,
      "loss": 1.596,
      "theoretical_loss": 4.2227788996155375,
      "tokens_seen": 272236544
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004633801404212638,
      "loss": 1.5209,
      "theoretical_loss": 4.222658572269022,
      "tokens_seen": 272302080
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000463370110330993,
      "loss": 1.611,
      "theoretical_loss": 4.222538281985151,
      "tokens_seen": 272367616
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046336008024072217,
      "loss": 1.5634,
      "theoretical_loss": 4.2224180287435935,
      "tokens_seen": 272433152
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046335005015045135,
      "loss": 1.8052,
      "theoretical_loss": 4.222297812524037,
      "tokens_seen": 272498688
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046334002006018053,
      "loss": 1.5724,
      "theoretical_loss": 4.222177633306183,
      "tokens_seen": 272564224
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004633299899699097,
      "loss": 1.5705,
      "theoretical_loss": 4.222057491069751,
      "tokens_seen": 272629760
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046331995987963895,
      "loss": 1.6783,
      "theoretical_loss": 4.221937385794474,
      "tokens_seen": 272695296
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004633099297893681,
      "loss": 1.6546,
      "theoretical_loss": 4.221817317460104,
      "tokens_seen": 272760832
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004632998996990973,
      "loss": 1.546,
      "theoretical_loss": 4.221697286046407,
      "tokens_seen": 272826368
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046328986960882644,
      "loss": 1.55,
      "theoretical_loss": 4.221577291533165,
      "tokens_seen": 272891904
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004632798395185557,
      "loss": 1.5937,
      "theoretical_loss": 4.221457333900176,
      "tokens_seen": 272957440
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046326980942828485,
      "loss": 1.516,
      "theoretical_loss": 4.221337413127254,
      "tokens_seen": 273022976
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046325977933801404,
      "loss": 1.6158,
      "theoretical_loss": 4.221217529194231,
      "tokens_seen": 273088512
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004632497492477432,
      "loss": 1.5015,
      "theoretical_loss": 4.22109768208095,
      "tokens_seen": 273154048
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046323971915747245,
      "loss": 1.5022,
      "theoretical_loss": 4.220977871767275,
      "tokens_seen": 273219584
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004632296890672016,
      "loss": 1.4876,
      "theoretical_loss": 4.220858098233082,
      "tokens_seen": 273285120
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004632196589769308,
      "loss": 1.5516,
      "theoretical_loss": 4.220738361458266,
      "tokens_seen": 273350656
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046320962888666,
      "loss": 1.7006,
      "theoretical_loss": 4.220618661422735,
      "tokens_seen": 273416192
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631995987963892,
      "loss": 1.6025,
      "theoretical_loss": 4.2204989981064145,
      "tokens_seen": 273481728
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631895687061184,
      "loss": 1.5393,
      "theoretical_loss": 4.220379371489246,
      "tokens_seen": 273547264
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046317953861584754,
      "loss": 1.6307,
      "theoretical_loss": 4.220259781551185,
      "tokens_seen": 273612800
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631695085255768,
      "loss": 1.5651,
      "theoretical_loss": 4.2201402282722045,
      "tokens_seen": 273678336
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631594784353059,
      "loss": 1.6907,
      "theoretical_loss": 4.2200207116322925,
      "tokens_seen": 273743872
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046314944834503514,
      "loss": 1.6317,
      "theoretical_loss": 4.219901231611452,
      "tokens_seen": 273809408
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631394182547643,
      "loss": 1.5316,
      "theoretical_loss": 4.219781788189703,
      "tokens_seen": 273874944
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631293881644935,
      "loss": 1.6202,
      "theoretical_loss": 4.2196623813470815,
      "tokens_seen": 273940480
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631193580742227,
      "loss": 1.4949,
      "theoretical_loss": 4.219543011063637,
      "tokens_seen": 274006016
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004631093279839519,
      "loss": 1.5828,
      "theoretical_loss": 4.219423677319437,
      "tokens_seen": 274071552
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046309929789368104,
      "loss": 1.6207,
      "theoretical_loss": 4.219304380094562,
      "tokens_seen": 274137088
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004630892678034103,
      "loss": 1.5511,
      "theoretical_loss": 4.2191851193691114,
      "tokens_seen": 274202624
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004630792377131394,
      "loss": 1.6702,
      "theoretical_loss": 4.219065895123197,
      "tokens_seen": 274268160
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046306920762286864,
      "loss": 1.6899,
      "theoretical_loss": 4.218946707336949,
      "tokens_seen": 274333696
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004630591775325978,
      "loss": 1.5959,
      "theoretical_loss": 4.2188275559905115,
      "tokens_seen": 274399232
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000463049147442327,
      "loss": 1.5358,
      "theoretical_loss": 4.218708441064044,
      "tokens_seen": 274464768
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004630391173520562,
      "loss": 1.6063,
      "theoretical_loss": 4.218589362537723,
      "tokens_seen": 274530304
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046302908726178536,
      "loss": 1.5992,
      "theoretical_loss": 4.218470320391739,
      "tokens_seen": 274595840
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046301905717151455,
      "loss": 1.7409,
      "theoretical_loss": 4.218351314606298,
      "tokens_seen": 274661376
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004630090270812438,
      "loss": 1.6026,
      "theoretical_loss": 4.218232345161622,
      "tokens_seen": 274726912
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004629989969909729,
      "loss": 1.58,
      "theoretical_loss": 4.21811341203795,
      "tokens_seen": 274792448
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046298896690070214,
      "loss": 1.6309,
      "theoretical_loss": 4.217994515215534,
      "tokens_seen": 274857984
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046297893681043127,
      "loss": 1.5857,
      "theoretical_loss": 4.217875654674642,
      "tokens_seen": 274923520
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004629689067201605,
      "loss": 1.6037,
      "theoretical_loss": 4.217756830395559,
      "tokens_seen": 274989056
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004629588766298897,
      "loss": 1.5558,
      "theoretical_loss": 4.217638042358583,
      "tokens_seen": 275054592
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046294884653961887,
      "loss": 1.6126,
      "theoretical_loss": 4.21751929054403,
      "tokens_seen": 275120128
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046293881644934805,
      "loss": 1.5511,
      "theoretical_loss": 4.2174005749322285,
      "tokens_seen": 275185664
    },
    {
      "epoch": 0.08,
      "objective/train/docs_used": 97409,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.609714388847351,
      "objective/train/theoretical_loss": 4.2172818955035245,
      "objective/train/tokens_used": 295711200,
      "theoretical_loss": 4.2172818955035245,
      "tokens_seen": 275251200
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004629287863590773,
      "loss": 1.6097,
      "theoretical_loss": 4.2172818955035245,
      "tokens_seen": 275251200
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004629187562688064,
      "loss": 1.5428,
      "theoretical_loss": 4.217163252238279,
      "tokens_seen": 275316736
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046290872617853565,
      "loss": 1.5945,
      "theoretical_loss": 4.217044645116869,
      "tokens_seen": 275382272
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046289869608826477,
      "loss": 1.6049,
      "theoretical_loss": 4.216926074119684,
      "tokens_seen": 275447808
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000462888665997994,
      "loss": 1.6135,
      "theoretical_loss": 4.216807539227132,
      "tokens_seen": 275513344
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004628786359077232,
      "loss": 1.5212,
      "theoretical_loss": 4.2166890404196335,
      "tokens_seen": 275578880
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046286860581745237,
      "loss": 1.6125,
      "theoretical_loss": 4.216570577677627,
      "tokens_seen": 275644416
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046285857572718155,
      "loss": 1.6913,
      "theoretical_loss": 4.216452150981566,
      "tokens_seen": 275709952
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046284854563691073,
      "loss": 1.5732,
      "theoretical_loss": 4.216333760311916,
      "tokens_seen": 275775488
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004628385155466399,
      "loss": 1.6911,
      "theoretical_loss": 4.216215405649161,
      "tokens_seen": 275841024
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046282848545636915,
      "loss": 1.7279,
      "theoretical_loss": 4.2160970869738,
      "tokens_seen": 275906560
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004628184553660983,
      "loss": 1.6626,
      "theoretical_loss": 4.215978804266345,
      "tokens_seen": 275972096
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004628084252758275,
      "loss": 1.7102,
      "theoretical_loss": 4.215860557507324,
      "tokens_seen": 276037632
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046279839518555664,
      "loss": 1.6476,
      "theoretical_loss": 4.215742346677283,
      "tokens_seen": 276103168
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004627883650952859,
      "loss": 1.4932,
      "theoretical_loss": 4.215624171756779,
      "tokens_seen": 276168704
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046277833500501505,
      "loss": 1.6358,
      "theoretical_loss": 4.215506032726386,
      "tokens_seen": 276234240
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046276830491474424,
      "loss": 1.5788,
      "theoretical_loss": 4.215387929566694,
      "tokens_seen": 276299776
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004627582748244734,
      "loss": 1.5598,
      "theoretical_loss": 4.215269862258307,
      "tokens_seen": 276365312
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046274824473420265,
      "loss": 1.597,
      "theoretical_loss": 4.215151830781843,
      "tokens_seen": 276430848
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004627382146439318,
      "loss": 1.5234,
      "theoretical_loss": 4.2150338351179375,
      "tokens_seen": 276496384
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000462728184553661,
      "loss": 1.7016,
      "theoretical_loss": 4.21491587524724,
      "tokens_seen": 276561920
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046271815446339014,
      "loss": 1.6002,
      "theoretical_loss": 4.214797951150415,
      "tokens_seen": 276627456
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004627081243731194,
      "loss": 1.6303,
      "theoretical_loss": 4.214680062808142,
      "tokens_seen": 276692992
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046269809428284856,
      "loss": 1.641,
      "theoretical_loss": 4.214562210201114,
      "tokens_seen": 276758528
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046268806419257774,
      "loss": 1.6068,
      "theoretical_loss": 4.214444393310042,
      "tokens_seen": 276824064
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004626780341023069,
      "loss": 1.523,
      "theoretical_loss": 4.2143266121156495,
      "tokens_seen": 276889600
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004626680040120361,
      "loss": 1.6671,
      "theoretical_loss": 4.2142088665986766,
      "tokens_seen": 276955136
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004626579739217653,
      "loss": 1.7531,
      "theoretical_loss": 4.214091156739878,
      "tokens_seen": 277020672
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004626479438314945,
      "loss": 1.7156,
      "theoretical_loss": 4.213973482520021,
      "tokens_seen": 277086208
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046263791374122364,
      "loss": 1.5658,
      "theoretical_loss": 4.213855843919891,
      "tokens_seen": 277151744
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004626278836509529,
      "loss": 1.6724,
      "theoretical_loss": 4.2137382409202875,
      "tokens_seen": 277217280
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000462617853560682,
      "loss": 1.6737,
      "theoretical_loss": 4.2136206735020245,
      "tokens_seen": 277282816
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046260782347041124,
      "loss": 1.6206,
      "theoretical_loss": 4.21350314164593,
      "tokens_seen": 277348352
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004625977933801404,
      "loss": 1.5547,
      "theoretical_loss": 4.213385645332848,
      "tokens_seen": 277413888
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004625877632898696,
      "loss": 1.6409,
      "theoretical_loss": 4.213268184543638,
      "tokens_seen": 277479424
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004625777331995988,
      "loss": 1.6431,
      "theoretical_loss": 4.213150759259172,
      "tokens_seen": 277544960
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000462567703109328,
      "loss": 1.6023,
      "theoretical_loss": 4.213033369460339,
      "tokens_seen": 277610496
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046255767301905715,
      "loss": 1.5743,
      "theoretical_loss": 4.212916015128041,
      "tokens_seen": 277676032
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004625476429287864,
      "loss": 1.6056,
      "theoretical_loss": 4.212798696243197,
      "tokens_seen": 277741568
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004625376128385155,
      "loss": 1.5246,
      "theoretical_loss": 4.212681412786738,
      "tokens_seen": 277807104
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046252758274824475,
      "loss": 1.6388,
      "theoretical_loss": 4.212564164739613,
      "tokens_seen": 277872640
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004625175526579739,
      "loss": 1.6359,
      "theoretical_loss": 4.212446952082783,
      "tokens_seen": 277938176
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004625075225677031,
      "loss": 1.6247,
      "theoretical_loss": 4.212329774797225,
      "tokens_seen": 278003712
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004624974924774323,
      "loss": 1.7059,
      "theoretical_loss": 4.212212632863931,
      "tokens_seen": 278069248
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046248746238716147,
      "loss": 1.6086,
      "theoretical_loss": 4.212095526263905,
      "tokens_seen": 278134784
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046247743229689065,
      "loss": 1.5794,
      "theoretical_loss": 4.211978454978171,
      "tokens_seen": 278200320
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004624674022066199,
      "loss": 1.5805,
      "theoretical_loss": 4.211861418987762,
      "tokens_seen": 278265856
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046245737211634907,
      "loss": 1.5793,
      "theoretical_loss": 4.211744418273728,
      "tokens_seen": 278331392
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046244734202607825,
      "loss": 1.613,
      "theoretical_loss": 4.211627452817136,
      "tokens_seen": 278396928
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004624373119358075,
      "loss": 1.5757,
      "theoretical_loss": 4.211510522599063,
      "tokens_seen": 278462464
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004624272818455366,
      "loss": 1.5577,
      "theoretical_loss": 4.2113936276006045,
      "tokens_seen": 278528000
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046241725175526585,
      "loss": 1.6299,
      "theoretical_loss": 4.211276767802868,
      "tokens_seen": 278593536
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000462407221664995,
      "loss": 1.627,
      "theoretical_loss": 4.211159943186978,
      "tokens_seen": 278659072
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004623971915747242,
      "loss": 1.6848,
      "theoretical_loss": 4.211043153734071,
      "tokens_seen": 278724608
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004623871614844534,
      "loss": 1.6504,
      "theoretical_loss": 4.2109263994253,
      "tokens_seen": 278790144
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046237713139418257,
      "loss": 1.5698,
      "theoretical_loss": 4.21080968024183,
      "tokens_seen": 278855680
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046236710130391175,
      "loss": 1.587,
      "theoretical_loss": 4.210692996164845,
      "tokens_seen": 278921216
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046235707121364093,
      "loss": 1.5834,
      "theoretical_loss": 4.210576347175539,
      "tokens_seen": 278986752
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004623470411233701,
      "loss": 1.5123,
      "theoretical_loss": 4.210459733255123,
      "tokens_seen": 279052288
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046233701103309935,
      "loss": 1.5365,
      "theoretical_loss": 4.2103431543848195,
      "tokens_seen": 279117824
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004623269809428285,
      "loss": 1.5548,
      "theoretical_loss": 4.210226610545872,
      "tokens_seen": 279183360
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004623169508525577,
      "loss": 1.6421,
      "theoretical_loss": 4.21011010171953,
      "tokens_seen": 279248896
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046230692076228684,
      "loss": 1.6716,
      "theoretical_loss": 4.209993627887064,
      "tokens_seen": 279314432
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004622968906720161,
      "loss": 1.6091,
      "theoretical_loss": 4.209877189029756,
      "tokens_seen": 279379968
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046228686058174525,
      "loss": 1.65,
      "theoretical_loss": 4.209760785128903,
      "tokens_seen": 279445504
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046227683049147444,
      "loss": 1.6616,
      "theoretical_loss": 4.2096444161658155,
      "tokens_seen": 279511040
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004622668004012036,
      "loss": 1.5533,
      "theoretical_loss": 4.209528082121819,
      "tokens_seen": 279576576
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046225677031093285,
      "loss": 1.6732,
      "theoretical_loss": 4.209411782978256,
      "tokens_seen": 279642112
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.000462246740220662,
      "loss": 1.5711,
      "theoretical_loss": 4.209295518716477,
      "tokens_seen": 279707648
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004622367101303912,
      "loss": 1.4681,
      "theoretical_loss": 4.209179289317854,
      "tokens_seen": 279773184
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046222668004012034,
      "loss": 1.7303,
      "theoretical_loss": 4.209063094763767,
      "tokens_seen": 279838720
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004622166499498496,
      "loss": 1.6924,
      "theoretical_loss": 4.208946935035616,
      "tokens_seen": 279904256
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046220661985957876,
      "loss": 1.5625,
      "theoretical_loss": 4.2088308101148115,
      "tokens_seen": 279969792
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046219658976930794,
      "loss": 1.5456,
      "theoretical_loss": 4.208714719982778,
      "tokens_seen": 280035328
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004621865596790371,
      "loss": 1.5303,
      "theoretical_loss": 4.208598664620958,
      "tokens_seen": 280100864
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004621765295887663,
      "loss": 1.7256,
      "theoretical_loss": 4.208482644010804,
      "tokens_seen": 280166400
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004621664994984955,
      "loss": 1.646,
      "theoretical_loss": 4.2083666581337855,
      "tokens_seen": 280231936
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004621564694082247,
      "loss": 1.5813,
      "theoretical_loss": 4.208250706971385,
      "tokens_seen": 280297472
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.00046214643931795384,
      "loss": 1.525,
      "theoretical_loss": 4.208134790505099,
      "tokens_seen": 280363008
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004621364092276831,
      "loss": 1.4819,
      "theoretical_loss": 4.20801890871644,
      "tokens_seen": 280428544
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0004621263791374122,
      "loss": 1.565,
      "theoretical_loss": 4.207903061586931,
      "tokens_seen": 280494080
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046211634904714144,
      "loss": 1.55,
      "theoretical_loss": 4.207787249098113,
      "tokens_seen": 280559616
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004621063189568706,
      "loss": 1.595,
      "theoretical_loss": 4.20767147123154,
      "tokens_seen": 280625152
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004620962888665998,
      "loss": 1.653,
      "theoretical_loss": 4.20755572796878,
      "tokens_seen": 280690688
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000462086258776329,
      "loss": 1.6293,
      "theoretical_loss": 4.207440019291413,
      "tokens_seen": 280756224
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004620762286860582,
      "loss": 1.5811,
      "theoretical_loss": 4.2073243451810365,
      "tokens_seen": 280821760
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046206619859578735,
      "loss": 1.6163,
      "theoretical_loss": 4.20720870561926,
      "tokens_seen": 280887296
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004620561685055166,
      "loss": 1.5216,
      "theoretical_loss": 4.2070931005877075,
      "tokens_seen": 280952832
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004620461384152457,
      "loss": 1.7029,
      "theoretical_loss": 4.206977530068017,
      "tokens_seen": 281018368
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046203610832497495,
      "loss": 1.5209,
      "theoretical_loss": 4.206861994041842,
      "tokens_seen": 281083904
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004620260782347041,
      "loss": 1.6217,
      "theoretical_loss": 4.206746492490847,
      "tokens_seen": 281149440
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004620160481444333,
      "loss": 1.5989,
      "theoretical_loss": 4.206631025396714,
      "tokens_seen": 281214976
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004620060180541625,
      "loss": 1.5804,
      "theoretical_loss": 4.206515592741135,
      "tokens_seen": 281280512
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046199598796389167,
      "loss": 1.5522,
      "theoretical_loss": 4.20640019450582,
      "tokens_seen": 281346048
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046198595787362085,
      "loss": 1.6886,
      "theoretical_loss": 4.206284830672491,
      "tokens_seen": 281411584
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004619759277833501,
      "loss": 1.602,
      "theoretical_loss": 4.206169501222885,
      "tokens_seen": 281477120
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004619658976930792,
      "loss": 1.437,
      "theoretical_loss": 4.20605420613875,
      "tokens_seen": 281542656
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046195586760280845,
      "loss": 1.5706,
      "theoretical_loss": 4.205938945401851,
      "tokens_seen": 281608192
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046194583751253763,
      "loss": 1.483,
      "theoretical_loss": 4.205823718993966,
      "tokens_seen": 281673728
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004619358074222668,
      "loss": 1.5283,
      "theoretical_loss": 4.2057085268968875,
      "tokens_seen": 281739264
    },
    {
      "epoch": 0.09,
      "objective/train/docs_used": 99475,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.5707111358642578,
      "objective/train/theoretical_loss": 4.205593369092421,
      "objective/train/tokens_used": 302264800,
      "theoretical_loss": 4.205593369092421,
      "tokens_seen": 281804800
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000461925777331996,
      "loss": 1.5707,
      "theoretical_loss": 4.205593369092421,
      "tokens_seen": 281804800
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004619157472417252,
      "loss": 1.6669,
      "theoretical_loss": 4.205478245562386,
      "tokens_seen": 281870336
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046190571715145435,
      "loss": 1.5719,
      "theoretical_loss": 4.205363156288615,
      "tokens_seen": 281935872
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004618956870611836,
      "loss": 1.5943,
      "theoretical_loss": 4.205248101252957,
      "tokens_seen": 282001408
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004618856569709127,
      "loss": 1.5053,
      "theoretical_loss": 4.205133080437273,
      "tokens_seen": 282066944
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046187562688064195,
      "loss": 1.6975,
      "theoretical_loss": 4.205018093823437,
      "tokens_seen": 282132480
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004618655967903711,
      "loss": 1.5538,
      "theoretical_loss": 4.204903141393338,
      "tokens_seen": 282198016
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004618555667001003,
      "loss": 1.4966,
      "theoretical_loss": 4.204788223128879,
      "tokens_seen": 282263552
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004618455366098295,
      "loss": 1.584,
      "theoretical_loss": 4.204673339011976,
      "tokens_seen": 282329088
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004618355065195587,
      "loss": 1.6573,
      "theoretical_loss": 4.204558489024561,
      "tokens_seen": 282394624
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046182547642928786,
      "loss": 1.5883,
      "theoretical_loss": 4.204443673148575,
      "tokens_seen": 282460160
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046181544633901704,
      "loss": 1.486,
      "theoretical_loss": 4.204328891365977,
      "tokens_seen": 282525696
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004618054162487462,
      "loss": 1.5675,
      "theoretical_loss": 4.2042141436587395,
      "tokens_seen": 282591232
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046179538615847545,
      "loss": 1.5222,
      "theoretical_loss": 4.204099430008846,
      "tokens_seen": 282656768
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004617853560682046,
      "loss": 1.6176,
      "theoretical_loss": 4.203984750398296,
      "tokens_seen": 282722304
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004617753259779338,
      "loss": 1.6112,
      "theoretical_loss": 4.203870104809101,
      "tokens_seen": 282787840
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000461765295887663,
      "loss": 1.5088,
      "theoretical_loss": 4.203755493223289,
      "tokens_seen": 282853376
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004617552657973922,
      "loss": 1.6222,
      "theoretical_loss": 4.203640915622898,
      "tokens_seen": 282918912
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046174523570712136,
      "loss": 1.5785,
      "theoretical_loss": 4.203526371989983,
      "tokens_seen": 282984448
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046173520561685054,
      "loss": 1.6281,
      "theoretical_loss": 4.203411862306609,
      "tokens_seen": 283049984
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004617251755265797,
      "loss": 1.607,
      "theoretical_loss": 4.203297386554859,
      "tokens_seen": 283115520
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046171514543630896,
      "loss": 1.5437,
      "theoretical_loss": 4.203182944716826,
      "tokens_seen": 283181056
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046170511534603814,
      "loss": 1.6284,
      "theoretical_loss": 4.203068536774619,
      "tokens_seen": 283246592
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004616950852557673,
      "loss": 1.6758,
      "theoretical_loss": 4.202954162710357,
      "tokens_seen": 283312128
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004616850551654965,
      "loss": 1.5713,
      "theoretical_loss": 4.202839822506178,
      "tokens_seen": 283377664
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004616750250752257,
      "loss": 1.606,
      "theoretical_loss": 4.202725516144228,
      "tokens_seen": 283443200
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004616649949849549,
      "loss": 1.6293,
      "theoretical_loss": 4.202611243606671,
      "tokens_seen": 283508736
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046165496489468404,
      "loss": 1.644,
      "theoretical_loss": 4.202497004875681,
      "tokens_seen": 283574272
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004616449348044133,
      "loss": 1.5915,
      "theoretical_loss": 4.202382799933449,
      "tokens_seen": 283639808
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004616349047141424,
      "loss": 1.5675,
      "theoretical_loss": 4.2022686287621775,
      "tokens_seen": 283705344
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046162487462387164,
      "loss": 1.6303,
      "theoretical_loss": 4.20215449134408,
      "tokens_seen": 283770880
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004616148445336008,
      "loss": 1.5623,
      "theoretical_loss": 4.202040387661389,
      "tokens_seen": 283836416
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046160481444333,
      "loss": 1.6015,
      "theoretical_loss": 4.201926317696347,
      "tokens_seen": 283901952
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004615947843530592,
      "loss": 1.5746,
      "theoretical_loss": 4.201812281431209,
      "tokens_seen": 283967488
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004615847542627884,
      "loss": 1.733,
      "theoretical_loss": 4.201698278848246,
      "tokens_seen": 284033024
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046157472417251755,
      "loss": 1.6603,
      "theoretical_loss": 4.201584309929743,
      "tokens_seen": 284098560
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004615646940822468,
      "loss": 1.5723,
      "theoretical_loss": 4.201470374657993,
      "tokens_seen": 284164096
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004615546639919759,
      "loss": 1.6517,
      "theoretical_loss": 4.201356473015308,
      "tokens_seen": 284229632
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046154463390170515,
      "loss": 1.5397,
      "theoretical_loss": 4.201242604984013,
      "tokens_seen": 284295168
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004615346038114343,
      "loss": 1.6158,
      "theoretical_loss": 4.201128770546442,
      "tokens_seen": 284360704
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004615245737211635,
      "loss": 1.5039,
      "theoretical_loss": 4.201014969684948,
      "tokens_seen": 284426240
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004615145436308927,
      "loss": 1.5835,
      "theoretical_loss": 4.200901202381893,
      "tokens_seen": 284491776
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046150451354062187,
      "loss": 1.6166,
      "theoretical_loss": 4.200787468619653,
      "tokens_seen": 284557312
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046149448345035105,
      "loss": 1.5941,
      "theoretical_loss": 4.200673768380621,
      "tokens_seen": 284622848
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004614844533600803,
      "loss": 1.6194,
      "theoretical_loss": 4.200560101647198,
      "tokens_seen": 284688384
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004614744232698094,
      "loss": 1.6754,
      "theoretical_loss": 4.2004464684018,
      "tokens_seen": 284753920
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046146439317953865,
      "loss": 1.5973,
      "theoretical_loss": 4.200332868626861,
      "tokens_seen": 284819456
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046145436308926783,
      "loss": 1.5735,
      "theoretical_loss": 4.200219302304821,
      "tokens_seen": 284884992
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000461444332998997,
      "loss": 1.6003,
      "theoretical_loss": 4.200105769418138,
      "tokens_seen": 284950528
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004614343029087262,
      "loss": 1.6818,
      "theoretical_loss": 4.199992269949281,
      "tokens_seen": 285016064
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004614242728184554,
      "loss": 1.4789,
      "theoretical_loss": 4.199878803880733,
      "tokens_seen": 285081600
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046141424272818455,
      "loss": 1.6587,
      "theoretical_loss": 4.1997653711949905,
      "tokens_seen": 285147136
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004614042126379138,
      "loss": 1.6075,
      "theoretical_loss": 4.199651971874562,
      "tokens_seen": 285212672
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004613941825476429,
      "loss": 1.5272,
      "theoretical_loss": 4.199538605901973,
      "tokens_seen": 285278208
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046138415245737215,
      "loss": 1.586,
      "theoretical_loss": 4.199425273259756,
      "tokens_seen": 285343744
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004613741223671013,
      "loss": 1.6046,
      "theoretical_loss": 4.199311973930461,
      "tokens_seen": 285409280
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004613640922768305,
      "loss": 1.6035,
      "theoretical_loss": 4.199198707896651,
      "tokens_seen": 285474816
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004613540621865597,
      "loss": 1.5531,
      "theoretical_loss": 4.199085475140899,
      "tokens_seen": 285540352
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004613440320962889,
      "loss": 1.6023,
      "theoretical_loss": 4.1989722756457954,
      "tokens_seen": 285605888
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046133400200601806,
      "loss": 1.6459,
      "theoretical_loss": 4.198859109393941,
      "tokens_seen": 285671424
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046132397191574724,
      "loss": 1.5437,
      "theoretical_loss": 4.198745976367949,
      "tokens_seen": 285736960
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004613139418254764,
      "loss": 1.73,
      "theoretical_loss": 4.198632876550449,
      "tokens_seen": 285802496
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046130391173520566,
      "loss": 1.4563,
      "theoretical_loss": 4.19851980992408,
      "tokens_seen": 285868032
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004612938816449348,
      "loss": 1.6094,
      "theoretical_loss": 4.198406776471497,
      "tokens_seen": 285933568
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000461283851554664,
      "loss": 1.7493,
      "theoretical_loss": 4.198293776175365,
      "tokens_seen": 285999104
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004612738214643932,
      "loss": 1.508,
      "theoretical_loss": 4.198180809018366,
      "tokens_seen": 286064640
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004612637913741224,
      "loss": 1.5808,
      "theoretical_loss": 4.198067874983192,
      "tokens_seen": 286130176
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046125376128385156,
      "loss": 1.6224,
      "theoretical_loss": 4.197954974052546,
      "tokens_seen": 286195712
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046124373119358074,
      "loss": 1.7128,
      "theoretical_loss": 4.19784210620915,
      "tokens_seen": 286261248
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004612337011033099,
      "loss": 1.6488,
      "theoretical_loss": 4.197729271435736,
      "tokens_seen": 286326784
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046122367101303916,
      "loss": 1.6605,
      "theoretical_loss": 4.197616469715046,
      "tokens_seen": 286392320
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004612136409227683,
      "loss": 1.6459,
      "theoretical_loss": 4.19750370102984,
      "tokens_seen": 286457856
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004612036108324975,
      "loss": 1.6123,
      "theoretical_loss": 4.197390965362887,
      "tokens_seen": 286523392
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046119358074222665,
      "loss": 1.57,
      "theoretical_loss": 4.197278262696971,
      "tokens_seen": 286588928
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004611835506519559,
      "loss": 1.5731,
      "theoretical_loss": 4.197165593014889,
      "tokens_seen": 286654464
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046117352056168506,
      "loss": 1.5957,
      "theoretical_loss": 4.197052956299449,
      "tokens_seen": 286720000
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046116349047141425,
      "loss": 1.5333,
      "theoretical_loss": 4.196940352533474,
      "tokens_seen": 286785536
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004611534603811434,
      "loss": 1.5835,
      "theoretical_loss": 4.196827781699799,
      "tokens_seen": 286851072
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004611434302908726,
      "loss": 1.6659,
      "theoretical_loss": 4.196715243781273,
      "tokens_seen": 286916608
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004611334002006018,
      "loss": 1.631,
      "theoretical_loss": 4.196602738760754,
      "tokens_seen": 286982144
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000461123370110331,
      "loss": 1.6184,
      "theoretical_loss": 4.196490266621119,
      "tokens_seen": 287047680
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046111334002006015,
      "loss": 1.4961,
      "theoretical_loss": 4.196377827345252,
      "tokens_seen": 287113216
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004611033099297894,
      "loss": 1.6074,
      "theoretical_loss": 4.196265420916053,
      "tokens_seen": 287178752
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046109327983951857,
      "loss": 1.6701,
      "theoretical_loss": 4.196153047316433,
      "tokens_seen": 287244288
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046108324974924775,
      "loss": 1.597,
      "theoretical_loss": 4.196040706529319,
      "tokens_seen": 287309824
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046107321965897693,
      "loss": 1.6012,
      "theoretical_loss": 4.195928398537647,
      "tokens_seen": 287375360
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004610631895687061,
      "loss": 1.5527,
      "theoretical_loss": 4.195816123324367,
      "tokens_seen": 287440896
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004610531594784353,
      "loss": 1.6498,
      "theoretical_loss": 4.195703880872443,
      "tokens_seen": 287506432
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004610431293881645,
      "loss": 1.5768,
      "theoretical_loss": 4.195591671164852,
      "tokens_seen": 287571968
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046103309929789365,
      "loss": 1.5568,
      "theoretical_loss": 4.195479494184581,
      "tokens_seen": 287637504
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004610230692076229,
      "loss": 1.6068,
      "theoretical_loss": 4.195367349914631,
      "tokens_seen": 287703040
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000461013039117352,
      "loss": 1.6379,
      "theoretical_loss": 4.195255238338016,
      "tokens_seen": 287768576
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046100300902708125,
      "loss": 1.6472,
      "theoretical_loss": 4.195143159437764,
      "tokens_seen": 287834112
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046099297893681043,
      "loss": 1.5973,
      "theoretical_loss": 4.195031113196913,
      "tokens_seen": 287899648
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004609829488465396,
      "loss": 1.5884,
      "theoretical_loss": 4.194919099598516,
      "tokens_seen": 287965184
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004609729187562688,
      "loss": 1.4192,
      "theoretical_loss": 4.194807118625636,
      "tokens_seen": 288030720
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046096288866599803,
      "loss": 1.5927,
      "theoretical_loss": 4.194695170261353,
      "tokens_seen": 288096256
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004609528585757272,
      "loss": 1.6056,
      "theoretical_loss": 4.194583254488754,
      "tokens_seen": 288161792
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004609428284854564,
      "loss": 1.6925,
      "theoretical_loss": 4.194471371290944,
      "tokens_seen": 288227328
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004609327983951856,
      "loss": 1.5066,
      "theoretical_loss": 4.194359520651036,
      "tokens_seen": 288292864
    },
    {
      "epoch": 0.09,
      "objective/train/docs_used": 101706,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.627620816230774,
      "objective/train/theoretical_loss": 4.1942477025521585,
      "objective/train/tokens_used": 308818400,
      "theoretical_loss": 4.1942477025521585,
      "tokens_seen": 288358400
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046092276830491475,
      "loss": 1.6276,
      "theoretical_loss": 4.1942477025521585,
      "tokens_seen": 288358400
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000460912738214644,
      "loss": 1.609,
      "theoretical_loss": 4.194135916977452,
      "tokens_seen": 288423936
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004609027081243731,
      "loss": 1.6427,
      "theoretical_loss": 4.19402416391007,
      "tokens_seen": 288489472
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046089267803410235,
      "loss": 1.7026,
      "theoretical_loss": 4.193912443333177,
      "tokens_seen": 288555008
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004608826479438315,
      "loss": 1.7282,
      "theoretical_loss": 4.193800755229951,
      "tokens_seen": 288620544
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004608726178535607,
      "loss": 1.6755,
      "theoretical_loss": 4.193689099583582,
      "tokens_seen": 288686080
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004608625877632899,
      "loss": 1.7619,
      "theoretical_loss": 4.193577476377275,
      "tokens_seen": 288751616
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004608525576730191,
      "loss": 1.5808,
      "theoretical_loss": 4.193465885594242,
      "tokens_seen": 288817152
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046084252758274826,
      "loss": 1.6223,
      "theoretical_loss": 4.1933543272177145,
      "tokens_seen": 288882688
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046083249749247744,
      "loss": 1.7167,
      "theoretical_loss": 4.193242801230931,
      "tokens_seen": 288948224
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004608224674022066,
      "loss": 1.619,
      "theoretical_loss": 4.193131307617145,
      "tokens_seen": 289013760
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046081243731193586,
      "loss": 1.6026,
      "theoretical_loss": 4.193019846359622,
      "tokens_seen": 289079296
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000460802407221665,
      "loss": 1.5772,
      "theoretical_loss": 4.192908417441639,
      "tokens_seen": 289144832
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004607923771313942,
      "loss": 1.5505,
      "theoretical_loss": 4.192797020846487,
      "tokens_seen": 289210368
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004607823470411234,
      "loss": 1.626,
      "theoretical_loss": 4.192685656557468,
      "tokens_seen": 289275904
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004607723169508526,
      "loss": 1.6463,
      "theoretical_loss": 4.1925743245578975,
      "tokens_seen": 289341440
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046076228686058176,
      "loss": 1.5799,
      "theoretical_loss": 4.1924630248311034,
      "tokens_seen": 289406976
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046075225677031094,
      "loss": 1.5848,
      "theoretical_loss": 4.192351757360425,
      "tokens_seen": 289472512
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004607422266800401,
      "loss": 1.5967,
      "theoretical_loss": 4.1922405221292145,
      "tokens_seen": 289538048
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046073219658976936,
      "loss": 1.6578,
      "theoretical_loss": 4.192129319120838,
      "tokens_seen": 289603584
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004607221664994985,
      "loss": 1.6347,
      "theoretical_loss": 4.1920181483186685,
      "tokens_seen": 289669120
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004607121364092277,
      "loss": 1.6145,
      "theoretical_loss": 4.1919070097060995,
      "tokens_seen": 289734656
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046070210631895685,
      "loss": 1.5795,
      "theoretical_loss": 4.19179590326653,
      "tokens_seen": 289800192
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004606920762286861,
      "loss": 1.5234,
      "theoretical_loss": 4.191684828983375,
      "tokens_seen": 289865728
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046068204613841526,
      "loss": 1.5943,
      "theoretical_loss": 4.191573786840061,
      "tokens_seen": 289931264
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046067201604814445,
      "loss": 1.6613,
      "theoretical_loss": 4.191462776820025,
      "tokens_seen": 289996800
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004606619859578736,
      "loss": 1.5849,
      "theoretical_loss": 4.191351798906719,
      "tokens_seen": 290062336
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004606519558676028,
      "loss": 1.584,
      "theoretical_loss": 4.191240853083604,
      "tokens_seen": 290127872
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000460641925777332,
      "loss": 1.5736,
      "theoretical_loss": 4.191129939334159,
      "tokens_seen": 290193408
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004606318956870612,
      "loss": 1.7766,
      "theoretical_loss": 4.191019057641868,
      "tokens_seen": 290258944
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046062186559679035,
      "loss": 1.5863,
      "theoretical_loss": 4.1909082079902324,
      "tokens_seen": 290324480
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004606118355065196,
      "loss": 1.6692,
      "theoretical_loss": 4.190797390362764,
      "tokens_seen": 290390016
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046060180541624877,
      "loss": 1.5706,
      "theoretical_loss": 4.190686604742986,
      "tokens_seen": 290455552
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046059177532597795,
      "loss": 1.5446,
      "theoretical_loss": 4.190575851114437,
      "tokens_seen": 290521088
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046058174523570713,
      "loss": 1.6852,
      "theoretical_loss": 4.190465129460662,
      "tokens_seen": 290586624
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004605717151454363,
      "loss": 1.5909,
      "theoretical_loss": 4.190354439765224,
      "tokens_seen": 290652160
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004605616850551655,
      "loss": 1.6079,
      "theoretical_loss": 4.190243782011696,
      "tokens_seen": 290717696
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004605516549648947,
      "loss": 1.6067,
      "theoretical_loss": 4.190133156183663,
      "tokens_seen": 290783232
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046054162487462385,
      "loss": 1.517,
      "theoretical_loss": 4.190022562264721,
      "tokens_seen": 290848768
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004605315947843531,
      "loss": 1.6008,
      "theoretical_loss": 4.189912000238479,
      "tokens_seen": 290914304
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004605215646940822,
      "loss": 1.65,
      "theoretical_loss": 4.189801470088559,
      "tokens_seen": 290979840
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046051153460381145,
      "loss": 1.7047,
      "theoretical_loss": 4.189690971798596,
      "tokens_seen": 291045376
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046050150451354063,
      "loss": 1.653,
      "theoretical_loss": 4.189580505352232,
      "tokens_seen": 291110912
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004604914744232698,
      "loss": 1.6088,
      "theoretical_loss": 4.189470070733129,
      "tokens_seen": 291176448
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000460481444332999,
      "loss": 1.5796,
      "theoretical_loss": 4.189359667924952,
      "tokens_seen": 291241984
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046047141424272823,
      "loss": 1.6417,
      "theoretical_loss": 4.189249296911386,
      "tokens_seen": 291307520
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046046138415245736,
      "loss": 1.6355,
      "theoretical_loss": 4.189138957676125,
      "tokens_seen": 291373056
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004604513540621866,
      "loss": 1.6052,
      "theoretical_loss": 4.1890286502028715,
      "tokens_seen": 291438592
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004604413239719157,
      "loss": 1.7482,
      "theoretical_loss": 4.188918374475347,
      "tokens_seen": 291504128
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046043129388164495,
      "loss": 1.6087,
      "theoretical_loss": 4.188808130477279,
      "tokens_seen": 291569664
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046042126379137414,
      "loss": 1.5205,
      "theoretical_loss": 4.1886979181924096,
      "tokens_seen": 291635200
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004604112337011033,
      "loss": 1.6613,
      "theoretical_loss": 4.188587737604493,
      "tokens_seen": 291700736
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004604012036108325,
      "loss": 1.5905,
      "theoretical_loss": 4.188477588697295,
      "tokens_seen": 291766272
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004603911735205617,
      "loss": 1.5969,
      "theoretical_loss": 4.188367471454593,
      "tokens_seen": 291831808
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046038114343029086,
      "loss": 1.6465,
      "theoretical_loss": 4.188257385860177,
      "tokens_seen": 291897344
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004603711133400201,
      "loss": 1.7209,
      "theoretical_loss": 4.188147331897849,
      "tokens_seen": 291962880
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004603610832497492,
      "loss": 1.5973,
      "theoretical_loss": 4.1880373095514205,
      "tokens_seen": 292028416
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046035105315947846,
      "loss": 1.5595,
      "theoretical_loss": 4.18792731880472,
      "tokens_seen": 292093952
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004603410230692076,
      "loss": 1.5799,
      "theoretical_loss": 4.187817359641581,
      "tokens_seen": 292159488
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004603309929789368,
      "loss": 1.6511,
      "theoretical_loss": 4.1877074320458565,
      "tokens_seen": 292225024
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000460320962888666,
      "loss": 1.5917,
      "theoretical_loss": 4.187597536001406,
      "tokens_seen": 292290560
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004603109327983952,
      "loss": 1.6376,
      "theoretical_loss": 4.187487671492102,
      "tokens_seen": 292356096
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046030090270812436,
      "loss": 1.6182,
      "theoretical_loss": 4.18737783850183,
      "tokens_seen": 292421632
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004602908726178536,
      "loss": 1.5791,
      "theoretical_loss": 4.187268037014486,
      "tokens_seen": 292487168
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004602808425275827,
      "loss": 1.5296,
      "theoretical_loss": 4.187158267013979,
      "tokens_seen": 292552704
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046027081243731196,
      "loss": 1.5974,
      "theoretical_loss": 4.18704852848423,
      "tokens_seen": 292618240
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004602607823470411,
      "loss": 1.6037,
      "theoretical_loss": 4.18693882140917,
      "tokens_seen": 292683776
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004602507522567703,
      "loss": 1.6504,
      "theoretical_loss": 4.186829145772743,
      "tokens_seen": 292749312
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004602407221664995,
      "loss": 1.5384,
      "theoretical_loss": 4.186719501558905,
      "tokens_seen": 292814848
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004602306920762287,
      "loss": 1.5756,
      "theoretical_loss": 4.186609888751623,
      "tokens_seen": 292880384
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046022066198595787,
      "loss": 1.7113,
      "theoretical_loss": 4.186500307334878,
      "tokens_seen": 292945920
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046021063189568705,
      "loss": 1.6228,
      "theoretical_loss": 4.186390757292659,
      "tokens_seen": 293011456
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004602006018054163,
      "loss": 1.561,
      "theoretical_loss": 4.18628123860897,
      "tokens_seen": 293076992
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046019057171514546,
      "loss": 1.5192,
      "theoretical_loss": 4.186171751267825,
      "tokens_seen": 293142528
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046018054162487465,
      "loss": 1.5459,
      "theoretical_loss": 4.186062295253249,
      "tokens_seen": 293208064
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004601705115346038,
      "loss": 1.6559,
      "theoretical_loss": 4.185952870549283,
      "tokens_seen": 293273600
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000460160481444333,
      "loss": 1.6139,
      "theoretical_loss": 4.185843477139974,
      "tokens_seen": 293339136
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004601504513540622,
      "loss": 1.6959,
      "theoretical_loss": 4.185734115009383,
      "tokens_seen": 293404672
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004601404212637914,
      "loss": 1.4628,
      "theoretical_loss": 4.185624784141585,
      "tokens_seen": 293470208
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046013039117352055,
      "loss": 1.672,
      "theoretical_loss": 4.185515484520664,
      "tokens_seen": 293535744
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004601203610832498,
      "loss": 1.6975,
      "theoretical_loss": 4.1854062161307155,
      "tokens_seen": 293601280
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046011033099297897,
      "loss": 1.5619,
      "theoretical_loss": 4.185296978955848,
      "tokens_seen": 293666816
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046010030090270815,
      "loss": 1.6133,
      "theoretical_loss": 4.185187772980181,
      "tokens_seen": 293732352
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046009027081243733,
      "loss": 1.7376,
      "theoretical_loss": 4.185078598187846,
      "tokens_seen": 293797888
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004600802407221665,
      "loss": 1.4694,
      "theoretical_loss": 4.184969454562985,
      "tokens_seen": 293863424
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004600702106318957,
      "loss": 1.6143,
      "theoretical_loss": 4.1848603420897525,
      "tokens_seen": 293928960
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046006018054162493,
      "loss": 1.6236,
      "theoretical_loss": 4.184751260752316,
      "tokens_seen": 293994496
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046005015045135405,
      "loss": 1.7125,
      "theoretical_loss": 4.18464221053485,
      "tokens_seen": 294060032
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004600401203610833,
      "loss": 1.481,
      "theoretical_loss": 4.184533191421547,
      "tokens_seen": 294125568
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004600300902708124,
      "loss": 1.5275,
      "theoretical_loss": 4.184424203396606,
      "tokens_seen": 294191104
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046002006018054165,
      "loss": 1.635,
      "theoretical_loss": 4.184315246444239,
      "tokens_seen": 294256640
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046001003009027083,
      "loss": 1.5082,
      "theoretical_loss": 4.18420632054867,
      "tokens_seen": 294322176
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00046,
      "loss": 1.6182,
      "theoretical_loss": 4.1840974256941355,
      "tokens_seen": 294387712
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004599899699097292,
      "loss": 1.5156,
      "theoretical_loss": 4.183988561864879,
      "tokens_seen": 294453248
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045997993981945843,
      "loss": 1.5508,
      "theoretical_loss": 4.183879729045163,
      "tokens_seen": 294518784
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045996990972918756,
      "loss": 1.6816,
      "theoretical_loss": 4.183770927219255,
      "tokens_seen": 294584320
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004599598796389168,
      "loss": 1.6271,
      "theoretical_loss": 4.183662156371436,
      "tokens_seen": 294649856
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004599498495486459,
      "loss": 1.6511,
      "theoretical_loss": 4.183553416485999,
      "tokens_seen": 294715392
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045993981945837515,
      "loss": 1.4996,
      "theoretical_loss": 4.183444707547249,
      "tokens_seen": 294780928
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045992978936810434,
      "loss": 1.5606,
      "theoretical_loss": 4.1833360295395,
      "tokens_seen": 294846464
    },
    {
      "epoch": 0.09,
      "objective/train/docs_used": 103707,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.5992002487182617,
      "objective/train/theoretical_loss": 4.183227382447081,
      "objective/train/tokens_used": 315372000,
      "theoretical_loss": 4.183227382447081,
      "tokens_seen": 294912000
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004599197592778335,
      "loss": 1.5992,
      "theoretical_loss": 4.183227382447081,
      "tokens_seen": 294912000
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004599097291875627,
      "loss": 1.624,
      "theoretical_loss": 4.183118766254328,
      "tokens_seen": 294977536
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004598996990972919,
      "loss": 1.581,
      "theoretical_loss": 4.183010180945593,
      "tokens_seen": 295043072
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045988966900702106,
      "loss": 1.7065,
      "theoretical_loss": 4.182901626505237,
      "tokens_seen": 295108608
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004598796389167503,
      "loss": 1.5627,
      "theoretical_loss": 4.182793102917632,
      "tokens_seen": 295174144
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004598696088264794,
      "loss": 1.6525,
      "theoretical_loss": 4.182684610167162,
      "tokens_seen": 295239680
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045985957873620866,
      "loss": 1.645,
      "theoretical_loss": 4.1825761482382235,
      "tokens_seen": 295305216
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004598495486459378,
      "loss": 1.5677,
      "theoretical_loss": 4.182467717115221,
      "tokens_seen": 295370752
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000459839518555667,
      "loss": 1.6591,
      "theoretical_loss": 4.182359316782576,
      "tokens_seen": 295436288
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004598294884653962,
      "loss": 1.5827,
      "theoretical_loss": 4.1822509472247145,
      "tokens_seen": 295501824
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004598194583751254,
      "loss": 1.5574,
      "theoretical_loss": 4.18214260842608,
      "tokens_seen": 295567360
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045980942828485456,
      "loss": 1.5524,
      "theoretical_loss": 4.182034300371122,
      "tokens_seen": 295632896
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004597993981945838,
      "loss": 1.6178,
      "theoretical_loss": 4.181926023044306,
      "tokens_seen": 295698432
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004597893681043129,
      "loss": 1.6106,
      "theoretical_loss": 4.181817776430106,
      "tokens_seen": 295763968
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045977933801404216,
      "loss": 1.6092,
      "theoretical_loss": 4.181709560513008,
      "tokens_seen": 295829504
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004597693079237713,
      "loss": 1.6474,
      "theoretical_loss": 4.181601375277509,
      "tokens_seen": 295895040
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004597592778335005,
      "loss": 1.6221,
      "theoretical_loss": 4.181493220708117,
      "tokens_seen": 295960576
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004597492477432297,
      "loss": 1.5788,
      "theoretical_loss": 4.181385096789353,
      "tokens_seen": 296026112
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004597392176529589,
      "loss": 1.6394,
      "theoretical_loss": 4.181277003505747,
      "tokens_seen": 296091648
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045972918756268807,
      "loss": 1.6367,
      "theoretical_loss": 4.181168940841843,
      "tokens_seen": 296157184
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045971915747241725,
      "loss": 1.492,
      "theoretical_loss": 4.181060908782191,
      "tokens_seen": 296222720
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045970912738214643,
      "loss": 1.5711,
      "theoretical_loss": 4.18095290731136,
      "tokens_seen": 296288256
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045969909729187566,
      "loss": 1.69,
      "theoretical_loss": 4.180844936413922,
      "tokens_seen": 296353792
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004596890672016048,
      "loss": 1.6669,
      "theoretical_loss": 4.180736996074465,
      "tokens_seen": 296419328
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000459679037111334,
      "loss": 1.6316,
      "theoretical_loss": 4.180629086277589,
      "tokens_seen": 296484864
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045966900702106315,
      "loss": 1.5543,
      "theoretical_loss": 4.180521207007902,
      "tokens_seen": 296550400
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004596589769307924,
      "loss": 1.5223,
      "theoretical_loss": 4.180413358250024,
      "tokens_seen": 296615936
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045964894684052157,
      "loss": 1.621,
      "theoretical_loss": 4.180305539988588,
      "tokens_seen": 296681472
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045963891675025075,
      "loss": 1.5034,
      "theoretical_loss": 4.180197752208235,
      "tokens_seen": 296747008
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045962888665997993,
      "loss": 1.604,
      "theoretical_loss": 4.1800899948936205,
      "tokens_seen": 296812544
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045961885656970917,
      "loss": 1.6376,
      "theoretical_loss": 4.179982268029409,
      "tokens_seen": 296878080
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004596088264794383,
      "loss": 1.6703,
      "theoretical_loss": 4.179874571600277,
      "tokens_seen": 296943616
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045959879638916753,
      "loss": 1.5014,
      "theoretical_loss": 4.1797669055909115,
      "tokens_seen": 297009152
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045958876629889666,
      "loss": 1.5958,
      "theoretical_loss": 4.1796592699860105,
      "tokens_seen": 297074688
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004595787362086259,
      "loss": 1.5595,
      "theoretical_loss": 4.179551664770283,
      "tokens_seen": 297140224
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004595687061183551,
      "loss": 1.6027,
      "theoretical_loss": 4.1794440899284515,
      "tokens_seen": 297205760
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045955867602808425,
      "loss": 1.5345,
      "theoretical_loss": 4.179336545445245,
      "tokens_seen": 297271296
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045954864593781344,
      "loss": 1.525,
      "theoretical_loss": 4.1792290313054075,
      "tokens_seen": 297336832
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004595386158475426,
      "loss": 1.5892,
      "theoretical_loss": 4.179121547493692,
      "tokens_seen": 297402368
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004595285857572718,
      "loss": 1.6364,
      "theoretical_loss": 4.179014093994862,
      "tokens_seen": 297467904
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045951855566700103,
      "loss": 1.6081,
      "theoretical_loss": 4.178906670793695,
      "tokens_seen": 297533440
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045950852557673016,
      "loss": 1.529,
      "theoretical_loss": 4.178799277874977,
      "tokens_seen": 297598976
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004594984954864594,
      "loss": 1.5343,
      "theoretical_loss": 4.178691915223505,
      "tokens_seen": 297664512
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004594884653961885,
      "loss": 1.5143,
      "theoretical_loss": 4.178584582824088,
      "tokens_seen": 297730048
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045947843530591776,
      "loss": 1.5336,
      "theoretical_loss": 4.1784772806615464,
      "tokens_seen": 297795584
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045946840521564694,
      "loss": 1.5162,
      "theoretical_loss": 4.178370008720709,
      "tokens_seen": 297861120
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004594583751253761,
      "loss": 1.6125,
      "theoretical_loss": 4.178262766986418,
      "tokens_seen": 297926656
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045944834503510536,
      "loss": 1.4852,
      "theoretical_loss": 4.178155555443525,
      "tokens_seen": 297992192
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045943831494483454,
      "loss": 1.6146,
      "theoretical_loss": 4.178048374076894,
      "tokens_seen": 298057728
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004594282848545637,
      "loss": 1.5634,
      "theoretical_loss": 4.1779412228714,
      "tokens_seen": 298123264
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004594182547642929,
      "loss": 1.6302,
      "theoretical_loss": 4.177834101811927,
      "tokens_seen": 298188800
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004594082246740221,
      "loss": 1.6316,
      "theoretical_loss": 4.1777270108833715,
      "tokens_seen": 298254336
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045939819458375126,
      "loss": 1.5225,
      "theoretical_loss": 4.177619950070639,
      "tokens_seen": 298319872
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004593881644934805,
      "loss": 1.4996,
      "theoretical_loss": 4.177512919358649,
      "tokens_seen": 298385408
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004593781344032096,
      "loss": 1.6387,
      "theoretical_loss": 4.17740591873233,
      "tokens_seen": 298450944
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045936810431293886,
      "loss": 1.6003,
      "theoretical_loss": 4.177298948176619,
      "tokens_seen": 298516480
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000459358074222668,
      "loss": 1.6224,
      "theoretical_loss": 4.17719200767647,
      "tokens_seen": 298582016
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004593480441323972,
      "loss": 1.6047,
      "theoretical_loss": 4.177085097216842,
      "tokens_seen": 298647552
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004593380140421264,
      "loss": 1.6281,
      "theoretical_loss": 4.1769782167827065,
      "tokens_seen": 298713088
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004593279839518556,
      "loss": 1.6373,
      "theoretical_loss": 4.176871366359047,
      "tokens_seen": 298778624
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045931795386158476,
      "loss": 1.5477,
      "theoretical_loss": 4.176764545930858,
      "tokens_seen": 298844160
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000459307923771314,
      "loss": 1.6557,
      "theoretical_loss": 4.176657755483143,
      "tokens_seen": 298909696
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004592978936810431,
      "loss": 1.5849,
      "theoretical_loss": 4.176550995000917,
      "tokens_seen": 298975232
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045928786359077236,
      "loss": 1.4837,
      "theoretical_loss": 4.176444264469206,
      "tokens_seen": 299040768
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004592778335005015,
      "loss": 1.5926,
      "theoretical_loss": 4.176337563873046,
      "tokens_seen": 299106304
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004592678034102307,
      "loss": 1.5532,
      "theoretical_loss": 4.176230893197486,
      "tokens_seen": 299171840
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004592577733199599,
      "loss": 1.5381,
      "theoretical_loss": 4.1761242524275834,
      "tokens_seen": 299237376
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004592477432296891,
      "loss": 1.6144,
      "theoretical_loss": 4.176017641548407,
      "tokens_seen": 299302912
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045923771313941827,
      "loss": 1.6403,
      "theoretical_loss": 4.175911060545037,
      "tokens_seen": 299368448
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045922768304914745,
      "loss": 1.4486,
      "theoretical_loss": 4.175804509402562,
      "tokens_seen": 299433984
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045921765295887663,
      "loss": 1.5405,
      "theoretical_loss": 4.175697988106085,
      "tokens_seen": 299499520
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045920762286860586,
      "loss": 1.6008,
      "theoretical_loss": 4.175591496640718,
      "tokens_seen": 299565056
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000459197592778335,
      "loss": 1.6611,
      "theoretical_loss": 4.175485034991581,
      "tokens_seen": 299630592
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004591875626880642,
      "loss": 1.6878,
      "theoretical_loss": 4.17537860314381,
      "tokens_seen": 299696128
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045917753259779335,
      "loss": 1.5181,
      "theoretical_loss": 4.175272201082547,
      "tokens_seen": 299761664
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004591675025075226,
      "loss": 1.6329,
      "theoretical_loss": 4.175165828792946,
      "tokens_seen": 299827200
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045915747241725177,
      "loss": 1.5886,
      "theoretical_loss": 4.1750594862601735,
      "tokens_seen": 299892736
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045914744232698095,
      "loss": 1.5013,
      "theoretical_loss": 4.1749531734694045,
      "tokens_seen": 299958272
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045913741223671013,
      "loss": 1.5568,
      "theoretical_loss": 4.174846890405825,
      "tokens_seen": 300023808
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045912738214643937,
      "loss": 1.6663,
      "theoretical_loss": 4.174740637054632,
      "tokens_seen": 300089344
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004591173520561685,
      "loss": 1.6492,
      "theoretical_loss": 4.174634413401034,
      "tokens_seen": 300154880
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045910732196589773,
      "loss": 1.4448,
      "theoretical_loss": 4.174528219430247,
      "tokens_seen": 300220416
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045909729187562686,
      "loss": 1.5212,
      "theoretical_loss": 4.174422055127502,
      "tokens_seen": 300285952
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004590872617853561,
      "loss": 1.6481,
      "theoretical_loss": 4.174315920478037,
      "tokens_seen": 300351488
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004590772316950853,
      "loss": 1.5564,
      "theoretical_loss": 4.174209815467102,
      "tokens_seen": 300417024
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045906720160481445,
      "loss": 1.5792,
      "theoretical_loss": 4.174103740079958,
      "tokens_seen": 300482560
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045905717151454364,
      "loss": 1.5486,
      "theoretical_loss": 4.1739976943018755,
      "tokens_seen": 300548096
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004590471414242728,
      "loss": 1.7039,
      "theoretical_loss": 4.173891678118135,
      "tokens_seen": 300613632
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000459037111334002,
      "loss": 1.5161,
      "theoretical_loss": 4.173785691514031,
      "tokens_seen": 300679168
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045902708124373123,
      "loss": 1.7943,
      "theoretical_loss": 4.173679734474862,
      "tokens_seen": 300744704
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045901705115346036,
      "loss": 1.6219,
      "theoretical_loss": 4.173573806985945,
      "tokens_seen": 300810240
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004590070210631896,
      "loss": 1.5921,
      "theoretical_loss": 4.173467909032602,
      "tokens_seen": 300875776
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004589969909729187,
      "loss": 1.4789,
      "theoretical_loss": 4.173362040600166,
      "tokens_seen": 300941312
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045898696088264796,
      "loss": 1.6788,
      "theoretical_loss": 4.173256201673983,
      "tokens_seen": 301006848
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045897693079237714,
      "loss": 1.6132,
      "theoretical_loss": 4.173150392239406,
      "tokens_seen": 301072384
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004589669007021063,
      "loss": 1.6196,
      "theoretical_loss": 4.173044612281802,
      "tokens_seen": 301137920
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004589568706118355,
      "loss": 1.5711,
      "theoretical_loss": 4.172938861786546,
      "tokens_seen": 301203456
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045894684052156474,
      "loss": 1.6233,
      "theoretical_loss": 4.1728331407390264,
      "tokens_seen": 301268992
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045893681043129386,
      "loss": 1.6455,
      "theoretical_loss": 4.172727449124636,
      "tokens_seen": 301334528
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004589267803410231,
      "loss": 1.6279,
      "theoretical_loss": 4.172621786928786,
      "tokens_seen": 301400064
    },
    {
      "epoch": 0.09,
      "objective/train/docs_used": 106236,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.5772457122802734,
      "objective/train/theoretical_loss": 4.17251615413689,
      "objective/train/tokens_used": 321925600,
      "theoretical_loss": 4.17251615413689,
      "tokens_seen": 301465600
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004589167502507522,
      "loss": 1.5772,
      "theoretical_loss": 4.17251615413689,
      "tokens_seen": 301465600
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045890672016048146,
      "loss": 1.5089,
      "theoretical_loss": 4.172410550734378,
      "tokens_seen": 301531136
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045889669007021064,
      "loss": 1.6021,
      "theoretical_loss": 4.172304976706689,
      "tokens_seen": 301596672
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004588866599799398,
      "loss": 1.6546,
      "theoretical_loss": 4.17219943203927,
      "tokens_seen": 301662208
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000458876629889669,
      "loss": 1.607,
      "theoretical_loss": 4.172093916717581,
      "tokens_seen": 301727744
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004588665997993982,
      "loss": 1.5956,
      "theoretical_loss": 4.171988430727091,
      "tokens_seen": 301793280
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045885656970912737,
      "loss": 1.5285,
      "theoretical_loss": 4.17188297405328,
      "tokens_seen": 301858816
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004588465396188566,
      "loss": 1.5802,
      "theoretical_loss": 4.171777546681638,
      "tokens_seen": 301924352
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045883650952858573,
      "loss": 1.5437,
      "theoretical_loss": 4.171672148597665,
      "tokens_seen": 301989888
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045882647943831496,
      "loss": 1.6005,
      "theoretical_loss": 4.171566779786872,
      "tokens_seen": 302055424
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045881644934804415,
      "loss": 1.72,
      "theoretical_loss": 4.17146144023478,
      "tokens_seen": 302120960
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004588064192577733,
      "loss": 1.6324,
      "theoretical_loss": 4.171356129926921,
      "tokens_seen": 302186496
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004587963891675025,
      "loss": 1.528,
      "theoretical_loss": 4.171250848848835,
      "tokens_seen": 302252032
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004587863590772317,
      "loss": 1.6019,
      "theoretical_loss": 4.171145596986076,
      "tokens_seen": 302317568
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045877632898696087,
      "loss": 1.4733,
      "theoretical_loss": 4.171040374324204,
      "tokens_seen": 302383104
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004587662988966901,
      "loss": 1.5048,
      "theoretical_loss": 4.170935180848793,
      "tokens_seen": 302448640
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045875626880641923,
      "loss": 1.5539,
      "theoretical_loss": 4.170830016545425,
      "tokens_seen": 302514176
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045874623871614847,
      "loss": 1.5498,
      "theoretical_loss": 4.1707248813996936,
      "tokens_seen": 302579712
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004587362086258776,
      "loss": 1.5594,
      "theoretical_loss": 4.170619775397201,
      "tokens_seen": 302645248
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045872617853560683,
      "loss": 1.6284,
      "theoretical_loss": 4.1705146985235615,
      "tokens_seen": 302710784
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000458716148445336,
      "loss": 1.7276,
      "theoretical_loss": 4.170409650764397,
      "tokens_seen": 302776320
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004587061183550652,
      "loss": 1.6998,
      "theoretical_loss": 4.170304632105344,
      "tokens_seen": 302841856
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004586960882647944,
      "loss": 1.5652,
      "theoretical_loss": 4.170199642532045,
      "tokens_seen": 302907392
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045868605817452355,
      "loss": 1.575,
      "theoretical_loss": 4.170094682030154,
      "tokens_seen": 302972928
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004586760280842528,
      "loss": 1.5344,
      "theoretical_loss": 4.169989750585335,
      "tokens_seen": 303038464
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045866599799398197,
      "loss": 1.6442,
      "theoretical_loss": 4.169884848183264,
      "tokens_seen": 303104000
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045865596790371115,
      "loss": 1.6746,
      "theoretical_loss": 4.169779974809624,
      "tokens_seen": 303169536
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045864593781344033,
      "loss": 1.6346,
      "theoretical_loss": 4.169675130450111,
      "tokens_seen": 303235072
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045863590772316957,
      "loss": 1.5988,
      "theoretical_loss": 4.16957031509043,
      "tokens_seen": 303300608
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004586258776328987,
      "loss": 1.6718,
      "theoretical_loss": 4.169465528716295,
      "tokens_seen": 303366144
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045861584754262793,
      "loss": 1.6544,
      "theoretical_loss": 4.169360771313434,
      "tokens_seen": 303431680
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045860581745235706,
      "loss": 1.5573,
      "theoretical_loss": 4.169256042867579,
      "tokens_seen": 303497216
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004585957873620863,
      "loss": 1.6748,
      "theoretical_loss": 4.169151343364476,
      "tokens_seen": 303562752
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004585857572718155,
      "loss": 1.516,
      "theoretical_loss": 4.169046672789882,
      "tokens_seen": 303628288
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045857572718154465,
      "loss": 1.6619,
      "theoretical_loss": 4.168942031129562,
      "tokens_seen": 303693824
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045856569709127384,
      "loss": 1.5522,
      "theoretical_loss": 4.168837418369292,
      "tokens_seen": 303759360
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000458555667001003,
      "loss": 1.5319,
      "theoretical_loss": 4.168732834494857,
      "tokens_seen": 303824896
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004585456369107322,
      "loss": 1.6068,
      "theoretical_loss": 4.1686282794920535,
      "tokens_seen": 303890432
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045853560682046143,
      "loss": 1.6369,
      "theoretical_loss": 4.168523753346687,
      "tokens_seen": 303955968
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045852557673019056,
      "loss": 1.6056,
      "theoretical_loss": 4.168419256044573,
      "tokens_seen": 304021504
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004585155466399198,
      "loss": 1.5945,
      "theoretical_loss": 4.168314787571538,
      "tokens_seen": 304087040
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004585055165496489,
      "loss": 1.4952,
      "theoretical_loss": 4.168210347913418,
      "tokens_seen": 304152576
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045849548645937816,
      "loss": 1.6275,
      "theoretical_loss": 4.168105937056059,
      "tokens_seen": 304218112
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045848545636910734,
      "loss": 1.5784,
      "theoretical_loss": 4.168001554985317,
      "tokens_seen": 304283648
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004584754262788365,
      "loss": 1.6659,
      "theoretical_loss": 4.167897201687056,
      "tokens_seen": 304349184
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004584653961885657,
      "loss": 1.7342,
      "theoretical_loss": 4.167792877147155,
      "tokens_seen": 304414720
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045845536609829494,
      "loss": 1.5895,
      "theoretical_loss": 4.1676885813514986,
      "tokens_seen": 304480256
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045844533600802406,
      "loss": 1.527,
      "theoretical_loss": 4.167584314285982,
      "tokens_seen": 304545792
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004584353059177533,
      "loss": 1.6643,
      "theoretical_loss": 4.167480075936512,
      "tokens_seen": 304611328
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004584252758274824,
      "loss": 1.5568,
      "theoretical_loss": 4.167375866289004,
      "tokens_seen": 304676864
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045841524573721166,
      "loss": 1.7109,
      "theoretical_loss": 4.167271685329383,
      "tokens_seen": 304742400
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045840521564694084,
      "loss": 1.7294,
      "theoretical_loss": 4.167167533043585,
      "tokens_seen": 304807936
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045839518555667,
      "loss": 1.5395,
      "theoretical_loss": 4.1670634094175565,
      "tokens_seen": 304873472
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004583851554663992,
      "loss": 1.4432,
      "theoretical_loss": 4.166959314437252,
      "tokens_seen": 304939008
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004583751253761284,
      "loss": 1.5583,
      "theoretical_loss": 4.166855248088637,
      "tokens_seen": 305004544
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045836509528585757,
      "loss": 1.5163,
      "theoretical_loss": 4.1667512103576865,
      "tokens_seen": 305070080
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004583550651955868,
      "loss": 1.6278,
      "theoretical_loss": 4.166647201230386,
      "tokens_seen": 305135616
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045834503510531593,
      "loss": 1.623,
      "theoretical_loss": 4.166543220692731,
      "tokens_seen": 305201152
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045833500501504516,
      "loss": 1.5545,
      "theoretical_loss": 4.166439268730724,
      "tokens_seen": 305266688
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045832497492477435,
      "loss": 1.5468,
      "theoretical_loss": 4.166335345330383,
      "tokens_seen": 305332224
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004583149448345035,
      "loss": 1.6393,
      "theoretical_loss": 4.16623145047773,
      "tokens_seen": 305397760
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004583049147442327,
      "loss": 1.723,
      "theoretical_loss": 4.166127584158801,
      "tokens_seen": 305463296
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004582948846539619,
      "loss": 1.6404,
      "theoretical_loss": 4.166023746359639,
      "tokens_seen": 305528832
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045828485456369107,
      "loss": 1.6619,
      "theoretical_loss": 4.165919937066299,
      "tokens_seen": 305594368
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004582748244734203,
      "loss": 1.6263,
      "theoretical_loss": 4.165816156264844,
      "tokens_seen": 305659904
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045826479438314943,
      "loss": 1.6526,
      "theoretical_loss": 4.165712403941348,
      "tokens_seen": 305725440
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045825476429287867,
      "loss": 1.6301,
      "theoretical_loss": 4.1656086800818946,
      "tokens_seen": 305790976
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004582447342026078,
      "loss": 1.5103,
      "theoretical_loss": 4.165504984672577,
      "tokens_seen": 305856512
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045823470411233703,
      "loss": 1.608,
      "theoretical_loss": 4.165401317699498,
      "tokens_seen": 305922048
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004582246740220662,
      "loss": 1.4864,
      "theoretical_loss": 4.16529767914877,
      "tokens_seen": 305987584
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004582146439317954,
      "loss": 1.5662,
      "theoretical_loss": 4.165194069006516,
      "tokens_seen": 306053120
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045820461384152457,
      "loss": 1.5494,
      "theoretical_loss": 4.165090487258867,
      "tokens_seen": 306118656
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045819458375125375,
      "loss": 1.6736,
      "theoretical_loss": 4.164986933891968,
      "tokens_seen": 306184192
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045818455366098294,
      "loss": 1.6251,
      "theoretical_loss": 4.164883408891968,
      "tokens_seen": 306249728
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045817452357071217,
      "loss": 1.5724,
      "theoretical_loss": 4.164779912245029,
      "tokens_seen": 306315264
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004581644934804413,
      "loss": 1.5563,
      "theoretical_loss": 4.1646764439373225,
      "tokens_seen": 306380800
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045815446339017053,
      "loss": 1.5167,
      "theoretical_loss": 4.164573003955029,
      "tokens_seen": 306446336
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004581444332998997,
      "loss": 1.5819,
      "theoretical_loss": 4.164469592284338,
      "tokens_seen": 306511872
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004581344032096289,
      "loss": 1.613,
      "theoretical_loss": 4.164366208911453,
      "tokens_seen": 306577408
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004581243731193581,
      "loss": 1.5501,
      "theoretical_loss": 4.1642628538225805,
      "tokens_seen": 306642944
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045811434302908726,
      "loss": 1.5955,
      "theoretical_loss": 4.1641595270039415,
      "tokens_seen": 306708480
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045810431293881644,
      "loss": 1.5329,
      "theoretical_loss": 4.1640562284417655,
      "tokens_seen": 306774016
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004580942828485457,
      "loss": 1.6385,
      "theoretical_loss": 4.16395295812229,
      "tokens_seen": 306839552
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004580842527582748,
      "loss": 1.5687,
      "theoretical_loss": 4.1638497160317645,
      "tokens_seen": 306905088
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045807422266800404,
      "loss": 1.5428,
      "theoretical_loss": 4.163746502156448,
      "tokens_seen": 306970624
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045806419257773316,
      "loss": 1.5831,
      "theoretical_loss": 4.163643316482606,
      "tokens_seen": 307036160
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004580541624874624,
      "loss": 1.4681,
      "theoretical_loss": 4.1635401589965175,
      "tokens_seen": 307101696
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004580441323971916,
      "loss": 1.5292,
      "theoretical_loss": 4.163437029684469,
      "tokens_seen": 307167232
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045803410230692076,
      "loss": 1.5437,
      "theoretical_loss": 4.163333928532758,
      "tokens_seen": 307232768
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045802407221664994,
      "loss": 1.5799,
      "theoretical_loss": 4.163230855527688,
      "tokens_seen": 307298304
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004580140421263791,
      "loss": 1.451,
      "theoretical_loss": 4.163127810655578,
      "tokens_seen": 307363840
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004580040120361083,
      "loss": 1.6719,
      "theoretical_loss": 4.163024793902752,
      "tokens_seen": 307429376
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045799398194583754,
      "loss": 1.4972,
      "theoretical_loss": 4.162921805255543,
      "tokens_seen": 307494912
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045798395185556667,
      "loss": 1.6456,
      "theoretical_loss": 4.162818844700298,
      "tokens_seen": 307560448
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004579739217652959,
      "loss": 1.6416,
      "theoretical_loss": 4.162715912223369,
      "tokens_seen": 307625984
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004579638916750251,
      "loss": 1.4997,
      "theoretical_loss": 4.162613007811122,
      "tokens_seen": 307691520
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045795386158475426,
      "loss": 1.584,
      "theoretical_loss": 4.1625101314499275,
      "tokens_seen": 307757056
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004579438314944835,
      "loss": 1.6065,
      "theoretical_loss": 4.162407283126169,
      "tokens_seen": 307822592
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004579338014042126,
      "loss": 1.738,
      "theoretical_loss": 4.1623044628262384,
      "tokens_seen": 307888128
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045792377131394186,
      "loss": 1.6428,
      "theoretical_loss": 4.162201670536537,
      "tokens_seen": 307953664
    },
    {
      "epoch": 0.09,
      "objective/train/docs_used": 108409,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.5707652568817139,
      "objective/train/theoretical_loss": 4.162098906243477,
      "objective/train/tokens_used": 328479200,
      "theoretical_loss": 4.162098906243477,
      "tokens_seen": 308019200
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045791374122367104,
      "loss": 1.5708,
      "theoretical_loss": 4.162098906243477,
      "tokens_seen": 308019200
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004579037111334002,
      "loss": 1.5002,
      "theoretical_loss": 4.161996169933477,
      "tokens_seen": 308084736
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004578936810431294,
      "loss": 1.7806,
      "theoretical_loss": 4.161893461592968,
      "tokens_seen": 308150272
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004578836509528586,
      "loss": 1.5298,
      "theoretical_loss": 4.16179078120839,
      "tokens_seen": 308215808
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045787362086258777,
      "loss": 1.5895,
      "theoretical_loss": 4.161688128766191,
      "tokens_seen": 308281344
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000457863590772317,
      "loss": 1.5645,
      "theoretical_loss": 4.16158550425283,
      "tokens_seen": 308346880
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045785356068204613,
      "loss": 1.585,
      "theoretical_loss": 4.161482907654775,
      "tokens_seen": 308412416
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045784353059177536,
      "loss": 1.551,
      "theoretical_loss": 4.161380338958502,
      "tokens_seen": 308477952
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045783350050150455,
      "loss": 1.4657,
      "theoretical_loss": 4.161277798150498,
      "tokens_seen": 308543488
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004578234704112337,
      "loss": 1.5982,
      "theoretical_loss": 4.16117528521726,
      "tokens_seen": 308609024
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004578134403209629,
      "loss": 1.5637,
      "theoretical_loss": 4.161072800145292,
      "tokens_seen": 308674560
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004578034102306921,
      "loss": 1.5796,
      "theoretical_loss": 4.16097034292111,
      "tokens_seen": 308740096
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045779338014042127,
      "loss": 1.559,
      "theoretical_loss": 4.160867913531238,
      "tokens_seen": 308805632
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004577833500501505,
      "loss": 1.6121,
      "theoretical_loss": 4.160765511962209,
      "tokens_seen": 308871168
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045777331995987963,
      "loss": 1.5646,
      "theoretical_loss": 4.160663138200567,
      "tokens_seen": 308936704
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045776328986960887,
      "loss": 1.6975,
      "theoretical_loss": 4.1605607922328645,
      "tokens_seen": 309002240
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000457753259779338,
      "loss": 1.6608,
      "theoretical_loss": 4.160458474045662,
      "tokens_seen": 309067776
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045774322968906723,
      "loss": 1.562,
      "theoretical_loss": 4.16035618362553,
      "tokens_seen": 309133312
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004577331995987964,
      "loss": 1.7237,
      "theoretical_loss": 4.16025392095905,
      "tokens_seen": 309198848
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004577231695085256,
      "loss": 1.7372,
      "theoretical_loss": 4.160151686032814,
      "tokens_seen": 309264384
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004577131394182548,
      "loss": 1.4962,
      "theoretical_loss": 4.160049478833416,
      "tokens_seen": 309329920
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045770310932798395,
      "loss": 1.731,
      "theoretical_loss": 4.159947299347468,
      "tokens_seen": 309395456
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045769307923771314,
      "loss": 1.5989,
      "theoretical_loss": 4.159845147561587,
      "tokens_seen": 309460992
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045768304914744237,
      "loss": 1.5962,
      "theoretical_loss": 4.1597430234624,
      "tokens_seen": 309526528
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004576730190571715,
      "loss": 1.5521,
      "theoretical_loss": 4.159640927036541,
      "tokens_seen": 309592064
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045766298896690073,
      "loss": 1.6553,
      "theoretical_loss": 4.159538858270659,
      "tokens_seen": 309657600
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004576529588766299,
      "loss": 1.6924,
      "theoretical_loss": 4.159436817151407,
      "tokens_seen": 309723136
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004576429287863591,
      "loss": 1.6767,
      "theoretical_loss": 4.159334803665448,
      "tokens_seen": 309788672
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004576328986960883,
      "loss": 1.5852,
      "theoretical_loss": 4.159232817799458,
      "tokens_seen": 309854208
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045762286860581746,
      "loss": 1.6575,
      "theoretical_loss": 4.1591308595401175,
      "tokens_seen": 309919744
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045761283851554664,
      "loss": 1.6073,
      "theoretical_loss": 4.159028928874118,
      "tokens_seen": 309985280
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004576028084252759,
      "loss": 1.695,
      "theoretical_loss": 4.158927025788162,
      "tokens_seen": 310050816
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000457592778335005,
      "loss": 1.6378,
      "theoretical_loss": 4.158825150268958,
      "tokens_seen": 310116352
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045758274824473424,
      "loss": 1.6545,
      "theoretical_loss": 4.158723302303227,
      "tokens_seen": 310181888
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045757271815446336,
      "loss": 1.4503,
      "theoretical_loss": 4.158621481877697,
      "tokens_seen": 310247424
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004575626880641926,
      "loss": 1.5545,
      "theoretical_loss": 4.158519688979106,
      "tokens_seen": 310312960
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004575526579739218,
      "loss": 1.5548,
      "theoretical_loss": 4.1584179235942,
      "tokens_seen": 310378496
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045754262788365096,
      "loss": 1.5968,
      "theoretical_loss": 4.158316185709737,
      "tokens_seen": 310444032
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045753259779338014,
      "loss": 1.646,
      "theoretical_loss": 4.158214475312481,
      "tokens_seen": 310509568
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004575225677031093,
      "loss": 1.5779,
      "theoretical_loss": 4.158112792389206,
      "tokens_seen": 310575104
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004575125376128385,
      "loss": 1.5417,
      "theoretical_loss": 4.158011136926698,
      "tokens_seen": 310640640
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045750250752256774,
      "loss": 1.5241,
      "theoretical_loss": 4.157909508911747,
      "tokens_seen": 310706176
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045749247743229687,
      "loss": 1.5442,
      "theoretical_loss": 4.157807908331157,
      "tokens_seen": 310771712
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004574824473420261,
      "loss": 1.7359,
      "theoretical_loss": 4.157706335171738,
      "tokens_seen": 310837248
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004574724172517553,
      "loss": 1.6548,
      "theoretical_loss": 4.15760478942031,
      "tokens_seen": 310902784
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045746238716148446,
      "loss": 1.6077,
      "theoretical_loss": 4.157503271063703,
      "tokens_seen": 310968320
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045745235707121364,
      "loss": 1.5925,
      "theoretical_loss": 4.157401780088756,
      "tokens_seen": 311033856
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004574423269809428,
      "loss": 1.527,
      "theoretical_loss": 4.157300316482315,
      "tokens_seen": 311099392
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000457432296890672,
      "loss": 1.5889,
      "theoretical_loss": 4.157198880231238,
      "tokens_seen": 311164928
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045742226680040124,
      "loss": 1.5612,
      "theoretical_loss": 4.157097471322389,
      "tokens_seen": 311230464
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045741223671013037,
      "loss": 1.6702,
      "theoretical_loss": 4.156996089742645,
      "tokens_seen": 311296000
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004574022066198596,
      "loss": 1.6925,
      "theoretical_loss": 4.156894735478888,
      "tokens_seen": 311361536
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045739217652958873,
      "loss": 1.6305,
      "theoretical_loss": 4.156793408518011,
      "tokens_seen": 311427072
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045738214643931797,
      "loss": 1.5521,
      "theoretical_loss": 4.156692108846916,
      "tokens_seen": 311492608
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045737211634904715,
      "loss": 1.5597,
      "theoretical_loss": 4.156590836452514,
      "tokens_seen": 311558144
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045736208625877633,
      "loss": 1.6328,
      "theoretical_loss": 4.156489591321726,
      "tokens_seen": 311623680
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004573520561685055,
      "loss": 1.629,
      "theoretical_loss": 4.15638837344148,
      "tokens_seen": 311689216
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045734202607823475,
      "loss": 1.7126,
      "theoretical_loss": 4.156287182798714,
      "tokens_seen": 311754752
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045733199598796387,
      "loss": 1.6654,
      "theoretical_loss": 4.156186019380375,
      "tokens_seen": 311820288
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004573219658976931,
      "loss": 1.6008,
      "theoretical_loss": 4.156084883173419,
      "tokens_seen": 311885824
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045731193580742223,
      "loss": 1.6343,
      "theoretical_loss": 4.155983774164811,
      "tokens_seen": 311951360
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045730190571715147,
      "loss": 1.5141,
      "theoretical_loss": 4.1558826923415255,
      "tokens_seen": 312016896
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045729187562688065,
      "loss": 1.5586,
      "theoretical_loss": 4.155781637690545,
      "tokens_seen": 312082432
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045728184553660983,
      "loss": 1.6544,
      "theoretical_loss": 4.1556806101988615,
      "tokens_seen": 312147968
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000457271815446339,
      "loss": 1.5765,
      "theoretical_loss": 4.155579609853476,
      "tokens_seen": 312213504
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004572617853560682,
      "loss": 1.6142,
      "theoretical_loss": 4.155478636641398,
      "tokens_seen": 312279040
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004572517552657974,
      "loss": 1.7368,
      "theoretical_loss": 4.155377690549646,
      "tokens_seen": 312344576
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004572417251755266,
      "loss": 1.5567,
      "theoretical_loss": 4.155276771565248,
      "tokens_seen": 312410112
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045723169508525574,
      "loss": 1.5746,
      "theoretical_loss": 4.155175879675241,
      "tokens_seen": 312475648
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.000457221664994985,
      "loss": 1.5231,
      "theoretical_loss": 4.155075014866671,
      "tokens_seen": 312541184
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004572116349047141,
      "loss": 1.6573,
      "theoretical_loss": 4.15497417712659,
      "tokens_seen": 312606720
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045720160481444334,
      "loss": 1.524,
      "theoretical_loss": 4.1548733664420645,
      "tokens_seen": 312672256
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045719157472417257,
      "loss": 1.5337,
      "theoretical_loss": 4.154772582800165,
      "tokens_seen": 312737792
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004571815446339017,
      "loss": 1.541,
      "theoretical_loss": 4.154671826187972,
      "tokens_seen": 312803328
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045717151454363093,
      "loss": 1.5438,
      "theoretical_loss": 4.154571096592576,
      "tokens_seen": 312868864
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004571614844533601,
      "loss": 1.6741,
      "theoretical_loss": 4.154470394001077,
      "tokens_seen": 312934400
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004571514543630893,
      "loss": 1.6919,
      "theoretical_loss": 4.154369718400583,
      "tokens_seen": 312999936
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004571414242728185,
      "loss": 1.6056,
      "theoretical_loss": 4.154269069778207,
      "tokens_seen": 313065472
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045713139418254766,
      "loss": 1.6761,
      "theoretical_loss": 4.154168448121078,
      "tokens_seen": 313131008
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045712136409227684,
      "loss": 1.6688,
      "theoretical_loss": 4.15406785341633,
      "tokens_seen": 313196544
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004571113340020061,
      "loss": 1.5521,
      "theoretical_loss": 4.153967285651105,
      "tokens_seen": 313262080
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.0004571013039117352,
      "loss": 1.5507,
      "theoretical_loss": 4.153866744812555,
      "tokens_seen": 313327616
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045709127382146444,
      "loss": 1.484,
      "theoretical_loss": 4.1537662308878405,
      "tokens_seen": 313393152
    },
    {
      "epoch": 0.09,
      "learning_rate": 0.00045708124373119356,
      "loss": 1.633,
      "theoretical_loss": 4.153665743864131,
      "tokens_seen": 313458688
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004570712136409228,
      "loss": 1.5812,
      "theoretical_loss": 4.153565283728606,
      "tokens_seen": 313524224
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000457061183550652,
      "loss": 1.6044,
      "theoretical_loss": 4.153464850468452,
      "tokens_seen": 313589760
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045705115346038116,
      "loss": 1.6262,
      "theoretical_loss": 4.1533644440708635,
      "tokens_seen": 313655296
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045704112337011034,
      "loss": 1.5669,
      "theoretical_loss": 4.153264064523047,
      "tokens_seen": 313720832
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004570310932798395,
      "loss": 1.5433,
      "theoretical_loss": 4.1531637118122156,
      "tokens_seen": 313786368
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004570210631895687,
      "loss": 1.5344,
      "theoretical_loss": 4.153063385925591,
      "tokens_seen": 313851904
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045701103309929794,
      "loss": 1.5815,
      "theoretical_loss": 4.152963086850405,
      "tokens_seen": 313917440
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045700100300902707,
      "loss": 1.4451,
      "theoretical_loss": 4.152862814573895,
      "tokens_seen": 313982976
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004569909729187563,
      "loss": 1.6462,
      "theoretical_loss": 4.152762569083313,
      "tokens_seen": 314048512
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004569809428284855,
      "loss": 1.5326,
      "theoretical_loss": 4.1526623503659135,
      "tokens_seen": 314114048
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045697091273821466,
      "loss": 1.5968,
      "theoretical_loss": 4.152562158408962,
      "tokens_seen": 314179584
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045696088264794384,
      "loss": 1.5951,
      "theoretical_loss": 4.1524619931997355,
      "tokens_seen": 314245120
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000456950852557673,
      "loss": 1.5947,
      "theoretical_loss": 4.152361854725515,
      "tokens_seen": 314310656
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004569408224674022,
      "loss": 1.6376,
      "theoretical_loss": 4.152261742973594,
      "tokens_seen": 314376192
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045693079237713144,
      "loss": 1.6656,
      "theoretical_loss": 4.152161657931273,
      "tokens_seen": 314441728
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045692076228686057,
      "loss": 1.5445,
      "theoretical_loss": 4.15206159958586,
      "tokens_seen": 314507264
    },
    {
      "epoch": 0.1,
      "objective/train/docs_used": 110660,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.592132806777954,
      "objective/train/theoretical_loss": 4.1519615679246735,
      "objective/train/tokens_used": 335032800,
      "theoretical_loss": 4.1519615679246735,
      "tokens_seen": 314572800
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004569107321965898,
      "loss": 1.5921,
      "theoretical_loss": 4.1519615679246735,
      "tokens_seen": 314572800
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045690070210631893,
      "loss": 1.5828,
      "theoretical_loss": 4.151861562935041,
      "tokens_seen": 314638336
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045689067201604817,
      "loss": 1.7178,
      "theoretical_loss": 4.151761584604298,
      "tokens_seen": 314703872
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045688064192577735,
      "loss": 1.5654,
      "theoretical_loss": 4.1516616329197875,
      "tokens_seen": 314769408
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045687061183550653,
      "loss": 1.6063,
      "theoretical_loss": 4.151561707868863,
      "tokens_seen": 314834944
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004568605817452357,
      "loss": 1.4534,
      "theoretical_loss": 4.151461809438885,
      "tokens_seen": 314900480
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045685055165496495,
      "loss": 1.5856,
      "theoretical_loss": 4.1513619376172235,
      "tokens_seen": 314966016
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045684052156469407,
      "loss": 1.6175,
      "theoretical_loss": 4.151262092391257,
      "tokens_seen": 315031552
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004568304914744233,
      "loss": 1.604,
      "theoretical_loss": 4.1511622737483735,
      "tokens_seen": 315097088
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045682046138415243,
      "loss": 1.4709,
      "theoretical_loss": 4.151062481675968,
      "tokens_seen": 315162624
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045681043129388167,
      "loss": 1.6399,
      "theoretical_loss": 4.150962716161445,
      "tokens_seen": 315228160
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045680040120361085,
      "loss": 1.5242,
      "theoretical_loss": 4.150862977192217,
      "tokens_seen": 315293696
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045679037111334003,
      "loss": 1.5149,
      "theoretical_loss": 4.150763264755706,
      "tokens_seen": 315359232
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004567803410230692,
      "loss": 1.6086,
      "theoretical_loss": 4.150663578839342,
      "tokens_seen": 315424768
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004567703109327984,
      "loss": 1.59,
      "theoretical_loss": 4.150563919430562,
      "tokens_seen": 315490304
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004567602808425276,
      "loss": 1.6697,
      "theoretical_loss": 4.150464286516816,
      "tokens_seen": 315555840
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004567502507522568,
      "loss": 1.615,
      "theoretical_loss": 4.150364680085558,
      "tokens_seen": 315621376
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045674022066198594,
      "loss": 1.5612,
      "theoretical_loss": 4.150265100124253,
      "tokens_seen": 315686912
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004567301905717152,
      "loss": 1.7129,
      "theoretical_loss": 4.150165546620373,
      "tokens_seen": 315752448
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004567201604814443,
      "loss": 1.5475,
      "theoretical_loss": 4.1500660195614,
      "tokens_seen": 315817984
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045671013039117354,
      "loss": 1.6028,
      "theoretical_loss": 4.149966518934824,
      "tokens_seen": 315883520
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004567001003009027,
      "loss": 1.8103,
      "theoretical_loss": 4.149867044728143,
      "tokens_seen": 315949056
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004566900702106319,
      "loss": 1.5441,
      "theoretical_loss": 4.149767596928863,
      "tokens_seen": 316014592
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004566800401203611,
      "loss": 1.577,
      "theoretical_loss": 4.149668175524502,
      "tokens_seen": 316080128
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004566700100300903,
      "loss": 1.6828,
      "theoretical_loss": 4.14956878050258,
      "tokens_seen": 316145664
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045665997993981944,
      "loss": 1.6726,
      "theoretical_loss": 4.1494694118506334,
      "tokens_seen": 316211200
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004566499498495487,
      "loss": 1.5702,
      "theoretical_loss": 4.1493700695562,
      "tokens_seen": 316276736
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004566399197592778,
      "loss": 1.6073,
      "theoretical_loss": 4.14927075360683,
      "tokens_seen": 316342272
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045662988966900704,
      "loss": 1.5491,
      "theoretical_loss": 4.149171463990082,
      "tokens_seen": 316407808
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004566198595787362,
      "loss": 1.589,
      "theoretical_loss": 4.149072200693521,
      "tokens_seen": 316473344
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004566098294884654,
      "loss": 1.75,
      "theoretical_loss": 4.148972963704722,
      "tokens_seen": 316538880
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004565997993981946,
      "loss": 1.497,
      "theoretical_loss": 4.148873753011269,
      "tokens_seen": 316604416
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045658976930792376,
      "loss": 1.628,
      "theoretical_loss": 4.148774568600752,
      "tokens_seen": 316669952
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045657973921765294,
      "loss": 1.5401,
      "theoretical_loss": 4.148675410460772,
      "tokens_seen": 316735488
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004565697091273822,
      "loss": 1.6004,
      "theoretical_loss": 4.148576278578937,
      "tokens_seen": 316801024
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004565596790371113,
      "loss": 1.6271,
      "theoretical_loss": 4.148477172942863,
      "tokens_seen": 316866560
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045654964894684054,
      "loss": 1.5263,
      "theoretical_loss": 4.1483780935401775,
      "tokens_seen": 316932096
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045653961885656967,
      "loss": 1.8442,
      "theoretical_loss": 4.148279040358511,
      "tokens_seen": 316997632
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004565295887662989,
      "loss": 1.6178,
      "theoretical_loss": 4.148180013385507,
      "tokens_seen": 317063168
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004565195586760281,
      "loss": 1.6722,
      "theoretical_loss": 4.148081012608817,
      "tokens_seen": 317128704
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045650952858575727,
      "loss": 1.5877,
      "theoretical_loss": 4.147982038016096,
      "tokens_seen": 317194240
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045649949849548645,
      "loss": 1.7738,
      "theoretical_loss": 4.147883089595015,
      "tokens_seen": 317259776
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004564894684052157,
      "loss": 1.5036,
      "theoretical_loss": 4.147784167333247,
      "tokens_seen": 317325312
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004564794383149448,
      "loss": 1.5651,
      "theoretical_loss": 4.147685271218477,
      "tokens_seen": 317390848
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045646940822467405,
      "loss": 1.6698,
      "theoretical_loss": 4.147586401238396,
      "tokens_seen": 317456384
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045645937813440317,
      "loss": 1.5985,
      "theoretical_loss": 4.147487557380705,
      "tokens_seen": 317521920
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004564493480441324,
      "loss": 1.6034,
      "theoretical_loss": 4.147388739633113,
      "tokens_seen": 317587456
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045643931795386164,
      "loss": 1.6941,
      "theoretical_loss": 4.147289947983337,
      "tokens_seen": 317652992
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045642928786359077,
      "loss": 1.5537,
      "theoretical_loss": 4.1471911824191015,
      "tokens_seen": 317718528
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045641925777332,
      "loss": 1.5748,
      "theoretical_loss": 4.147092442928141,
      "tokens_seen": 317784064
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045640922768304913,
      "loss": 1.5783,
      "theoretical_loss": 4.146993729498197,
      "tokens_seen": 317849600
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045639919759277837,
      "loss": 1.6119,
      "theoretical_loss": 4.146895042117021,
      "tokens_seen": 317915136
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045638916750250755,
      "loss": 1.5364,
      "theoretical_loss": 4.146796380772369,
      "tokens_seen": 317980672
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045637913741223673,
      "loss": 1.5316,
      "theoretical_loss": 4.146697745452011,
      "tokens_seen": 318046208
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004563691073219659,
      "loss": 1.5766,
      "theoretical_loss": 4.146599136143719,
      "tokens_seen": 318111744
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045635907723169515,
      "loss": 1.5788,
      "theoretical_loss": 4.146500552835278,
      "tokens_seen": 318177280
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045634904714142427,
      "loss": 1.8243,
      "theoretical_loss": 4.146401995514479,
      "tokens_seen": 318242816
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004563390170511535,
      "loss": 1.6424,
      "theoretical_loss": 4.146303464169123,
      "tokens_seen": 318308352
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045632898696088263,
      "loss": 1.7073,
      "theoretical_loss": 4.146204958787017,
      "tokens_seen": 318373888
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045631895687061187,
      "loss": 1.5735,
      "theoretical_loss": 4.146106479355978,
      "tokens_seen": 318439424
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045630892678034105,
      "loss": 1.7629,
      "theoretical_loss": 4.1460080258638285,
      "tokens_seen": 318504960
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045629889669007023,
      "loss": 1.5897,
      "theoretical_loss": 4.145909598298404,
      "tokens_seen": 318570496
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004562888665997994,
      "loss": 1.6021,
      "theoretical_loss": 4.145811196647544,
      "tokens_seen": 318636032
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004562788365095286,
      "loss": 1.8418,
      "theoretical_loss": 4.145712820899098,
      "tokens_seen": 318701568
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004562688064192578,
      "loss": 1.5584,
      "theoretical_loss": 4.145614471040923,
      "tokens_seen": 318767104
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000456258776328987,
      "loss": 1.7713,
      "theoretical_loss": 4.145516147060884,
      "tokens_seen": 318832640
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045624874623871614,
      "loss": 1.6027,
      "theoretical_loss": 4.145417848946857,
      "tokens_seen": 318898176
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004562387161484454,
      "loss": 1.5799,
      "theoretical_loss": 4.145319576686721,
      "tokens_seen": 318963712
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004562286860581745,
      "loss": 1.656,
      "theoretical_loss": 4.1452213302683685,
      "tokens_seen": 319029248
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045621865596790374,
      "loss": 1.6123,
      "theoretical_loss": 4.145123109679696,
      "tokens_seen": 319094784
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004562086258776329,
      "loss": 1.7639,
      "theoretical_loss": 4.1450249149086105,
      "tokens_seen": 319160320
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004561985957873621,
      "loss": 1.6646,
      "theoretical_loss": 4.144926745943026,
      "tokens_seen": 319225856
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004561885656970913,
      "loss": 1.6014,
      "theoretical_loss": 4.1448286027708665,
      "tokens_seen": 319291392
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004561785356068205,
      "loss": 1.6868,
      "theoretical_loss": 4.144730485380062,
      "tokens_seen": 319356928
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045616850551654964,
      "loss": 1.7493,
      "theoretical_loss": 4.144632393758551,
      "tokens_seen": 319422464
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004561584754262789,
      "loss": 1.5998,
      "theoretical_loss": 4.144534327894281,
      "tokens_seen": 319488000
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000456148445336008,
      "loss": 1.6253,
      "theoretical_loss": 4.144436287775206,
      "tokens_seen": 319553536
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045613841524573724,
      "loss": 1.7296,
      "theoretical_loss": 4.144338273389291,
      "tokens_seen": 319619072
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004561283851554664,
      "loss": 1.7918,
      "theoretical_loss": 4.144240284724505,
      "tokens_seen": 319684608
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004561183550651956,
      "loss": 1.6379,
      "theoretical_loss": 4.144142321768831,
      "tokens_seen": 319750144
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004561083249749248,
      "loss": 1.7339,
      "theoretical_loss": 4.144044384510253,
      "tokens_seen": 319815680
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045609829488465396,
      "loss": 1.736,
      "theoretical_loss": 4.1439464729367685,
      "tokens_seen": 319881216
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045608826479438314,
      "loss": 1.6261,
      "theoretical_loss": 4.14384858703638,
      "tokens_seen": 319946752
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004560782347041124,
      "loss": 1.6971,
      "theoretical_loss": 4.1437507267971,
      "tokens_seen": 320012288
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004560682046138415,
      "loss": 1.7757,
      "theoretical_loss": 4.143652892206948,
      "tokens_seen": 320077824
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045605817452357074,
      "loss": 1.7261,
      "theoretical_loss": 4.1435550832539505,
      "tokens_seen": 320143360
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045604814443329987,
      "loss": 1.6148,
      "theoretical_loss": 4.143457299926146,
      "tokens_seen": 320208896
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004560381143430291,
      "loss": 1.6777,
      "theoretical_loss": 4.143359542211576,
      "tokens_seen": 320274432
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004560280842527583,
      "loss": 1.9022,
      "theoretical_loss": 4.143261810098293,
      "tokens_seen": 320339968
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045601805416248747,
      "loss": 1.7293,
      "theoretical_loss": 4.1431641035743585,
      "tokens_seen": 320405504
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045600802407221665,
      "loss": 1.7025,
      "theoretical_loss": 4.143066422627838,
      "tokens_seen": 320471040
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004559979939819459,
      "loss": 1.6262,
      "theoretical_loss": 4.142968767246808,
      "tokens_seen": 320536576
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000455987963891675,
      "loss": 1.6425,
      "theoretical_loss": 4.142871137419354,
      "tokens_seen": 320602112
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045597793380140425,
      "loss": 1.7298,
      "theoretical_loss": 4.142773533133565,
      "tokens_seen": 320667648
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045596790371113337,
      "loss": 1.747,
      "theoretical_loss": 4.142675954377543,
      "tokens_seen": 320733184
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004559578736208626,
      "loss": 1.708,
      "theoretical_loss": 4.142578401139396,
      "tokens_seen": 320798720
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004559478435305918,
      "loss": 1.6909,
      "theoretical_loss": 4.142480873407239,
      "tokens_seen": 320864256
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045593781344032097,
      "loss": 1.7536,
      "theoretical_loss": 4.1423833711691955,
      "tokens_seen": 320929792
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045592778335005015,
      "loss": 1.6514,
      "theoretical_loss": 4.142285894413398,
      "tokens_seen": 320995328
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045591775325977933,
      "loss": 1.7027,
      "theoretical_loss": 4.142188443127985,
      "tokens_seen": 321060864
    },
    {
      "epoch": 0.1,
      "objective/train/docs_used": 112831,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.6136972904205322,
      "objective/train/theoretical_loss": 4.142091017301105,
      "objective/train/tokens_used": 341586400,
      "theoretical_loss": 4.142091017301105,
      "tokens_seen": 321126400
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004559077231695085,
      "loss": 1.6137,
      "theoretical_loss": 4.142091017301105,
      "tokens_seen": 321126400
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045589769307923775,
      "loss": 1.6265,
      "theoretical_loss": 4.141993616920914,
      "tokens_seen": 321191936
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004558876629889669,
      "loss": 1.6282,
      "theoretical_loss": 4.141896241975575,
      "tokens_seen": 321257472
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004558776328986961,
      "loss": 1.7189,
      "theoretical_loss": 4.141798892453259,
      "tokens_seen": 321323008
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045586760280842524,
      "loss": 1.6513,
      "theoretical_loss": 4.141701568342145,
      "tokens_seen": 321388544
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004558575727181545,
      "loss": 1.7497,
      "theoretical_loss": 4.141604269630422,
      "tokens_seen": 321454080
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045584754262788365,
      "loss": 1.685,
      "theoretical_loss": 4.1415069963062825,
      "tokens_seen": 321519616
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045583751253761284,
      "loss": 1.6414,
      "theoretical_loss": 4.1414097483579315,
      "tokens_seen": 321585152
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000455827482447342,
      "loss": 1.6973,
      "theoretical_loss": 4.1413125257735794,
      "tokens_seen": 321650688
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045581745235707125,
      "loss": 1.7371,
      "theoretical_loss": 4.141215328541445,
      "tokens_seen": 321716224
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004558074222668004,
      "loss": 1.7546,
      "theoretical_loss": 4.141118156649753,
      "tokens_seen": 321781760
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004557973921765296,
      "loss": 1.6402,
      "theoretical_loss": 4.1410210100867415,
      "tokens_seen": 321847296
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045578736208625874,
      "loss": 1.5882,
      "theoretical_loss": 4.14092388884065,
      "tokens_seen": 321912832
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000455777331995988,
      "loss": 1.5846,
      "theoretical_loss": 4.1408267928997295,
      "tokens_seen": 321978368
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045576730190571716,
      "loss": 1.7344,
      "theoretical_loss": 4.140729722252239,
      "tokens_seen": 322043904
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045575727181544634,
      "loss": 1.624,
      "theoretical_loss": 4.140632676886442,
      "tokens_seen": 322109440
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004557472417251755,
      "loss": 1.6798,
      "theoretical_loss": 4.140535656790615,
      "tokens_seen": 322174976
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004557372116349047,
      "loss": 1.6721,
      "theoretical_loss": 4.140438661953038,
      "tokens_seen": 322240512
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004557271815446339,
      "loss": 1.5873,
      "theoretical_loss": 4.140341692362,
      "tokens_seen": 322306048
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004557171514543631,
      "loss": 1.7285,
      "theoretical_loss": 4.140244748005799,
      "tokens_seen": 322371584
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045570712136409224,
      "loss": 1.6083,
      "theoretical_loss": 4.14014782887274,
      "tokens_seen": 322437120
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004556970912738215,
      "loss": 1.598,
      "theoretical_loss": 4.140050934951135,
      "tokens_seen": 322502656
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004556870611835507,
      "loss": 1.8373,
      "theoretical_loss": 4.139954066229304,
      "tokens_seen": 322568192
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045567703109327984,
      "loss": 1.6567,
      "theoretical_loss": 4.139857222695578,
      "tokens_seen": 322633728
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004556670010030091,
      "loss": 1.8065,
      "theoretical_loss": 4.139760404338291,
      "tokens_seen": 322699264
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004556569709127382,
      "loss": 1.6896,
      "theoretical_loss": 4.139663611145786,
      "tokens_seen": 322764800
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045564694082246744,
      "loss": 1.7044,
      "theoretical_loss": 4.139566843106417,
      "tokens_seen": 322830336
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004556369107321966,
      "loss": 1.6145,
      "theoretical_loss": 4.139470100208542,
      "tokens_seen": 322895872
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004556268806419258,
      "loss": 1.7517,
      "theoretical_loss": 4.139373382440528,
      "tokens_seen": 322961408
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000455616850551655,
      "loss": 1.7563,
      "theoretical_loss": 4.1392766897907505,
      "tokens_seen": 323026944
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045560682046138416,
      "loss": 1.6524,
      "theoretical_loss": 4.139180022247592,
      "tokens_seen": 323092480
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045559679037111334,
      "loss": 1.7858,
      "theoretical_loss": 4.139083379799443,
      "tokens_seen": 323158016
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004555867602808426,
      "loss": 1.7087,
      "theoretical_loss": 4.1389867624347,
      "tokens_seen": 323223552
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004555767301905717,
      "loss": 1.5961,
      "theoretical_loss": 4.138890170141771,
      "tokens_seen": 323289088
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045556670010030094,
      "loss": 1.6283,
      "theoretical_loss": 4.138793602909068,
      "tokens_seen": 323354624
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045555667001003007,
      "loss": 1.6265,
      "theoretical_loss": 4.138697060725013,
      "tokens_seen": 323420160
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004555466399197593,
      "loss": 1.6871,
      "theoretical_loss": 4.138600543578034,
      "tokens_seen": 323485696
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004555366098294885,
      "loss": 1.6606,
      "theoretical_loss": 4.138504051456568,
      "tokens_seen": 323551232
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045552657973921767,
      "loss": 1.6011,
      "theoretical_loss": 4.13840758434906,
      "tokens_seen": 323616768
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045551654964894685,
      "loss": 1.7883,
      "theoretical_loss": 4.1383111422439605,
      "tokens_seen": 323682304
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004555065195586761,
      "loss": 1.6156,
      "theoretical_loss": 4.13821472512973,
      "tokens_seen": 323747840
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004554964894684052,
      "loss": 1.6301,
      "theoretical_loss": 4.138118332994837,
      "tokens_seen": 323813376
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045548645937813445,
      "loss": 1.7174,
      "theoretical_loss": 4.138021965827753,
      "tokens_seen": 323878912
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045547642928786357,
      "loss": 1.6812,
      "theoretical_loss": 4.1379256236169635,
      "tokens_seen": 323944448
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004554663991975928,
      "loss": 1.5789,
      "theoretical_loss": 4.137829306350957,
      "tokens_seen": 324009984
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.000455456369107322,
      "loss": 1.7654,
      "theoretical_loss": 4.137733014018233,
      "tokens_seen": 324075520
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045544633901705117,
      "loss": 1.7182,
      "theoretical_loss": 4.137636746607295,
      "tokens_seen": 324141056
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045543630892678035,
      "loss": 1.613,
      "theoretical_loss": 4.137540504106657,
      "tokens_seen": 324206592
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045542627883650953,
      "loss": 1.6924,
      "theoretical_loss": 4.137444286504841,
      "tokens_seen": 324272128
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004554162487462387,
      "loss": 1.5764,
      "theoretical_loss": 4.137348093790372,
      "tokens_seen": 324337664
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045540621865596795,
      "loss": 1.7428,
      "theoretical_loss": 4.13725192595179,
      "tokens_seen": 324403200
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004553961885656971,
      "loss": 1.6382,
      "theoretical_loss": 4.1371557829776355,
      "tokens_seen": 324468736
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004553861584754263,
      "loss": 1.4825,
      "theoretical_loss": 4.13705966485646,
      "tokens_seen": 324534272
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045537612838515544,
      "loss": 1.5464,
      "theoretical_loss": 4.136963571576825,
      "tokens_seen": 324599808
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004553660982948847,
      "loss": 1.6649,
      "theoretical_loss": 4.136867503127292,
      "tokens_seen": 324665344
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045535606820461385,
      "loss": 1.7553,
      "theoretical_loss": 4.136771459496439,
      "tokens_seen": 324730880
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045534603811434304,
      "loss": 1.7891,
      "theoretical_loss": 4.136675440672844,
      "tokens_seen": 324796416
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004553360080240722,
      "loss": 1.6685,
      "theoretical_loss": 4.136579446645098,
      "tokens_seen": 324861952
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045532597793380145,
      "loss": 1.7086,
      "theoretical_loss": 4.136483477401798,
      "tokens_seen": 324927488
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004553159478435306,
      "loss": 1.6364,
      "theoretical_loss": 4.136387532931546,
      "tokens_seen": 324993024
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004553059177532598,
      "loss": 1.631,
      "theoretical_loss": 4.136291613222955,
      "tokens_seen": 325058560
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045529588766298894,
      "loss": 1.5353,
      "theoretical_loss": 4.136195718264644,
      "tokens_seen": 325124096
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004552858575727182,
      "loss": 1.5773,
      "theoretical_loss": 4.136099848045239,
      "tokens_seen": 325189632
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045527582748244736,
      "loss": 1.6333,
      "theoretical_loss": 4.136004002553375,
      "tokens_seen": 325255168
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045526579739217654,
      "loss": 1.5992,
      "theoretical_loss": 4.135908181777693,
      "tokens_seen": 325320704
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004552557673019057,
      "loss": 1.5994,
      "theoretical_loss": 4.135812385706842,
      "tokens_seen": 325386240
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004552457372116349,
      "loss": 1.707,
      "theoretical_loss": 4.135716614329479,
      "tokens_seen": 325451776
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004552357071213641,
      "loss": 1.576,
      "theoretical_loss": 4.135620867634269,
      "tokens_seen": 325517312
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004552256770310933,
      "loss": 1.5049,
      "theoretical_loss": 4.135525145609881,
      "tokens_seen": 325582848
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045521564694082244,
      "loss": 1.535,
      "theoretical_loss": 4.135429448244997,
      "tokens_seen": 325648384
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004552056168505517,
      "loss": 1.702,
      "theoretical_loss": 4.135333775528302,
      "tokens_seen": 325713920
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004551955867602808,
      "loss": 1.6278,
      "theoretical_loss": 4.13523812744849,
      "tokens_seen": 325779456
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045518555667001004,
      "loss": 1.5958,
      "theoretical_loss": 4.135142503994263,
      "tokens_seen": 325844992
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004551755265797392,
      "loss": 1.6027,
      "theoretical_loss": 4.13504690515433,
      "tokens_seen": 325910528
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004551654964894684,
      "loss": 1.6422,
      "theoretical_loss": 4.134951330917408,
      "tokens_seen": 325976064
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004551554663991976,
      "loss": 1.6013,
      "theoretical_loss": 4.134855781272218,
      "tokens_seen": 326041600
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004551454363089268,
      "loss": 1.5537,
      "theoretical_loss": 4.134760256207495,
      "tokens_seen": 326107136
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045513540621865595,
      "loss": 1.4357,
      "theoretical_loss": 4.1346647557119764,
      "tokens_seen": 326172672
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004551253761283852,
      "loss": 1.6031,
      "theoretical_loss": 4.134569279774407,
      "tokens_seen": 326238208
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004551153460381143,
      "loss": 1.6934,
      "theoretical_loss": 4.134473828383541,
      "tokens_seen": 326303744
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045510531594784354,
      "loss": 1.6819,
      "theoretical_loss": 4.13437840152814,
      "tokens_seen": 326369280
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004550952858575727,
      "loss": 1.709,
      "theoretical_loss": 4.134282999196973,
      "tokens_seen": 326434816
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004550852557673019,
      "loss": 1.6249,
      "theoretical_loss": 4.134187621378813,
      "tokens_seen": 326500352
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004550752256770311,
      "loss": 1.6254,
      "theoretical_loss": 4.134092268062446,
      "tokens_seen": 326565888
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045506519558676027,
      "loss": 1.5942,
      "theoretical_loss": 4.133996939236661,
      "tokens_seen": 326631424
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045505516549648945,
      "loss": 1.5319,
      "theoretical_loss": 4.133901634890256,
      "tokens_seen": 326696960
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004550451354062187,
      "loss": 1.6054,
      "theoretical_loss": 4.1338063550120365,
      "tokens_seen": 326762496
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004550351053159478,
      "loss": 1.561,
      "theoretical_loss": 4.133711099590815,
      "tokens_seen": 326828032
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045502507522567705,
      "loss": 1.5195,
      "theoretical_loss": 4.133615868615411,
      "tokens_seen": 326893568
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045501504513540623,
      "loss": 1.5591,
      "theoretical_loss": 4.133520662074654,
      "tokens_seen": 326959104
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004550050150451354,
      "loss": 1.7241,
      "theoretical_loss": 4.133425479957375,
      "tokens_seen": 327024640
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004549949849548646,
      "loss": 1.5567,
      "theoretical_loss": 4.133330322252419,
      "tokens_seen": 327090176
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045498495486459377,
      "loss": 1.5983,
      "theoretical_loss": 4.1332351889486345,
      "tokens_seen": 327155712
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045497492477432295,
      "loss": 1.5642,
      "theoretical_loss": 4.133140080034878,
      "tokens_seen": 327221248
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004549648946840522,
      "loss": 1.6706,
      "theoretical_loss": 4.133044995500013,
      "tokens_seen": 327286784
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045495486459378137,
      "loss": 1.5418,
      "theoretical_loss": 4.1329499353329116,
      "tokens_seen": 327352320
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045494483450351055,
      "loss": 1.718,
      "theoretical_loss": 4.132854899522453,
      "tokens_seen": 327417856
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045493480441323973,
      "loss": 1.5433,
      "theoretical_loss": 4.132759888057521,
      "tokens_seen": 327483392
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004549247743229689,
      "loss": 1.5227,
      "theoretical_loss": 4.13266490092701,
      "tokens_seen": 327548928
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.00045491474423269815,
      "loss": 1.5423,
      "theoretical_loss": 4.132569938119821,
      "tokens_seen": 327614464
    },
    {
      "epoch": 0.1,
      "objective/train/docs_used": 114982,
      "objective/train/instantaneous_batch_size": 64,
      "objective/train/instantaneous_microbatch_size": 65536,
      "objective/train/original_loss": 1.5542881488800049,
      "objective/train/theoretical_loss": 4.132474999624861,
      "objective/train/tokens_used": 348140000,
      "theoretical_loss": 4.132474999624861,
      "tokens_seen": 327680000
    },
    {
      "epoch": 0.1,
      "learning_rate": 0.0004549047141424273,
      "loss": 1.5543,
      "theoretical_loss": 4.132474999624861,
      "tokens_seen": 327680000
    }
  ],
  "max_steps": 50354,
  "num_train_epochs": 9223372036854775807,
  "total_flos": 1.6722690048e+17,
  "trial_name": null,
  "trial_params": null
}