relation_t5_small / trainer_state.json
Jiexing's picture
commit from Jiexing
a3c1180
Raw
History Blame
329 kB
{
"best_metric": 0.5174081237911026,
"best_model_checkpoint": "./experiment/train_0308_t5_small_db_content_26001_weight_decay_00001_ls_00_lr_constant_bs_2064/checkpoint-8192",
"epoch": 2730.5890410958905,
"global_step": 8192,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.29,
"learning_rate": 0.0001,
"loss": 4.4465,
"step": 1
},
{
"epoch": 0.88,
"learning_rate": 0.0001,
"loss": 4.1272,
"step": 3
},
{
"epoch": 1.88,
"learning_rate": 0.0001,
"loss": 4.0649,
"step": 6
},
{
"epoch": 2.88,
"learning_rate": 0.0001,
"loss": 3.5316,
"step": 9
},
{
"epoch": 3.88,
"learning_rate": 0.0001,
"loss": 3.1042,
"step": 12
},
{
"epoch": 4.88,
"learning_rate": 0.0001,
"loss": 2.733,
"step": 15
},
{
"epoch": 5.88,
"learning_rate": 0.0001,
"loss": 2.4421,
"step": 18
},
{
"epoch": 6.88,
"learning_rate": 0.0001,
"loss": 2.1818,
"step": 21
},
{
"epoch": 7.88,
"learning_rate": 0.0001,
"loss": 1.9857,
"step": 24
},
{
"epoch": 8.88,
"learning_rate": 0.0001,
"loss": 1.8413,
"step": 27
},
{
"epoch": 9.88,
"learning_rate": 0.0001,
"loss": 1.686,
"step": 30
},
{
"epoch": 10.88,
"learning_rate": 0.0001,
"loss": 1.5623,
"step": 33
},
{
"epoch": 11.88,
"learning_rate": 0.0001,
"loss": 1.4631,
"step": 36
},
{
"epoch": 12.88,
"learning_rate": 0.0001,
"loss": 1.3776,
"step": 39
},
{
"epoch": 13.88,
"learning_rate": 0.0001,
"loss": 1.3096,
"step": 42
},
{
"epoch": 14.88,
"learning_rate": 0.0001,
"loss": 1.2347,
"step": 45
},
{
"epoch": 15.88,
"learning_rate": 0.0001,
"loss": 1.1792,
"step": 48
},
{
"epoch": 16.88,
"learning_rate": 0.0001,
"loss": 1.1255,
"step": 51
},
{
"epoch": 17.88,
"learning_rate": 0.0001,
"loss": 1.0843,
"step": 54
},
{
"epoch": 18.88,
"learning_rate": 0.0001,
"loss": 1.0435,
"step": 57
},
{
"epoch": 19.88,
"learning_rate": 0.0001,
"loss": 1.0021,
"step": 60
},
{
"epoch": 20.88,
"learning_rate": 0.0001,
"loss": 0.971,
"step": 63
},
{
"epoch": 21.29,
"eval_exact_match": 0.04061895551257253,
"eval_exec": 0.043520309477756286,
"eval_loss": 0.6706878542900085,
"eval_runtime": 693.5751,
"eval_samples_per_second": 1.491,
"step": 64
},
{
"epoch": 21.88,
"learning_rate": 0.0001,
"loss": 0.9412,
"step": 66
},
{
"epoch": 22.88,
"learning_rate": 0.0001,
"loss": 0.9117,
"step": 69
},
{
"epoch": 23.88,
"learning_rate": 0.0001,
"loss": 0.8753,
"step": 72
},
{
"epoch": 24.88,
"learning_rate": 0.0001,
"loss": 0.8514,
"step": 75
},
{
"epoch": 25.88,
"learning_rate": 0.0001,
"loss": 0.8317,
"step": 78
},
{
"epoch": 26.88,
"learning_rate": 0.0001,
"loss": 0.8019,
"step": 81
},
{
"epoch": 27.88,
"learning_rate": 0.0001,
"loss": 0.7857,
"step": 84
},
{
"epoch": 28.88,
"learning_rate": 0.0001,
"loss": 0.7623,
"step": 87
},
{
"epoch": 29.88,
"learning_rate": 0.0001,
"loss": 0.7418,
"step": 90
},
{
"epoch": 30.88,
"learning_rate": 0.0001,
"loss": 0.7291,
"step": 93
},
{
"epoch": 31.88,
"learning_rate": 0.0001,
"loss": 0.7086,
"step": 96
},
{
"epoch": 32.88,
"learning_rate": 0.0001,
"loss": 0.6875,
"step": 99
},
{
"epoch": 33.88,
"learning_rate": 0.0001,
"loss": 0.6781,
"step": 102
},
{
"epoch": 34.88,
"learning_rate": 0.0001,
"loss": 0.6609,
"step": 105
},
{
"epoch": 35.88,
"learning_rate": 0.0001,
"loss": 0.6443,
"step": 108
},
{
"epoch": 36.88,
"learning_rate": 0.0001,
"loss": 0.6356,
"step": 111
},
{
"epoch": 37.88,
"learning_rate": 0.0001,
"loss": 0.6093,
"step": 114
},
{
"epoch": 38.88,
"learning_rate": 0.0001,
"loss": 0.6128,
"step": 117
},
{
"epoch": 39.88,
"learning_rate": 0.0001,
"loss": 0.5916,
"step": 120
},
{
"epoch": 40.88,
"learning_rate": 0.0001,
"loss": 0.5842,
"step": 123
},
{
"epoch": 41.88,
"learning_rate": 0.0001,
"loss": 0.5757,
"step": 126
},
{
"epoch": 42.59,
"eval_exact_match": 0.21179883945841393,
"eval_exec": 0.2205029013539652,
"eval_loss": 0.45285192131996155,
"eval_runtime": 131.42,
"eval_samples_per_second": 7.868,
"step": 128
},
{
"epoch": 42.88,
"learning_rate": 0.0001,
"loss": 0.5613,
"step": 129
},
{
"epoch": 43.88,
"learning_rate": 0.0001,
"loss": 0.5474,
"step": 132
},
{
"epoch": 44.88,
"learning_rate": 0.0001,
"loss": 0.5398,
"step": 135
},
{
"epoch": 45.88,
"learning_rate": 0.0001,
"loss": 0.5321,
"step": 138
},
{
"epoch": 46.88,
"learning_rate": 0.0001,
"loss": 0.5247,
"step": 141
},
{
"epoch": 47.88,
"learning_rate": 0.0001,
"loss": 0.5135,
"step": 144
},
{
"epoch": 48.88,
"learning_rate": 0.0001,
"loss": 0.5065,
"step": 147
},
{
"epoch": 49.88,
"learning_rate": 0.0001,
"loss": 0.4933,
"step": 150
},
{
"epoch": 50.88,
"learning_rate": 0.0001,
"loss": 0.4881,
"step": 153
},
{
"epoch": 51.88,
"learning_rate": 0.0001,
"loss": 0.4831,
"step": 156
},
{
"epoch": 52.88,
"learning_rate": 0.0001,
"loss": 0.4778,
"step": 159
},
{
"epoch": 53.88,
"learning_rate": 0.0001,
"loss": 0.4641,
"step": 162
},
{
"epoch": 54.88,
"learning_rate": 0.0001,
"loss": 0.4581,
"step": 165
},
{
"epoch": 55.88,
"learning_rate": 0.0001,
"loss": 0.4536,
"step": 168
},
{
"epoch": 56.88,
"learning_rate": 0.0001,
"loss": 0.4472,
"step": 171
},
{
"epoch": 57.88,
"learning_rate": 0.0001,
"loss": 0.4394,
"step": 174
},
{
"epoch": 58.88,
"learning_rate": 0.0001,
"loss": 0.4311,
"step": 177
},
{
"epoch": 59.88,
"learning_rate": 0.0001,
"loss": 0.4283,
"step": 180
},
{
"epoch": 60.88,
"learning_rate": 0.0001,
"loss": 0.4192,
"step": 183
},
{
"epoch": 61.88,
"learning_rate": 0.0001,
"loss": 0.4132,
"step": 186
},
{
"epoch": 62.88,
"learning_rate": 0.0001,
"loss": 0.4106,
"step": 189
},
{
"epoch": 63.88,
"learning_rate": 0.0001,
"loss": 0.4049,
"step": 192
},
{
"epoch": 63.88,
"eval_exact_match": 0.28820116054158607,
"eval_exec": 0.3056092843326886,
"eval_loss": 0.37886810302734375,
"eval_runtime": 134.3287,
"eval_samples_per_second": 7.698,
"step": 192
},
{
"epoch": 64.88,
"learning_rate": 0.0001,
"loss": 0.3949,
"step": 195
},
{
"epoch": 65.88,
"learning_rate": 0.0001,
"loss": 0.3943,
"step": 198
},
{
"epoch": 66.88,
"learning_rate": 0.0001,
"loss": 0.3912,
"step": 201
},
{
"epoch": 67.88,
"learning_rate": 0.0001,
"loss": 0.3833,
"step": 204
},
{
"epoch": 68.88,
"learning_rate": 0.0001,
"loss": 0.3804,
"step": 207
},
{
"epoch": 69.88,
"learning_rate": 0.0001,
"loss": 0.3694,
"step": 210
},
{
"epoch": 70.88,
"learning_rate": 0.0001,
"loss": 0.3723,
"step": 213
},
{
"epoch": 71.88,
"learning_rate": 0.0001,
"loss": 0.3637,
"step": 216
},
{
"epoch": 72.88,
"learning_rate": 0.0001,
"loss": 0.3622,
"step": 219
},
{
"epoch": 73.88,
"learning_rate": 0.0001,
"loss": 0.3541,
"step": 222
},
{
"epoch": 74.88,
"learning_rate": 0.0001,
"loss": 0.3519,
"step": 225
},
{
"epoch": 75.88,
"learning_rate": 0.0001,
"loss": 0.346,
"step": 228
},
{
"epoch": 76.88,
"learning_rate": 0.0001,
"loss": 0.3441,
"step": 231
},
{
"epoch": 77.88,
"learning_rate": 0.0001,
"loss": 0.339,
"step": 234
},
{
"epoch": 78.88,
"learning_rate": 0.0001,
"loss": 0.3334,
"step": 237
},
{
"epoch": 79.88,
"learning_rate": 0.0001,
"loss": 0.3317,
"step": 240
},
{
"epoch": 80.88,
"learning_rate": 0.0001,
"loss": 0.3247,
"step": 243
},
{
"epoch": 81.88,
"learning_rate": 0.0001,
"loss": 0.3225,
"step": 246
},
{
"epoch": 82.88,
"learning_rate": 0.0001,
"loss": 0.3173,
"step": 249
},
{
"epoch": 83.88,
"learning_rate": 0.0001,
"loss": 0.3148,
"step": 252
},
{
"epoch": 84.88,
"learning_rate": 0.0001,
"loss": 0.3123,
"step": 255
},
{
"epoch": 85.29,
"eval_exact_match": 0.3288201160541586,
"eval_exec": 0.3471953578336557,
"eval_loss": 0.3469275236129761,
"eval_runtime": 135.0596,
"eval_samples_per_second": 7.656,
"step": 256
},
{
"epoch": 85.88,
"learning_rate": 0.0001,
"loss": 0.3067,
"step": 258
},
{
"epoch": 86.88,
"learning_rate": 0.0001,
"loss": 0.3062,
"step": 261
},
{
"epoch": 87.88,
"learning_rate": 0.0001,
"loss": 0.3044,
"step": 264
},
{
"epoch": 88.88,
"learning_rate": 0.0001,
"loss": 0.2976,
"step": 267
},
{
"epoch": 89.88,
"learning_rate": 0.0001,
"loss": 0.2978,
"step": 270
},
{
"epoch": 90.88,
"learning_rate": 0.0001,
"loss": 0.292,
"step": 273
},
{
"epoch": 91.88,
"learning_rate": 0.0001,
"loss": 0.29,
"step": 276
},
{
"epoch": 92.88,
"learning_rate": 0.0001,
"loss": 0.2863,
"step": 279
},
{
"epoch": 93.88,
"learning_rate": 0.0001,
"loss": 0.2832,
"step": 282
},
{
"epoch": 94.88,
"learning_rate": 0.0001,
"loss": 0.2787,
"step": 285
},
{
"epoch": 95.88,
"learning_rate": 0.0001,
"loss": 0.2751,
"step": 288
},
{
"epoch": 96.88,
"learning_rate": 0.0001,
"loss": 0.2741,
"step": 291
},
{
"epoch": 97.88,
"learning_rate": 0.0001,
"loss": 0.2724,
"step": 294
},
{
"epoch": 98.88,
"learning_rate": 0.0001,
"loss": 0.2677,
"step": 297
},
{
"epoch": 99.88,
"learning_rate": 0.0001,
"loss": 0.2673,
"step": 300
},
{
"epoch": 100.88,
"learning_rate": 0.0001,
"loss": 0.2619,
"step": 303
},
{
"epoch": 101.88,
"learning_rate": 0.0001,
"loss": 0.2584,
"step": 306
},
{
"epoch": 102.88,
"learning_rate": 0.0001,
"loss": 0.2575,
"step": 309
},
{
"epoch": 103.88,
"learning_rate": 0.0001,
"loss": 0.2525,
"step": 312
},
{
"epoch": 104.88,
"learning_rate": 0.0001,
"loss": 0.2535,
"step": 315
},
{
"epoch": 105.88,
"learning_rate": 0.0001,
"loss": 0.2479,
"step": 318
},
{
"epoch": 106.59,
"eval_exact_match": 0.35880077369439073,
"eval_exec": 0.3820116054158607,
"eval_loss": 0.33587977290153503,
"eval_runtime": 103.6076,
"eval_samples_per_second": 9.98,
"step": 320
},
{
"epoch": 106.88,
"learning_rate": 0.0001,
"loss": 0.2464,
"step": 321
},
{
"epoch": 107.88,
"learning_rate": 0.0001,
"loss": 0.2455,
"step": 324
},
{
"epoch": 108.88,
"learning_rate": 0.0001,
"loss": 0.2403,
"step": 327
},
{
"epoch": 109.88,
"learning_rate": 0.0001,
"loss": 0.242,
"step": 330
},
{
"epoch": 110.88,
"learning_rate": 0.0001,
"loss": 0.2381,
"step": 333
},
{
"epoch": 111.88,
"learning_rate": 0.0001,
"loss": 0.2344,
"step": 336
},
{
"epoch": 112.88,
"learning_rate": 0.0001,
"loss": 0.2343,
"step": 339
},
{
"epoch": 113.88,
"learning_rate": 0.0001,
"loss": 0.2328,
"step": 342
},
{
"epoch": 114.88,
"learning_rate": 0.0001,
"loss": 0.2297,
"step": 345
},
{
"epoch": 115.88,
"learning_rate": 0.0001,
"loss": 0.2303,
"step": 348
},
{
"epoch": 116.88,
"learning_rate": 0.0001,
"loss": 0.2247,
"step": 351
},
{
"epoch": 117.88,
"learning_rate": 0.0001,
"loss": 0.2255,
"step": 354
},
{
"epoch": 118.88,
"learning_rate": 0.0001,
"loss": 0.2243,
"step": 357
},
{
"epoch": 119.88,
"learning_rate": 0.0001,
"loss": 0.2215,
"step": 360
},
{
"epoch": 120.88,
"learning_rate": 0.0001,
"loss": 0.2215,
"step": 363
},
{
"epoch": 121.88,
"learning_rate": 0.0001,
"loss": 0.2158,
"step": 366
},
{
"epoch": 122.88,
"learning_rate": 0.0001,
"loss": 0.2168,
"step": 369
},
{
"epoch": 123.88,
"learning_rate": 0.0001,
"loss": 0.2135,
"step": 372
},
{
"epoch": 124.88,
"learning_rate": 0.0001,
"loss": 0.2138,
"step": 375
},
{
"epoch": 125.88,
"learning_rate": 0.0001,
"loss": 0.2113,
"step": 378
},
{
"epoch": 126.88,
"learning_rate": 0.0001,
"loss": 0.2095,
"step": 381
},
{
"epoch": 127.88,
"learning_rate": 0.0001,
"loss": 0.2085,
"step": 384
},
{
"epoch": 127.88,
"eval_exact_match": 0.379110251450677,
"eval_exec": 0.40038684719535783,
"eval_loss": 0.3285636603832245,
"eval_runtime": 143.1024,
"eval_samples_per_second": 7.226,
"step": 384
},
{
"epoch": 128.88,
"learning_rate": 0.0001,
"loss": 0.2072,
"step": 387
},
{
"epoch": 129.88,
"learning_rate": 0.0001,
"loss": 0.2056,
"step": 390
},
{
"epoch": 130.88,
"learning_rate": 0.0001,
"loss": 0.2023,
"step": 393
},
{
"epoch": 131.88,
"learning_rate": 0.0001,
"loss": 0.201,
"step": 396
},
{
"epoch": 132.88,
"learning_rate": 0.0001,
"loss": 0.1982,
"step": 399
},
{
"epoch": 133.88,
"learning_rate": 0.0001,
"loss": 0.1977,
"step": 402
},
{
"epoch": 134.88,
"learning_rate": 0.0001,
"loss": 0.1976,
"step": 405
},
{
"epoch": 135.88,
"learning_rate": 0.0001,
"loss": 0.1946,
"step": 408
},
{
"epoch": 136.88,
"learning_rate": 0.0001,
"loss": 0.1961,
"step": 411
},
{
"epoch": 137.88,
"learning_rate": 0.0001,
"loss": 0.1931,
"step": 414
},
{
"epoch": 138.88,
"learning_rate": 0.0001,
"loss": 0.1913,
"step": 417
},
{
"epoch": 139.88,
"learning_rate": 0.0001,
"loss": 0.1905,
"step": 420
},
{
"epoch": 140.88,
"learning_rate": 0.0001,
"loss": 0.1885,
"step": 423
},
{
"epoch": 141.88,
"learning_rate": 0.0001,
"loss": 0.187,
"step": 426
},
{
"epoch": 142.88,
"learning_rate": 0.0001,
"loss": 0.1846,
"step": 429
},
{
"epoch": 143.88,
"learning_rate": 0.0001,
"loss": 0.1859,
"step": 432
},
{
"epoch": 144.88,
"learning_rate": 0.0001,
"loss": 0.1835,
"step": 435
},
{
"epoch": 145.88,
"learning_rate": 0.0001,
"loss": 0.1811,
"step": 438
},
{
"epoch": 146.88,
"learning_rate": 0.0001,
"loss": 0.1817,
"step": 441
},
{
"epoch": 147.88,
"learning_rate": 0.0001,
"loss": 0.1799,
"step": 444
},
{
"epoch": 148.88,
"learning_rate": 0.0001,
"loss": 0.179,
"step": 447
},
{
"epoch": 149.29,
"eval_exact_match": 0.40618955512572535,
"eval_exec": 0.42263056092843326,
"eval_loss": 0.3326466381549835,
"eval_runtime": 101.2464,
"eval_samples_per_second": 10.213,
"step": 448
},
{
"epoch": 149.88,
"learning_rate": 0.0001,
"loss": 0.1773,
"step": 450
},
{
"epoch": 150.88,
"learning_rate": 0.0001,
"loss": 0.1763,
"step": 453
},
{
"epoch": 151.88,
"learning_rate": 0.0001,
"loss": 0.1766,
"step": 456
},
{
"epoch": 152.88,
"learning_rate": 0.0001,
"loss": 0.1754,
"step": 459
},
{
"epoch": 153.88,
"learning_rate": 0.0001,
"loss": 0.1727,
"step": 462
},
{
"epoch": 154.88,
"learning_rate": 0.0001,
"loss": 0.1698,
"step": 465
},
{
"epoch": 155.88,
"learning_rate": 0.0001,
"loss": 0.1711,
"step": 468
},
{
"epoch": 156.88,
"learning_rate": 0.0001,
"loss": 0.1686,
"step": 471
},
{
"epoch": 157.88,
"learning_rate": 0.0001,
"loss": 0.1684,
"step": 474
},
{
"epoch": 158.88,
"learning_rate": 0.0001,
"loss": 0.1695,
"step": 477
},
{
"epoch": 159.88,
"learning_rate": 0.0001,
"loss": 0.1649,
"step": 480
},
{
"epoch": 160.88,
"learning_rate": 0.0001,
"loss": 0.1644,
"step": 483
},
{
"epoch": 161.88,
"learning_rate": 0.0001,
"loss": 0.1644,
"step": 486
},
{
"epoch": 162.88,
"learning_rate": 0.0001,
"loss": 0.1636,
"step": 489
},
{
"epoch": 163.88,
"learning_rate": 0.0001,
"loss": 0.1611,
"step": 492
},
{
"epoch": 164.88,
"learning_rate": 0.0001,
"loss": 0.1596,
"step": 495
},
{
"epoch": 165.88,
"learning_rate": 0.0001,
"loss": 0.1608,
"step": 498
},
{
"epoch": 166.88,
"learning_rate": 0.0001,
"loss": 0.159,
"step": 501
},
{
"epoch": 167.88,
"learning_rate": 0.0001,
"loss": 0.1583,
"step": 504
},
{
"epoch": 168.88,
"learning_rate": 0.0001,
"loss": 0.1572,
"step": 507
},
{
"epoch": 169.88,
"learning_rate": 0.0001,
"loss": 0.1564,
"step": 510
},
{
"epoch": 170.59,
"eval_exact_match": 0.41779497098646035,
"eval_exec": 0.43036750483558994,
"eval_loss": 0.3266688883304596,
"eval_runtime": 118.2565,
"eval_samples_per_second": 8.744,
"step": 512
},
{
"epoch": 170.88,
"learning_rate": 0.0001,
"loss": 0.1515,
"step": 513
},
{
"epoch": 171.88,
"learning_rate": 0.0001,
"loss": 0.1531,
"step": 516
},
{
"epoch": 172.88,
"learning_rate": 0.0001,
"loss": 0.1527,
"step": 519
},
{
"epoch": 173.88,
"learning_rate": 0.0001,
"loss": 0.1517,
"step": 522
},
{
"epoch": 174.88,
"learning_rate": 0.0001,
"loss": 0.1502,
"step": 525
},
{
"epoch": 175.88,
"learning_rate": 0.0001,
"loss": 0.1483,
"step": 528
},
{
"epoch": 176.88,
"learning_rate": 0.0001,
"loss": 0.1497,
"step": 531
},
{
"epoch": 177.88,
"learning_rate": 0.0001,
"loss": 0.1488,
"step": 534
},
{
"epoch": 178.88,
"learning_rate": 0.0001,
"loss": 0.1447,
"step": 537
},
{
"epoch": 179.88,
"learning_rate": 0.0001,
"loss": 0.1467,
"step": 540
},
{
"epoch": 180.88,
"learning_rate": 0.0001,
"loss": 0.1453,
"step": 543
},
{
"epoch": 181.88,
"learning_rate": 0.0001,
"loss": 0.1444,
"step": 546
},
{
"epoch": 182.88,
"learning_rate": 0.0001,
"loss": 0.1441,
"step": 549
},
{
"epoch": 183.88,
"learning_rate": 0.0001,
"loss": 0.143,
"step": 552
},
{
"epoch": 184.88,
"learning_rate": 0.0001,
"loss": 0.1419,
"step": 555
},
{
"epoch": 185.88,
"learning_rate": 0.0001,
"loss": 0.1413,
"step": 558
},
{
"epoch": 186.88,
"learning_rate": 0.0001,
"loss": 0.1405,
"step": 561
},
{
"epoch": 187.88,
"learning_rate": 0.0001,
"loss": 0.1389,
"step": 564
},
{
"epoch": 188.88,
"learning_rate": 0.0001,
"loss": 0.1382,
"step": 567
},
{
"epoch": 189.88,
"learning_rate": 0.0001,
"loss": 0.1364,
"step": 570
},
{
"epoch": 190.88,
"learning_rate": 0.0001,
"loss": 0.1361,
"step": 573
},
{
"epoch": 191.88,
"learning_rate": 0.0001,
"loss": 0.1371,
"step": 576
},
{
"epoch": 191.88,
"eval_exact_match": 0.41102514506769827,
"eval_exec": 0.42359767891682787,
"eval_loss": 0.33160606026649475,
"eval_runtime": 124.8766,
"eval_samples_per_second": 8.28,
"step": 576
},
{
"epoch": 192.88,
"learning_rate": 0.0001,
"loss": 0.1353,
"step": 579
},
{
"epoch": 193.88,
"learning_rate": 0.0001,
"loss": 0.1336,
"step": 582
},
{
"epoch": 194.88,
"learning_rate": 0.0001,
"loss": 0.1336,
"step": 585
},
{
"epoch": 195.88,
"learning_rate": 0.0001,
"loss": 0.1335,
"step": 588
},
{
"epoch": 196.88,
"learning_rate": 0.0001,
"loss": 0.1332,
"step": 591
},
{
"epoch": 197.88,
"learning_rate": 0.0001,
"loss": 0.1312,
"step": 594
},
{
"epoch": 198.88,
"learning_rate": 0.0001,
"loss": 0.13,
"step": 597
},
{
"epoch": 199.88,
"learning_rate": 0.0001,
"loss": 0.1278,
"step": 600
},
{
"epoch": 200.88,
"learning_rate": 0.0001,
"loss": 0.1314,
"step": 603
},
{
"epoch": 201.88,
"learning_rate": 0.0001,
"loss": 0.1273,
"step": 606
},
{
"epoch": 202.88,
"learning_rate": 0.0001,
"loss": 0.1258,
"step": 609
},
{
"epoch": 203.88,
"learning_rate": 0.0001,
"loss": 0.1264,
"step": 612
},
{
"epoch": 204.88,
"learning_rate": 0.0001,
"loss": 0.1256,
"step": 615
},
{
"epoch": 205.88,
"learning_rate": 0.0001,
"loss": 0.125,
"step": 618
},
{
"epoch": 206.88,
"learning_rate": 0.0001,
"loss": 0.1235,
"step": 621
},
{
"epoch": 207.88,
"learning_rate": 0.0001,
"loss": 0.124,
"step": 624
},
{
"epoch": 208.88,
"learning_rate": 0.0001,
"loss": 0.1236,
"step": 627
},
{
"epoch": 209.88,
"learning_rate": 0.0001,
"loss": 0.1224,
"step": 630
},
{
"epoch": 210.88,
"learning_rate": 0.0001,
"loss": 0.1212,
"step": 633
},
{
"epoch": 211.88,
"learning_rate": 0.0001,
"loss": 0.1218,
"step": 636
},
{
"epoch": 212.88,
"learning_rate": 0.0001,
"loss": 0.1204,
"step": 639
},
{
"epoch": 213.29,
"eval_exact_match": 0.42940038684719534,
"eval_exec": 0.4332688588007737,
"eval_loss": 0.33052191138267517,
"eval_runtime": 117.5462,
"eval_samples_per_second": 8.797,
"step": 640
},
{
"epoch": 213.88,
"learning_rate": 0.0001,
"loss": 0.1195,
"step": 642
},
{
"epoch": 214.88,
"learning_rate": 0.0001,
"loss": 0.1181,
"step": 645
},
{
"epoch": 215.88,
"learning_rate": 0.0001,
"loss": 0.1194,
"step": 648
},
{
"epoch": 216.88,
"learning_rate": 0.0001,
"loss": 0.1177,
"step": 651
},
{
"epoch": 217.88,
"learning_rate": 0.0001,
"loss": 0.1172,
"step": 654
},
{
"epoch": 218.88,
"learning_rate": 0.0001,
"loss": 0.1171,
"step": 657
},
{
"epoch": 219.88,
"learning_rate": 0.0001,
"loss": 0.1163,
"step": 660
},
{
"epoch": 220.88,
"learning_rate": 0.0001,
"loss": 0.1146,
"step": 663
},
{
"epoch": 221.88,
"learning_rate": 0.0001,
"loss": 0.116,
"step": 666
},
{
"epoch": 222.88,
"learning_rate": 0.0001,
"loss": 0.1142,
"step": 669
},
{
"epoch": 223.88,
"learning_rate": 0.0001,
"loss": 0.1146,
"step": 672
},
{
"epoch": 224.88,
"learning_rate": 0.0001,
"loss": 0.1111,
"step": 675
},
{
"epoch": 225.88,
"learning_rate": 0.0001,
"loss": 0.1132,
"step": 678
},
{
"epoch": 226.88,
"learning_rate": 0.0001,
"loss": 0.1137,
"step": 681
},
{
"epoch": 227.88,
"learning_rate": 0.0001,
"loss": 0.1102,
"step": 684
},
{
"epoch": 228.88,
"learning_rate": 0.0001,
"loss": 0.1103,
"step": 687
},
{
"epoch": 229.88,
"learning_rate": 0.0001,
"loss": 0.1122,
"step": 690
},
{
"epoch": 230.88,
"learning_rate": 0.0001,
"loss": 0.1091,
"step": 693
},
{
"epoch": 231.88,
"learning_rate": 0.0001,
"loss": 0.1067,
"step": 696
},
{
"epoch": 232.88,
"learning_rate": 0.0001,
"loss": 0.1075,
"step": 699
},
{
"epoch": 233.88,
"learning_rate": 0.0001,
"loss": 0.107,
"step": 702
},
{
"epoch": 234.59,
"eval_exact_match": 0.437137330754352,
"eval_exec": 0.44197292069632493,
"eval_loss": 0.3356037437915802,
"eval_runtime": 105.2625,
"eval_samples_per_second": 9.823,
"step": 704
},
{
"epoch": 234.88,
"learning_rate": 0.0001,
"loss": 0.1088,
"step": 705
},
{
"epoch": 235.88,
"learning_rate": 0.0001,
"loss": 0.1054,
"step": 708
},
{
"epoch": 236.88,
"learning_rate": 0.0001,
"loss": 0.1039,
"step": 711
},
{
"epoch": 237.88,
"learning_rate": 0.0001,
"loss": 0.1053,
"step": 714
},
{
"epoch": 238.88,
"learning_rate": 0.0001,
"loss": 0.1028,
"step": 717
},
{
"epoch": 239.88,
"learning_rate": 0.0001,
"loss": 0.1064,
"step": 720
},
{
"epoch": 240.88,
"learning_rate": 0.0001,
"loss": 0.1031,
"step": 723
},
{
"epoch": 241.88,
"learning_rate": 0.0001,
"loss": 0.1019,
"step": 726
},
{
"epoch": 242.88,
"learning_rate": 0.0001,
"loss": 0.1034,
"step": 729
},
{
"epoch": 243.88,
"learning_rate": 0.0001,
"loss": 0.1021,
"step": 732
},
{
"epoch": 244.88,
"learning_rate": 0.0001,
"loss": 0.1026,
"step": 735
},
{
"epoch": 245.88,
"learning_rate": 0.0001,
"loss": 0.1,
"step": 738
},
{
"epoch": 246.88,
"learning_rate": 0.0001,
"loss": 0.1008,
"step": 741
},
{
"epoch": 247.88,
"learning_rate": 0.0001,
"loss": 0.0999,
"step": 744
},
{
"epoch": 248.88,
"learning_rate": 0.0001,
"loss": 0.1002,
"step": 747
},
{
"epoch": 249.88,
"learning_rate": 0.0001,
"loss": 0.0995,
"step": 750
},
{
"epoch": 250.88,
"learning_rate": 0.0001,
"loss": 0.0961,
"step": 753
},
{
"epoch": 251.88,
"learning_rate": 0.0001,
"loss": 0.0997,
"step": 756
},
{
"epoch": 252.88,
"learning_rate": 0.0001,
"loss": 0.0982,
"step": 759
},
{
"epoch": 253.88,
"learning_rate": 0.0001,
"loss": 0.0975,
"step": 762
},
{
"epoch": 254.88,
"learning_rate": 0.0001,
"loss": 0.0972,
"step": 765
},
{
"epoch": 255.88,
"learning_rate": 0.0001,
"loss": 0.0972,
"step": 768
},
{
"epoch": 255.88,
"eval_exact_match": 0.45454545454545453,
"eval_exec": 0.4564796905222437,
"eval_loss": 0.3354557156562805,
"eval_runtime": 97.9303,
"eval_samples_per_second": 10.559,
"step": 768
},
{
"epoch": 256.88,
"learning_rate": 0.0001,
"loss": 0.0955,
"step": 771
},
{
"epoch": 257.88,
"learning_rate": 0.0001,
"loss": 0.0939,
"step": 774
},
{
"epoch": 258.88,
"learning_rate": 0.0001,
"loss": 0.094,
"step": 777
},
{
"epoch": 259.88,
"learning_rate": 0.0001,
"loss": 0.0947,
"step": 780
},
{
"epoch": 260.88,
"learning_rate": 0.0001,
"loss": 0.0927,
"step": 783
},
{
"epoch": 261.88,
"learning_rate": 0.0001,
"loss": 0.0918,
"step": 786
},
{
"epoch": 262.88,
"learning_rate": 0.0001,
"loss": 0.09,
"step": 789
},
{
"epoch": 263.88,
"learning_rate": 0.0001,
"loss": 0.09,
"step": 792
},
{
"epoch": 264.88,
"learning_rate": 0.0001,
"loss": 0.0915,
"step": 795
},
{
"epoch": 265.88,
"learning_rate": 0.0001,
"loss": 0.0888,
"step": 798
},
{
"epoch": 266.88,
"learning_rate": 0.0001,
"loss": 0.09,
"step": 801
},
{
"epoch": 267.88,
"learning_rate": 0.0001,
"loss": 0.0886,
"step": 804
},
{
"epoch": 268.88,
"learning_rate": 0.0001,
"loss": 0.0913,
"step": 807
},
{
"epoch": 269.88,
"learning_rate": 0.0001,
"loss": 0.0889,
"step": 810
},
{
"epoch": 270.88,
"learning_rate": 0.0001,
"loss": 0.0876,
"step": 813
},
{
"epoch": 271.88,
"learning_rate": 0.0001,
"loss": 0.0869,
"step": 816
},
{
"epoch": 272.88,
"learning_rate": 0.0001,
"loss": 0.0881,
"step": 819
},
{
"epoch": 273.88,
"learning_rate": 0.0001,
"loss": 0.0868,
"step": 822
},
{
"epoch": 274.88,
"learning_rate": 0.0001,
"loss": 0.0842,
"step": 825
},
{
"epoch": 275.88,
"learning_rate": 0.0001,
"loss": 0.0858,
"step": 828
},
{
"epoch": 276.88,
"learning_rate": 0.0001,
"loss": 0.0857,
"step": 831
},
{
"epoch": 277.29,
"eval_exact_match": 0.4274661508704062,
"eval_exec": 0.43036750483558994,
"eval_loss": 0.3401657044887543,
"eval_runtime": 115.2041,
"eval_samples_per_second": 8.975,
"step": 832
},
{
"epoch": 277.88,
"learning_rate": 0.0001,
"loss": 0.0847,
"step": 834
},
{
"epoch": 278.88,
"learning_rate": 0.0001,
"loss": 0.0854,
"step": 837
},
{
"epoch": 279.88,
"learning_rate": 0.0001,
"loss": 0.0852,
"step": 840
},
{
"epoch": 280.88,
"learning_rate": 0.0001,
"loss": 0.0843,
"step": 843
},
{
"epoch": 281.88,
"learning_rate": 0.0001,
"loss": 0.0826,
"step": 846
},
{
"epoch": 282.88,
"learning_rate": 0.0001,
"loss": 0.0833,
"step": 849
},
{
"epoch": 283.88,
"learning_rate": 0.0001,
"loss": 0.0824,
"step": 852
},
{
"epoch": 284.88,
"learning_rate": 0.0001,
"loss": 0.0822,
"step": 855
},
{
"epoch": 285.88,
"learning_rate": 0.0001,
"loss": 0.081,
"step": 858
},
{
"epoch": 286.88,
"learning_rate": 0.0001,
"loss": 0.0826,
"step": 861
},
{
"epoch": 287.88,
"learning_rate": 0.0001,
"loss": 0.0801,
"step": 864
},
{
"epoch": 288.88,
"learning_rate": 0.0001,
"loss": 0.0806,
"step": 867
},
{
"epoch": 289.88,
"learning_rate": 0.0001,
"loss": 0.0804,
"step": 870
},
{
"epoch": 290.88,
"learning_rate": 0.0001,
"loss": 0.0824,
"step": 873
},
{
"epoch": 291.88,
"learning_rate": 0.0001,
"loss": 0.0806,
"step": 876
},
{
"epoch": 292.88,
"learning_rate": 0.0001,
"loss": 0.0791,
"step": 879
},
{
"epoch": 293.88,
"learning_rate": 0.0001,
"loss": 0.0803,
"step": 882
},
{
"epoch": 294.88,
"learning_rate": 0.0001,
"loss": 0.0782,
"step": 885
},
{
"epoch": 295.88,
"learning_rate": 0.0001,
"loss": 0.0803,
"step": 888
},
{
"epoch": 296.88,
"learning_rate": 0.0001,
"loss": 0.0764,
"step": 891
},
{
"epoch": 297.88,
"learning_rate": 0.0001,
"loss": 0.077,
"step": 894
},
{
"epoch": 298.59,
"eval_exact_match": 0.45938104448742745,
"eval_exec": 0.45357833655706,
"eval_loss": 0.34239432215690613,
"eval_runtime": 103.8684,
"eval_samples_per_second": 9.955,
"step": 896
},
{
"epoch": 298.88,
"learning_rate": 0.0001,
"loss": 0.0766,
"step": 897
},
{
"epoch": 299.88,
"learning_rate": 0.0001,
"loss": 0.0773,
"step": 900
},
{
"epoch": 300.88,
"learning_rate": 0.0001,
"loss": 0.076,
"step": 903
},
{
"epoch": 301.88,
"learning_rate": 0.0001,
"loss": 0.0757,
"step": 906
},
{
"epoch": 302.88,
"learning_rate": 0.0001,
"loss": 0.0753,
"step": 909
},
{
"epoch": 303.88,
"learning_rate": 0.0001,
"loss": 0.0753,
"step": 912
},
{
"epoch": 304.88,
"learning_rate": 0.0001,
"loss": 0.0752,
"step": 915
},
{
"epoch": 305.88,
"learning_rate": 0.0001,
"loss": 0.0739,
"step": 918
},
{
"epoch": 306.88,
"learning_rate": 0.0001,
"loss": 0.0748,
"step": 921
},
{
"epoch": 307.88,
"learning_rate": 0.0001,
"loss": 0.074,
"step": 924
},
{
"epoch": 308.88,
"learning_rate": 0.0001,
"loss": 0.0736,
"step": 927
},
{
"epoch": 309.88,
"learning_rate": 0.0001,
"loss": 0.0734,
"step": 930
},
{
"epoch": 310.88,
"learning_rate": 0.0001,
"loss": 0.0732,
"step": 933
},
{
"epoch": 311.88,
"learning_rate": 0.0001,
"loss": 0.0732,
"step": 936
},
{
"epoch": 312.88,
"learning_rate": 0.0001,
"loss": 0.0729,
"step": 939
},
{
"epoch": 313.88,
"learning_rate": 0.0001,
"loss": 0.0708,
"step": 942
},
{
"epoch": 314.88,
"learning_rate": 0.0001,
"loss": 0.0714,
"step": 945
},
{
"epoch": 315.88,
"learning_rate": 0.0001,
"loss": 0.0711,
"step": 948
},
{
"epoch": 316.88,
"learning_rate": 0.0001,
"loss": 0.0722,
"step": 951
},
{
"epoch": 317.88,
"learning_rate": 0.0001,
"loss": 0.0705,
"step": 954
},
{
"epoch": 318.88,
"learning_rate": 0.0001,
"loss": 0.071,
"step": 957
},
{
"epoch": 319.88,
"learning_rate": 0.0001,
"loss": 0.0704,
"step": 960
},
{
"epoch": 319.88,
"eval_exact_match": 0.45551257253384914,
"eval_exec": 0.4497098646034816,
"eval_loss": 0.34637653827667236,
"eval_runtime": 103.6764,
"eval_samples_per_second": 9.973,
"step": 960
},
{
"epoch": 320.88,
"learning_rate": 0.0001,
"loss": 0.0687,
"step": 963
},
{
"epoch": 321.88,
"learning_rate": 0.0001,
"loss": 0.069,
"step": 966
},
{
"epoch": 322.88,
"learning_rate": 0.0001,
"loss": 0.0694,
"step": 969
},
{
"epoch": 323.88,
"learning_rate": 0.0001,
"loss": 0.0692,
"step": 972
},
{
"epoch": 324.88,
"learning_rate": 0.0001,
"loss": 0.0688,
"step": 975
},
{
"epoch": 325.88,
"learning_rate": 0.0001,
"loss": 0.0694,
"step": 978
},
{
"epoch": 326.88,
"learning_rate": 0.0001,
"loss": 0.0681,
"step": 981
},
{
"epoch": 327.88,
"learning_rate": 0.0001,
"loss": 0.0676,
"step": 984
},
{
"epoch": 328.88,
"learning_rate": 0.0001,
"loss": 0.0663,
"step": 987
},
{
"epoch": 329.88,
"learning_rate": 0.0001,
"loss": 0.0665,
"step": 990
},
{
"epoch": 330.88,
"learning_rate": 0.0001,
"loss": 0.0672,
"step": 993
},
{
"epoch": 331.88,
"learning_rate": 0.0001,
"loss": 0.066,
"step": 996
},
{
"epoch": 332.88,
"learning_rate": 0.0001,
"loss": 0.0651,
"step": 999
},
{
"epoch": 333.88,
"learning_rate": 0.0001,
"loss": 0.0659,
"step": 1002
},
{
"epoch": 334.88,
"learning_rate": 0.0001,
"loss": 0.0654,
"step": 1005
},
{
"epoch": 335.88,
"learning_rate": 0.0001,
"loss": 0.0641,
"step": 1008
},
{
"epoch": 336.88,
"learning_rate": 0.0001,
"loss": 0.0648,
"step": 1011
},
{
"epoch": 337.88,
"learning_rate": 0.0001,
"loss": 0.0651,
"step": 1014
},
{
"epoch": 338.88,
"learning_rate": 0.0001,
"loss": 0.0653,
"step": 1017
},
{
"epoch": 339.88,
"learning_rate": 0.0001,
"loss": 0.0645,
"step": 1020
},
{
"epoch": 340.88,
"learning_rate": 0.0001,
"loss": 0.0641,
"step": 1023
},
{
"epoch": 341.29,
"eval_exact_match": 0.46034816247582205,
"eval_exec": 0.45164410058027077,
"eval_loss": 0.35341936349868774,
"eval_runtime": 117.5098,
"eval_samples_per_second": 8.799,
"step": 1024
},
{
"epoch": 341.88,
"learning_rate": 0.0001,
"loss": 0.0634,
"step": 1026
},
{
"epoch": 342.88,
"learning_rate": 0.0001,
"loss": 0.0617,
"step": 1029
},
{
"epoch": 343.88,
"learning_rate": 0.0001,
"loss": 0.0625,
"step": 1032
},
{
"epoch": 344.88,
"learning_rate": 0.0001,
"loss": 0.0623,
"step": 1035
},
{
"epoch": 345.88,
"learning_rate": 0.0001,
"loss": 0.0614,
"step": 1038
},
{
"epoch": 346.88,
"learning_rate": 0.0001,
"loss": 0.0616,
"step": 1041
},
{
"epoch": 347.88,
"learning_rate": 0.0001,
"loss": 0.0613,
"step": 1044
},
{
"epoch": 348.88,
"learning_rate": 0.0001,
"loss": 0.0615,
"step": 1047
},
{
"epoch": 349.88,
"learning_rate": 0.0001,
"loss": 0.0609,
"step": 1050
},
{
"epoch": 350.88,
"learning_rate": 0.0001,
"loss": 0.0609,
"step": 1053
},
{
"epoch": 351.88,
"learning_rate": 0.0001,
"loss": 0.0606,
"step": 1056
},
{
"epoch": 352.88,
"learning_rate": 0.0001,
"loss": 0.0599,
"step": 1059
},
{
"epoch": 353.88,
"learning_rate": 0.0001,
"loss": 0.0604,
"step": 1062
},
{
"epoch": 354.88,
"learning_rate": 0.0001,
"loss": 0.0596,
"step": 1065
},
{
"epoch": 355.88,
"learning_rate": 0.0001,
"loss": 0.06,
"step": 1068
},
{
"epoch": 356.88,
"learning_rate": 0.0001,
"loss": 0.0589,
"step": 1071
},
{
"epoch": 357.88,
"learning_rate": 0.0001,
"loss": 0.0606,
"step": 1074
},
{
"epoch": 358.88,
"learning_rate": 0.0001,
"loss": 0.0591,
"step": 1077
},
{
"epoch": 359.88,
"learning_rate": 0.0001,
"loss": 0.0566,
"step": 1080
},
{
"epoch": 360.88,
"learning_rate": 0.0001,
"loss": 0.0572,
"step": 1083
},
{
"epoch": 361.88,
"learning_rate": 0.0001,
"loss": 0.0575,
"step": 1086
},
{
"epoch": 362.59,
"eval_exact_match": 0.45164410058027077,
"eval_exec": 0.4458413926499033,
"eval_loss": 0.35678333044052124,
"eval_runtime": 127.3225,
"eval_samples_per_second": 8.121,
"step": 1088
},
{
"epoch": 362.88,
"learning_rate": 0.0001,
"loss": 0.057,
"step": 1089
},
{
"epoch": 363.88,
"learning_rate": 0.0001,
"loss": 0.0571,
"step": 1092
},
{
"epoch": 364.88,
"learning_rate": 0.0001,
"loss": 0.0568,
"step": 1095
},
{
"epoch": 365.88,
"learning_rate": 0.0001,
"loss": 0.057,
"step": 1098
},
{
"epoch": 366.88,
"learning_rate": 0.0001,
"loss": 0.0561,
"step": 1101
},
{
"epoch": 367.88,
"learning_rate": 0.0001,
"loss": 0.0555,
"step": 1104
},
{
"epoch": 368.88,
"learning_rate": 0.0001,
"loss": 0.0557,
"step": 1107
},
{
"epoch": 369.88,
"learning_rate": 0.0001,
"loss": 0.055,
"step": 1110
},
{
"epoch": 370.88,
"learning_rate": 0.0001,
"loss": 0.0556,
"step": 1113
},
{
"epoch": 371.88,
"learning_rate": 0.0001,
"loss": 0.0554,
"step": 1116
},
{
"epoch": 372.88,
"learning_rate": 0.0001,
"loss": 0.0566,
"step": 1119
},
{
"epoch": 373.88,
"learning_rate": 0.0001,
"loss": 0.0557,
"step": 1122
},
{
"epoch": 374.88,
"learning_rate": 0.0001,
"loss": 0.0552,
"step": 1125
},
{
"epoch": 375.88,
"learning_rate": 0.0001,
"loss": 0.0546,
"step": 1128
},
{
"epoch": 376.88,
"learning_rate": 0.0001,
"loss": 0.0545,
"step": 1131
},
{
"epoch": 377.88,
"learning_rate": 0.0001,
"loss": 0.0545,
"step": 1134
},
{
"epoch": 378.88,
"learning_rate": 0.0001,
"loss": 0.0527,
"step": 1137
},
{
"epoch": 379.88,
"learning_rate": 0.0001,
"loss": 0.0536,
"step": 1140
},
{
"epoch": 380.88,
"learning_rate": 0.0001,
"loss": 0.0536,
"step": 1143
},
{
"epoch": 381.88,
"learning_rate": 0.0001,
"loss": 0.0536,
"step": 1146
},
{
"epoch": 382.88,
"learning_rate": 0.0001,
"loss": 0.0532,
"step": 1149
},
{
"epoch": 383.88,
"learning_rate": 0.0001,
"loss": 0.0521,
"step": 1152
},
{
"epoch": 383.88,
"eval_exact_match": 0.47292069632495165,
"eval_exec": 0.4584139264990329,
"eval_loss": 0.3651985228061676,
"eval_runtime": 107.8989,
"eval_samples_per_second": 9.583,
"step": 1152
},
{
"epoch": 384.88,
"learning_rate": 0.0001,
"loss": 0.0518,
"step": 1155
},
{
"epoch": 385.88,
"learning_rate": 0.0001,
"loss": 0.0523,
"step": 1158
},
{
"epoch": 386.88,
"learning_rate": 0.0001,
"loss": 0.0509,
"step": 1161
},
{
"epoch": 387.88,
"learning_rate": 0.0001,
"loss": 0.0525,
"step": 1164
},
{
"epoch": 388.88,
"learning_rate": 0.0001,
"loss": 0.0517,
"step": 1167
},
{
"epoch": 389.88,
"learning_rate": 0.0001,
"loss": 0.0507,
"step": 1170
},
{
"epoch": 390.88,
"learning_rate": 0.0001,
"loss": 0.05,
"step": 1173
},
{
"epoch": 391.88,
"learning_rate": 0.0001,
"loss": 0.0506,
"step": 1176
},
{
"epoch": 392.88,
"learning_rate": 0.0001,
"loss": 0.0505,
"step": 1179
},
{
"epoch": 393.88,
"learning_rate": 0.0001,
"loss": 0.0504,
"step": 1182
},
{
"epoch": 394.88,
"learning_rate": 0.0001,
"loss": 0.05,
"step": 1185
},
{
"epoch": 395.88,
"learning_rate": 0.0001,
"loss": 0.05,
"step": 1188
},
{
"epoch": 396.88,
"learning_rate": 0.0001,
"loss": 0.0497,
"step": 1191
},
{
"epoch": 397.88,
"learning_rate": 0.0001,
"loss": 0.049,
"step": 1194
},
{
"epoch": 398.88,
"learning_rate": 0.0001,
"loss": 0.0496,
"step": 1197
},
{
"epoch": 399.88,
"learning_rate": 0.0001,
"loss": 0.049,
"step": 1200
},
{
"epoch": 400.88,
"learning_rate": 0.0001,
"loss": 0.0487,
"step": 1203
},
{
"epoch": 401.88,
"learning_rate": 0.0001,
"loss": 0.049,
"step": 1206
},
{
"epoch": 402.88,
"learning_rate": 0.0001,
"loss": 0.0486,
"step": 1209
},
{
"epoch": 403.88,
"learning_rate": 0.0001,
"loss": 0.0484,
"step": 1212
},
{
"epoch": 404.88,
"learning_rate": 0.0001,
"loss": 0.0493,
"step": 1215
},
{
"epoch": 405.29,
"eval_exact_match": 0.46808510638297873,
"eval_exec": 0.4632495164410058,
"eval_loss": 0.36478203535079956,
"eval_runtime": 110.1876,
"eval_samples_per_second": 9.384,
"step": 1216
},
{
"epoch": 405.88,
"learning_rate": 0.0001,
"loss": 0.0477,
"step": 1218
},
{
"epoch": 406.88,
"learning_rate": 0.0001,
"loss": 0.047,
"step": 1221
},
{
"epoch": 407.88,
"learning_rate": 0.0001,
"loss": 0.0476,
"step": 1224
},
{
"epoch": 408.88,
"learning_rate": 0.0001,
"loss": 0.047,
"step": 1227
},
{
"epoch": 409.88,
"learning_rate": 0.0001,
"loss": 0.048,
"step": 1230
},
{
"epoch": 410.88,
"learning_rate": 0.0001,
"loss": 0.0462,
"step": 1233
},
{
"epoch": 411.88,
"learning_rate": 0.0001,
"loss": 0.0468,
"step": 1236
},
{
"epoch": 412.88,
"learning_rate": 0.0001,
"loss": 0.0455,
"step": 1239
},
{
"epoch": 413.88,
"learning_rate": 0.0001,
"loss": 0.0468,
"step": 1242
},
{
"epoch": 414.88,
"learning_rate": 0.0001,
"loss": 0.0458,
"step": 1245
},
{
"epoch": 415.88,
"learning_rate": 0.0001,
"loss": 0.0461,
"step": 1248
},
{
"epoch": 416.88,
"learning_rate": 0.0001,
"loss": 0.0462,
"step": 1251
},
{
"epoch": 417.88,
"learning_rate": 0.0001,
"loss": 0.0447,
"step": 1254
},
{
"epoch": 418.88,
"learning_rate": 0.0001,
"loss": 0.0452,
"step": 1257
},
{
"epoch": 419.88,
"learning_rate": 0.0001,
"loss": 0.0439,
"step": 1260
},
{
"epoch": 420.88,
"learning_rate": 0.0001,
"loss": 0.0444,
"step": 1263
},
{
"epoch": 421.88,
"learning_rate": 0.0001,
"loss": 0.0447,
"step": 1266
},
{
"epoch": 422.88,
"learning_rate": 0.0001,
"loss": 0.0447,
"step": 1269
},
{
"epoch": 423.88,
"learning_rate": 0.0001,
"loss": 0.0448,
"step": 1272
},
{
"epoch": 424.88,
"learning_rate": 0.0001,
"loss": 0.0443,
"step": 1275
},
{
"epoch": 425.88,
"learning_rate": 0.0001,
"loss": 0.0437,
"step": 1278
},
{
"epoch": 426.59,
"eval_exact_match": 0.47195357833655704,
"eval_exec": 0.4632495164410058,
"eval_loss": 0.37120428681373596,
"eval_runtime": 101.6241,
"eval_samples_per_second": 10.175,
"step": 1280
},
{
"epoch": 426.88,
"learning_rate": 0.0001,
"loss": 0.042,
"step": 1281
},
{
"epoch": 427.88,
"learning_rate": 0.0001,
"loss": 0.0444,
"step": 1284
},
{
"epoch": 428.88,
"learning_rate": 0.0001,
"loss": 0.0445,
"step": 1287
},
{
"epoch": 429.88,
"learning_rate": 0.0001,
"loss": 0.0427,
"step": 1290
},
{
"epoch": 430.88,
"learning_rate": 0.0001,
"loss": 0.0423,
"step": 1293
},
{
"epoch": 431.88,
"learning_rate": 0.0001,
"loss": 0.0427,
"step": 1296
},
{
"epoch": 432.88,
"learning_rate": 0.0001,
"loss": 0.0426,
"step": 1299
},
{
"epoch": 433.88,
"learning_rate": 0.0001,
"loss": 0.0427,
"step": 1302
},
{
"epoch": 434.88,
"learning_rate": 0.0001,
"loss": 0.0418,
"step": 1305
},
{
"epoch": 435.88,
"learning_rate": 0.0001,
"loss": 0.0422,
"step": 1308
},
{
"epoch": 436.88,
"learning_rate": 0.0001,
"loss": 0.0406,
"step": 1311
},
{
"epoch": 437.88,
"learning_rate": 0.0001,
"loss": 0.0413,
"step": 1314
},
{
"epoch": 438.88,
"learning_rate": 0.0001,
"loss": 0.0403,
"step": 1317
},
{
"epoch": 439.88,
"learning_rate": 0.0001,
"loss": 0.0417,
"step": 1320
},
{
"epoch": 440.88,
"learning_rate": 0.0001,
"loss": 0.0407,
"step": 1323
},
{
"epoch": 441.88,
"learning_rate": 0.0001,
"loss": 0.0416,
"step": 1326
},
{
"epoch": 442.88,
"learning_rate": 0.0001,
"loss": 0.0414,
"step": 1329
},
{
"epoch": 443.88,
"learning_rate": 0.0001,
"loss": 0.0407,
"step": 1332
},
{
"epoch": 444.88,
"learning_rate": 0.0001,
"loss": 0.0407,
"step": 1335
},
{
"epoch": 445.88,
"learning_rate": 0.0001,
"loss": 0.0404,
"step": 1338
},
{
"epoch": 446.88,
"learning_rate": 0.0001,
"loss": 0.0401,
"step": 1341
},
{
"epoch": 447.88,
"learning_rate": 0.0001,
"loss": 0.0399,
"step": 1344
},
{
"epoch": 447.88,
"eval_exact_match": 0.47195357833655704,
"eval_exec": 0.4632495164410058,
"eval_loss": 0.3796737492084503,
"eval_runtime": 116.7328,
"eval_samples_per_second": 8.858,
"step": 1344
},
{
"epoch": 448.88,
"learning_rate": 0.0001,
"loss": 0.0403,
"step": 1347
},
{
"epoch": 449.88,
"learning_rate": 0.0001,
"loss": 0.0397,
"step": 1350
},
{
"epoch": 450.88,
"learning_rate": 0.0001,
"loss": 0.0392,
"step": 1353
},
{
"epoch": 451.88,
"learning_rate": 0.0001,
"loss": 0.0391,
"step": 1356
},
{
"epoch": 452.88,
"learning_rate": 0.0001,
"loss": 0.0405,
"step": 1359
},
{
"epoch": 453.88,
"learning_rate": 0.0001,
"loss": 0.0395,
"step": 1362
},
{
"epoch": 454.88,
"learning_rate": 0.0001,
"loss": 0.0394,
"step": 1365
},
{
"epoch": 455.88,
"learning_rate": 0.0001,
"loss": 0.0386,
"step": 1368
},
{
"epoch": 456.88,
"learning_rate": 0.0001,
"loss": 0.0381,
"step": 1371
},
{
"epoch": 457.88,
"learning_rate": 0.0001,
"loss": 0.0384,
"step": 1374
},
{
"epoch": 458.88,
"learning_rate": 0.0001,
"loss": 0.0382,
"step": 1377
},
{
"epoch": 459.88,
"learning_rate": 0.0001,
"loss": 0.0379,
"step": 1380
},
{
"epoch": 460.88,
"learning_rate": 0.0001,
"loss": 0.0381,
"step": 1383
},
{
"epoch": 461.88,
"learning_rate": 0.0001,
"loss": 0.0377,
"step": 1386
},
{
"epoch": 462.88,
"learning_rate": 0.0001,
"loss": 0.0377,
"step": 1389
},
{
"epoch": 463.88,
"learning_rate": 0.0001,
"loss": 0.0374,
"step": 1392
},
{
"epoch": 464.88,
"learning_rate": 0.0001,
"loss": 0.0369,
"step": 1395
},
{
"epoch": 465.88,
"learning_rate": 0.0001,
"loss": 0.0372,
"step": 1398
},
{
"epoch": 466.88,
"learning_rate": 0.0001,
"loss": 0.0386,
"step": 1401
},
{
"epoch": 467.88,
"learning_rate": 0.0001,
"loss": 0.0367,
"step": 1404
},
{
"epoch": 468.88,
"learning_rate": 0.0001,
"loss": 0.0365,
"step": 1407
},
{
"epoch": 469.29,
"eval_exact_match": 0.47195357833655704,
"eval_exec": 0.4622823984526112,
"eval_loss": 0.38305917382240295,
"eval_runtime": 123.8052,
"eval_samples_per_second": 8.352,
"step": 1408
},
{
"epoch": 469.88,
"learning_rate": 0.0001,
"loss": 0.0363,
"step": 1410
},
{
"epoch": 470.88,
"learning_rate": 0.0001,
"loss": 0.037,
"step": 1413
},
{
"epoch": 471.88,
"learning_rate": 0.0001,
"loss": 0.0367,
"step": 1416
},
{
"epoch": 472.88,
"learning_rate": 0.0001,
"loss": 0.0367,
"step": 1419
},
{
"epoch": 473.88,
"learning_rate": 0.0001,
"loss": 0.0362,
"step": 1422
},
{
"epoch": 474.88,
"learning_rate": 0.0001,
"loss": 0.0359,
"step": 1425
},
{
"epoch": 475.88,
"learning_rate": 0.0001,
"loss": 0.0352,
"step": 1428
},
{
"epoch": 476.88,
"learning_rate": 0.0001,
"loss": 0.0355,
"step": 1431
},
{
"epoch": 477.88,
"learning_rate": 0.0001,
"loss": 0.0363,
"step": 1434
},
{
"epoch": 478.88,
"learning_rate": 0.0001,
"loss": 0.0342,
"step": 1437
},
{
"epoch": 479.88,
"learning_rate": 0.0001,
"loss": 0.0353,
"step": 1440
},
{
"epoch": 480.88,
"learning_rate": 0.0001,
"loss": 0.0344,
"step": 1443
},
{
"epoch": 481.88,
"learning_rate": 0.0001,
"loss": 0.0344,
"step": 1446
},
{
"epoch": 482.88,
"learning_rate": 0.0001,
"loss": 0.0342,
"step": 1449
},
{
"epoch": 483.88,
"learning_rate": 0.0001,
"loss": 0.0361,
"step": 1452
},
{
"epoch": 484.88,
"learning_rate": 0.0001,
"loss": 0.0343,
"step": 1455
},
{
"epoch": 485.88,
"learning_rate": 0.0001,
"loss": 0.0341,
"step": 1458
},
{
"epoch": 486.88,
"learning_rate": 0.0001,
"loss": 0.0332,
"step": 1461
},
{
"epoch": 487.88,
"learning_rate": 0.0001,
"loss": 0.0338,
"step": 1464
},
{
"epoch": 488.88,
"learning_rate": 0.0001,
"loss": 0.0344,
"step": 1467
},
{
"epoch": 489.88,
"learning_rate": 0.0001,
"loss": 0.0342,
"step": 1470
},
{
"epoch": 490.59,
"eval_exact_match": 0.47292069632495165,
"eval_exec": 0.46421663442940037,
"eval_loss": 0.3914486765861511,
"eval_runtime": 103.8318,
"eval_samples_per_second": 9.958,
"step": 1472
},
{
"epoch": 490.88,
"learning_rate": 0.0001,
"loss": 0.0325,
"step": 1473
},
{
"epoch": 491.88,
"learning_rate": 0.0001,
"loss": 0.0348,
"step": 1476
},
{
"epoch": 492.88,
"learning_rate": 0.0001,
"loss": 0.0336,
"step": 1479
},
{
"epoch": 493.88,
"learning_rate": 0.0001,
"loss": 0.0337,
"step": 1482
},
{
"epoch": 494.88,
"learning_rate": 0.0001,
"loss": 0.0335,
"step": 1485
},
{
"epoch": 495.88,
"learning_rate": 0.0001,
"loss": 0.0332,
"step": 1488
},
{
"epoch": 496.88,
"learning_rate": 0.0001,
"loss": 0.0331,
"step": 1491
},
{
"epoch": 497.88,
"learning_rate": 0.0001,
"loss": 0.032,
"step": 1494
},
{
"epoch": 498.88,
"learning_rate": 0.0001,
"loss": 0.0339,
"step": 1497
},
{
"epoch": 499.88,
"learning_rate": 0.0001,
"loss": 0.0326,
"step": 1500
},
{
"epoch": 500.88,
"learning_rate": 0.0001,
"loss": 0.032,
"step": 1503
},
{
"epoch": 501.88,
"learning_rate": 0.0001,
"loss": 0.0324,
"step": 1506
},
{
"epoch": 502.88,
"learning_rate": 0.0001,
"loss": 0.0324,
"step": 1509
},
{
"epoch": 503.88,
"learning_rate": 0.0001,
"loss": 0.0326,
"step": 1512
},
{
"epoch": 504.88,
"learning_rate": 0.0001,
"loss": 0.032,
"step": 1515
},
{
"epoch": 505.88,
"learning_rate": 0.0001,
"loss": 0.0307,
"step": 1518
},
{
"epoch": 506.88,
"learning_rate": 0.0001,
"loss": 0.0311,
"step": 1521
},
{
"epoch": 507.88,
"learning_rate": 0.0001,
"loss": 0.0313,
"step": 1524
},
{
"epoch": 508.88,
"learning_rate": 0.0001,
"loss": 0.0314,
"step": 1527
},
{
"epoch": 509.88,
"learning_rate": 0.0001,
"loss": 0.0306,
"step": 1530
},
{
"epoch": 510.88,
"learning_rate": 0.0001,
"loss": 0.0305,
"step": 1533
},
{
"epoch": 511.88,
"learning_rate": 0.0001,
"loss": 0.0319,
"step": 1536
},
{
"epoch": 511.88,
"eval_exact_match": 0.46808510638297873,
"eval_exec": 0.45938104448742745,
"eval_loss": 0.3986540734767914,
"eval_runtime": 109.5821,
"eval_samples_per_second": 9.436,
"step": 1536
},
{
"epoch": 512.88,
"learning_rate": 0.0001,
"loss": 0.0309,
"step": 1539
},
{
"epoch": 513.88,
"learning_rate": 0.0001,
"loss": 0.0316,
"step": 1542
},
{
"epoch": 514.88,
"learning_rate": 0.0001,
"loss": 0.0298,
"step": 1545
},
{
"epoch": 515.88,
"learning_rate": 0.0001,
"loss": 0.0302,
"step": 1548
},
{
"epoch": 516.88,
"learning_rate": 0.0001,
"loss": 0.0289,
"step": 1551
},
{
"epoch": 517.88,
"learning_rate": 0.0001,
"loss": 0.0302,
"step": 1554
},
{
"epoch": 518.88,
"learning_rate": 0.0001,
"loss": 0.0299,
"step": 1557
},
{
"epoch": 519.88,
"learning_rate": 0.0001,
"loss": 0.0298,
"step": 1560
},
{
"epoch": 520.88,
"learning_rate": 0.0001,
"loss": 0.0297,
"step": 1563
},
{
"epoch": 521.88,
"learning_rate": 0.0001,
"loss": 0.0292,
"step": 1566
},
{
"epoch": 522.88,
"learning_rate": 0.0001,
"loss": 0.0294,
"step": 1569
},
{
"epoch": 523.88,
"learning_rate": 0.0001,
"loss": 0.03,
"step": 1572
},
{
"epoch": 524.88,
"learning_rate": 0.0001,
"loss": 0.0293,
"step": 1575
},
{
"epoch": 525.88,
"learning_rate": 0.0001,
"loss": 0.0291,
"step": 1578
},
{
"epoch": 526.88,
"learning_rate": 0.0001,
"loss": 0.0286,
"step": 1581
},
{
"epoch": 527.88,
"learning_rate": 0.0001,
"loss": 0.029,
"step": 1584
},
{
"epoch": 528.88,
"learning_rate": 0.0001,
"loss": 0.0294,
"step": 1587
},
{
"epoch": 529.88,
"learning_rate": 0.0001,
"loss": 0.0298,
"step": 1590
},
{
"epoch": 530.88,
"learning_rate": 0.0001,
"loss": 0.0286,
"step": 1593
},
{
"epoch": 531.88,
"learning_rate": 0.0001,
"loss": 0.028,
"step": 1596
},
{
"epoch": 532.88,
"learning_rate": 0.0001,
"loss": 0.0283,
"step": 1599
},
{
"epoch": 533.29,
"eval_exact_match": 0.46421663442940037,
"eval_exec": 0.45938104448742745,
"eval_loss": 0.4072656035423279,
"eval_runtime": 128.9566,
"eval_samples_per_second": 8.018,
"step": 1600
},
{
"epoch": 533.88,
"learning_rate": 0.0001,
"loss": 0.0292,
"step": 1602
},
{
"epoch": 534.88,
"learning_rate": 0.0001,
"loss": 0.0287,
"step": 1605
},
{
"epoch": 535.88,
"learning_rate": 0.0001,
"loss": 0.0294,
"step": 1608
},
{
"epoch": 536.88,
"learning_rate": 0.0001,
"loss": 0.0291,
"step": 1611
},
{
"epoch": 537.88,
"learning_rate": 0.0001,
"loss": 0.0282,
"step": 1614
},
{
"epoch": 538.88,
"learning_rate": 0.0001,
"loss": 0.028,
"step": 1617
},
{
"epoch": 539.88,
"learning_rate": 0.0001,
"loss": 0.0289,
"step": 1620
},
{
"epoch": 540.88,
"learning_rate": 0.0001,
"loss": 0.0272,
"step": 1623
},
{
"epoch": 541.88,
"learning_rate": 0.0001,
"loss": 0.0274,
"step": 1626
},
{
"epoch": 542.88,
"learning_rate": 0.0001,
"loss": 0.0275,
"step": 1629
},
{
"epoch": 543.88,
"learning_rate": 0.0001,
"loss": 0.0278,
"step": 1632
},
{
"epoch": 544.88,
"learning_rate": 0.0001,
"loss": 0.0278,
"step": 1635
},
{
"epoch": 545.88,
"learning_rate": 0.0001,
"loss": 0.0279,
"step": 1638
},
{
"epoch": 546.88,
"learning_rate": 0.0001,
"loss": 0.0272,
"step": 1641
},
{
"epoch": 547.88,
"learning_rate": 0.0001,
"loss": 0.0275,
"step": 1644
},
{
"epoch": 548.88,
"learning_rate": 0.0001,
"loss": 0.0262,
"step": 1647
},
{
"epoch": 549.88,
"learning_rate": 0.0001,
"loss": 0.027,
"step": 1650
},
{
"epoch": 550.88,
"learning_rate": 0.0001,
"loss": 0.0266,
"step": 1653
},
{
"epoch": 551.88,
"learning_rate": 0.0001,
"loss": 0.0265,
"step": 1656
},
{
"epoch": 552.88,
"learning_rate": 0.0001,
"loss": 0.0272,
"step": 1659
},
{
"epoch": 553.88,
"learning_rate": 0.0001,
"loss": 0.0265,
"step": 1662
},
{
"epoch": 554.59,
"eval_exact_match": 0.488394584139265,
"eval_exec": 0.4816247582205029,
"eval_loss": 0.40782487392425537,
"eval_runtime": 108.3403,
"eval_samples_per_second": 9.544,
"step": 1664
},
{
"epoch": 554.88,
"learning_rate": 0.0001,
"loss": 0.0262,
"step": 1665
},
{
"epoch": 555.88,
"learning_rate": 0.0001,
"loss": 0.0276,
"step": 1668
},
{
"epoch": 556.88,
"learning_rate": 0.0001,
"loss": 0.0264,
"step": 1671
},
{
"epoch": 557.88,
"learning_rate": 0.0001,
"loss": 0.0256,
"step": 1674
},
{
"epoch": 558.88,
"learning_rate": 0.0001,
"loss": 0.0255,
"step": 1677
},
{
"epoch": 559.88,
"learning_rate": 0.0001,
"loss": 0.0259,
"step": 1680
},
{
"epoch": 560.88,
"learning_rate": 0.0001,
"loss": 0.0246,
"step": 1683
},
{
"epoch": 561.88,
"learning_rate": 0.0001,
"loss": 0.0257,
"step": 1686
},
{
"epoch": 562.88,
"learning_rate": 0.0001,
"loss": 0.0267,
"step": 1689
},
{
"epoch": 563.88,
"learning_rate": 0.0001,
"loss": 0.0251,
"step": 1692
},
{
"epoch": 564.88,
"learning_rate": 0.0001,
"loss": 0.0253,
"step": 1695
},
{
"epoch": 565.88,
"learning_rate": 0.0001,
"loss": 0.0248,
"step": 1698
},
{
"epoch": 566.88,
"learning_rate": 0.0001,
"loss": 0.0252,
"step": 1701
},
{
"epoch": 567.88,
"learning_rate": 0.0001,
"loss": 0.0255,
"step": 1704
},
{
"epoch": 568.88,
"learning_rate": 0.0001,
"loss": 0.0249,
"step": 1707
},
{
"epoch": 569.88,
"learning_rate": 0.0001,
"loss": 0.0254,
"step": 1710
},
{
"epoch": 570.88,
"learning_rate": 0.0001,
"loss": 0.0251,
"step": 1713
},
{
"epoch": 571.88,
"learning_rate": 0.0001,
"loss": 0.024,
"step": 1716
},
{
"epoch": 572.88,
"learning_rate": 0.0001,
"loss": 0.0239,
"step": 1719
},
{
"epoch": 573.88,
"learning_rate": 0.0001,
"loss": 0.0247,
"step": 1722
},
{
"epoch": 574.88,
"learning_rate": 0.0001,
"loss": 0.0246,
"step": 1725
},
{
"epoch": 575.88,
"learning_rate": 0.0001,
"loss": 0.0249,
"step": 1728
},
{
"epoch": 575.88,
"eval_exact_match": 0.4738878143133462,
"eval_exec": 0.4690522243713733,
"eval_loss": 0.413275808095932,
"eval_runtime": 120.0672,
"eval_samples_per_second": 8.612,
"step": 1728
},
{
"epoch": 576.88,
"learning_rate": 0.0001,
"loss": 0.0246,
"step": 1731
},
{
"epoch": 577.88,
"learning_rate": 0.0001,
"loss": 0.0235,
"step": 1734
},
{
"epoch": 578.88,
"learning_rate": 0.0001,
"loss": 0.0239,
"step": 1737
},
{
"epoch": 579.88,
"learning_rate": 0.0001,
"loss": 0.0234,
"step": 1740
},
{
"epoch": 580.88,
"learning_rate": 0.0001,
"loss": 0.0231,
"step": 1743
},
{
"epoch": 581.88,
"learning_rate": 0.0001,
"loss": 0.0233,
"step": 1746
},
{
"epoch": 582.88,
"learning_rate": 0.0001,
"loss": 0.023,
"step": 1749
},
{
"epoch": 583.88,
"learning_rate": 0.0001,
"loss": 0.0235,
"step": 1752
},
{
"epoch": 584.88,
"learning_rate": 0.0001,
"loss": 0.0238,
"step": 1755
},
{
"epoch": 585.88,
"learning_rate": 0.0001,
"loss": 0.0254,
"step": 1758
},
{
"epoch": 586.88,
"learning_rate": 0.0001,
"loss": 0.0243,
"step": 1761
},
{
"epoch": 587.88,
"learning_rate": 0.0001,
"loss": 0.0236,
"step": 1764
},
{
"epoch": 588.88,
"learning_rate": 0.0001,
"loss": 0.0222,
"step": 1767
},
{
"epoch": 589.88,
"learning_rate": 0.0001,
"loss": 0.0228,
"step": 1770
},
{
"epoch": 590.88,
"learning_rate": 0.0001,
"loss": 0.0236,
"step": 1773
},
{
"epoch": 591.88,
"learning_rate": 0.0001,
"loss": 0.023,
"step": 1776
},
{
"epoch": 592.88,
"learning_rate": 0.0001,
"loss": 0.0233,
"step": 1779
},
{
"epoch": 593.88,
"learning_rate": 0.0001,
"loss": 0.0229,
"step": 1782
},
{
"epoch": 594.88,
"learning_rate": 0.0001,
"loss": 0.0226,
"step": 1785
},
{
"epoch": 595.88,
"learning_rate": 0.0001,
"loss": 0.0221,
"step": 1788
},
{
"epoch": 596.88,
"learning_rate": 0.0001,
"loss": 0.0228,
"step": 1791
},
{
"epoch": 597.29,
"eval_exact_match": 0.4671179883945841,
"eval_exec": 0.4622823984526112,
"eval_loss": 0.421924889087677,
"eval_runtime": 121.4411,
"eval_samples_per_second": 8.514,
"step": 1792
},
{
"epoch": 597.88,
"learning_rate": 0.0001,
"loss": 0.0225,
"step": 1794
},
{
"epoch": 598.88,
"learning_rate": 0.0001,
"loss": 0.0221,
"step": 1797
},
{
"epoch": 599.88,
"learning_rate": 0.0001,
"loss": 0.0216,
"step": 1800
},
{
"epoch": 600.88,
"learning_rate": 0.0001,
"loss": 0.0219,
"step": 1803
},
{
"epoch": 601.88,
"learning_rate": 0.0001,
"loss": 0.0214,
"step": 1806
},
{
"epoch": 602.88,
"learning_rate": 0.0001,
"loss": 0.0219,
"step": 1809
},
{
"epoch": 603.88,
"learning_rate": 0.0001,
"loss": 0.0216,
"step": 1812
},
{
"epoch": 604.88,
"learning_rate": 0.0001,
"loss": 0.0213,
"step": 1815
},
{
"epoch": 605.88,
"learning_rate": 0.0001,
"loss": 0.0212,
"step": 1818
},
{
"epoch": 606.88,
"learning_rate": 0.0001,
"loss": 0.0218,
"step": 1821
},
{
"epoch": 607.88,
"learning_rate": 0.0001,
"loss": 0.0218,
"step": 1824
},
{
"epoch": 608.88,
"learning_rate": 0.0001,
"loss": 0.0221,
"step": 1827
},
{
"epoch": 609.88,
"learning_rate": 0.0001,
"loss": 0.0217,
"step": 1830
},
{
"epoch": 610.88,
"learning_rate": 0.0001,
"loss": 0.0224,
"step": 1833
},
{
"epoch": 611.88,
"learning_rate": 0.0001,
"loss": 0.0208,
"step": 1836
},
{
"epoch": 612.88,
"learning_rate": 0.0001,
"loss": 0.0208,
"step": 1839
},
{
"epoch": 613.88,
"learning_rate": 0.0001,
"loss": 0.0205,
"step": 1842
},
{
"epoch": 614.88,
"learning_rate": 0.0001,
"loss": 0.021,
"step": 1845
},
{
"epoch": 615.88,
"learning_rate": 0.0001,
"loss": 0.0207,
"step": 1848
},
{
"epoch": 616.88,
"learning_rate": 0.0001,
"loss": 0.0206,
"step": 1851
},
{
"epoch": 617.88,
"learning_rate": 0.0001,
"loss": 0.0211,
"step": 1854
},
{
"epoch": 618.59,
"eval_exact_match": 0.4941972920696325,
"eval_exec": 0.48936170212765956,
"eval_loss": 0.42522886395454407,
"eval_runtime": 108.5837,
"eval_samples_per_second": 9.523,
"step": 1856
},
{
"epoch": 618.88,
"learning_rate": 0.0001,
"loss": 0.0206,
"step": 1857
},
{
"epoch": 619.88,
"learning_rate": 0.0001,
"loss": 0.0209,
"step": 1860
},
{
"epoch": 620.88,
"learning_rate": 0.0001,
"loss": 0.0209,
"step": 1863
},
{
"epoch": 621.88,
"learning_rate": 0.0001,
"loss": 0.0209,
"step": 1866
},
{
"epoch": 622.88,
"learning_rate": 0.0001,
"loss": 0.0206,
"step": 1869
},
{
"epoch": 623.88,
"learning_rate": 0.0001,
"loss": 0.0195,
"step": 1872
},
{
"epoch": 624.88,
"learning_rate": 0.0001,
"loss": 0.0194,
"step": 1875
},
{
"epoch": 625.88,
"learning_rate": 0.0001,
"loss": 0.0201,
"step": 1878
},
{
"epoch": 626.88,
"learning_rate": 0.0001,
"loss": 0.0197,
"step": 1881
},
{
"epoch": 627.88,
"learning_rate": 0.0001,
"loss": 0.0194,
"step": 1884
},
{
"epoch": 628.88,
"learning_rate": 0.0001,
"loss": 0.02,
"step": 1887
},
{
"epoch": 629.88,
"learning_rate": 0.0001,
"loss": 0.0198,
"step": 1890
},
{
"epoch": 630.88,
"learning_rate": 0.0001,
"loss": 0.0196,
"step": 1893
},
{
"epoch": 631.88,
"learning_rate": 0.0001,
"loss": 0.0185,
"step": 1896
},
{
"epoch": 632.88,
"learning_rate": 0.0001,
"loss": 0.0203,
"step": 1899
},
{
"epoch": 633.88,
"learning_rate": 0.0001,
"loss": 0.0201,
"step": 1902
},
{
"epoch": 634.88,
"learning_rate": 0.0001,
"loss": 0.0197,
"step": 1905
},
{
"epoch": 635.88,
"learning_rate": 0.0001,
"loss": 0.0196,
"step": 1908
},
{
"epoch": 636.88,
"learning_rate": 0.0001,
"loss": 0.0192,
"step": 1911
},
{
"epoch": 637.88,
"learning_rate": 0.0001,
"loss": 0.0184,
"step": 1914
},
{
"epoch": 638.88,
"learning_rate": 0.0001,
"loss": 0.0188,
"step": 1917
},
{
"epoch": 639.88,
"learning_rate": 0.0001,
"loss": 0.0185,
"step": 1920
},
{
"epoch": 639.88,
"eval_exact_match": 0.49806576402321084,
"eval_exec": 0.488394584139265,
"eval_loss": 0.43099677562713623,
"eval_runtime": 104.5413,
"eval_samples_per_second": 9.891,
"step": 1920
},
{
"epoch": 640.88,
"learning_rate": 0.0001,
"loss": 0.0194,
"step": 1923
},
{
"epoch": 641.88,
"learning_rate": 0.0001,
"loss": 0.0189,
"step": 1926
},
{
"epoch": 642.88,
"learning_rate": 0.0001,
"loss": 0.0201,
"step": 1929
},
{
"epoch": 643.88,
"learning_rate": 0.0001,
"loss": 0.0196,
"step": 1932
},
{
"epoch": 644.88,
"learning_rate": 0.0001,
"loss": 0.0187,
"step": 1935
},
{
"epoch": 645.88,
"learning_rate": 0.0001,
"loss": 0.0192,
"step": 1938
},
{
"epoch": 646.88,
"learning_rate": 0.0001,
"loss": 0.0194,
"step": 1941
},
{
"epoch": 647.88,
"learning_rate": 0.0001,
"loss": 0.0188,
"step": 1944
},
{
"epoch": 648.88,
"learning_rate": 0.0001,
"loss": 0.0185,
"step": 1947
},
{
"epoch": 649.88,
"learning_rate": 0.0001,
"loss": 0.0182,
"step": 1950
},
{
"epoch": 650.88,
"learning_rate": 0.0001,
"loss": 0.0181,
"step": 1953
},
{
"epoch": 651.88,
"learning_rate": 0.0001,
"loss": 0.0182,
"step": 1956
},
{
"epoch": 652.88,
"learning_rate": 0.0001,
"loss": 0.0193,
"step": 1959
},
{
"epoch": 653.88,
"learning_rate": 0.0001,
"loss": 0.0179,
"step": 1962
},
{
"epoch": 654.88,
"learning_rate": 0.0001,
"loss": 0.0177,
"step": 1965
},
{
"epoch": 655.88,
"learning_rate": 0.0001,
"loss": 0.018,
"step": 1968
},
{
"epoch": 656.88,
"learning_rate": 0.0001,
"loss": 0.018,
"step": 1971
},
{
"epoch": 657.88,
"learning_rate": 0.0001,
"loss": 0.0179,
"step": 1974
},
{
"epoch": 658.88,
"learning_rate": 0.0001,
"loss": 0.0173,
"step": 1977
},
{
"epoch": 659.88,
"learning_rate": 0.0001,
"loss": 0.0179,
"step": 1980
},
{
"epoch": 660.88,
"learning_rate": 0.0001,
"loss": 0.0179,
"step": 1983
},
{
"epoch": 661.29,
"eval_exact_match": 0.47678916827852996,
"eval_exec": 0.47678916827852996,
"eval_loss": 0.43502098321914673,
"eval_runtime": 115.2904,
"eval_samples_per_second": 8.969,
"step": 1984
},
{
"epoch": 661.88,
"learning_rate": 0.0001,
"loss": 0.0174,
"step": 1986
},
{
"epoch": 662.88,
"learning_rate": 0.0001,
"loss": 0.0181,
"step": 1989
},
{
"epoch": 663.88,
"learning_rate": 0.0001,
"loss": 0.0185,
"step": 1992
},
{
"epoch": 664.88,
"learning_rate": 0.0001,
"loss": 0.0183,
"step": 1995
},
{
"epoch": 665.88,
"learning_rate": 0.0001,
"loss": 0.0173,
"step": 1998
},
{
"epoch": 666.88,
"learning_rate": 0.0001,
"loss": 0.0169,
"step": 2001
},
{
"epoch": 667.88,
"learning_rate": 0.0001,
"loss": 0.0169,
"step": 2004
},
{
"epoch": 668.88,
"learning_rate": 0.0001,
"loss": 0.0172,
"step": 2007
},
{
"epoch": 669.88,
"learning_rate": 0.0001,
"loss": 0.0165,
"step": 2010
},
{
"epoch": 670.88,
"learning_rate": 0.0001,
"loss": 0.0168,
"step": 2013
},
{
"epoch": 671.88,
"learning_rate": 0.0001,
"loss": 0.017,
"step": 2016
},
{
"epoch": 672.88,
"learning_rate": 0.0001,
"loss": 0.0173,
"step": 2019
},
{
"epoch": 673.88,
"learning_rate": 0.0001,
"loss": 0.0178,
"step": 2022
},
{
"epoch": 674.88,
"learning_rate": 0.0001,
"loss": 0.0164,
"step": 2025
},
{
"epoch": 675.88,
"learning_rate": 0.0001,
"loss": 0.0167,
"step": 2028
},
{
"epoch": 676.88,
"learning_rate": 0.0001,
"loss": 0.0166,
"step": 2031
},
{
"epoch": 677.88,
"learning_rate": 0.0001,
"loss": 0.0163,
"step": 2034
},
{
"epoch": 678.88,
"learning_rate": 0.0001,
"loss": 0.0162,
"step": 2037
},
{
"epoch": 679.88,
"learning_rate": 0.0001,
"loss": 0.0163,
"step": 2040
},
{
"epoch": 680.88,
"learning_rate": 0.0001,
"loss": 0.0163,
"step": 2043
},
{
"epoch": 681.88,
"learning_rate": 0.0001,
"loss": 0.0162,
"step": 2046
},
{
"epoch": 682.59,
"eval_exact_match": 0.4825918762088975,
"eval_exec": 0.4816247582205029,
"eval_loss": 0.4417296051979065,
"eval_runtime": 103.7496,
"eval_samples_per_second": 9.966,
"step": 2048
},
{
"epoch": 682.88,
"learning_rate": 0.0001,
"loss": 0.0173,
"step": 2049
},
{
"epoch": 683.88,
"learning_rate": 0.0001,
"loss": 0.0174,
"step": 2052
},
{
"epoch": 684.88,
"learning_rate": 0.0001,
"loss": 0.0153,
"step": 2055
},
{
"epoch": 685.88,
"learning_rate": 0.0001,
"loss": 0.0155,
"step": 2058
},
{
"epoch": 686.88,
"learning_rate": 0.0001,
"loss": 0.016,
"step": 2061
},
{
"epoch": 687.88,
"learning_rate": 0.0001,
"loss": 0.0161,
"step": 2064
},
{
"epoch": 688.88,
"learning_rate": 0.0001,
"loss": 0.017,
"step": 2067
},
{
"epoch": 689.88,
"learning_rate": 0.0001,
"loss": 0.0164,
"step": 2070
},
{
"epoch": 690.88,
"learning_rate": 0.0001,
"loss": 0.0165,
"step": 2073
},
{
"epoch": 691.88,
"learning_rate": 0.0001,
"loss": 0.016,
"step": 2076
},
{
"epoch": 692.88,
"learning_rate": 0.0001,
"loss": 0.0152,
"step": 2079
},
{
"epoch": 693.88,
"learning_rate": 0.0001,
"loss": 0.0164,
"step": 2082
},
{
"epoch": 694.88,
"learning_rate": 0.0001,
"loss": 0.0161,
"step": 2085
},
{
"epoch": 695.88,
"learning_rate": 0.0001,
"loss": 0.0152,
"step": 2088
},
{
"epoch": 696.88,
"learning_rate": 0.0001,
"loss": 0.0156,
"step": 2091
},
{
"epoch": 697.88,
"learning_rate": 0.0001,
"loss": 0.0151,
"step": 2094
},
{
"epoch": 698.88,
"learning_rate": 0.0001,
"loss": 0.0156,
"step": 2097
},
{
"epoch": 699.88,
"learning_rate": 0.0001,
"loss": 0.0161,
"step": 2100
},
{
"epoch": 700.88,
"learning_rate": 0.0001,
"loss": 0.0161,
"step": 2103
},
{
"epoch": 701.88,
"learning_rate": 0.0001,
"loss": 0.0158,
"step": 2106
},
{
"epoch": 702.88,
"learning_rate": 0.0001,
"loss": 0.0154,
"step": 2109
},
{
"epoch": 703.88,
"learning_rate": 0.0001,
"loss": 0.0154,
"step": 2112
},
{
"epoch": 703.88,
"eval_exact_match": 0.4874274661508704,
"eval_exec": 0.4864603481624758,
"eval_loss": 0.4481361210346222,
"eval_runtime": 110.2347,
"eval_samples_per_second": 9.38,
"step": 2112
},
{
"epoch": 704.88,
"learning_rate": 0.0001,
"loss": 0.0154,
"step": 2115
},
{
"epoch": 705.88,
"learning_rate": 0.0001,
"loss": 0.0151,
"step": 2118
},
{
"epoch": 706.88,
"learning_rate": 0.0001,
"loss": 0.015,
"step": 2121
},
{
"epoch": 707.88,
"learning_rate": 0.0001,
"loss": 0.0152,
"step": 2124
},
{
"epoch": 708.88,
"learning_rate": 0.0001,
"loss": 0.0143,
"step": 2127
},
{
"epoch": 709.88,
"learning_rate": 0.0001,
"loss": 0.0151,
"step": 2130
},
{
"epoch": 710.88,
"learning_rate": 0.0001,
"loss": 0.0146,
"step": 2133
},
{
"epoch": 711.88,
"learning_rate": 0.0001,
"loss": 0.015,
"step": 2136
},
{
"epoch": 712.88,
"learning_rate": 0.0001,
"loss": 0.0149,
"step": 2139
},
{
"epoch": 713.88,
"learning_rate": 0.0001,
"loss": 0.0153,
"step": 2142
},
{
"epoch": 714.88,
"learning_rate": 0.0001,
"loss": 0.0147,
"step": 2145
},
{
"epoch": 715.88,
"learning_rate": 0.0001,
"loss": 0.0147,
"step": 2148
},
{
"epoch": 716.88,
"learning_rate": 0.0001,
"loss": 0.0149,
"step": 2151
},
{
"epoch": 717.88,
"learning_rate": 0.0001,
"loss": 0.0151,
"step": 2154
},
{
"epoch": 718.88,
"learning_rate": 0.0001,
"loss": 0.0145,
"step": 2157
},
{
"epoch": 719.88,
"learning_rate": 0.0001,
"loss": 0.0147,
"step": 2160
},
{
"epoch": 720.88,
"learning_rate": 0.0001,
"loss": 0.0145,
"step": 2163
},
{
"epoch": 721.88,
"learning_rate": 0.0001,
"loss": 0.0145,
"step": 2166
},
{
"epoch": 722.88,
"learning_rate": 0.0001,
"loss": 0.0142,
"step": 2169
},
{
"epoch": 723.88,
"learning_rate": 0.0001,
"loss": 0.0142,
"step": 2172
},
{
"epoch": 724.88,
"learning_rate": 0.0001,
"loss": 0.0141,
"step": 2175
},
{
"epoch": 725.29,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.4548819959163666,
"eval_runtime": 108.1709,
"eval_samples_per_second": 9.559,
"step": 2176
},
{
"epoch": 725.88,
"learning_rate": 0.0001,
"loss": 0.0141,
"step": 2178
},
{
"epoch": 726.88,
"learning_rate": 0.0001,
"loss": 0.0153,
"step": 2181
},
{
"epoch": 727.88,
"learning_rate": 0.0001,
"loss": 0.0144,
"step": 2184
},
{
"epoch": 728.88,
"learning_rate": 0.0001,
"loss": 0.0145,
"step": 2187
},
{
"epoch": 729.88,
"learning_rate": 0.0001,
"loss": 0.0136,
"step": 2190
},
{
"epoch": 730.88,
"learning_rate": 0.0001,
"loss": 0.0136,
"step": 2193
},
{
"epoch": 731.88,
"learning_rate": 0.0001,
"loss": 0.0139,
"step": 2196
},
{
"epoch": 732.88,
"learning_rate": 0.0001,
"loss": 0.014,
"step": 2199
},
{
"epoch": 733.88,
"learning_rate": 0.0001,
"loss": 0.0137,
"step": 2202
},
{
"epoch": 734.88,
"learning_rate": 0.0001,
"loss": 0.0143,
"step": 2205
},
{
"epoch": 735.88,
"learning_rate": 0.0001,
"loss": 0.0138,
"step": 2208
},
{
"epoch": 736.88,
"learning_rate": 0.0001,
"loss": 0.0137,
"step": 2211
},
{
"epoch": 737.88,
"learning_rate": 0.0001,
"loss": 0.0142,
"step": 2214
},
{
"epoch": 738.88,
"learning_rate": 0.0001,
"loss": 0.0134,
"step": 2217
},
{
"epoch": 739.88,
"learning_rate": 0.0001,
"loss": 0.0134,
"step": 2220
},
{
"epoch": 740.88,
"learning_rate": 0.0001,
"loss": 0.0133,
"step": 2223
},
{
"epoch": 741.88,
"learning_rate": 0.0001,
"loss": 0.0137,
"step": 2226
},
{
"epoch": 742.88,
"learning_rate": 0.0001,
"loss": 0.0139,
"step": 2229
},
{
"epoch": 743.88,
"learning_rate": 0.0001,
"loss": 0.0134,
"step": 2232
},
{
"epoch": 744.88,
"learning_rate": 0.0001,
"loss": 0.0134,
"step": 2235
},
{
"epoch": 745.88,
"learning_rate": 0.0001,
"loss": 0.0135,
"step": 2238
},
{
"epoch": 746.59,
"eval_exact_match": 0.4835589941972921,
"eval_exec": 0.4864603481624758,
"eval_loss": 0.4577375054359436,
"eval_runtime": 101.9311,
"eval_samples_per_second": 10.144,
"step": 2240
},
{
"epoch": 746.88,
"learning_rate": 0.0001,
"loss": 0.0134,
"step": 2241
},
{
"epoch": 747.88,
"learning_rate": 0.0001,
"loss": 0.0139,
"step": 2244
},
{
"epoch": 748.88,
"learning_rate": 0.0001,
"loss": 0.0136,
"step": 2247
},
{
"epoch": 749.88,
"learning_rate": 0.0001,
"loss": 0.0137,
"step": 2250
},
{
"epoch": 750.88,
"learning_rate": 0.0001,
"loss": 0.0128,
"step": 2253
},
{
"epoch": 751.88,
"learning_rate": 0.0001,
"loss": 0.0125,
"step": 2256
},
{
"epoch": 752.88,
"learning_rate": 0.0001,
"loss": 0.0132,
"step": 2259
},
{
"epoch": 753.88,
"learning_rate": 0.0001,
"loss": 0.013,
"step": 2262
},
{
"epoch": 754.88,
"learning_rate": 0.0001,
"loss": 0.0127,
"step": 2265
},
{
"epoch": 755.88,
"learning_rate": 0.0001,
"loss": 0.0125,
"step": 2268
},
{
"epoch": 756.88,
"learning_rate": 0.0001,
"loss": 0.0126,
"step": 2271
},
{
"epoch": 757.88,
"learning_rate": 0.0001,
"loss": 0.0136,
"step": 2274
},
{
"epoch": 758.88,
"learning_rate": 0.0001,
"loss": 0.0125,
"step": 2277
},
{
"epoch": 759.88,
"learning_rate": 0.0001,
"loss": 0.0126,
"step": 2280
},
{
"epoch": 760.88,
"learning_rate": 0.0001,
"loss": 0.0122,
"step": 2283
},
{
"epoch": 761.88,
"learning_rate": 0.0001,
"loss": 0.0123,
"step": 2286
},
{
"epoch": 762.88,
"learning_rate": 0.0001,
"loss": 0.0125,
"step": 2289
},
{
"epoch": 763.88,
"learning_rate": 0.0001,
"loss": 0.0117,
"step": 2292
},
{
"epoch": 764.88,
"learning_rate": 0.0001,
"loss": 0.0121,
"step": 2295
},
{
"epoch": 765.88,
"learning_rate": 0.0001,
"loss": 0.0124,
"step": 2298
},
{
"epoch": 766.88,
"learning_rate": 0.0001,
"loss": 0.0122,
"step": 2301
},
{
"epoch": 767.88,
"learning_rate": 0.0001,
"loss": 0.0126,
"step": 2304
},
{
"epoch": 767.88,
"eval_exact_match": 0.48936170212765956,
"eval_exec": 0.488394584139265,
"eval_loss": 0.46691325306892395,
"eval_runtime": 106.1611,
"eval_samples_per_second": 9.74,
"step": 2304
},
{
"epoch": 768.88,
"learning_rate": 0.0001,
"loss": 0.0123,
"step": 2307
},
{
"epoch": 769.88,
"learning_rate": 0.0001,
"loss": 0.0114,
"step": 2310
},
{
"epoch": 770.88,
"learning_rate": 0.0001,
"loss": 0.0123,
"step": 2313
},
{
"epoch": 771.88,
"learning_rate": 0.0001,
"loss": 0.0128,
"step": 2316
},
{
"epoch": 772.88,
"learning_rate": 0.0001,
"loss": 0.0124,
"step": 2319
},
{
"epoch": 773.88,
"learning_rate": 0.0001,
"loss": 0.0125,
"step": 2322
},
{
"epoch": 774.88,
"learning_rate": 0.0001,
"loss": 0.0124,
"step": 2325
},
{
"epoch": 775.88,
"learning_rate": 0.0001,
"loss": 0.0117,
"step": 2328
},
{
"epoch": 776.88,
"learning_rate": 0.0001,
"loss": 0.0126,
"step": 2331
},
{
"epoch": 777.88,
"learning_rate": 0.0001,
"loss": 0.012,
"step": 2334
},
{
"epoch": 778.88,
"learning_rate": 0.0001,
"loss": 0.0126,
"step": 2337
},
{
"epoch": 779.88,
"learning_rate": 0.0001,
"loss": 0.0123,
"step": 2340
},
{
"epoch": 780.88,
"learning_rate": 0.0001,
"loss": 0.011,
"step": 2343
},
{
"epoch": 781.88,
"learning_rate": 0.0001,
"loss": 0.0116,
"step": 2346
},
{
"epoch": 782.88,
"learning_rate": 0.0001,
"loss": 0.0117,
"step": 2349
},
{
"epoch": 783.88,
"learning_rate": 0.0001,
"loss": 0.012,
"step": 2352
},
{
"epoch": 784.88,
"learning_rate": 0.0001,
"loss": 0.0114,
"step": 2355
},
{
"epoch": 785.88,
"learning_rate": 0.0001,
"loss": 0.0126,
"step": 2358
},
{
"epoch": 786.88,
"learning_rate": 0.0001,
"loss": 0.0112,
"step": 2361
},
{
"epoch": 787.88,
"learning_rate": 0.0001,
"loss": 0.0116,
"step": 2364
},
{
"epoch": 788.88,
"learning_rate": 0.0001,
"loss": 0.0114,
"step": 2367
},
{
"epoch": 789.29,
"eval_exact_match": 0.4951644100580271,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.4785517156124115,
"eval_runtime": 101.2749,
"eval_samples_per_second": 10.21,
"step": 2368
},
{
"epoch": 789.88,
"learning_rate": 0.0001,
"loss": 0.0109,
"step": 2370
},
{
"epoch": 790.88,
"learning_rate": 0.0001,
"loss": 0.0114,
"step": 2373
},
{
"epoch": 791.88,
"learning_rate": 0.0001,
"loss": 0.0114,
"step": 2376
},
{
"epoch": 792.88,
"learning_rate": 0.0001,
"loss": 0.0114,
"step": 2379
},
{
"epoch": 793.88,
"learning_rate": 0.0001,
"loss": 0.0109,
"step": 2382
},
{
"epoch": 794.88,
"learning_rate": 0.0001,
"loss": 0.0116,
"step": 2385
},
{
"epoch": 795.88,
"learning_rate": 0.0001,
"loss": 0.0115,
"step": 2388
},
{
"epoch": 796.88,
"learning_rate": 0.0001,
"loss": 0.011,
"step": 2391
},
{
"epoch": 797.88,
"learning_rate": 0.0001,
"loss": 0.011,
"step": 2394
},
{
"epoch": 798.88,
"learning_rate": 0.0001,
"loss": 0.0113,
"step": 2397
},
{
"epoch": 799.88,
"learning_rate": 0.0001,
"loss": 0.0114,
"step": 2400
},
{
"epoch": 800.88,
"learning_rate": 0.0001,
"loss": 0.011,
"step": 2403
},
{
"epoch": 801.88,
"learning_rate": 0.0001,
"loss": 0.0108,
"step": 2406
},
{
"epoch": 802.88,
"learning_rate": 0.0001,
"loss": 0.0112,
"step": 2409
},
{
"epoch": 803.88,
"learning_rate": 0.0001,
"loss": 0.0106,
"step": 2412
},
{
"epoch": 804.88,
"learning_rate": 0.0001,
"loss": 0.0108,
"step": 2415
},
{
"epoch": 805.88,
"learning_rate": 0.0001,
"loss": 0.0106,
"step": 2418
},
{
"epoch": 806.88,
"learning_rate": 0.0001,
"loss": 0.0109,
"step": 2421
},
{
"epoch": 807.88,
"learning_rate": 0.0001,
"loss": 0.0108,
"step": 2424
},
{
"epoch": 808.88,
"learning_rate": 0.0001,
"loss": 0.0113,
"step": 2427
},
{
"epoch": 809.88,
"learning_rate": 0.0001,
"loss": 0.0105,
"step": 2430
},
{
"epoch": 810.59,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.4874274661508704,
"eval_loss": 0.47889411449432373,
"eval_runtime": 106.781,
"eval_samples_per_second": 9.683,
"step": 2432
},
{
"epoch": 810.88,
"learning_rate": 0.0001,
"loss": 0.0109,
"step": 2433
},
{
"epoch": 811.88,
"learning_rate": 0.0001,
"loss": 0.0105,
"step": 2436
},
{
"epoch": 812.88,
"learning_rate": 0.0001,
"loss": 0.0112,
"step": 2439
},
{
"epoch": 813.88,
"learning_rate": 0.0001,
"loss": 0.0102,
"step": 2442
},
{
"epoch": 814.88,
"learning_rate": 0.0001,
"loss": 0.0104,
"step": 2445
},
{
"epoch": 815.88,
"learning_rate": 0.0001,
"loss": 0.0105,
"step": 2448
},
{
"epoch": 816.88,
"learning_rate": 0.0001,
"loss": 0.0101,
"step": 2451
},
{
"epoch": 817.88,
"learning_rate": 0.0001,
"loss": 0.0107,
"step": 2454
},
{
"epoch": 818.88,
"learning_rate": 0.0001,
"loss": 0.0104,
"step": 2457
},
{
"epoch": 819.88,
"learning_rate": 0.0001,
"loss": 0.01,
"step": 2460
},
{
"epoch": 820.88,
"learning_rate": 0.0001,
"loss": 0.0098,
"step": 2463
},
{
"epoch": 821.88,
"learning_rate": 0.0001,
"loss": 0.0102,
"step": 2466
},
{
"epoch": 822.88,
"learning_rate": 0.0001,
"loss": 0.0104,
"step": 2469
},
{
"epoch": 823.88,
"learning_rate": 0.0001,
"loss": 0.0118,
"step": 2472
},
{
"epoch": 824.88,
"learning_rate": 0.0001,
"loss": 0.0111,
"step": 2475
},
{
"epoch": 825.88,
"learning_rate": 0.0001,
"loss": 0.0101,
"step": 2478
},
{
"epoch": 826.88,
"learning_rate": 0.0001,
"loss": 0.0099,
"step": 2481
},
{
"epoch": 827.88,
"learning_rate": 0.0001,
"loss": 0.0101,
"step": 2484
},
{
"epoch": 828.88,
"learning_rate": 0.0001,
"loss": 0.0108,
"step": 2487
},
{
"epoch": 829.88,
"learning_rate": 0.0001,
"loss": 0.0109,
"step": 2490
},
{
"epoch": 830.88,
"learning_rate": 0.0001,
"loss": 0.0102,
"step": 2493
},
{
"epoch": 831.88,
"learning_rate": 0.0001,
"loss": 0.0106,
"step": 2496
},
{
"epoch": 831.88,
"eval_exact_match": 0.4941972920696325,
"eval_exec": 0.4922630560928433,
"eval_loss": 0.47770604491233826,
"eval_runtime": 109.549,
"eval_samples_per_second": 9.439,
"step": 2496
},
{
"epoch": 832.88,
"learning_rate": 0.0001,
"loss": 0.0097,
"step": 2499
},
{
"epoch": 833.88,
"learning_rate": 0.0001,
"loss": 0.0098,
"step": 2502
},
{
"epoch": 834.88,
"learning_rate": 0.0001,
"loss": 0.0102,
"step": 2505
},
{
"epoch": 835.88,
"learning_rate": 0.0001,
"loss": 0.0097,
"step": 2508
},
{
"epoch": 836.88,
"learning_rate": 0.0001,
"loss": 0.0097,
"step": 2511
},
{
"epoch": 837.88,
"learning_rate": 0.0001,
"loss": 0.0102,
"step": 2514
},
{
"epoch": 838.88,
"learning_rate": 0.0001,
"loss": 0.0092,
"step": 2517
},
{
"epoch": 839.88,
"learning_rate": 0.0001,
"loss": 0.0096,
"step": 2520
},
{
"epoch": 840.88,
"learning_rate": 0.0001,
"loss": 0.0101,
"step": 2523
},
{
"epoch": 841.88,
"learning_rate": 0.0001,
"loss": 0.0098,
"step": 2526
},
{
"epoch": 842.88,
"learning_rate": 0.0001,
"loss": 0.0101,
"step": 2529
},
{
"epoch": 843.88,
"learning_rate": 0.0001,
"loss": 0.0098,
"step": 2532
},
{
"epoch": 844.88,
"learning_rate": 0.0001,
"loss": 0.0096,
"step": 2535
},
{
"epoch": 845.88,
"learning_rate": 0.0001,
"loss": 0.0096,
"step": 2538
},
{
"epoch": 846.88,
"learning_rate": 0.0001,
"loss": 0.0094,
"step": 2541
},
{
"epoch": 847.88,
"learning_rate": 0.0001,
"loss": 0.0096,
"step": 2544
},
{
"epoch": 848.88,
"learning_rate": 0.0001,
"loss": 0.0101,
"step": 2547
},
{
"epoch": 849.88,
"learning_rate": 0.0001,
"loss": 0.0099,
"step": 2550
},
{
"epoch": 850.88,
"learning_rate": 0.0001,
"loss": 0.0102,
"step": 2553
},
{
"epoch": 851.88,
"learning_rate": 0.0001,
"loss": 0.0107,
"step": 2556
},
{
"epoch": 852.88,
"learning_rate": 0.0001,
"loss": 0.0095,
"step": 2559
},
{
"epoch": 853.29,
"eval_exact_match": 0.4922630560928433,
"eval_exec": 0.4932301740812379,
"eval_loss": 0.4875582158565521,
"eval_runtime": 106.2482,
"eval_samples_per_second": 9.732,
"step": 2560
},
{
"epoch": 853.88,
"learning_rate": 0.0001,
"loss": 0.0093,
"step": 2562
},
{
"epoch": 854.88,
"learning_rate": 0.0001,
"loss": 0.0097,
"step": 2565
},
{
"epoch": 855.88,
"learning_rate": 0.0001,
"loss": 0.0096,
"step": 2568
},
{
"epoch": 856.88,
"learning_rate": 0.0001,
"loss": 0.0097,
"step": 2571
},
{
"epoch": 857.88,
"learning_rate": 0.0001,
"loss": 0.0094,
"step": 2574
},
{
"epoch": 858.88,
"learning_rate": 0.0001,
"loss": 0.0095,
"step": 2577
},
{
"epoch": 859.88,
"learning_rate": 0.0001,
"loss": 0.0094,
"step": 2580
},
{
"epoch": 860.88,
"learning_rate": 0.0001,
"loss": 0.009,
"step": 2583
},
{
"epoch": 861.88,
"learning_rate": 0.0001,
"loss": 0.0096,
"step": 2586
},
{
"epoch": 862.88,
"learning_rate": 0.0001,
"loss": 0.0091,
"step": 2589
},
{
"epoch": 863.88,
"learning_rate": 0.0001,
"loss": 0.0087,
"step": 2592
},
{
"epoch": 864.88,
"learning_rate": 0.0001,
"loss": 0.0086,
"step": 2595
},
{
"epoch": 865.88,
"learning_rate": 0.0001,
"loss": 0.0089,
"step": 2598
},
{
"epoch": 866.88,
"learning_rate": 0.0001,
"loss": 0.0093,
"step": 2601
},
{
"epoch": 867.88,
"learning_rate": 0.0001,
"loss": 0.0094,
"step": 2604
},
{
"epoch": 868.88,
"learning_rate": 0.0001,
"loss": 0.0093,
"step": 2607
},
{
"epoch": 869.88,
"learning_rate": 0.0001,
"loss": 0.0092,
"step": 2610
},
{
"epoch": 870.88,
"learning_rate": 0.0001,
"loss": 0.0092,
"step": 2613
},
{
"epoch": 871.88,
"learning_rate": 0.0001,
"loss": 0.0087,
"step": 2616
},
{
"epoch": 872.88,
"learning_rate": 0.0001,
"loss": 0.0088,
"step": 2619
},
{
"epoch": 873.88,
"learning_rate": 0.0001,
"loss": 0.0093,
"step": 2622
},
{
"epoch": 874.59,
"eval_exact_match": 0.48936170212765956,
"eval_exec": 0.49032882011605416,
"eval_loss": 0.4897403120994568,
"eval_runtime": 109.6459,
"eval_samples_per_second": 9.43,
"step": 2624
},
{
"epoch": 874.88,
"learning_rate": 0.0001,
"loss": 0.009,
"step": 2625
},
{
"epoch": 875.88,
"learning_rate": 0.0001,
"loss": 0.0085,
"step": 2628
},
{
"epoch": 876.88,
"learning_rate": 0.0001,
"loss": 0.0086,
"step": 2631
},
{
"epoch": 877.88,
"learning_rate": 0.0001,
"loss": 0.0085,
"step": 2634
},
{
"epoch": 878.88,
"learning_rate": 0.0001,
"loss": 0.0093,
"step": 2637
},
{
"epoch": 879.88,
"learning_rate": 0.0001,
"loss": 0.0091,
"step": 2640
},
{
"epoch": 880.88,
"learning_rate": 0.0001,
"loss": 0.0086,
"step": 2643
},
{
"epoch": 881.88,
"learning_rate": 0.0001,
"loss": 0.0086,
"step": 2646
},
{
"epoch": 882.88,
"learning_rate": 0.0001,
"loss": 0.0089,
"step": 2649
},
{
"epoch": 883.88,
"learning_rate": 0.0001,
"loss": 0.0082,
"step": 2652
},
{
"epoch": 884.88,
"learning_rate": 0.0001,
"loss": 0.0085,
"step": 2655
},
{
"epoch": 885.88,
"learning_rate": 0.0001,
"loss": 0.0084,
"step": 2658
},
{
"epoch": 886.88,
"learning_rate": 0.0001,
"loss": 0.0086,
"step": 2661
},
{
"epoch": 887.88,
"learning_rate": 0.0001,
"loss": 0.008,
"step": 2664
},
{
"epoch": 888.88,
"learning_rate": 0.0001,
"loss": 0.0082,
"step": 2667
},
{
"epoch": 889.88,
"learning_rate": 0.0001,
"loss": 0.0082,
"step": 2670
},
{
"epoch": 890.88,
"learning_rate": 0.0001,
"loss": 0.0087,
"step": 2673
},
{
"epoch": 891.88,
"learning_rate": 0.0001,
"loss": 0.0083,
"step": 2676
},
{
"epoch": 892.88,
"learning_rate": 0.0001,
"loss": 0.0084,
"step": 2679
},
{
"epoch": 893.88,
"learning_rate": 0.0001,
"loss": 0.0087,
"step": 2682
},
{
"epoch": 894.88,
"learning_rate": 0.0001,
"loss": 0.0085,
"step": 2685
},
{
"epoch": 895.88,
"learning_rate": 0.0001,
"loss": 0.0083,
"step": 2688
},
{
"epoch": 895.88,
"eval_exact_match": 0.5,
"eval_exec": 0.4961315280464217,
"eval_loss": 0.4995100796222687,
"eval_runtime": 115.5484,
"eval_samples_per_second": 8.949,
"step": 2688
},
{
"epoch": 896.88,
"learning_rate": 0.0001,
"loss": 0.0081,
"step": 2691
},
{
"epoch": 897.88,
"learning_rate": 0.0001,
"loss": 0.0081,
"step": 2694
},
{
"epoch": 898.88,
"learning_rate": 0.0001,
"loss": 0.0088,
"step": 2697
},
{
"epoch": 899.88,
"learning_rate": 0.0001,
"loss": 0.0086,
"step": 2700
},
{
"epoch": 900.88,
"learning_rate": 0.0001,
"loss": 0.008,
"step": 2703
},
{
"epoch": 901.88,
"learning_rate": 0.0001,
"loss": 0.0088,
"step": 2706
},
{
"epoch": 902.88,
"learning_rate": 0.0001,
"loss": 0.0083,
"step": 2709
},
{
"epoch": 903.88,
"learning_rate": 0.0001,
"loss": 0.0084,
"step": 2712
},
{
"epoch": 904.88,
"learning_rate": 0.0001,
"loss": 0.0079,
"step": 2715
},
{
"epoch": 905.88,
"learning_rate": 0.0001,
"loss": 0.0084,
"step": 2718
},
{
"epoch": 906.88,
"learning_rate": 0.0001,
"loss": 0.0079,
"step": 2721
},
{
"epoch": 907.88,
"learning_rate": 0.0001,
"loss": 0.0082,
"step": 2724
},
{
"epoch": 908.88,
"learning_rate": 0.0001,
"loss": 0.0079,
"step": 2727
},
{
"epoch": 909.88,
"learning_rate": 0.0001,
"loss": 0.0081,
"step": 2730
},
{
"epoch": 910.88,
"learning_rate": 0.0001,
"loss": 0.008,
"step": 2733
},
{
"epoch": 911.88,
"learning_rate": 0.0001,
"loss": 0.0078,
"step": 2736
},
{
"epoch": 912.88,
"learning_rate": 0.0001,
"loss": 0.008,
"step": 2739
},
{
"epoch": 913.88,
"learning_rate": 0.0001,
"loss": 0.0083,
"step": 2742
},
{
"epoch": 914.88,
"learning_rate": 0.0001,
"loss": 0.0085,
"step": 2745
},
{
"epoch": 915.88,
"learning_rate": 0.0001,
"loss": 0.0079,
"step": 2748
},
{
"epoch": 916.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2751
},
{
"epoch": 917.29,
"eval_exact_match": 0.49709864603481624,
"eval_exec": 0.4941972920696325,
"eval_loss": 0.4965713918209076,
"eval_runtime": 103.1798,
"eval_samples_per_second": 10.021,
"step": 2752
},
{
"epoch": 917.88,
"learning_rate": 0.0001,
"loss": 0.0077,
"step": 2754
},
{
"epoch": 918.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2757
},
{
"epoch": 919.88,
"learning_rate": 0.0001,
"loss": 0.008,
"step": 2760
},
{
"epoch": 920.88,
"learning_rate": 0.0001,
"loss": 0.0083,
"step": 2763
},
{
"epoch": 921.88,
"learning_rate": 0.0001,
"loss": 0.008,
"step": 2766
},
{
"epoch": 922.88,
"learning_rate": 0.0001,
"loss": 0.0073,
"step": 2769
},
{
"epoch": 923.88,
"learning_rate": 0.0001,
"loss": 0.0074,
"step": 2772
},
{
"epoch": 924.88,
"learning_rate": 0.0001,
"loss": 0.0075,
"step": 2775
},
{
"epoch": 925.88,
"learning_rate": 0.0001,
"loss": 0.0079,
"step": 2778
},
{
"epoch": 926.88,
"learning_rate": 0.0001,
"loss": 0.0077,
"step": 2781
},
{
"epoch": 927.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2784
},
{
"epoch": 928.88,
"learning_rate": 0.0001,
"loss": 0.0075,
"step": 2787
},
{
"epoch": 929.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2790
},
{
"epoch": 930.88,
"learning_rate": 0.0001,
"loss": 0.0079,
"step": 2793
},
{
"epoch": 931.88,
"learning_rate": 0.0001,
"loss": 0.0078,
"step": 2796
},
{
"epoch": 932.88,
"learning_rate": 0.0001,
"loss": 0.007,
"step": 2799
},
{
"epoch": 933.88,
"learning_rate": 0.0001,
"loss": 0.0077,
"step": 2802
},
{
"epoch": 934.88,
"learning_rate": 0.0001,
"loss": 0.0072,
"step": 2805
},
{
"epoch": 935.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2808
},
{
"epoch": 936.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2811
},
{
"epoch": 937.88,
"learning_rate": 0.0001,
"loss": 0.0075,
"step": 2814
},
{
"epoch": 938.59,
"eval_exact_match": 0.4912959381044487,
"eval_exec": 0.49032882011605416,
"eval_loss": 0.5068889856338501,
"eval_runtime": 114.9149,
"eval_samples_per_second": 8.998,
"step": 2816
},
{
"epoch": 938.88,
"learning_rate": 0.0001,
"loss": 0.0077,
"step": 2817
},
{
"epoch": 939.88,
"learning_rate": 0.0001,
"loss": 0.0074,
"step": 2820
},
{
"epoch": 940.88,
"learning_rate": 0.0001,
"loss": 0.0077,
"step": 2823
},
{
"epoch": 941.88,
"learning_rate": 0.0001,
"loss": 0.008,
"step": 2826
},
{
"epoch": 942.88,
"learning_rate": 0.0001,
"loss": 0.0073,
"step": 2829
},
{
"epoch": 943.88,
"learning_rate": 0.0001,
"loss": 0.0073,
"step": 2832
},
{
"epoch": 944.88,
"learning_rate": 0.0001,
"loss": 0.007,
"step": 2835
},
{
"epoch": 945.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2838
},
{
"epoch": 946.88,
"learning_rate": 0.0001,
"loss": 0.0071,
"step": 2841
},
{
"epoch": 947.88,
"learning_rate": 0.0001,
"loss": 0.0071,
"step": 2844
},
{
"epoch": 948.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2847
},
{
"epoch": 949.88,
"learning_rate": 0.0001,
"loss": 0.0078,
"step": 2850
},
{
"epoch": 950.88,
"learning_rate": 0.0001,
"loss": 0.0082,
"step": 2853
},
{
"epoch": 951.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2856
},
{
"epoch": 952.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2859
},
{
"epoch": 953.88,
"learning_rate": 0.0001,
"loss": 0.007,
"step": 2862
},
{
"epoch": 954.88,
"learning_rate": 0.0001,
"loss": 0.0066,
"step": 2865
},
{
"epoch": 955.88,
"learning_rate": 0.0001,
"loss": 0.0071,
"step": 2868
},
{
"epoch": 956.88,
"learning_rate": 0.0001,
"loss": 0.0073,
"step": 2871
},
{
"epoch": 957.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2874
},
{
"epoch": 958.88,
"learning_rate": 0.0001,
"loss": 0.0064,
"step": 2877
},
{
"epoch": 959.88,
"learning_rate": 0.0001,
"loss": 0.0076,
"step": 2880
},
{
"epoch": 959.88,
"eval_exact_match": 0.4835589941972921,
"eval_exec": 0.488394584139265,
"eval_loss": 0.5026101469993591,
"eval_runtime": 106.021,
"eval_samples_per_second": 9.753,
"step": 2880
},
{
"epoch": 960.88,
"learning_rate": 0.0001,
"loss": 0.0072,
"step": 2883
},
{
"epoch": 961.88,
"learning_rate": 0.0001,
"loss": 0.0065,
"step": 2886
},
{
"epoch": 962.88,
"learning_rate": 0.0001,
"loss": 0.0074,
"step": 2889
},
{
"epoch": 963.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 2892
},
{
"epoch": 964.88,
"learning_rate": 0.0001,
"loss": 0.0072,
"step": 2895
},
{
"epoch": 965.88,
"learning_rate": 0.0001,
"loss": 0.0074,
"step": 2898
},
{
"epoch": 966.88,
"learning_rate": 0.0001,
"loss": 0.007,
"step": 2901
},
{
"epoch": 967.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2904
},
{
"epoch": 968.88,
"learning_rate": 0.0001,
"loss": 0.0065,
"step": 2907
},
{
"epoch": 969.88,
"learning_rate": 0.0001,
"loss": 0.0069,
"step": 2910
},
{
"epoch": 970.88,
"learning_rate": 0.0001,
"loss": 0.0066,
"step": 2913
},
{
"epoch": 971.88,
"learning_rate": 0.0001,
"loss": 0.007,
"step": 2916
},
{
"epoch": 972.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2919
},
{
"epoch": 973.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 2922
},
{
"epoch": 974.88,
"learning_rate": 0.0001,
"loss": 0.0067,
"step": 2925
},
{
"epoch": 975.88,
"learning_rate": 0.0001,
"loss": 0.0066,
"step": 2928
},
{
"epoch": 976.88,
"learning_rate": 0.0001,
"loss": 0.0067,
"step": 2931
},
{
"epoch": 977.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2934
},
{
"epoch": 978.88,
"learning_rate": 0.0001,
"loss": 0.0066,
"step": 2937
},
{
"epoch": 979.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2940
},
{
"epoch": 980.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2943
},
{
"epoch": 981.29,
"eval_exact_match": 0.4796905222437137,
"eval_exec": 0.4874274661508704,
"eval_loss": 0.5093928575515747,
"eval_runtime": 102.014,
"eval_samples_per_second": 10.136,
"step": 2944
},
{
"epoch": 981.88,
"learning_rate": 0.0001,
"loss": 0.0064,
"step": 2946
},
{
"epoch": 982.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 2949
},
{
"epoch": 983.88,
"learning_rate": 0.0001,
"loss": 0.0065,
"step": 2952
},
{
"epoch": 984.88,
"learning_rate": 0.0001,
"loss": 0.0067,
"step": 2955
},
{
"epoch": 985.88,
"learning_rate": 0.0001,
"loss": 0.0064,
"step": 2958
},
{
"epoch": 986.88,
"learning_rate": 0.0001,
"loss": 0.0064,
"step": 2961
},
{
"epoch": 987.88,
"learning_rate": 0.0001,
"loss": 0.0058,
"step": 2964
},
{
"epoch": 988.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 2967
},
{
"epoch": 989.88,
"learning_rate": 0.0001,
"loss": 0.0068,
"step": 2970
},
{
"epoch": 990.88,
"learning_rate": 0.0001,
"loss": 0.0065,
"step": 2973
},
{
"epoch": 991.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 2976
},
{
"epoch": 992.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 2979
},
{
"epoch": 993.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 2982
},
{
"epoch": 994.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 2985
},
{
"epoch": 995.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 2988
},
{
"epoch": 996.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 2991
},
{
"epoch": 997.88,
"learning_rate": 0.0001,
"loss": 0.0061,
"step": 2994
},
{
"epoch": 998.88,
"learning_rate": 0.0001,
"loss": 0.0065,
"step": 2997
},
{
"epoch": 999.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 3000
},
{
"epoch": 1000.88,
"learning_rate": 0.0001,
"loss": 0.0065,
"step": 3003
},
{
"epoch": 1001.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 3006
},
{
"epoch": 1002.59,
"eval_exact_match": 0.49032882011605416,
"eval_exec": 0.4874274661508704,
"eval_loss": 0.5153567790985107,
"eval_runtime": 112.3969,
"eval_samples_per_second": 9.2,
"step": 3008
},
{
"epoch": 1002.88,
"learning_rate": 0.0001,
"loss": 0.0067,
"step": 3009
},
{
"epoch": 1003.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 3012
},
{
"epoch": 1004.88,
"learning_rate": 0.0001,
"loss": 0.0064,
"step": 3015
},
{
"epoch": 1005.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3018
},
{
"epoch": 1006.88,
"learning_rate": 0.0001,
"loss": 0.0067,
"step": 3021
},
{
"epoch": 1007.88,
"learning_rate": 0.0001,
"loss": 0.0061,
"step": 3024
},
{
"epoch": 1008.88,
"learning_rate": 0.0001,
"loss": 0.0066,
"step": 3027
},
{
"epoch": 1009.88,
"learning_rate": 0.0001,
"loss": 0.0064,
"step": 3030
},
{
"epoch": 1010.88,
"learning_rate": 0.0001,
"loss": 0.0066,
"step": 3033
},
{
"epoch": 1011.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 3036
},
{
"epoch": 1012.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 3039
},
{
"epoch": 1013.88,
"learning_rate": 0.0001,
"loss": 0.0061,
"step": 3042
},
{
"epoch": 1014.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 3045
},
{
"epoch": 1015.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 3048
},
{
"epoch": 1016.88,
"learning_rate": 0.0001,
"loss": 0.0063,
"step": 3051
},
{
"epoch": 1017.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3054
},
{
"epoch": 1018.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 3057
},
{
"epoch": 1019.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 3060
},
{
"epoch": 1020.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 3063
},
{
"epoch": 1021.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 3066
},
{
"epoch": 1022.88,
"learning_rate": 0.0001,
"loss": 0.0058,
"step": 3069
},
{
"epoch": 1023.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 3072
},
{
"epoch": 1023.88,
"eval_exact_match": 0.4864603481624758,
"eval_exec": 0.4864603481624758,
"eval_loss": 0.5245723724365234,
"eval_runtime": 108.9392,
"eval_samples_per_second": 9.492,
"step": 3072
},
{
"epoch": 1024.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3075
},
{
"epoch": 1025.88,
"learning_rate": 0.0001,
"loss": 0.0061,
"step": 3078
},
{
"epoch": 1026.88,
"learning_rate": 0.0001,
"loss": 0.0064,
"step": 3081
},
{
"epoch": 1027.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3084
},
{
"epoch": 1028.88,
"learning_rate": 0.0001,
"loss": 0.0061,
"step": 3087
},
{
"epoch": 1029.88,
"learning_rate": 0.0001,
"loss": 0.0056,
"step": 3090
},
{
"epoch": 1030.88,
"learning_rate": 0.0001,
"loss": 0.0057,
"step": 3093
},
{
"epoch": 1031.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 3096
},
{
"epoch": 1032.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3099
},
{
"epoch": 1033.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 3102
},
{
"epoch": 1034.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 3105
},
{
"epoch": 1035.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3108
},
{
"epoch": 1036.88,
"learning_rate": 0.0001,
"loss": 0.0057,
"step": 3111
},
{
"epoch": 1037.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3114
},
{
"epoch": 1038.88,
"learning_rate": 0.0001,
"loss": 0.0061,
"step": 3117
},
{
"epoch": 1039.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3120
},
{
"epoch": 1040.88,
"learning_rate": 0.0001,
"loss": 0.0057,
"step": 3123
},
{
"epoch": 1041.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3126
},
{
"epoch": 1042.88,
"learning_rate": 0.0001,
"loss": 0.0056,
"step": 3129
},
{
"epoch": 1043.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3132
},
{
"epoch": 1044.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3135
},
{
"epoch": 1045.29,
"eval_exact_match": 0.49032882011605416,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.5266330242156982,
"eval_runtime": 100.7584,
"eval_samples_per_second": 10.262,
"step": 3136
},
{
"epoch": 1045.88,
"learning_rate": 0.0001,
"loss": 0.0065,
"step": 3138
},
{
"epoch": 1046.88,
"learning_rate": 0.0001,
"loss": 0.0062,
"step": 3141
},
{
"epoch": 1047.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3144
},
{
"epoch": 1048.88,
"learning_rate": 0.0001,
"loss": 0.0056,
"step": 3147
},
{
"epoch": 1049.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3150
},
{
"epoch": 1050.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3153
},
{
"epoch": 1051.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3156
},
{
"epoch": 1052.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3159
},
{
"epoch": 1053.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3162
},
{
"epoch": 1054.88,
"learning_rate": 0.0001,
"loss": 0.0057,
"step": 3165
},
{
"epoch": 1055.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3168
},
{
"epoch": 1056.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3171
},
{
"epoch": 1057.88,
"learning_rate": 0.0001,
"loss": 0.006,
"step": 3174
},
{
"epoch": 1058.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3177
},
{
"epoch": 1059.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3180
},
{
"epoch": 1060.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3183
},
{
"epoch": 1061.88,
"learning_rate": 0.0001,
"loss": 0.0056,
"step": 3186
},
{
"epoch": 1062.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3189
},
{
"epoch": 1063.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3192
},
{
"epoch": 1064.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3195
},
{
"epoch": 1065.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3198
},
{
"epoch": 1066.59,
"eval_exact_match": 0.4864603481624758,
"eval_exec": 0.48549323017408125,
"eval_loss": 0.5267293453216553,
"eval_runtime": 104.4326,
"eval_samples_per_second": 9.901,
"step": 3200
},
{
"epoch": 1066.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3201
},
{
"epoch": 1067.88,
"learning_rate": 0.0001,
"loss": 0.0058,
"step": 3204
},
{
"epoch": 1068.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3207
},
{
"epoch": 1069.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3210
},
{
"epoch": 1070.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3213
},
{
"epoch": 1071.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3216
},
{
"epoch": 1072.88,
"learning_rate": 0.0001,
"loss": 0.0056,
"step": 3219
},
{
"epoch": 1073.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3222
},
{
"epoch": 1074.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3225
},
{
"epoch": 1075.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3228
},
{
"epoch": 1076.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3231
},
{
"epoch": 1077.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3234
},
{
"epoch": 1078.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3237
},
{
"epoch": 1079.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3240
},
{
"epoch": 1080.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3243
},
{
"epoch": 1081.88,
"learning_rate": 0.0001,
"loss": 0.0055,
"step": 3246
},
{
"epoch": 1082.88,
"learning_rate": 0.0001,
"loss": 0.0056,
"step": 3249
},
{
"epoch": 1083.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3252
},
{
"epoch": 1084.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3255
},
{
"epoch": 1085.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3258
},
{
"epoch": 1086.88,
"learning_rate": 0.0001,
"loss": 0.0057,
"step": 3261
},
{
"epoch": 1087.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3264
},
{
"epoch": 1087.88,
"eval_exact_match": 0.488394584139265,
"eval_exec": 0.4835589941972921,
"eval_loss": 0.5323160290718079,
"eval_runtime": 100.2092,
"eval_samples_per_second": 10.318,
"step": 3264
},
{
"epoch": 1088.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3267
},
{
"epoch": 1089.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3270
},
{
"epoch": 1090.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3273
},
{
"epoch": 1091.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3276
},
{
"epoch": 1092.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3279
},
{
"epoch": 1093.88,
"learning_rate": 0.0001,
"loss": 0.0056,
"step": 3282
},
{
"epoch": 1094.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3285
},
{
"epoch": 1095.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3288
},
{
"epoch": 1096.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3291
},
{
"epoch": 1097.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3294
},
{
"epoch": 1098.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3297
},
{
"epoch": 1099.88,
"learning_rate": 0.0001,
"loss": 0.0059,
"step": 3300
},
{
"epoch": 1100.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3303
},
{
"epoch": 1101.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3306
},
{
"epoch": 1102.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3309
},
{
"epoch": 1103.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3312
},
{
"epoch": 1104.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3315
},
{
"epoch": 1105.88,
"learning_rate": 0.0001,
"loss": 0.0054,
"step": 3318
},
{
"epoch": 1106.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3321
},
{
"epoch": 1107.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3324
},
{
"epoch": 1108.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3327
},
{
"epoch": 1109.29,
"eval_exact_match": 0.48452611218568664,
"eval_exec": 0.4796905222437137,
"eval_loss": 0.5343111157417297,
"eval_runtime": 99.4552,
"eval_samples_per_second": 10.397,
"step": 3328
},
{
"epoch": 1109.88,
"learning_rate": 0.0001,
"loss": 0.0053,
"step": 3330
},
{
"epoch": 1110.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3333
},
{
"epoch": 1111.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3336
},
{
"epoch": 1112.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3339
},
{
"epoch": 1113.88,
"learning_rate": 0.0001,
"loss": 0.0047,
"step": 3342
},
{
"epoch": 1114.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3345
},
{
"epoch": 1115.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3348
},
{
"epoch": 1116.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3351
},
{
"epoch": 1117.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3354
},
{
"epoch": 1118.88,
"learning_rate": 0.0001,
"loss": 0.0047,
"step": 3357
},
{
"epoch": 1119.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3360
},
{
"epoch": 1120.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3363
},
{
"epoch": 1121.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3366
},
{
"epoch": 1122.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3369
},
{
"epoch": 1123.88,
"learning_rate": 0.0001,
"loss": 0.0047,
"step": 3372
},
{
"epoch": 1124.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3375
},
{
"epoch": 1125.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3378
},
{
"epoch": 1126.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3381
},
{
"epoch": 1127.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3384
},
{
"epoch": 1128.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3387
},
{
"epoch": 1129.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3390
},
{
"epoch": 1130.59,
"eval_exact_match": 0.488394584139265,
"eval_exec": 0.488394584139265,
"eval_loss": 0.5409371256828308,
"eval_runtime": 104.8508,
"eval_samples_per_second": 9.862,
"step": 3392
},
{
"epoch": 1130.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3393
},
{
"epoch": 1131.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3396
},
{
"epoch": 1132.88,
"learning_rate": 0.0001,
"loss": 0.0046,
"step": 3399
},
{
"epoch": 1133.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3402
},
{
"epoch": 1134.88,
"learning_rate": 0.0001,
"loss": 0.0047,
"step": 3405
},
{
"epoch": 1135.88,
"learning_rate": 0.0001,
"loss": 0.0048,
"step": 3408
},
{
"epoch": 1136.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3411
},
{
"epoch": 1137.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3414
},
{
"epoch": 1138.88,
"learning_rate": 0.0001,
"loss": 0.0046,
"step": 3417
},
{
"epoch": 1139.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3420
},
{
"epoch": 1140.88,
"learning_rate": 0.0001,
"loss": 0.005,
"step": 3423
},
{
"epoch": 1141.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3426
},
{
"epoch": 1142.88,
"learning_rate": 0.0001,
"loss": 0.0046,
"step": 3429
},
{
"epoch": 1143.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3432
},
{
"epoch": 1144.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3435
},
{
"epoch": 1145.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3438
},
{
"epoch": 1146.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3441
},
{
"epoch": 1147.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3444
},
{
"epoch": 1148.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3447
},
{
"epoch": 1149.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3450
},
{
"epoch": 1150.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3453
},
{
"epoch": 1151.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3456
},
{
"epoch": 1151.88,
"eval_exact_match": 0.4941972920696325,
"eval_exec": 0.488394584139265,
"eval_loss": 0.5484944581985474,
"eval_runtime": 103.3732,
"eval_samples_per_second": 10.003,
"step": 3456
},
{
"epoch": 1152.88,
"learning_rate": 0.0001,
"loss": 0.0051,
"step": 3459
},
{
"epoch": 1153.88,
"learning_rate": 0.0001,
"loss": 0.0052,
"step": 3462
},
{
"epoch": 1154.88,
"learning_rate": 0.0001,
"loss": 0.0046,
"step": 3465
},
{
"epoch": 1155.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3468
},
{
"epoch": 1156.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3471
},
{
"epoch": 1157.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3474
},
{
"epoch": 1158.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3477
},
{
"epoch": 1159.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3480
},
{
"epoch": 1160.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3483
},
{
"epoch": 1161.88,
"learning_rate": 0.0001,
"loss": 0.0046,
"step": 3486
},
{
"epoch": 1162.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3489
},
{
"epoch": 1163.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3492
},
{
"epoch": 1164.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3495
},
{
"epoch": 1165.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3498
},
{
"epoch": 1166.88,
"learning_rate": 0.0001,
"loss": 0.0049,
"step": 3501
},
{
"epoch": 1167.88,
"learning_rate": 0.0001,
"loss": 0.0042,
"step": 3504
},
{
"epoch": 1168.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3507
},
{
"epoch": 1169.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3510
},
{
"epoch": 1170.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3513
},
{
"epoch": 1171.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3516
},
{
"epoch": 1172.88,
"learning_rate": 0.0001,
"loss": 0.0042,
"step": 3519
},
{
"epoch": 1173.29,
"eval_exact_match": 0.4990328820116054,
"eval_exec": 0.4941972920696325,
"eval_loss": 0.547235369682312,
"eval_runtime": 96.1089,
"eval_samples_per_second": 10.759,
"step": 3520
},
{
"epoch": 1173.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3522
},
{
"epoch": 1174.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3525
},
{
"epoch": 1175.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3528
},
{
"epoch": 1176.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3531
},
{
"epoch": 1177.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3534
},
{
"epoch": 1178.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3537
},
{
"epoch": 1179.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3540
},
{
"epoch": 1180.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3543
},
{
"epoch": 1181.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3546
},
{
"epoch": 1182.88,
"learning_rate": 0.0001,
"loss": 0.0046,
"step": 3549
},
{
"epoch": 1183.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3552
},
{
"epoch": 1184.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3555
},
{
"epoch": 1185.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3558
},
{
"epoch": 1186.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3561
},
{
"epoch": 1187.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3564
},
{
"epoch": 1188.88,
"learning_rate": 0.0001,
"loss": 0.0042,
"step": 3567
},
{
"epoch": 1189.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3570
},
{
"epoch": 1190.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3573
},
{
"epoch": 1191.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3576
},
{
"epoch": 1192.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3579
},
{
"epoch": 1193.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3582
},
{
"epoch": 1194.59,
"eval_exact_match": 0.5009671179883946,
"eval_exec": 0.49709864603481624,
"eval_loss": 0.5491827130317688,
"eval_runtime": 100.0201,
"eval_samples_per_second": 10.338,
"step": 3584
},
{
"epoch": 1194.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3585
},
{
"epoch": 1195.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3588
},
{
"epoch": 1196.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3591
},
{
"epoch": 1197.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3594
},
{
"epoch": 1198.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3597
},
{
"epoch": 1199.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3600
},
{
"epoch": 1200.88,
"learning_rate": 0.0001,
"loss": 0.0042,
"step": 3603
},
{
"epoch": 1201.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3606
},
{
"epoch": 1202.88,
"learning_rate": 0.0001,
"loss": 0.0042,
"step": 3609
},
{
"epoch": 1203.88,
"learning_rate": 0.0001,
"loss": 0.0044,
"step": 3612
},
{
"epoch": 1204.88,
"learning_rate": 0.0001,
"loss": 0.0045,
"step": 3615
},
{
"epoch": 1205.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3618
},
{
"epoch": 1206.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3621
},
{
"epoch": 1207.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3624
},
{
"epoch": 1208.88,
"learning_rate": 0.0001,
"loss": 0.0042,
"step": 3627
},
{
"epoch": 1209.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3630
},
{
"epoch": 1210.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3633
},
{
"epoch": 1211.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3636
},
{
"epoch": 1212.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3639
},
{
"epoch": 1213.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3642
},
{
"epoch": 1214.88,
"learning_rate": 0.0001,
"loss": 0.0042,
"step": 3645
},
{
"epoch": 1215.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3648
},
{
"epoch": 1215.88,
"eval_exact_match": 0.4864603481624758,
"eval_exec": 0.48549323017408125,
"eval_loss": 0.5521473288536072,
"eval_runtime": 101.5945,
"eval_samples_per_second": 10.178,
"step": 3648
},
{
"epoch": 1216.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3651
},
{
"epoch": 1217.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3654
},
{
"epoch": 1218.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3657
},
{
"epoch": 1219.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3660
},
{
"epoch": 1220.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3663
},
{
"epoch": 1221.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3666
},
{
"epoch": 1222.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3669
},
{
"epoch": 1223.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3672
},
{
"epoch": 1224.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3675
},
{
"epoch": 1225.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3678
},
{
"epoch": 1226.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3681
},
{
"epoch": 1227.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3684
},
{
"epoch": 1228.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3687
},
{
"epoch": 1229.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3690
},
{
"epoch": 1230.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3693
},
{
"epoch": 1231.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3696
},
{
"epoch": 1232.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3699
},
{
"epoch": 1233.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3702
},
{
"epoch": 1234.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3705
},
{
"epoch": 1235.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3708
},
{
"epoch": 1236.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3711
},
{
"epoch": 1237.29,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.48549323017408125,
"eval_loss": 0.5529308319091797,
"eval_runtime": 103.2003,
"eval_samples_per_second": 10.019,
"step": 3712
},
{
"epoch": 1237.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3714
},
{
"epoch": 1238.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3717
},
{
"epoch": 1239.88,
"learning_rate": 0.0001,
"loss": 0.0041,
"step": 3720
},
{
"epoch": 1240.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3723
},
{
"epoch": 1241.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3726
},
{
"epoch": 1242.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3729
},
{
"epoch": 1243.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3732
},
{
"epoch": 1244.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3735
},
{
"epoch": 1245.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3738
},
{
"epoch": 1246.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3741
},
{
"epoch": 1247.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3744
},
{
"epoch": 1248.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3747
},
{
"epoch": 1249.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3750
},
{
"epoch": 1250.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3753
},
{
"epoch": 1251.88,
"learning_rate": 0.0001,
"loss": 0.0043,
"step": 3756
},
{
"epoch": 1252.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3759
},
{
"epoch": 1253.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3762
},
{
"epoch": 1254.88,
"learning_rate": 0.0001,
"loss": 0.004,
"step": 3765
},
{
"epoch": 1255.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3768
},
{
"epoch": 1256.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3771
},
{
"epoch": 1257.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3774
},
{
"epoch": 1258.59,
"eval_exact_match": 0.48936170212765956,
"eval_exec": 0.4864603481624758,
"eval_loss": 0.5576500296592712,
"eval_runtime": 102.4554,
"eval_samples_per_second": 10.092,
"step": 3776
},
{
"epoch": 1258.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3777
},
{
"epoch": 1259.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3780
},
{
"epoch": 1260.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3783
},
{
"epoch": 1261.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3786
},
{
"epoch": 1262.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3789
},
{
"epoch": 1263.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3792
},
{
"epoch": 1264.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3795
},
{
"epoch": 1265.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3798
},
{
"epoch": 1266.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3801
},
{
"epoch": 1267.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3804
},
{
"epoch": 1268.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3807
},
{
"epoch": 1269.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3810
},
{
"epoch": 1270.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3813
},
{
"epoch": 1271.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3816
},
{
"epoch": 1272.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3819
},
{
"epoch": 1273.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3822
},
{
"epoch": 1274.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3825
},
{
"epoch": 1275.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3828
},
{
"epoch": 1276.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3831
},
{
"epoch": 1277.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3834
},
{
"epoch": 1278.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3837
},
{
"epoch": 1279.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3840
},
{
"epoch": 1279.88,
"eval_exact_match": 0.4990328820116054,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.5551109910011292,
"eval_runtime": 108.2571,
"eval_samples_per_second": 9.551,
"step": 3840
},
{
"epoch": 1280.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3843
},
{
"epoch": 1281.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3846
},
{
"epoch": 1282.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3849
},
{
"epoch": 1283.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3852
},
{
"epoch": 1284.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3855
},
{
"epoch": 1285.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3858
},
{
"epoch": 1286.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3861
},
{
"epoch": 1287.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 3864
},
{
"epoch": 1288.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3867
},
{
"epoch": 1289.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3870
},
{
"epoch": 1290.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3873
},
{
"epoch": 1291.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3876
},
{
"epoch": 1292.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3879
},
{
"epoch": 1293.88,
"learning_rate": 0.0001,
"loss": 0.0039,
"step": 3882
},
{
"epoch": 1294.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3885
},
{
"epoch": 1295.88,
"learning_rate": 0.0001,
"loss": 0.0037,
"step": 3888
},
{
"epoch": 1296.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3891
},
{
"epoch": 1297.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3894
},
{
"epoch": 1298.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3897
},
{
"epoch": 1299.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3900
},
{
"epoch": 1300.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3903
},
{
"epoch": 1301.29,
"eval_exact_match": 0.49806576402321084,
"eval_exec": 0.4941972920696325,
"eval_loss": 0.5643026232719421,
"eval_runtime": 100.8652,
"eval_samples_per_second": 10.251,
"step": 3904
},
{
"epoch": 1301.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 3906
},
{
"epoch": 1302.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3909
},
{
"epoch": 1303.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3912
},
{
"epoch": 1304.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3915
},
{
"epoch": 1305.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3918
},
{
"epoch": 1306.88,
"learning_rate": 0.0001,
"loss": 0.0038,
"step": 3921
},
{
"epoch": 1307.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3924
},
{
"epoch": 1308.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3927
},
{
"epoch": 1309.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 3930
},
{
"epoch": 1310.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3933
},
{
"epoch": 1311.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3936
},
{
"epoch": 1312.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3939
},
{
"epoch": 1313.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 3942
},
{
"epoch": 1314.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3945
},
{
"epoch": 1315.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3948
},
{
"epoch": 1316.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3951
},
{
"epoch": 1317.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 3954
},
{
"epoch": 1318.88,
"learning_rate": 0.0001,
"loss": 0.0036,
"step": 3957
},
{
"epoch": 1319.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 3960
},
{
"epoch": 1320.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3963
},
{
"epoch": 1321.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3966
},
{
"epoch": 1322.59,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.48549323017408125,
"eval_loss": 0.5721480250358582,
"eval_runtime": 106.1276,
"eval_samples_per_second": 9.743,
"step": 3968
},
{
"epoch": 1322.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 3969
},
{
"epoch": 1323.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3972
},
{
"epoch": 1324.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 3975
},
{
"epoch": 1325.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3978
},
{
"epoch": 1326.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 3981
},
{
"epoch": 1327.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 3984
},
{
"epoch": 1328.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 3987
},
{
"epoch": 1329.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3990
},
{
"epoch": 1330.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 3993
},
{
"epoch": 1331.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 3996
},
{
"epoch": 1332.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 3999
},
{
"epoch": 1333.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4002
},
{
"epoch": 1334.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 4005
},
{
"epoch": 1335.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4008
},
{
"epoch": 1336.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4011
},
{
"epoch": 1337.88,
"learning_rate": 0.0001,
"loss": 0.0034,
"step": 4014
},
{
"epoch": 1338.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4017
},
{
"epoch": 1339.88,
"learning_rate": 0.0001,
"loss": 0.0035,
"step": 4020
},
{
"epoch": 1340.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4023
},
{
"epoch": 1341.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4026
},
{
"epoch": 1342.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4029
},
{
"epoch": 1343.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4032
},
{
"epoch": 1343.88,
"eval_exact_match": 0.4912959381044487,
"eval_exec": 0.4864603481624758,
"eval_loss": 0.5649085640907288,
"eval_runtime": 100.2657,
"eval_samples_per_second": 10.313,
"step": 4032
},
{
"epoch": 1344.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4035
},
{
"epoch": 1345.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4038
},
{
"epoch": 1346.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4041
},
{
"epoch": 1347.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4044
},
{
"epoch": 1348.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4047
},
{
"epoch": 1349.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4050
},
{
"epoch": 1350.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4053
},
{
"epoch": 1351.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4056
},
{
"epoch": 1352.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4059
},
{
"epoch": 1353.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4062
},
{
"epoch": 1354.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4065
},
{
"epoch": 1355.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4068
},
{
"epoch": 1356.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4071
},
{
"epoch": 1357.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4074
},
{
"epoch": 1358.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4077
},
{
"epoch": 1359.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4080
},
{
"epoch": 1360.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4083
},
{
"epoch": 1361.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4086
},
{
"epoch": 1362.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4089
},
{
"epoch": 1363.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4092
},
{
"epoch": 1364.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4095
},
{
"epoch": 1365.29,
"eval_exact_match": 0.49806576402321084,
"eval_exec": 0.4922630560928433,
"eval_loss": 0.5747038722038269,
"eval_runtime": 108.1776,
"eval_samples_per_second": 9.558,
"step": 4096
},
{
"epoch": 1365.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4098
},
{
"epoch": 1366.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4101
},
{
"epoch": 1367.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4104
},
{
"epoch": 1368.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4107
},
{
"epoch": 1369.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4110
},
{
"epoch": 1370.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4113
},
{
"epoch": 1371.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4116
},
{
"epoch": 1372.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4119
},
{
"epoch": 1373.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4122
},
{
"epoch": 1374.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4125
},
{
"epoch": 1375.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4128
},
{
"epoch": 1376.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4131
},
{
"epoch": 1377.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4134
},
{
"epoch": 1378.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4137
},
{
"epoch": 1379.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4140
},
{
"epoch": 1380.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4143
},
{
"epoch": 1381.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4146
},
{
"epoch": 1382.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4149
},
{
"epoch": 1383.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4152
},
{
"epoch": 1384.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4155
},
{
"epoch": 1385.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4158
},
{
"epoch": 1386.59,
"eval_exact_match": 0.49032882011605416,
"eval_exec": 0.48549323017408125,
"eval_loss": 0.5771034359931946,
"eval_runtime": 105.7502,
"eval_samples_per_second": 9.778,
"step": 4160
},
{
"epoch": 1386.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4161
},
{
"epoch": 1387.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4164
},
{
"epoch": 1388.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4167
},
{
"epoch": 1389.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4170
},
{
"epoch": 1390.88,
"learning_rate": 0.0001,
"loss": 0.0032,
"step": 4173
},
{
"epoch": 1391.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4176
},
{
"epoch": 1392.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4179
},
{
"epoch": 1393.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4182
},
{
"epoch": 1394.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4185
},
{
"epoch": 1395.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4188
},
{
"epoch": 1396.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4191
},
{
"epoch": 1397.88,
"learning_rate": 0.0001,
"loss": 0.0033,
"step": 4194
},
{
"epoch": 1398.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4197
},
{
"epoch": 1399.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4200
},
{
"epoch": 1400.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4203
},
{
"epoch": 1401.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4206
},
{
"epoch": 1402.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4209
},
{
"epoch": 1403.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4212
},
{
"epoch": 1404.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4215
},
{
"epoch": 1405.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4218
},
{
"epoch": 1406.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4221
},
{
"epoch": 1407.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4224
},
{
"epoch": 1407.88,
"eval_exact_match": 0.4922630560928433,
"eval_exec": 0.4874274661508704,
"eval_loss": 0.5785483717918396,
"eval_runtime": 117.2042,
"eval_samples_per_second": 8.822,
"step": 4224
},
{
"epoch": 1408.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4227
},
{
"epoch": 1409.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4230
},
{
"epoch": 1410.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4233
},
{
"epoch": 1411.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4236
},
{
"epoch": 1412.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4239
},
{
"epoch": 1413.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4242
},
{
"epoch": 1414.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4245
},
{
"epoch": 1415.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4248
},
{
"epoch": 1416.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4251
},
{
"epoch": 1417.88,
"learning_rate": 0.0001,
"loss": 0.0031,
"step": 4254
},
{
"epoch": 1418.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4257
},
{
"epoch": 1419.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4260
},
{
"epoch": 1420.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4263
},
{
"epoch": 1421.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4266
},
{
"epoch": 1422.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4269
},
{
"epoch": 1423.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4272
},
{
"epoch": 1424.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4275
},
{
"epoch": 1425.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4278
},
{
"epoch": 1426.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4281
},
{
"epoch": 1427.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4284
},
{
"epoch": 1428.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4287
},
{
"epoch": 1429.29,
"eval_exact_match": 0.4874274661508704,
"eval_exec": 0.48549323017408125,
"eval_loss": 0.5841559171676636,
"eval_runtime": 96.7174,
"eval_samples_per_second": 10.691,
"step": 4288
},
{
"epoch": 1429.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4290
},
{
"epoch": 1430.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4293
},
{
"epoch": 1431.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4296
},
{
"epoch": 1432.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4299
},
{
"epoch": 1433.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4302
},
{
"epoch": 1434.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4305
},
{
"epoch": 1435.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4308
},
{
"epoch": 1436.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4311
},
{
"epoch": 1437.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4314
},
{
"epoch": 1438.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4317
},
{
"epoch": 1439.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4320
},
{
"epoch": 1440.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4323
},
{
"epoch": 1441.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4326
},
{
"epoch": 1442.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4329
},
{
"epoch": 1443.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4332
},
{
"epoch": 1444.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4335
},
{
"epoch": 1445.88,
"learning_rate": 0.0001,
"loss": 0.003,
"step": 4338
},
{
"epoch": 1446.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4341
},
{
"epoch": 1447.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4344
},
{
"epoch": 1448.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4347
},
{
"epoch": 1449.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4350
},
{
"epoch": 1450.59,
"eval_exact_match": 0.49709864603481624,
"eval_exec": 0.49806576402321084,
"eval_loss": 0.5847323536872864,
"eval_runtime": 104.9047,
"eval_samples_per_second": 9.857,
"step": 4352
},
{
"epoch": 1450.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4353
},
{
"epoch": 1451.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4356
},
{
"epoch": 1452.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4359
},
{
"epoch": 1453.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4362
},
{
"epoch": 1454.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4365
},
{
"epoch": 1455.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4368
},
{
"epoch": 1456.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4371
},
{
"epoch": 1457.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4374
},
{
"epoch": 1458.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4377
},
{
"epoch": 1459.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4380
},
{
"epoch": 1460.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4383
},
{
"epoch": 1461.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4386
},
{
"epoch": 1462.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4389
},
{
"epoch": 1463.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4392
},
{
"epoch": 1464.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4395
},
{
"epoch": 1465.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4398
},
{
"epoch": 1466.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4401
},
{
"epoch": 1467.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4404
},
{
"epoch": 1468.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4407
},
{
"epoch": 1469.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4410
},
{
"epoch": 1470.88,
"learning_rate": 0.0001,
"loss": 0.0028,
"step": 4413
},
{
"epoch": 1471.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4416
},
{
"epoch": 1471.88,
"eval_exact_match": 0.48452611218568664,
"eval_exec": 0.48452611218568664,
"eval_loss": 0.590592622756958,
"eval_runtime": 105.9184,
"eval_samples_per_second": 9.762,
"step": 4416
},
{
"epoch": 1472.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4419
},
{
"epoch": 1473.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4422
},
{
"epoch": 1474.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4425
},
{
"epoch": 1475.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4428
},
{
"epoch": 1476.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4431
},
{
"epoch": 1477.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4434
},
{
"epoch": 1478.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4437
},
{
"epoch": 1479.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4440
},
{
"epoch": 1480.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4443
},
{
"epoch": 1481.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4446
},
{
"epoch": 1482.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4449
},
{
"epoch": 1483.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4452
},
{
"epoch": 1484.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4455
},
{
"epoch": 1485.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4458
},
{
"epoch": 1486.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4461
},
{
"epoch": 1487.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4464
},
{
"epoch": 1488.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4467
},
{
"epoch": 1489.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4470
},
{
"epoch": 1490.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4473
},
{
"epoch": 1491.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4476
},
{
"epoch": 1492.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4479
},
{
"epoch": 1493.29,
"eval_exact_match": 0.48549323017408125,
"eval_exec": 0.4874274661508704,
"eval_loss": 0.5873758792877197,
"eval_runtime": 99.7821,
"eval_samples_per_second": 10.363,
"step": 4480
},
{
"epoch": 1493.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4482
},
{
"epoch": 1494.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4485
},
{
"epoch": 1495.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4488
},
{
"epoch": 1496.88,
"learning_rate": 0.0001,
"loss": 0.0029,
"step": 4491
},
{
"epoch": 1497.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4494
},
{
"epoch": 1498.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4497
},
{
"epoch": 1499.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4500
},
{
"epoch": 1500.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4503
},
{
"epoch": 1501.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4506
},
{
"epoch": 1502.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4509
},
{
"epoch": 1503.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4512
},
{
"epoch": 1504.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4515
},
{
"epoch": 1505.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4518
},
{
"epoch": 1506.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4521
},
{
"epoch": 1507.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4524
},
{
"epoch": 1508.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4527
},
{
"epoch": 1509.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4530
},
{
"epoch": 1510.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4533
},
{
"epoch": 1511.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4536
},
{
"epoch": 1512.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4539
},
{
"epoch": 1513.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4542
},
{
"epoch": 1514.59,
"eval_exact_match": 0.4816247582205029,
"eval_exec": 0.4796905222437137,
"eval_loss": 0.603107750415802,
"eval_runtime": 100.2594,
"eval_samples_per_second": 10.313,
"step": 4544
},
{
"epoch": 1514.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4545
},
{
"epoch": 1515.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4548
},
{
"epoch": 1516.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4551
},
{
"epoch": 1517.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4554
},
{
"epoch": 1518.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4557
},
{
"epoch": 1519.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4560
},
{
"epoch": 1520.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4563
},
{
"epoch": 1521.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4566
},
{
"epoch": 1522.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4569
},
{
"epoch": 1523.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4572
},
{
"epoch": 1524.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4575
},
{
"epoch": 1525.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4578
},
{
"epoch": 1526.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4581
},
{
"epoch": 1527.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4584
},
{
"epoch": 1528.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4587
},
{
"epoch": 1529.88,
"learning_rate": 0.0001,
"loss": 0.0026,
"step": 4590
},
{
"epoch": 1530.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4593
},
{
"epoch": 1531.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4596
},
{
"epoch": 1532.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4599
},
{
"epoch": 1533.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4602
},
{
"epoch": 1534.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4605
},
{
"epoch": 1535.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4608
},
{
"epoch": 1535.88,
"eval_exact_match": 0.49032882011605416,
"eval_exec": 0.4932301740812379,
"eval_loss": 0.5945437550544739,
"eval_runtime": 131.4626,
"eval_samples_per_second": 7.865,
"step": 4608
},
{
"epoch": 1536.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4611
},
{
"epoch": 1537.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4614
},
{
"epoch": 1538.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4617
},
{
"epoch": 1539.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4620
},
{
"epoch": 1540.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4623
},
{
"epoch": 1541.88,
"learning_rate": 0.0001,
"loss": 0.0027,
"step": 4626
},
{
"epoch": 1542.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4629
},
{
"epoch": 1543.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4632
},
{
"epoch": 1544.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4635
},
{
"epoch": 1545.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4638
},
{
"epoch": 1546.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4641
},
{
"epoch": 1547.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4644
},
{
"epoch": 1548.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4647
},
{
"epoch": 1549.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4650
},
{
"epoch": 1550.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4653
},
{
"epoch": 1551.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4656
},
{
"epoch": 1552.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4659
},
{
"epoch": 1553.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4662
},
{
"epoch": 1554.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4665
},
{
"epoch": 1555.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4668
},
{
"epoch": 1556.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4671
},
{
"epoch": 1557.29,
"eval_exact_match": 0.4922630560928433,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.5930950045585632,
"eval_runtime": 99.7074,
"eval_samples_per_second": 10.37,
"step": 4672
},
{
"epoch": 1557.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4674
},
{
"epoch": 1558.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4677
},
{
"epoch": 1559.88,
"learning_rate": 0.0001,
"loss": 0.0024,
"step": 4680
},
{
"epoch": 1560.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4683
},
{
"epoch": 1561.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4686
},
{
"epoch": 1562.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4689
},
{
"epoch": 1563.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4692
},
{
"epoch": 1564.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4695
},
{
"epoch": 1565.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4698
},
{
"epoch": 1566.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4701
},
{
"epoch": 1567.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4704
},
{
"epoch": 1568.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4707
},
{
"epoch": 1569.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4710
},
{
"epoch": 1570.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4713
},
{
"epoch": 1571.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4716
},
{
"epoch": 1572.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4719
},
{
"epoch": 1573.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4722
},
{
"epoch": 1574.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4725
},
{
"epoch": 1575.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4728
},
{
"epoch": 1576.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4731
},
{
"epoch": 1577.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4734
},
{
"epoch": 1578.59,
"eval_exact_match": 0.5,
"eval_exec": 0.5009671179883946,
"eval_loss": 0.6037657856941223,
"eval_runtime": 102.1529,
"eval_samples_per_second": 10.122,
"step": 4736
},
{
"epoch": 1578.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4737
},
{
"epoch": 1579.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4740
},
{
"epoch": 1580.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4743
},
{
"epoch": 1581.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4746
},
{
"epoch": 1582.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4749
},
{
"epoch": 1583.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4752
},
{
"epoch": 1584.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4755
},
{
"epoch": 1585.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4758
},
{
"epoch": 1586.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4761
},
{
"epoch": 1587.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4764
},
{
"epoch": 1588.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4767
},
{
"epoch": 1589.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4770
},
{
"epoch": 1590.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4773
},
{
"epoch": 1591.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4776
},
{
"epoch": 1592.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4779
},
{
"epoch": 1593.88,
"learning_rate": 0.0001,
"loss": 0.0025,
"step": 4782
},
{
"epoch": 1594.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4785
},
{
"epoch": 1595.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4788
},
{
"epoch": 1596.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4791
},
{
"epoch": 1597.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4794
},
{
"epoch": 1598.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4797
},
{
"epoch": 1599.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4800
},
{
"epoch": 1599.88,
"eval_exact_match": 0.49032882011605416,
"eval_exec": 0.4922630560928433,
"eval_loss": 0.5997296571731567,
"eval_runtime": 100.5407,
"eval_samples_per_second": 10.284,
"step": 4800
},
{
"epoch": 1600.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4803
},
{
"epoch": 1601.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4806
},
{
"epoch": 1602.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4809
},
{
"epoch": 1603.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4812
},
{
"epoch": 1604.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4815
},
{
"epoch": 1605.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4818
},
{
"epoch": 1606.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4821
},
{
"epoch": 1607.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4824
},
{
"epoch": 1608.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4827
},
{
"epoch": 1609.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4830
},
{
"epoch": 1610.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4833
},
{
"epoch": 1611.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4836
},
{
"epoch": 1612.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4839
},
{
"epoch": 1613.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4842
},
{
"epoch": 1614.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 4845
},
{
"epoch": 1615.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4848
},
{
"epoch": 1616.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4851
},
{
"epoch": 1617.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4854
},
{
"epoch": 1618.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4857
},
{
"epoch": 1619.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4860
},
{
"epoch": 1620.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4863
},
{
"epoch": 1621.29,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.4932301740812379,
"eval_loss": 0.6005607843399048,
"eval_runtime": 103.9716,
"eval_samples_per_second": 9.945,
"step": 4864
},
{
"epoch": 1621.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4866
},
{
"epoch": 1622.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4869
},
{
"epoch": 1623.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4872
},
{
"epoch": 1624.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 4875
},
{
"epoch": 1625.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4878
},
{
"epoch": 1626.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4881
},
{
"epoch": 1627.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4884
},
{
"epoch": 1628.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4887
},
{
"epoch": 1629.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4890
},
{
"epoch": 1630.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4893
},
{
"epoch": 1631.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4896
},
{
"epoch": 1632.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4899
},
{
"epoch": 1633.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4902
},
{
"epoch": 1634.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4905
},
{
"epoch": 1635.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4908
},
{
"epoch": 1636.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4911
},
{
"epoch": 1637.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4914
},
{
"epoch": 1638.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4917
},
{
"epoch": 1639.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4920
},
{
"epoch": 1640.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4923
},
{
"epoch": 1641.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4926
},
{
"epoch": 1642.59,
"eval_exact_match": 0.4961315280464217,
"eval_exec": 0.4874274661508704,
"eval_loss": 0.6110011339187622,
"eval_runtime": 100.0167,
"eval_samples_per_second": 10.338,
"step": 4928
},
{
"epoch": 1642.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4929
},
{
"epoch": 1643.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4932
},
{
"epoch": 1644.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4935
},
{
"epoch": 1645.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4938
},
{
"epoch": 1646.88,
"learning_rate": 0.0001,
"loss": 0.0023,
"step": 4941
},
{
"epoch": 1647.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4944
},
{
"epoch": 1648.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4947
},
{
"epoch": 1649.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4950
},
{
"epoch": 1650.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4953
},
{
"epoch": 1651.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4956
},
{
"epoch": 1652.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 4959
},
{
"epoch": 1653.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 4962
},
{
"epoch": 1654.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4965
},
{
"epoch": 1655.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4968
},
{
"epoch": 1656.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4971
},
{
"epoch": 1657.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 4974
},
{
"epoch": 1658.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4977
},
{
"epoch": 1659.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 4980
},
{
"epoch": 1660.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4983
},
{
"epoch": 1661.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4986
},
{
"epoch": 1662.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 4989
},
{
"epoch": 1663.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4992
},
{
"epoch": 1663.88,
"eval_exact_match": 0.5,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.6110185980796814,
"eval_runtime": 102.0442,
"eval_samples_per_second": 10.133,
"step": 4992
},
{
"epoch": 1664.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4995
},
{
"epoch": 1665.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 4998
},
{
"epoch": 1666.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5001
},
{
"epoch": 1667.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5004
},
{
"epoch": 1668.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5007
},
{
"epoch": 1669.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5010
},
{
"epoch": 1670.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5013
},
{
"epoch": 1671.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5016
},
{
"epoch": 1672.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5019
},
{
"epoch": 1673.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5022
},
{
"epoch": 1674.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5025
},
{
"epoch": 1675.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5028
},
{
"epoch": 1676.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 5031
},
{
"epoch": 1677.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5034
},
{
"epoch": 1678.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5037
},
{
"epoch": 1679.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5040
},
{
"epoch": 1680.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5043
},
{
"epoch": 1681.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5046
},
{
"epoch": 1682.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5049
},
{
"epoch": 1683.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5052
},
{
"epoch": 1684.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5055
},
{
"epoch": 1685.29,
"eval_exact_match": 0.4825918762088975,
"eval_exec": 0.4864603481624758,
"eval_loss": 0.6093866229057312,
"eval_runtime": 103.7246,
"eval_samples_per_second": 9.969,
"step": 5056
},
{
"epoch": 1685.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5058
},
{
"epoch": 1686.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5061
},
{
"epoch": 1687.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5064
},
{
"epoch": 1688.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5067
},
{
"epoch": 1689.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5070
},
{
"epoch": 1690.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5073
},
{
"epoch": 1691.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5076
},
{
"epoch": 1692.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5079
},
{
"epoch": 1693.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5082
},
{
"epoch": 1694.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5085
},
{
"epoch": 1695.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5088
},
{
"epoch": 1696.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5091
},
{
"epoch": 1697.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5094
},
{
"epoch": 1698.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5097
},
{
"epoch": 1699.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5100
},
{
"epoch": 1700.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5103
},
{
"epoch": 1701.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5106
},
{
"epoch": 1702.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5109
},
{
"epoch": 1703.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5112
},
{
"epoch": 1704.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5115
},
{
"epoch": 1705.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5118
},
{
"epoch": 1706.59,
"eval_exact_match": 0.488394584139265,
"eval_exec": 0.488394584139265,
"eval_loss": 0.6172391176223755,
"eval_runtime": 100.9408,
"eval_samples_per_second": 10.244,
"step": 5120
},
{
"epoch": 1706.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5121
},
{
"epoch": 1707.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5124
},
{
"epoch": 1708.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5127
},
{
"epoch": 1709.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 5130
},
{
"epoch": 1710.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5133
},
{
"epoch": 1711.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5136
},
{
"epoch": 1712.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5139
},
{
"epoch": 1713.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5142
},
{
"epoch": 1714.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5145
},
{
"epoch": 1715.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5148
},
{
"epoch": 1716.88,
"learning_rate": 0.0001,
"loss": 0.0022,
"step": 5151
},
{
"epoch": 1717.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5154
},
{
"epoch": 1718.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5157
},
{
"epoch": 1719.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5160
},
{
"epoch": 1720.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5163
},
{
"epoch": 1721.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5166
},
{
"epoch": 1722.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5169
},
{
"epoch": 1723.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5172
},
{
"epoch": 1724.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5175
},
{
"epoch": 1725.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5178
},
{
"epoch": 1726.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5181
},
{
"epoch": 1727.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5184
},
{
"epoch": 1727.88,
"eval_exact_match": 0.49032882011605416,
"eval_exec": 0.48452611218568664,
"eval_loss": 0.6174488663673401,
"eval_runtime": 103.1102,
"eval_samples_per_second": 10.028,
"step": 5184
},
{
"epoch": 1728.88,
"learning_rate": 0.0001,
"loss": 0.002,
"step": 5187
},
{
"epoch": 1729.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5190
},
{
"epoch": 1730.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5193
},
{
"epoch": 1731.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5196
},
{
"epoch": 1732.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5199
},
{
"epoch": 1733.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5202
},
{
"epoch": 1734.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5205
},
{
"epoch": 1735.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5208
},
{
"epoch": 1736.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5211
},
{
"epoch": 1737.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5214
},
{
"epoch": 1738.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5217
},
{
"epoch": 1739.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5220
},
{
"epoch": 1740.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5223
},
{
"epoch": 1741.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5226
},
{
"epoch": 1742.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5229
},
{
"epoch": 1743.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5232
},
{
"epoch": 1744.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5235
},
{
"epoch": 1745.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5238
},
{
"epoch": 1746.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5241
},
{
"epoch": 1747.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5244
},
{
"epoch": 1748.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5247
},
{
"epoch": 1749.29,
"eval_exact_match": 0.4825918762088975,
"eval_exec": 0.4816247582205029,
"eval_loss": 0.6244661211967468,
"eval_runtime": 105.1481,
"eval_samples_per_second": 9.834,
"step": 5248
},
{
"epoch": 1749.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5250
},
{
"epoch": 1750.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5253
},
{
"epoch": 1751.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5256
},
{
"epoch": 1752.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 5259
},
{
"epoch": 1753.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5262
},
{
"epoch": 1754.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5265
},
{
"epoch": 1755.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5268
},
{
"epoch": 1756.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5271
},
{
"epoch": 1757.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5274
},
{
"epoch": 1758.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5277
},
{
"epoch": 1759.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5280
},
{
"epoch": 1760.88,
"learning_rate": 0.0001,
"loss": 0.0021,
"step": 5283
},
{
"epoch": 1761.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5286
},
{
"epoch": 1762.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5289
},
{
"epoch": 1763.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5292
},
{
"epoch": 1764.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5295
},
{
"epoch": 1765.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5298
},
{
"epoch": 1766.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5301
},
{
"epoch": 1767.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5304
},
{
"epoch": 1768.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5307
},
{
"epoch": 1769.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5310
},
{
"epoch": 1770.59,
"eval_exact_match": 0.48936170212765956,
"eval_exec": 0.4864603481624758,
"eval_loss": 0.6090367436408997,
"eval_runtime": 104.7443,
"eval_samples_per_second": 9.872,
"step": 5312
},
{
"epoch": 1770.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5313
},
{
"epoch": 1771.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5316
},
{
"epoch": 1772.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5319
},
{
"epoch": 1773.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5322
},
{
"epoch": 1774.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5325
},
{
"epoch": 1775.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5328
},
{
"epoch": 1776.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5331
},
{
"epoch": 1777.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5334
},
{
"epoch": 1778.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5337
},
{
"epoch": 1779.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5340
},
{
"epoch": 1780.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5343
},
{
"epoch": 1781.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5346
},
{
"epoch": 1782.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5349
},
{
"epoch": 1783.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5352
},
{
"epoch": 1784.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5355
},
{
"epoch": 1785.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5358
},
{
"epoch": 1786.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5361
},
{
"epoch": 1787.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5364
},
{
"epoch": 1788.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5367
},
{
"epoch": 1789.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5370
},
{
"epoch": 1790.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5373
},
{
"epoch": 1791.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5376
},
{
"epoch": 1791.88,
"eval_exact_match": 0.49806576402321084,
"eval_exec": 0.4961315280464217,
"eval_loss": 0.6232331395149231,
"eval_runtime": 102.2321,
"eval_samples_per_second": 10.114,
"step": 5376
},
{
"epoch": 1792.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5379
},
{
"epoch": 1793.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5382
},
{
"epoch": 1794.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5385
},
{
"epoch": 1795.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5388
},
{
"epoch": 1796.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5391
},
{
"epoch": 1797.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5394
},
{
"epoch": 1798.88,
"learning_rate": 0.0001,
"loss": 0.0019,
"step": 5397
},
{
"epoch": 1799.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5400
},
{
"epoch": 1800.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5403
},
{
"epoch": 1801.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5406
},
{
"epoch": 1802.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5409
},
{
"epoch": 1803.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5412
},
{
"epoch": 1804.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5415
},
{
"epoch": 1805.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5418
},
{
"epoch": 1806.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5421
},
{
"epoch": 1807.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5424
},
{
"epoch": 1808.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5427
},
{
"epoch": 1809.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5430
},
{
"epoch": 1810.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5433
},
{
"epoch": 1811.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5436
},
{
"epoch": 1812.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5439
},
{
"epoch": 1813.29,
"eval_exact_match": 0.49806576402321084,
"eval_exec": 0.4941972920696325,
"eval_loss": 0.6267974376678467,
"eval_runtime": 100.3635,
"eval_samples_per_second": 10.303,
"step": 5440
},
{
"epoch": 1813.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5442
},
{
"epoch": 1814.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5445
},
{
"epoch": 1815.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5448
},
{
"epoch": 1816.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5451
},
{
"epoch": 1817.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5454
},
{
"epoch": 1818.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5457
},
{
"epoch": 1819.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5460
},
{
"epoch": 1820.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5463
},
{
"epoch": 1821.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5466
},
{
"epoch": 1822.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5469
},
{
"epoch": 1823.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5472
},
{
"epoch": 1824.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5475
},
{
"epoch": 1825.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5478
},
{
"epoch": 1826.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5481
},
{
"epoch": 1827.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5484
},
{
"epoch": 1828.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5487
},
{
"epoch": 1829.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5490
},
{
"epoch": 1830.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5493
},
{
"epoch": 1831.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5496
},
{
"epoch": 1832.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5499
},
{
"epoch": 1833.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5502
},
{
"epoch": 1834.59,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.6204285025596619,
"eval_runtime": 99.4678,
"eval_samples_per_second": 10.395,
"step": 5504
},
{
"epoch": 1834.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5505
},
{
"epoch": 1835.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5508
},
{
"epoch": 1836.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5511
},
{
"epoch": 1837.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5514
},
{
"epoch": 1838.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5517
},
{
"epoch": 1839.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5520
},
{
"epoch": 1840.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5523
},
{
"epoch": 1841.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5526
},
{
"epoch": 1842.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5529
},
{
"epoch": 1843.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5532
},
{
"epoch": 1844.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5535
},
{
"epoch": 1845.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5538
},
{
"epoch": 1846.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5541
},
{
"epoch": 1847.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5544
},
{
"epoch": 1848.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5547
},
{
"epoch": 1849.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5550
},
{
"epoch": 1850.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5553
},
{
"epoch": 1851.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5556
},
{
"epoch": 1852.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5559
},
{
"epoch": 1853.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5562
},
{
"epoch": 1854.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5565
},
{
"epoch": 1855.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5568
},
{
"epoch": 1855.88,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.4951644100580271,
"eval_loss": 0.6250240802764893,
"eval_runtime": 98.8362,
"eval_samples_per_second": 10.462,
"step": 5568
},
{
"epoch": 1856.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5571
},
{
"epoch": 1857.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5574
},
{
"epoch": 1858.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5577
},
{
"epoch": 1859.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5580
},
{
"epoch": 1860.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5583
},
{
"epoch": 1861.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5586
},
{
"epoch": 1862.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5589
},
{
"epoch": 1863.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5592
},
{
"epoch": 1864.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5595
},
{
"epoch": 1865.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5598
},
{
"epoch": 1866.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5601
},
{
"epoch": 1867.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5604
},
{
"epoch": 1868.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5607
},
{
"epoch": 1869.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5610
},
{
"epoch": 1870.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5613
},
{
"epoch": 1871.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5616
},
{
"epoch": 1872.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 5619
},
{
"epoch": 1873.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5622
},
{
"epoch": 1874.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5625
},
{
"epoch": 1875.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5628
},
{
"epoch": 1876.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5631
},
{
"epoch": 1877.29,
"eval_exact_match": 0.504835589941973,
"eval_exec": 0.4961315280464217,
"eval_loss": 0.6261150240898132,
"eval_runtime": 102.3617,
"eval_samples_per_second": 10.101,
"step": 5632
},
{
"epoch": 1877.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5634
},
{
"epoch": 1878.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5637
},
{
"epoch": 1879.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5640
},
{
"epoch": 1880.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5643
},
{
"epoch": 1881.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5646
},
{
"epoch": 1882.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5649
},
{
"epoch": 1883.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5652
},
{
"epoch": 1884.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5655
},
{
"epoch": 1885.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5658
},
{
"epoch": 1886.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5661
},
{
"epoch": 1887.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5664
},
{
"epoch": 1888.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5667
},
{
"epoch": 1889.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5670
},
{
"epoch": 1890.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5673
},
{
"epoch": 1891.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5676
},
{
"epoch": 1892.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5679
},
{
"epoch": 1893.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5682
},
{
"epoch": 1894.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5685
},
{
"epoch": 1895.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5688
},
{
"epoch": 1896.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5691
},
{
"epoch": 1897.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5694
},
{
"epoch": 1898.59,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.48549323017408125,
"eval_loss": 0.6312097907066345,
"eval_runtime": 102.3467,
"eval_samples_per_second": 10.103,
"step": 5696
},
{
"epoch": 1898.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5697
},
{
"epoch": 1899.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5700
},
{
"epoch": 1900.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5703
},
{
"epoch": 1901.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5706
},
{
"epoch": 1902.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5709
},
{
"epoch": 1903.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5712
},
{
"epoch": 1904.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5715
},
{
"epoch": 1905.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5718
},
{
"epoch": 1906.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5721
},
{
"epoch": 1907.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5724
},
{
"epoch": 1908.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5727
},
{
"epoch": 1909.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5730
},
{
"epoch": 1910.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5733
},
{
"epoch": 1911.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5736
},
{
"epoch": 1912.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5739
},
{
"epoch": 1913.88,
"learning_rate": 0.0001,
"loss": 0.0018,
"step": 5742
},
{
"epoch": 1914.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5745
},
{
"epoch": 1915.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5748
},
{
"epoch": 1916.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5751
},
{
"epoch": 1917.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5754
},
{
"epoch": 1918.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5757
},
{
"epoch": 1919.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5760
},
{
"epoch": 1919.88,
"eval_exact_match": 0.4932301740812379,
"eval_exec": 0.49032882011605416,
"eval_loss": 0.6297084093093872,
"eval_runtime": 102.7251,
"eval_samples_per_second": 10.066,
"step": 5760
},
{
"epoch": 1920.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5763
},
{
"epoch": 1921.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5766
},
{
"epoch": 1922.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5769
},
{
"epoch": 1923.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5772
},
{
"epoch": 1924.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5775
},
{
"epoch": 1925.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5778
},
{
"epoch": 1926.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5781
},
{
"epoch": 1927.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5784
},
{
"epoch": 1928.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5787
},
{
"epoch": 1929.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5790
},
{
"epoch": 1930.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5793
},
{
"epoch": 1931.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5796
},
{
"epoch": 1932.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5799
},
{
"epoch": 1933.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5802
},
{
"epoch": 1934.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5805
},
{
"epoch": 1935.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5808
},
{
"epoch": 1936.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5811
},
{
"epoch": 1937.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5814
},
{
"epoch": 1938.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5817
},
{
"epoch": 1939.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5820
},
{
"epoch": 1940.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5823
},
{
"epoch": 1941.29,
"eval_exact_match": 0.5029013539651838,
"eval_exec": 0.49806576402321084,
"eval_loss": 0.6355636715888977,
"eval_runtime": 101.7003,
"eval_samples_per_second": 10.167,
"step": 5824
},
{
"epoch": 1941.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5826
},
{
"epoch": 1942.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 5829
},
{
"epoch": 1943.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5832
},
{
"epoch": 1944.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5835
},
{
"epoch": 1945.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5838
},
{
"epoch": 1946.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5841
},
{
"epoch": 1947.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5844
},
{
"epoch": 1948.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5847
},
{
"epoch": 1949.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5850
},
{
"epoch": 1950.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5853
},
{
"epoch": 1951.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5856
},
{
"epoch": 1952.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5859
},
{
"epoch": 1953.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5862
},
{
"epoch": 1954.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5865
},
{
"epoch": 1955.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5868
},
{
"epoch": 1956.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5871
},
{
"epoch": 1957.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5874
},
{
"epoch": 1958.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5877
},
{
"epoch": 1959.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5880
},
{
"epoch": 1960.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5883
},
{
"epoch": 1961.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5886
},
{
"epoch": 1962.59,
"eval_exact_match": 0.49709864603481624,
"eval_exec": 0.4941972920696325,
"eval_loss": 0.6439603567123413,
"eval_runtime": 98.8258,
"eval_samples_per_second": 10.463,
"step": 5888
},
{
"epoch": 1962.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5889
},
{
"epoch": 1963.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5892
},
{
"epoch": 1964.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5895
},
{
"epoch": 1965.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5898
},
{
"epoch": 1966.88,
"learning_rate": 0.0001,
"loss": 0.0017,
"step": 5901
},
{
"epoch": 1967.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5904
},
{
"epoch": 1968.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5907
},
{
"epoch": 1969.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5910
},
{
"epoch": 1970.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5913
},
{
"epoch": 1971.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5916
},
{
"epoch": 1972.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5919
},
{
"epoch": 1973.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5922
},
{
"epoch": 1974.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5925
},
{
"epoch": 1975.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5928
},
{
"epoch": 1976.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5931
},
{
"epoch": 1977.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5934
},
{
"epoch": 1978.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5937
},
{
"epoch": 1979.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5940
},
{
"epoch": 1980.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5943
},
{
"epoch": 1981.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5946
},
{
"epoch": 1982.88,
"learning_rate": 0.0001,
"loss": 0.0016,
"step": 5949
},
{
"epoch": 1983.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5952
},
{
"epoch": 1983.88,
"eval_exact_match": 0.5019342359767892,
"eval_exec": 0.4932301740812379,
"eval_loss": 0.6456257104873657,
"eval_runtime": 103.1728,
"eval_samples_per_second": 10.022,
"step": 5952
},
{
"epoch": 1984.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 5955
},
{
"epoch": 1985.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5958
},
{
"epoch": 1986.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5961
},
{
"epoch": 1987.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5964
},
{
"epoch": 1988.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5967
},
{
"epoch": 1989.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5970
},
{
"epoch": 1990.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5973
},
{
"epoch": 1991.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5976
},
{
"epoch": 1992.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 5979
},
{
"epoch": 1993.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5982
},
{
"epoch": 1994.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 5985
},
{
"epoch": 1995.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5988
},
{
"epoch": 1996.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5991
},
{
"epoch": 1997.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 5994
},
{
"epoch": 1998.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 5997
},
{
"epoch": 1999.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6000
},
{
"epoch": 2000.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6003
},
{
"epoch": 2001.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6006
},
{
"epoch": 2002.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6009
},
{
"epoch": 2003.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6012
},
{
"epoch": 2004.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 6015
},
{
"epoch": 2005.29,
"eval_exact_match": 0.4990328820116054,
"eval_exec": 0.4941972920696325,
"eval_loss": 0.6428639888763428,
"eval_runtime": 103.19,
"eval_samples_per_second": 10.02,
"step": 6016
},
{
"epoch": 2005.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6018
},
{
"epoch": 2006.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6021
},
{
"epoch": 2007.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6024
},
{
"epoch": 2008.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6027
},
{
"epoch": 2009.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6030
},
{
"epoch": 2010.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6033
},
{
"epoch": 2011.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6036
},
{
"epoch": 2012.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6039
},
{
"epoch": 2013.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6042
},
{
"epoch": 2014.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6045
},
{
"epoch": 2015.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6048
},
{
"epoch": 2016.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6051
},
{
"epoch": 2017.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6054
},
{
"epoch": 2018.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6057
},
{
"epoch": 2019.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6060
},
{
"epoch": 2020.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6063
},
{
"epoch": 2021.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6066
},
{
"epoch": 2022.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6069
},
{
"epoch": 2023.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6072
},
{
"epoch": 2024.88,
"learning_rate": 0.0001,
"loss": 0.0015,
"step": 6075
},
{
"epoch": 2025.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6078
},
{
"epoch": 2026.59,
"eval_exact_match": 0.5067698259187621,
"eval_exec": 0.4990328820116054,
"eval_loss": 0.6382647156715393,
"eval_runtime": 102.8692,
"eval_samples_per_second": 10.052,
"step": 6080
},
{
"epoch": 2026.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6081
},
{
"epoch": 2027.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6084
},
{
"epoch": 2028.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6087
},
{
"epoch": 2029.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6090
},
{
"epoch": 2030.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6093
},
{
"epoch": 2031.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6096
},
{
"epoch": 2032.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6099
},
{
"epoch": 2033.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6102
},
{
"epoch": 2034.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6105
},
{
"epoch": 2035.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6108
},
{
"epoch": 2036.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6111
},
{
"epoch": 2037.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6114
},
{
"epoch": 2038.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6117
},
{
"epoch": 2039.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6120
},
{
"epoch": 2040.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6123
},
{
"epoch": 2041.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6126
},
{
"epoch": 2042.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6129
},
{
"epoch": 2043.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6132
},
{
"epoch": 2044.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6135
},
{
"epoch": 2045.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6138
},
{
"epoch": 2046.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6141
},
{
"epoch": 2047.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6144
},
{
"epoch": 2047.88,
"eval_exact_match": 0.5009671179883946,
"eval_exec": 0.4961315280464217,
"eval_loss": 0.6453941464424133,
"eval_runtime": 118.2755,
"eval_samples_per_second": 8.742,
"step": 6144
},
{
"epoch": 2048.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6147
},
{
"epoch": 2049.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6150
},
{
"epoch": 2050.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6153
},
{
"epoch": 2051.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6156
},
{
"epoch": 2052.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6159
},
{
"epoch": 2053.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6162
},
{
"epoch": 2054.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6165
},
{
"epoch": 2055.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6168
},
{
"epoch": 2056.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6171
},
{
"epoch": 2057.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6174
},
{
"epoch": 2058.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6177
},
{
"epoch": 2059.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6180
},
{
"epoch": 2060.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6183
},
{
"epoch": 2061.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6186
},
{
"epoch": 2062.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6189
},
{
"epoch": 2063.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6192
},
{
"epoch": 2064.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6195
},
{
"epoch": 2065.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6198
},
{
"epoch": 2066.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6201
},
{
"epoch": 2067.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6204
},
{
"epoch": 2068.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6207
},
{
"epoch": 2069.29,
"eval_exact_match": 0.5067698259187621,
"eval_exec": 0.49709864603481624,
"eval_loss": 0.651779055595398,
"eval_runtime": 105.2474,
"eval_samples_per_second": 9.824,
"step": 6208
},
{
"epoch": 2069.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6210
},
{
"epoch": 2070.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6213
},
{
"epoch": 2071.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6216
},
{
"epoch": 2072.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6219
},
{
"epoch": 2073.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6222
},
{
"epoch": 2074.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6225
},
{
"epoch": 2075.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6228
},
{
"epoch": 2076.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6231
},
{
"epoch": 2077.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6234
},
{
"epoch": 2078.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6237
},
{
"epoch": 2079.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6240
},
{
"epoch": 2080.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6243
},
{
"epoch": 2081.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6246
},
{
"epoch": 2082.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6249
},
{
"epoch": 2083.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6252
},
{
"epoch": 2084.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6255
},
{
"epoch": 2085.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6258
},
{
"epoch": 2086.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6261
},
{
"epoch": 2087.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6264
},
{
"epoch": 2088.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6267
},
{
"epoch": 2089.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6270
},
{
"epoch": 2090.59,
"eval_exact_match": 0.504835589941973,
"eval_exec": 0.49709864603481624,
"eval_loss": 0.6524325013160706,
"eval_runtime": 103.384,
"eval_samples_per_second": 10.002,
"step": 6272
},
{
"epoch": 2090.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6273
},
{
"epoch": 2091.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6276
},
{
"epoch": 2092.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6279
},
{
"epoch": 2093.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6282
},
{
"epoch": 2094.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6285
},
{
"epoch": 2095.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6288
},
{
"epoch": 2096.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6291
},
{
"epoch": 2097.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6294
},
{
"epoch": 2098.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6297
},
{
"epoch": 2099.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6300
},
{
"epoch": 2100.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6303
},
{
"epoch": 2101.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6306
},
{
"epoch": 2102.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6309
},
{
"epoch": 2103.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6312
},
{
"epoch": 2104.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6315
},
{
"epoch": 2105.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6318
},
{
"epoch": 2106.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6321
},
{
"epoch": 2107.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6324
},
{
"epoch": 2108.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6327
},
{
"epoch": 2109.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6330
},
{
"epoch": 2110.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6333
},
{
"epoch": 2111.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6336
},
{
"epoch": 2111.88,
"eval_exact_match": 0.5067698259187621,
"eval_exec": 0.4961315280464217,
"eval_loss": 0.657222330570221,
"eval_runtime": 105.2034,
"eval_samples_per_second": 9.829,
"step": 6336
},
{
"epoch": 2112.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6339
},
{
"epoch": 2113.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6342
},
{
"epoch": 2114.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6345
},
{
"epoch": 2115.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6348
},
{
"epoch": 2116.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6351
},
{
"epoch": 2117.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6354
},
{
"epoch": 2118.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6357
},
{
"epoch": 2119.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6360
},
{
"epoch": 2120.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6363
},
{
"epoch": 2121.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6366
},
{
"epoch": 2122.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6369
},
{
"epoch": 2123.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6372
},
{
"epoch": 2124.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6375
},
{
"epoch": 2125.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6378
},
{
"epoch": 2126.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6381
},
{
"epoch": 2127.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6384
},
{
"epoch": 2128.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6387
},
{
"epoch": 2129.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6390
},
{
"epoch": 2130.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6393
},
{
"epoch": 2131.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6396
},
{
"epoch": 2132.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6399
},
{
"epoch": 2133.29,
"eval_exact_match": 0.5029013539651838,
"eval_exec": 0.4961315280464217,
"eval_loss": 0.6573466062545776,
"eval_runtime": 102.6054,
"eval_samples_per_second": 10.077,
"step": 6400
},
{
"epoch": 2133.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6402
},
{
"epoch": 2134.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6405
},
{
"epoch": 2135.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6408
},
{
"epoch": 2136.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6411
},
{
"epoch": 2137.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6414
},
{
"epoch": 2138.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6417
},
{
"epoch": 2139.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6420
},
{
"epoch": 2140.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6423
},
{
"epoch": 2141.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6426
},
{
"epoch": 2142.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6429
},
{
"epoch": 2143.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6432
},
{
"epoch": 2144.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6435
},
{
"epoch": 2145.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6438
},
{
"epoch": 2146.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6441
},
{
"epoch": 2147.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6444
},
{
"epoch": 2148.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6447
},
{
"epoch": 2149.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6450
},
{
"epoch": 2150.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6453
},
{
"epoch": 2151.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6456
},
{
"epoch": 2152.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6459
},
{
"epoch": 2153.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6462
},
{
"epoch": 2154.59,
"eval_exact_match": 0.5125725338491296,
"eval_exec": 0.4990328820116054,
"eval_loss": 0.6498933434486389,
"eval_runtime": 103.9046,
"eval_samples_per_second": 9.951,
"step": 6464
},
{
"epoch": 2154.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6465
},
{
"epoch": 2155.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6468
},
{
"epoch": 2156.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6471
},
{
"epoch": 2157.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6474
},
{
"epoch": 2158.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6477
},
{
"epoch": 2159.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6480
},
{
"epoch": 2160.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6483
},
{
"epoch": 2161.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6486
},
{
"epoch": 2162.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6489
},
{
"epoch": 2163.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6492
},
{
"epoch": 2164.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6495
},
{
"epoch": 2165.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6498
},
{
"epoch": 2166.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6501
},
{
"epoch": 2167.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6504
},
{
"epoch": 2168.88,
"learning_rate": 0.0001,
"loss": 0.0014,
"step": 6507
},
{
"epoch": 2169.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6510
},
{
"epoch": 2170.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6513
},
{
"epoch": 2171.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6516
},
{
"epoch": 2172.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6519
},
{
"epoch": 2173.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6522
},
{
"epoch": 2174.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6525
},
{
"epoch": 2175.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6528
},
{
"epoch": 2175.88,
"eval_exact_match": 0.5096711798839458,
"eval_exec": 0.5,
"eval_loss": 0.6579024195671082,
"eval_runtime": 103.7204,
"eval_samples_per_second": 9.969,
"step": 6528
},
{
"epoch": 2176.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6531
},
{
"epoch": 2177.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6534
},
{
"epoch": 2178.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6537
},
{
"epoch": 2179.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6540
},
{
"epoch": 2180.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6543
},
{
"epoch": 2181.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6546
},
{
"epoch": 2182.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6549
},
{
"epoch": 2183.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6552
},
{
"epoch": 2184.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6555
},
{
"epoch": 2185.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6558
},
{
"epoch": 2186.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6561
},
{
"epoch": 2187.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6564
},
{
"epoch": 2188.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6567
},
{
"epoch": 2189.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6570
},
{
"epoch": 2190.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6573
},
{
"epoch": 2191.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6576
},
{
"epoch": 2192.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6579
},
{
"epoch": 2193.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6582
},
{
"epoch": 2194.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6585
},
{
"epoch": 2195.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6588
},
{
"epoch": 2196.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6591
},
{
"epoch": 2197.29,
"eval_exact_match": 0.5067698259187621,
"eval_exec": 0.4990328820116054,
"eval_loss": 0.6636134386062622,
"eval_runtime": 104.9592,
"eval_samples_per_second": 9.851,
"step": 6592
},
{
"epoch": 2197.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6594
},
{
"epoch": 2198.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6597
},
{
"epoch": 2199.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6600
},
{
"epoch": 2200.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6603
},
{
"epoch": 2201.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6606
},
{
"epoch": 2202.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6609
},
{
"epoch": 2203.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6612
},
{
"epoch": 2204.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6615
},
{
"epoch": 2205.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6618
},
{
"epoch": 2206.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6621
},
{
"epoch": 2207.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6624
},
{
"epoch": 2208.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6627
},
{
"epoch": 2209.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6630
},
{
"epoch": 2210.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6633
},
{
"epoch": 2211.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6636
},
{
"epoch": 2212.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6639
},
{
"epoch": 2213.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6642
},
{
"epoch": 2214.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6645
},
{
"epoch": 2215.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6648
},
{
"epoch": 2216.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6651
},
{
"epoch": 2217.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6654
},
{
"epoch": 2218.59,
"eval_exact_match": 0.5029013539651838,
"eval_exec": 0.4951644100580271,
"eval_loss": 0.6537144780158997,
"eval_runtime": 101.4907,
"eval_samples_per_second": 10.188,
"step": 6656
},
{
"epoch": 2218.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6657
},
{
"epoch": 2219.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6660
},
{
"epoch": 2220.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6663
},
{
"epoch": 2221.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6666
},
{
"epoch": 2222.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6669
},
{
"epoch": 2223.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6672
},
{
"epoch": 2224.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6675
},
{
"epoch": 2225.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6678
},
{
"epoch": 2226.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6681
},
{
"epoch": 2227.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6684
},
{
"epoch": 2228.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6687
},
{
"epoch": 2229.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6690
},
{
"epoch": 2230.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6693
},
{
"epoch": 2231.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6696
},
{
"epoch": 2232.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6699
},
{
"epoch": 2233.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6702
},
{
"epoch": 2234.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6705
},
{
"epoch": 2235.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6708
},
{
"epoch": 2236.88,
"learning_rate": 0.0001,
"loss": 0.0013,
"step": 6711
},
{
"epoch": 2237.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6714
},
{
"epoch": 2238.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6717
},
{
"epoch": 2239.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6720
},
{
"epoch": 2239.88,
"eval_exact_match": 0.511605415860735,
"eval_exec": 0.5019342359767892,
"eval_loss": 0.6580149531364441,
"eval_runtime": 101.3481,
"eval_samples_per_second": 10.202,
"step": 6720
},
{
"epoch": 2240.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6723
},
{
"epoch": 2241.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6726
},
{
"epoch": 2242.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6729
},
{
"epoch": 2243.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6732
},
{
"epoch": 2244.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6735
},
{
"epoch": 2245.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6738
},
{
"epoch": 2246.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6741
},
{
"epoch": 2247.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6744
},
{
"epoch": 2248.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6747
},
{
"epoch": 2249.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6750
},
{
"epoch": 2250.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6753
},
{
"epoch": 2251.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6756
},
{
"epoch": 2252.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6759
},
{
"epoch": 2253.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6762
},
{
"epoch": 2254.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6765
},
{
"epoch": 2255.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6768
},
{
"epoch": 2256.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6771
},
{
"epoch": 2257.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6774
},
{
"epoch": 2258.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6777
},
{
"epoch": 2259.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6780
},
{
"epoch": 2260.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6783
},
{
"epoch": 2261.29,
"eval_exact_match": 0.49806576402321084,
"eval_exec": 0.4922630560928433,
"eval_loss": 0.656693696975708,
"eval_runtime": 103.6205,
"eval_samples_per_second": 9.979,
"step": 6784
},
{
"epoch": 2261.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6786
},
{
"epoch": 2262.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6789
},
{
"epoch": 2263.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6792
},
{
"epoch": 2264.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6795
},
{
"epoch": 2265.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6798
},
{
"epoch": 2266.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6801
},
{
"epoch": 2267.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6804
},
{
"epoch": 2268.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6807
},
{
"epoch": 2269.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6810
},
{
"epoch": 2270.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6813
},
{
"epoch": 2271.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6816
},
{
"epoch": 2272.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6819
},
{
"epoch": 2273.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6822
},
{
"epoch": 2274.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6825
},
{
"epoch": 2275.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6828
},
{
"epoch": 2276.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6831
},
{
"epoch": 2277.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6834
},
{
"epoch": 2278.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6837
},
{
"epoch": 2279.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6840
},
{
"epoch": 2280.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6843
},
{
"epoch": 2281.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6846
},
{
"epoch": 2282.59,
"eval_exact_match": 0.49709864603481624,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.6702226996421814,
"eval_runtime": 100.3881,
"eval_samples_per_second": 10.3,
"step": 6848
},
{
"epoch": 2282.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6849
},
{
"epoch": 2283.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6852
},
{
"epoch": 2284.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6855
},
{
"epoch": 2285.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6858
},
{
"epoch": 2286.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6861
},
{
"epoch": 2287.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6864
},
{
"epoch": 2288.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6867
},
{
"epoch": 2289.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6870
},
{
"epoch": 2290.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6873
},
{
"epoch": 2291.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 6876
},
{
"epoch": 2292.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6879
},
{
"epoch": 2293.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6882
},
{
"epoch": 2294.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6885
},
{
"epoch": 2295.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6888
},
{
"epoch": 2296.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6891
},
{
"epoch": 2297.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6894
},
{
"epoch": 2298.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6897
},
{
"epoch": 2299.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6900
},
{
"epoch": 2300.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6903
},
{
"epoch": 2301.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6906
},
{
"epoch": 2302.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6909
},
{
"epoch": 2303.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6912
},
{
"epoch": 2303.88,
"eval_exact_match": 0.49806576402321084,
"eval_exec": 0.49032882011605416,
"eval_loss": 0.6657952666282654,
"eval_runtime": 102.7872,
"eval_samples_per_second": 10.06,
"step": 6912
},
{
"epoch": 2304.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6915
},
{
"epoch": 2305.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6918
},
{
"epoch": 2306.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6921
},
{
"epoch": 2307.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6924
},
{
"epoch": 2308.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6927
},
{
"epoch": 2309.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 6930
},
{
"epoch": 2310.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6933
},
{
"epoch": 2311.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6936
},
{
"epoch": 2312.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6939
},
{
"epoch": 2313.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6942
},
{
"epoch": 2314.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6945
},
{
"epoch": 2315.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6948
},
{
"epoch": 2316.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6951
},
{
"epoch": 2317.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6954
},
{
"epoch": 2318.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6957
},
{
"epoch": 2319.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6960
},
{
"epoch": 2320.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6963
},
{
"epoch": 2321.88,
"learning_rate": 0.0001,
"loss": 0.0012,
"step": 6966
},
{
"epoch": 2322.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6969
},
{
"epoch": 2323.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6972
},
{
"epoch": 2324.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6975
},
{
"epoch": 2325.29,
"eval_exact_match": 0.4951644100580271,
"eval_exec": 0.4951644100580271,
"eval_loss": 0.6729605197906494,
"eval_runtime": 101.8227,
"eval_samples_per_second": 10.155,
"step": 6976
},
{
"epoch": 2325.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 6978
},
{
"epoch": 2326.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6981
},
{
"epoch": 2327.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6984
},
{
"epoch": 2328.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6987
},
{
"epoch": 2329.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 6990
},
{
"epoch": 2330.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 6993
},
{
"epoch": 2331.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 6996
},
{
"epoch": 2332.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 6999
},
{
"epoch": 2333.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7002
},
{
"epoch": 2334.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7005
},
{
"epoch": 2335.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7008
},
{
"epoch": 2336.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7011
},
{
"epoch": 2337.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7014
},
{
"epoch": 2338.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7017
},
{
"epoch": 2339.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7020
},
{
"epoch": 2340.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7023
},
{
"epoch": 2341.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7026
},
{
"epoch": 2342.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7029
},
{
"epoch": 2343.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7032
},
{
"epoch": 2344.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7035
},
{
"epoch": 2345.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7038
},
{
"epoch": 2346.59,
"eval_exact_match": 0.5038684719535783,
"eval_exec": 0.5,
"eval_loss": 0.6706193685531616,
"eval_runtime": 107.1601,
"eval_samples_per_second": 9.649,
"step": 7040
},
{
"epoch": 2346.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7041
},
{
"epoch": 2347.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7044
},
{
"epoch": 2348.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7047
},
{
"epoch": 2349.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7050
},
{
"epoch": 2350.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7053
},
{
"epoch": 2351.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7056
},
{
"epoch": 2352.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7059
},
{
"epoch": 2353.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7062
},
{
"epoch": 2354.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7065
},
{
"epoch": 2355.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7068
},
{
"epoch": 2356.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7071
},
{
"epoch": 2357.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7074
},
{
"epoch": 2358.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7077
},
{
"epoch": 2359.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7080
},
{
"epoch": 2360.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7083
},
{
"epoch": 2361.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7086
},
{
"epoch": 2362.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7089
},
{
"epoch": 2363.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7092
},
{
"epoch": 2364.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7095
},
{
"epoch": 2365.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7098
},
{
"epoch": 2366.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7101
},
{
"epoch": 2367.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7104
},
{
"epoch": 2367.88,
"eval_exact_match": 0.5058027079303675,
"eval_exec": 0.49709864603481624,
"eval_loss": 0.6719130277633667,
"eval_runtime": 103.7435,
"eval_samples_per_second": 9.967,
"step": 7104
},
{
"epoch": 2368.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7107
},
{
"epoch": 2369.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7110
},
{
"epoch": 2370.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7113
},
{
"epoch": 2371.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7116
},
{
"epoch": 2372.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7119
},
{
"epoch": 2373.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7122
},
{
"epoch": 2374.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7125
},
{
"epoch": 2375.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7128
},
{
"epoch": 2376.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7131
},
{
"epoch": 2377.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7134
},
{
"epoch": 2378.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7137
},
{
"epoch": 2379.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7140
},
{
"epoch": 2380.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7143
},
{
"epoch": 2381.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7146
},
{
"epoch": 2382.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7149
},
{
"epoch": 2383.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7152
},
{
"epoch": 2384.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7155
},
{
"epoch": 2385.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7158
},
{
"epoch": 2386.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7161
},
{
"epoch": 2387.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7164
},
{
"epoch": 2388.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7167
},
{
"epoch": 2389.29,
"eval_exact_match": 0.5,
"eval_exec": 0.49032882011605416,
"eval_loss": 0.6656604409217834,
"eval_runtime": 110.2501,
"eval_samples_per_second": 9.379,
"step": 7168
},
{
"epoch": 2389.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7170
},
{
"epoch": 2390.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7173
},
{
"epoch": 2391.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7176
},
{
"epoch": 2392.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7179
},
{
"epoch": 2393.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7182
},
{
"epoch": 2394.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7185
},
{
"epoch": 2395.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7188
},
{
"epoch": 2396.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7191
},
{
"epoch": 2397.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7194
},
{
"epoch": 2398.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7197
},
{
"epoch": 2399.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7200
},
{
"epoch": 2400.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7203
},
{
"epoch": 2401.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7206
},
{
"epoch": 2402.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7209
},
{
"epoch": 2403.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7212
},
{
"epoch": 2404.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7215
},
{
"epoch": 2405.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7218
},
{
"epoch": 2406.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7221
},
{
"epoch": 2407.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7224
},
{
"epoch": 2408.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7227
},
{
"epoch": 2409.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7230
},
{
"epoch": 2410.59,
"eval_exact_match": 0.5067698259187621,
"eval_exec": 0.49806576402321084,
"eval_loss": 0.6692262291908264,
"eval_runtime": 107.2383,
"eval_samples_per_second": 9.642,
"step": 7232
},
{
"epoch": 2410.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7233
},
{
"epoch": 2411.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7236
},
{
"epoch": 2412.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7239
},
{
"epoch": 2413.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7242
},
{
"epoch": 2414.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7245
},
{
"epoch": 2415.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7248
},
{
"epoch": 2416.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7251
},
{
"epoch": 2417.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7254
},
{
"epoch": 2418.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7257
},
{
"epoch": 2419.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7260
},
{
"epoch": 2420.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7263
},
{
"epoch": 2421.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7266
},
{
"epoch": 2422.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7269
},
{
"epoch": 2423.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7272
},
{
"epoch": 2424.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7275
},
{
"epoch": 2425.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7278
},
{
"epoch": 2426.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7281
},
{
"epoch": 2427.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7284
},
{
"epoch": 2428.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7287
},
{
"epoch": 2429.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7290
},
{
"epoch": 2430.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7293
},
{
"epoch": 2431.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7296
},
{
"epoch": 2431.88,
"eval_exact_match": 0.5038684719535783,
"eval_exec": 0.4912959381044487,
"eval_loss": 0.672451376914978,
"eval_runtime": 102.0344,
"eval_samples_per_second": 10.134,
"step": 7296
},
{
"epoch": 2432.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7299
},
{
"epoch": 2433.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7302
},
{
"epoch": 2434.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7305
},
{
"epoch": 2435.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7308
},
{
"epoch": 2436.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7311
},
{
"epoch": 2437.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7314
},
{
"epoch": 2438.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7317
},
{
"epoch": 2439.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7320
},
{
"epoch": 2440.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7323
},
{
"epoch": 2441.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7326
},
{
"epoch": 2442.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7329
},
{
"epoch": 2443.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7332
},
{
"epoch": 2444.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7335
},
{
"epoch": 2445.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7338
},
{
"epoch": 2446.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7341
},
{
"epoch": 2447.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7344
},
{
"epoch": 2448.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7347
},
{
"epoch": 2449.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7350
},
{
"epoch": 2450.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7353
},
{
"epoch": 2451.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7356
},
{
"epoch": 2452.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7359
},
{
"epoch": 2453.29,
"eval_exact_match": 0.5087040618955513,
"eval_exec": 0.4941972920696325,
"eval_loss": 0.6790467500686646,
"eval_runtime": 105.5575,
"eval_samples_per_second": 9.796,
"step": 7360
},
{
"epoch": 2453.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7362
},
{
"epoch": 2454.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7365
},
{
"epoch": 2455.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7368
},
{
"epoch": 2456.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7371
},
{
"epoch": 2457.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7374
},
{
"epoch": 2458.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7377
},
{
"epoch": 2459.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7380
},
{
"epoch": 2460.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7383
},
{
"epoch": 2461.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7386
},
{
"epoch": 2462.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7389
},
{
"epoch": 2463.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7392
},
{
"epoch": 2464.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7395
},
{
"epoch": 2465.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7398
},
{
"epoch": 2466.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7401
},
{
"epoch": 2467.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7404
},
{
"epoch": 2468.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7407
},
{
"epoch": 2469.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7410
},
{
"epoch": 2470.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7413
},
{
"epoch": 2471.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7416
},
{
"epoch": 2472.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7419
},
{
"epoch": 2473.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7422
},
{
"epoch": 2474.59,
"eval_exact_match": 0.5087040618955513,
"eval_exec": 0.4990328820116054,
"eval_loss": 0.6767649054527283,
"eval_runtime": 101.2746,
"eval_samples_per_second": 10.21,
"step": 7424
},
{
"epoch": 2474.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7425
},
{
"epoch": 2475.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7428
},
{
"epoch": 2476.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7431
},
{
"epoch": 2477.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7434
},
{
"epoch": 2478.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7437
},
{
"epoch": 2479.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7440
},
{
"epoch": 2480.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7443
},
{
"epoch": 2481.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7446
},
{
"epoch": 2482.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7449
},
{
"epoch": 2483.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7452
},
{
"epoch": 2484.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7455
},
{
"epoch": 2485.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7458
},
{
"epoch": 2486.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7461
},
{
"epoch": 2487.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7464
},
{
"epoch": 2488.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7467
},
{
"epoch": 2489.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7470
},
{
"epoch": 2490.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7473
},
{
"epoch": 2491.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7476
},
{
"epoch": 2492.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7479
},
{
"epoch": 2493.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7482
},
{
"epoch": 2494.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7485
},
{
"epoch": 2495.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7488
},
{
"epoch": 2495.88,
"eval_exact_match": 0.5029013539651838,
"eval_exec": 0.49806576402321084,
"eval_loss": 0.6734866499900818,
"eval_runtime": 98.1491,
"eval_samples_per_second": 10.535,
"step": 7488
},
{
"epoch": 2496.88,
"learning_rate": 0.0001,
"loss": 0.0011,
"step": 7491
},
{
"epoch": 2497.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7494
},
{
"epoch": 2498.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7497
},
{
"epoch": 2499.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7500
},
{
"epoch": 2500.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7503
},
{
"epoch": 2501.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7506
},
{
"epoch": 2502.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7509
},
{
"epoch": 2503.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7512
},
{
"epoch": 2504.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7515
},
{
"epoch": 2505.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7518
},
{
"epoch": 2506.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7521
},
{
"epoch": 2507.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7524
},
{
"epoch": 2508.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7527
},
{
"epoch": 2509.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7530
},
{
"epoch": 2510.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7533
},
{
"epoch": 2511.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7536
},
{
"epoch": 2512.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7539
},
{
"epoch": 2513.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7542
},
{
"epoch": 2514.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7545
},
{
"epoch": 2515.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7548
},
{
"epoch": 2516.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7551
},
{
"epoch": 2517.29,
"eval_exact_match": 0.5058027079303675,
"eval_exec": 0.4951644100580271,
"eval_loss": 0.6706563830375671,
"eval_runtime": 104.1289,
"eval_samples_per_second": 9.93,
"step": 7552
},
{
"epoch": 2517.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7554
},
{
"epoch": 2518.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7557
},
{
"epoch": 2519.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7560
},
{
"epoch": 2520.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7563
},
{
"epoch": 2521.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7566
},
{
"epoch": 2522.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7569
},
{
"epoch": 2523.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7572
},
{
"epoch": 2524.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7575
},
{
"epoch": 2525.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7578
},
{
"epoch": 2526.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7581
},
{
"epoch": 2527.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7584
},
{
"epoch": 2528.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7587
},
{
"epoch": 2529.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7590
},
{
"epoch": 2530.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7593
},
{
"epoch": 2531.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7596
},
{
"epoch": 2532.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7599
},
{
"epoch": 2533.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7602
},
{
"epoch": 2534.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7605
},
{
"epoch": 2535.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7608
},
{
"epoch": 2536.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7611
},
{
"epoch": 2537.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7614
},
{
"epoch": 2538.59,
"eval_exact_match": 0.5135396518375241,
"eval_exec": 0.4951644100580271,
"eval_loss": 0.6734728813171387,
"eval_runtime": 103.6866,
"eval_samples_per_second": 9.972,
"step": 7616
},
{
"epoch": 2538.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7617
},
{
"epoch": 2539.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7620
},
{
"epoch": 2540.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7623
},
{
"epoch": 2541.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7626
},
{
"epoch": 2542.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7629
},
{
"epoch": 2543.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7632
},
{
"epoch": 2544.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7635
},
{
"epoch": 2545.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7638
},
{
"epoch": 2546.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7641
},
{
"epoch": 2547.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7644
},
{
"epoch": 2548.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7647
},
{
"epoch": 2549.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7650
},
{
"epoch": 2550.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7653
},
{
"epoch": 2551.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7656
},
{
"epoch": 2552.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7659
},
{
"epoch": 2553.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7662
},
{
"epoch": 2554.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7665
},
{
"epoch": 2555.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7668
},
{
"epoch": 2556.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7671
},
{
"epoch": 2557.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7674
},
{
"epoch": 2558.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7677
},
{
"epoch": 2559.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7680
},
{
"epoch": 2559.88,
"eval_exact_match": 0.4951644100580271,
"eval_exec": 0.4922630560928433,
"eval_loss": 0.6788745522499084,
"eval_runtime": 100.2149,
"eval_samples_per_second": 10.318,
"step": 7680
},
{
"epoch": 2560.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7683
},
{
"epoch": 2561.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7686
},
{
"epoch": 2562.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7689
},
{
"epoch": 2563.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7692
},
{
"epoch": 2564.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7695
},
{
"epoch": 2565.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7698
},
{
"epoch": 2566.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7701
},
{
"epoch": 2567.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7704
},
{
"epoch": 2568.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7707
},
{
"epoch": 2569.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7710
},
{
"epoch": 2570.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7713
},
{
"epoch": 2571.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7716
},
{
"epoch": 2572.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7719
},
{
"epoch": 2573.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7722
},
{
"epoch": 2574.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7725
},
{
"epoch": 2575.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7728
},
{
"epoch": 2576.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7731
},
{
"epoch": 2577.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7734
},
{
"epoch": 2578.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7737
},
{
"epoch": 2579.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7740
},
{
"epoch": 2580.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7743
},
{
"epoch": 2581.29,
"eval_exact_match": 0.5,
"eval_exec": 0.488394584139265,
"eval_loss": 0.6870007514953613,
"eval_runtime": 103.442,
"eval_samples_per_second": 9.996,
"step": 7744
},
{
"epoch": 2581.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7746
},
{
"epoch": 2582.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7749
},
{
"epoch": 2583.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7752
},
{
"epoch": 2584.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7755
},
{
"epoch": 2585.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7758
},
{
"epoch": 2586.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7761
},
{
"epoch": 2587.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7764
},
{
"epoch": 2588.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7767
},
{
"epoch": 2589.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7770
},
{
"epoch": 2590.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7773
},
{
"epoch": 2591.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7776
},
{
"epoch": 2592.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7779
},
{
"epoch": 2593.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7782
},
{
"epoch": 2594.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7785
},
{
"epoch": 2595.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7788
},
{
"epoch": 2596.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7791
},
{
"epoch": 2597.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7794
},
{
"epoch": 2598.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7797
},
{
"epoch": 2599.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7800
},
{
"epoch": 2600.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7803
},
{
"epoch": 2601.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7806
},
{
"epoch": 2602.59,
"eval_exact_match": 0.5125725338491296,
"eval_exec": 0.49806576402321084,
"eval_loss": 0.6841245889663696,
"eval_runtime": 100.6823,
"eval_samples_per_second": 10.27,
"step": 7808
},
{
"epoch": 2602.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7809
},
{
"epoch": 2603.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7812
},
{
"epoch": 2604.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7815
},
{
"epoch": 2605.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7818
},
{
"epoch": 2606.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7821
},
{
"epoch": 2607.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7824
},
{
"epoch": 2608.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7827
},
{
"epoch": 2609.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7830
},
{
"epoch": 2610.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7833
},
{
"epoch": 2611.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7836
},
{
"epoch": 2612.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 7839
},
{
"epoch": 2613.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7842
},
{
"epoch": 2614.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7845
},
{
"epoch": 2615.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7848
},
{
"epoch": 2616.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7851
},
{
"epoch": 2617.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7854
},
{
"epoch": 2618.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7857
},
{
"epoch": 2619.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7860
},
{
"epoch": 2620.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7863
},
{
"epoch": 2621.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7866
},
{
"epoch": 2622.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7869
},
{
"epoch": 2623.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7872
},
{
"epoch": 2623.88,
"eval_exact_match": 0.5058027079303675,
"eval_exec": 0.4922630560928433,
"eval_loss": 0.6852383017539978,
"eval_runtime": 102.8761,
"eval_samples_per_second": 10.051,
"step": 7872
},
{
"epoch": 2624.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7875
},
{
"epoch": 2625.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7878
},
{
"epoch": 2626.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7881
},
{
"epoch": 2627.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7884
},
{
"epoch": 2628.88,
"learning_rate": 0.0001,
"loss": 0.0005,
"step": 7887
},
{
"epoch": 2629.88,
"learning_rate": 0.0001,
"loss": 0.001,
"step": 7890
},
{
"epoch": 2630.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7893
},
{
"epoch": 2631.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7896
},
{
"epoch": 2632.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7899
},
{
"epoch": 2633.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7902
},
{
"epoch": 2634.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7905
},
{
"epoch": 2635.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7908
},
{
"epoch": 2636.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7911
},
{
"epoch": 2637.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7914
},
{
"epoch": 2638.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7917
},
{
"epoch": 2639.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7920
},
{
"epoch": 2640.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7923
},
{
"epoch": 2641.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7926
},
{
"epoch": 2642.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7929
},
{
"epoch": 2643.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7932
},
{
"epoch": 2644.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7935
},
{
"epoch": 2645.29,
"eval_exact_match": 0.5087040618955513,
"eval_exec": 0.5,
"eval_loss": 0.678929328918457,
"eval_runtime": 101.2205,
"eval_samples_per_second": 10.215,
"step": 7936
},
{
"epoch": 2645.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7938
},
{
"epoch": 2646.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7941
},
{
"epoch": 2647.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7944
},
{
"epoch": 2648.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7947
},
{
"epoch": 2649.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7950
},
{
"epoch": 2650.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7953
},
{
"epoch": 2651.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7956
},
{
"epoch": 2652.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7959
},
{
"epoch": 2653.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7962
},
{
"epoch": 2654.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7965
},
{
"epoch": 2655.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7968
},
{
"epoch": 2656.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7971
},
{
"epoch": 2657.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7974
},
{
"epoch": 2658.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7977
},
{
"epoch": 2659.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7980
},
{
"epoch": 2660.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7983
},
{
"epoch": 2661.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7986
},
{
"epoch": 2662.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7989
},
{
"epoch": 2663.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 7992
},
{
"epoch": 2664.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 7995
},
{
"epoch": 2665.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 7998
},
{
"epoch": 2666.59,
"eval_exact_match": 0.5125725338491296,
"eval_exec": 0.5029013539651838,
"eval_loss": 0.6847764849662781,
"eval_runtime": 104.2805,
"eval_samples_per_second": 9.916,
"step": 8000
},
{
"epoch": 2666.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8001
},
{
"epoch": 2667.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8004
},
{
"epoch": 2668.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8007
},
{
"epoch": 2669.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8010
},
{
"epoch": 2670.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8013
},
{
"epoch": 2671.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8016
},
{
"epoch": 2672.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8019
},
{
"epoch": 2673.88,
"learning_rate": 0.0001,
"loss": 0.0005,
"step": 8022
},
{
"epoch": 2674.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8025
},
{
"epoch": 2675.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8028
},
{
"epoch": 2676.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8031
},
{
"epoch": 2677.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8034
},
{
"epoch": 2678.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8037
},
{
"epoch": 2679.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8040
},
{
"epoch": 2680.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8043
},
{
"epoch": 2681.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8046
},
{
"epoch": 2682.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8049
},
{
"epoch": 2683.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8052
},
{
"epoch": 2684.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8055
},
{
"epoch": 2685.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8058
},
{
"epoch": 2686.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8061
},
{
"epoch": 2687.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8064
},
{
"epoch": 2687.88,
"eval_exact_match": 0.5058027079303675,
"eval_exec": 0.5,
"eval_loss": 0.6950146555900574,
"eval_runtime": 103.8342,
"eval_samples_per_second": 9.958,
"step": 8064
},
{
"epoch": 2688.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8067
},
{
"epoch": 2689.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8070
},
{
"epoch": 2690.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8073
},
{
"epoch": 2691.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8076
},
{
"epoch": 2692.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8079
},
{
"epoch": 2693.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8082
},
{
"epoch": 2694.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8085
},
{
"epoch": 2695.88,
"learning_rate": 0.0001,
"loss": 0.0009,
"step": 8088
},
{
"epoch": 2696.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8091
},
{
"epoch": 2697.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8094
},
{
"epoch": 2698.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8097
},
{
"epoch": 2699.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8100
},
{
"epoch": 2700.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8103
},
{
"epoch": 2701.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8106
},
{
"epoch": 2702.88,
"learning_rate": 0.0001,
"loss": 0.0005,
"step": 8109
},
{
"epoch": 2703.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8112
},
{
"epoch": 2704.88,
"learning_rate": 0.0001,
"loss": 0.0005,
"step": 8115
},
{
"epoch": 2705.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8118
},
{
"epoch": 2706.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8121
},
{
"epoch": 2707.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8124
},
{
"epoch": 2708.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8127
},
{
"epoch": 2709.29,
"eval_exact_match": 0.4990328820116054,
"eval_exec": 0.4874274661508704,
"eval_loss": 0.6891441941261292,
"eval_runtime": 107.0055,
"eval_samples_per_second": 9.663,
"step": 8128
},
{
"epoch": 2709.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8130
},
{
"epoch": 2710.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8133
},
{
"epoch": 2711.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8136
},
{
"epoch": 2712.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8139
},
{
"epoch": 2713.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8142
},
{
"epoch": 2714.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8145
},
{
"epoch": 2715.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8148
},
{
"epoch": 2716.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8151
},
{
"epoch": 2717.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8154
},
{
"epoch": 2718.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8157
},
{
"epoch": 2719.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8160
},
{
"epoch": 2720.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8163
},
{
"epoch": 2721.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8166
},
{
"epoch": 2722.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8169
},
{
"epoch": 2723.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8172
},
{
"epoch": 2724.88,
"learning_rate": 0.0001,
"loss": 0.0008,
"step": 8175
},
{
"epoch": 2725.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8178
},
{
"epoch": 2726.88,
"learning_rate": 0.0001,
"loss": 0.0007,
"step": 8181
},
{
"epoch": 2727.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8184
},
{
"epoch": 2728.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8187
},
{
"epoch": 2729.88,
"learning_rate": 0.0001,
"loss": 0.0006,
"step": 8190
},
{
"epoch": 2730.59,
"eval_exact_match": 0.5174081237911026,
"eval_exec": 0.5067698259187621,
"eval_loss": 0.6930547952651978,
"eval_runtime": 100.8541,
"eval_samples_per_second": 10.252,
"step": 8192
}
],
"max_steps": 9216,
"num_train_epochs": 3072,
"total_flos": 1.627321267788972e+18,
"trial_name": null,
"trial_params": null
}