{ "best_metric": 0.5174081237911026, "best_model_checkpoint": "./experiment/train_0308_t5_small_db_content_26001_weight_decay_00001_ls_00_lr_constant_bs_2064/checkpoint-8192", "epoch": 2730.5890410958905, "global_step": 8192, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.29, "learning_rate": 0.0001, "loss": 4.4465, "step": 1 }, { "epoch": 0.88, "learning_rate": 0.0001, "loss": 4.1272, "step": 3 }, { "epoch": 1.88, "learning_rate": 0.0001, "loss": 4.0649, "step": 6 }, { "epoch": 2.88, "learning_rate": 0.0001, "loss": 3.5316, "step": 9 }, { "epoch": 3.88, "learning_rate": 0.0001, "loss": 3.1042, "step": 12 }, { "epoch": 4.88, "learning_rate": 0.0001, "loss": 2.733, "step": 15 }, { "epoch": 5.88, "learning_rate": 0.0001, "loss": 2.4421, "step": 18 }, { "epoch": 6.88, "learning_rate": 0.0001, "loss": 2.1818, "step": 21 }, { "epoch": 7.88, "learning_rate": 0.0001, "loss": 1.9857, "step": 24 }, { "epoch": 8.88, "learning_rate": 0.0001, "loss": 1.8413, "step": 27 }, { "epoch": 9.88, "learning_rate": 0.0001, "loss": 1.686, "step": 30 }, { "epoch": 10.88, "learning_rate": 0.0001, "loss": 1.5623, "step": 33 }, { "epoch": 11.88, "learning_rate": 0.0001, "loss": 1.4631, "step": 36 }, { "epoch": 12.88, "learning_rate": 0.0001, "loss": 1.3776, "step": 39 }, { "epoch": 13.88, "learning_rate": 0.0001, "loss": 1.3096, "step": 42 }, { "epoch": 14.88, "learning_rate": 0.0001, "loss": 1.2347, "step": 45 }, { "epoch": 15.88, "learning_rate": 0.0001, "loss": 1.1792, "step": 48 }, { "epoch": 16.88, "learning_rate": 0.0001, "loss": 1.1255, "step": 51 }, { "epoch": 17.88, "learning_rate": 0.0001, "loss": 1.0843, "step": 54 }, { "epoch": 18.88, "learning_rate": 0.0001, "loss": 1.0435, "step": 57 }, { "epoch": 19.88, "learning_rate": 0.0001, "loss": 1.0021, "step": 60 }, { "epoch": 20.88, "learning_rate": 0.0001, "loss": 0.971, "step": 63 }, { "epoch": 21.29, "eval_exact_match": 0.04061895551257253, "eval_exec": 0.043520309477756286, "eval_loss": 0.6706878542900085, "eval_runtime": 693.5751, "eval_samples_per_second": 1.491, "step": 64 }, { "epoch": 21.88, "learning_rate": 0.0001, "loss": 0.9412, "step": 66 }, { "epoch": 22.88, "learning_rate": 0.0001, "loss": 0.9117, "step": 69 }, { "epoch": 23.88, "learning_rate": 0.0001, "loss": 0.8753, "step": 72 }, { "epoch": 24.88, "learning_rate": 0.0001, "loss": 0.8514, "step": 75 }, { "epoch": 25.88, "learning_rate": 0.0001, "loss": 0.8317, "step": 78 }, { "epoch": 26.88, "learning_rate": 0.0001, "loss": 0.8019, "step": 81 }, { "epoch": 27.88, "learning_rate": 0.0001, "loss": 0.7857, "step": 84 }, { "epoch": 28.88, "learning_rate": 0.0001, "loss": 0.7623, "step": 87 }, { "epoch": 29.88, "learning_rate": 0.0001, "loss": 0.7418, "step": 90 }, { "epoch": 30.88, "learning_rate": 0.0001, "loss": 0.7291, "step": 93 }, { "epoch": 31.88, "learning_rate": 0.0001, "loss": 0.7086, "step": 96 }, { "epoch": 32.88, "learning_rate": 0.0001, "loss": 0.6875, "step": 99 }, { "epoch": 33.88, "learning_rate": 0.0001, "loss": 0.6781, "step": 102 }, { "epoch": 34.88, "learning_rate": 0.0001, "loss": 0.6609, "step": 105 }, { "epoch": 35.88, "learning_rate": 0.0001, "loss": 0.6443, "step": 108 }, { "epoch": 36.88, "learning_rate": 0.0001, "loss": 0.6356, "step": 111 }, { "epoch": 37.88, "learning_rate": 0.0001, "loss": 0.6093, "step": 114 }, { "epoch": 38.88, "learning_rate": 0.0001, "loss": 0.6128, "step": 117 }, { "epoch": 39.88, "learning_rate": 0.0001, "loss": 0.5916, "step": 120 }, { "epoch": 40.88, "learning_rate": 0.0001, "loss": 0.5842, "step": 123 }, { "epoch": 41.88, "learning_rate": 0.0001, "loss": 0.5757, "step": 126 }, { "epoch": 42.59, "eval_exact_match": 0.21179883945841393, "eval_exec": 0.2205029013539652, "eval_loss": 0.45285192131996155, "eval_runtime": 131.42, "eval_samples_per_second": 7.868, "step": 128 }, { "epoch": 42.88, "learning_rate": 0.0001, "loss": 0.5613, "step": 129 }, { "epoch": 43.88, "learning_rate": 0.0001, "loss": 0.5474, "step": 132 }, { "epoch": 44.88, "learning_rate": 0.0001, "loss": 0.5398, "step": 135 }, { "epoch": 45.88, "learning_rate": 0.0001, "loss": 0.5321, "step": 138 }, { "epoch": 46.88, "learning_rate": 0.0001, "loss": 0.5247, "step": 141 }, { "epoch": 47.88, "learning_rate": 0.0001, "loss": 0.5135, "step": 144 }, { "epoch": 48.88, "learning_rate": 0.0001, "loss": 0.5065, "step": 147 }, { "epoch": 49.88, "learning_rate": 0.0001, "loss": 0.4933, "step": 150 }, { "epoch": 50.88, "learning_rate": 0.0001, "loss": 0.4881, "step": 153 }, { "epoch": 51.88, "learning_rate": 0.0001, "loss": 0.4831, "step": 156 }, { "epoch": 52.88, "learning_rate": 0.0001, "loss": 0.4778, "step": 159 }, { "epoch": 53.88, "learning_rate": 0.0001, "loss": 0.4641, "step": 162 }, { "epoch": 54.88, "learning_rate": 0.0001, "loss": 0.4581, "step": 165 }, { "epoch": 55.88, "learning_rate": 0.0001, "loss": 0.4536, "step": 168 }, { "epoch": 56.88, "learning_rate": 0.0001, "loss": 0.4472, "step": 171 }, { "epoch": 57.88, "learning_rate": 0.0001, "loss": 0.4394, "step": 174 }, { "epoch": 58.88, "learning_rate": 0.0001, "loss": 0.4311, "step": 177 }, { "epoch": 59.88, "learning_rate": 0.0001, "loss": 0.4283, "step": 180 }, { "epoch": 60.88, "learning_rate": 0.0001, "loss": 0.4192, "step": 183 }, { "epoch": 61.88, "learning_rate": 0.0001, "loss": 0.4132, "step": 186 }, { "epoch": 62.88, "learning_rate": 0.0001, "loss": 0.4106, "step": 189 }, { "epoch": 63.88, "learning_rate": 0.0001, "loss": 0.4049, "step": 192 }, { "epoch": 63.88, "eval_exact_match": 0.28820116054158607, "eval_exec": 0.3056092843326886, "eval_loss": 0.37886810302734375, "eval_runtime": 134.3287, "eval_samples_per_second": 7.698, "step": 192 }, { "epoch": 64.88, "learning_rate": 0.0001, "loss": 0.3949, "step": 195 }, { "epoch": 65.88, "learning_rate": 0.0001, "loss": 0.3943, "step": 198 }, { "epoch": 66.88, "learning_rate": 0.0001, "loss": 0.3912, "step": 201 }, { "epoch": 67.88, "learning_rate": 0.0001, "loss": 0.3833, "step": 204 }, { "epoch": 68.88, "learning_rate": 0.0001, "loss": 0.3804, "step": 207 }, { "epoch": 69.88, "learning_rate": 0.0001, "loss": 0.3694, "step": 210 }, { "epoch": 70.88, "learning_rate": 0.0001, "loss": 0.3723, "step": 213 }, { "epoch": 71.88, "learning_rate": 0.0001, "loss": 0.3637, "step": 216 }, { "epoch": 72.88, "learning_rate": 0.0001, "loss": 0.3622, "step": 219 }, { "epoch": 73.88, "learning_rate": 0.0001, "loss": 0.3541, "step": 222 }, { "epoch": 74.88, "learning_rate": 0.0001, "loss": 0.3519, "step": 225 }, { "epoch": 75.88, "learning_rate": 0.0001, "loss": 0.346, "step": 228 }, { "epoch": 76.88, "learning_rate": 0.0001, "loss": 0.3441, "step": 231 }, { "epoch": 77.88, "learning_rate": 0.0001, "loss": 0.339, "step": 234 }, { "epoch": 78.88, "learning_rate": 0.0001, "loss": 0.3334, "step": 237 }, { "epoch": 79.88, "learning_rate": 0.0001, "loss": 0.3317, "step": 240 }, { "epoch": 80.88, "learning_rate": 0.0001, "loss": 0.3247, "step": 243 }, { "epoch": 81.88, "learning_rate": 0.0001, "loss": 0.3225, "step": 246 }, { "epoch": 82.88, "learning_rate": 0.0001, "loss": 0.3173, "step": 249 }, { "epoch": 83.88, "learning_rate": 0.0001, "loss": 0.3148, "step": 252 }, { "epoch": 84.88, "learning_rate": 0.0001, "loss": 0.3123, "step": 255 }, { "epoch": 85.29, "eval_exact_match": 0.3288201160541586, "eval_exec": 0.3471953578336557, "eval_loss": 0.3469275236129761, "eval_runtime": 135.0596, "eval_samples_per_second": 7.656, "step": 256 }, { "epoch": 85.88, "learning_rate": 0.0001, "loss": 0.3067, "step": 258 }, { "epoch": 86.88, "learning_rate": 0.0001, "loss": 0.3062, "step": 261 }, { "epoch": 87.88, "learning_rate": 0.0001, "loss": 0.3044, "step": 264 }, { "epoch": 88.88, "learning_rate": 0.0001, "loss": 0.2976, "step": 267 }, { "epoch": 89.88, "learning_rate": 0.0001, "loss": 0.2978, "step": 270 }, { "epoch": 90.88, "learning_rate": 0.0001, "loss": 0.292, "step": 273 }, { "epoch": 91.88, "learning_rate": 0.0001, "loss": 0.29, "step": 276 }, { "epoch": 92.88, "learning_rate": 0.0001, "loss": 0.2863, "step": 279 }, { "epoch": 93.88, "learning_rate": 0.0001, "loss": 0.2832, "step": 282 }, { "epoch": 94.88, "learning_rate": 0.0001, "loss": 0.2787, "step": 285 }, { "epoch": 95.88, "learning_rate": 0.0001, "loss": 0.2751, "step": 288 }, { "epoch": 96.88, "learning_rate": 0.0001, "loss": 0.2741, "step": 291 }, { "epoch": 97.88, "learning_rate": 0.0001, "loss": 0.2724, "step": 294 }, { "epoch": 98.88, "learning_rate": 0.0001, "loss": 0.2677, "step": 297 }, { "epoch": 99.88, "learning_rate": 0.0001, "loss": 0.2673, "step": 300 }, { "epoch": 100.88, "learning_rate": 0.0001, "loss": 0.2619, "step": 303 }, { "epoch": 101.88, "learning_rate": 0.0001, "loss": 0.2584, "step": 306 }, { "epoch": 102.88, "learning_rate": 0.0001, "loss": 0.2575, "step": 309 }, { "epoch": 103.88, "learning_rate": 0.0001, "loss": 0.2525, "step": 312 }, { "epoch": 104.88, "learning_rate": 0.0001, "loss": 0.2535, "step": 315 }, { "epoch": 105.88, "learning_rate": 0.0001, "loss": 0.2479, "step": 318 }, { "epoch": 106.59, "eval_exact_match": 0.35880077369439073, "eval_exec": 0.3820116054158607, "eval_loss": 0.33587977290153503, "eval_runtime": 103.6076, "eval_samples_per_second": 9.98, "step": 320 }, { "epoch": 106.88, "learning_rate": 0.0001, "loss": 0.2464, "step": 321 }, { "epoch": 107.88, "learning_rate": 0.0001, "loss": 0.2455, "step": 324 }, { "epoch": 108.88, "learning_rate": 0.0001, "loss": 0.2403, "step": 327 }, { "epoch": 109.88, "learning_rate": 0.0001, "loss": 0.242, "step": 330 }, { "epoch": 110.88, "learning_rate": 0.0001, "loss": 0.2381, "step": 333 }, { "epoch": 111.88, "learning_rate": 0.0001, "loss": 0.2344, "step": 336 }, { "epoch": 112.88, "learning_rate": 0.0001, "loss": 0.2343, "step": 339 }, { "epoch": 113.88, "learning_rate": 0.0001, "loss": 0.2328, "step": 342 }, { "epoch": 114.88, "learning_rate": 0.0001, "loss": 0.2297, "step": 345 }, { "epoch": 115.88, "learning_rate": 0.0001, "loss": 0.2303, "step": 348 }, { "epoch": 116.88, "learning_rate": 0.0001, "loss": 0.2247, "step": 351 }, { "epoch": 117.88, "learning_rate": 0.0001, "loss": 0.2255, "step": 354 }, { "epoch": 118.88, "learning_rate": 0.0001, "loss": 0.2243, "step": 357 }, { "epoch": 119.88, "learning_rate": 0.0001, "loss": 0.2215, "step": 360 }, { "epoch": 120.88, "learning_rate": 0.0001, "loss": 0.2215, "step": 363 }, { "epoch": 121.88, "learning_rate": 0.0001, "loss": 0.2158, "step": 366 }, { "epoch": 122.88, "learning_rate": 0.0001, "loss": 0.2168, "step": 369 }, { "epoch": 123.88, "learning_rate": 0.0001, "loss": 0.2135, "step": 372 }, { "epoch": 124.88, "learning_rate": 0.0001, "loss": 0.2138, "step": 375 }, { "epoch": 125.88, "learning_rate": 0.0001, "loss": 0.2113, "step": 378 }, { "epoch": 126.88, "learning_rate": 0.0001, "loss": 0.2095, "step": 381 }, { "epoch": 127.88, "learning_rate": 0.0001, "loss": 0.2085, "step": 384 }, { "epoch": 127.88, "eval_exact_match": 0.379110251450677, "eval_exec": 0.40038684719535783, "eval_loss": 0.3285636603832245, "eval_runtime": 143.1024, "eval_samples_per_second": 7.226, "step": 384 }, { "epoch": 128.88, "learning_rate": 0.0001, "loss": 0.2072, "step": 387 }, { "epoch": 129.88, "learning_rate": 0.0001, "loss": 0.2056, "step": 390 }, { "epoch": 130.88, "learning_rate": 0.0001, "loss": 0.2023, "step": 393 }, { "epoch": 131.88, "learning_rate": 0.0001, "loss": 0.201, "step": 396 }, { "epoch": 132.88, "learning_rate": 0.0001, "loss": 0.1982, "step": 399 }, { "epoch": 133.88, "learning_rate": 0.0001, "loss": 0.1977, "step": 402 }, { "epoch": 134.88, "learning_rate": 0.0001, "loss": 0.1976, "step": 405 }, { "epoch": 135.88, "learning_rate": 0.0001, "loss": 0.1946, "step": 408 }, { "epoch": 136.88, "learning_rate": 0.0001, "loss": 0.1961, "step": 411 }, { "epoch": 137.88, "learning_rate": 0.0001, "loss": 0.1931, "step": 414 }, { "epoch": 138.88, "learning_rate": 0.0001, "loss": 0.1913, "step": 417 }, { "epoch": 139.88, "learning_rate": 0.0001, "loss": 0.1905, "step": 420 }, { "epoch": 140.88, "learning_rate": 0.0001, "loss": 0.1885, "step": 423 }, { "epoch": 141.88, "learning_rate": 0.0001, "loss": 0.187, "step": 426 }, { "epoch": 142.88, "learning_rate": 0.0001, "loss": 0.1846, "step": 429 }, { "epoch": 143.88, "learning_rate": 0.0001, "loss": 0.1859, "step": 432 }, { "epoch": 144.88, "learning_rate": 0.0001, "loss": 0.1835, "step": 435 }, { "epoch": 145.88, "learning_rate": 0.0001, "loss": 0.1811, "step": 438 }, { "epoch": 146.88, "learning_rate": 0.0001, "loss": 0.1817, "step": 441 }, { "epoch": 147.88, "learning_rate": 0.0001, "loss": 0.1799, "step": 444 }, { "epoch": 148.88, "learning_rate": 0.0001, "loss": 0.179, "step": 447 }, { "epoch": 149.29, "eval_exact_match": 0.40618955512572535, "eval_exec": 0.42263056092843326, "eval_loss": 0.3326466381549835, "eval_runtime": 101.2464, "eval_samples_per_second": 10.213, "step": 448 }, { "epoch": 149.88, "learning_rate": 0.0001, "loss": 0.1773, "step": 450 }, { "epoch": 150.88, "learning_rate": 0.0001, "loss": 0.1763, "step": 453 }, { "epoch": 151.88, "learning_rate": 0.0001, "loss": 0.1766, "step": 456 }, { "epoch": 152.88, "learning_rate": 0.0001, "loss": 0.1754, "step": 459 }, { "epoch": 153.88, "learning_rate": 0.0001, "loss": 0.1727, "step": 462 }, { "epoch": 154.88, "learning_rate": 0.0001, "loss": 0.1698, "step": 465 }, { "epoch": 155.88, "learning_rate": 0.0001, "loss": 0.1711, "step": 468 }, { "epoch": 156.88, "learning_rate": 0.0001, "loss": 0.1686, "step": 471 }, { "epoch": 157.88, "learning_rate": 0.0001, "loss": 0.1684, "step": 474 }, { "epoch": 158.88, "learning_rate": 0.0001, "loss": 0.1695, "step": 477 }, { "epoch": 159.88, "learning_rate": 0.0001, "loss": 0.1649, "step": 480 }, { "epoch": 160.88, "learning_rate": 0.0001, "loss": 0.1644, "step": 483 }, { "epoch": 161.88, "learning_rate": 0.0001, "loss": 0.1644, "step": 486 }, { "epoch": 162.88, "learning_rate": 0.0001, "loss": 0.1636, "step": 489 }, { "epoch": 163.88, "learning_rate": 0.0001, "loss": 0.1611, "step": 492 }, { "epoch": 164.88, "learning_rate": 0.0001, "loss": 0.1596, "step": 495 }, { "epoch": 165.88, "learning_rate": 0.0001, "loss": 0.1608, "step": 498 }, { "epoch": 166.88, "learning_rate": 0.0001, "loss": 0.159, "step": 501 }, { "epoch": 167.88, "learning_rate": 0.0001, "loss": 0.1583, "step": 504 }, { "epoch": 168.88, "learning_rate": 0.0001, "loss": 0.1572, "step": 507 }, { "epoch": 169.88, "learning_rate": 0.0001, "loss": 0.1564, "step": 510 }, { "epoch": 170.59, "eval_exact_match": 0.41779497098646035, "eval_exec": 0.43036750483558994, "eval_loss": 0.3266688883304596, "eval_runtime": 118.2565, "eval_samples_per_second": 8.744, "step": 512 }, { "epoch": 170.88, "learning_rate": 0.0001, "loss": 0.1515, "step": 513 }, { "epoch": 171.88, "learning_rate": 0.0001, "loss": 0.1531, "step": 516 }, { "epoch": 172.88, "learning_rate": 0.0001, "loss": 0.1527, "step": 519 }, { "epoch": 173.88, "learning_rate": 0.0001, "loss": 0.1517, "step": 522 }, { "epoch": 174.88, "learning_rate": 0.0001, "loss": 0.1502, "step": 525 }, { "epoch": 175.88, "learning_rate": 0.0001, "loss": 0.1483, "step": 528 }, { "epoch": 176.88, "learning_rate": 0.0001, "loss": 0.1497, "step": 531 }, { "epoch": 177.88, "learning_rate": 0.0001, "loss": 0.1488, "step": 534 }, { "epoch": 178.88, "learning_rate": 0.0001, "loss": 0.1447, "step": 537 }, { "epoch": 179.88, "learning_rate": 0.0001, "loss": 0.1467, "step": 540 }, { "epoch": 180.88, "learning_rate": 0.0001, "loss": 0.1453, "step": 543 }, { "epoch": 181.88, "learning_rate": 0.0001, "loss": 0.1444, "step": 546 }, { "epoch": 182.88, "learning_rate": 0.0001, "loss": 0.1441, "step": 549 }, { "epoch": 183.88, "learning_rate": 0.0001, "loss": 0.143, "step": 552 }, { "epoch": 184.88, "learning_rate": 0.0001, "loss": 0.1419, "step": 555 }, { "epoch": 185.88, "learning_rate": 0.0001, "loss": 0.1413, "step": 558 }, { "epoch": 186.88, "learning_rate": 0.0001, "loss": 0.1405, "step": 561 }, { "epoch": 187.88, "learning_rate": 0.0001, "loss": 0.1389, "step": 564 }, { "epoch": 188.88, "learning_rate": 0.0001, "loss": 0.1382, "step": 567 }, { "epoch": 189.88, "learning_rate": 0.0001, "loss": 0.1364, "step": 570 }, { "epoch": 190.88, "learning_rate": 0.0001, "loss": 0.1361, "step": 573 }, { "epoch": 191.88, "learning_rate": 0.0001, "loss": 0.1371, "step": 576 }, { "epoch": 191.88, "eval_exact_match": 0.41102514506769827, "eval_exec": 0.42359767891682787, "eval_loss": 0.33160606026649475, "eval_runtime": 124.8766, "eval_samples_per_second": 8.28, "step": 576 }, { "epoch": 192.88, "learning_rate": 0.0001, "loss": 0.1353, "step": 579 }, { "epoch": 193.88, "learning_rate": 0.0001, "loss": 0.1336, "step": 582 }, { "epoch": 194.88, "learning_rate": 0.0001, "loss": 0.1336, "step": 585 }, { "epoch": 195.88, "learning_rate": 0.0001, "loss": 0.1335, "step": 588 }, { "epoch": 196.88, "learning_rate": 0.0001, "loss": 0.1332, "step": 591 }, { "epoch": 197.88, "learning_rate": 0.0001, "loss": 0.1312, "step": 594 }, { "epoch": 198.88, "learning_rate": 0.0001, "loss": 0.13, "step": 597 }, { "epoch": 199.88, "learning_rate": 0.0001, "loss": 0.1278, "step": 600 }, { "epoch": 200.88, "learning_rate": 0.0001, "loss": 0.1314, "step": 603 }, { "epoch": 201.88, "learning_rate": 0.0001, "loss": 0.1273, "step": 606 }, { "epoch": 202.88, "learning_rate": 0.0001, "loss": 0.1258, "step": 609 }, { "epoch": 203.88, "learning_rate": 0.0001, "loss": 0.1264, "step": 612 }, { "epoch": 204.88, "learning_rate": 0.0001, "loss": 0.1256, "step": 615 }, { "epoch": 205.88, "learning_rate": 0.0001, "loss": 0.125, "step": 618 }, { "epoch": 206.88, "learning_rate": 0.0001, "loss": 0.1235, "step": 621 }, { "epoch": 207.88, "learning_rate": 0.0001, "loss": 0.124, "step": 624 }, { "epoch": 208.88, "learning_rate": 0.0001, "loss": 0.1236, "step": 627 }, { "epoch": 209.88, "learning_rate": 0.0001, "loss": 0.1224, "step": 630 }, { "epoch": 210.88, "learning_rate": 0.0001, "loss": 0.1212, "step": 633 }, { "epoch": 211.88, "learning_rate": 0.0001, "loss": 0.1218, "step": 636 }, { "epoch": 212.88, "learning_rate": 0.0001, "loss": 0.1204, "step": 639 }, { "epoch": 213.29, "eval_exact_match": 0.42940038684719534, "eval_exec": 0.4332688588007737, "eval_loss": 0.33052191138267517, "eval_runtime": 117.5462, "eval_samples_per_second": 8.797, "step": 640 }, { "epoch": 213.88, "learning_rate": 0.0001, "loss": 0.1195, "step": 642 }, { "epoch": 214.88, "learning_rate": 0.0001, "loss": 0.1181, "step": 645 }, { "epoch": 215.88, "learning_rate": 0.0001, "loss": 0.1194, "step": 648 }, { "epoch": 216.88, "learning_rate": 0.0001, "loss": 0.1177, "step": 651 }, { "epoch": 217.88, "learning_rate": 0.0001, "loss": 0.1172, "step": 654 }, { "epoch": 218.88, "learning_rate": 0.0001, "loss": 0.1171, "step": 657 }, { "epoch": 219.88, "learning_rate": 0.0001, "loss": 0.1163, "step": 660 }, { "epoch": 220.88, "learning_rate": 0.0001, "loss": 0.1146, "step": 663 }, { "epoch": 221.88, "learning_rate": 0.0001, "loss": 0.116, "step": 666 }, { "epoch": 222.88, "learning_rate": 0.0001, "loss": 0.1142, "step": 669 }, { "epoch": 223.88, "learning_rate": 0.0001, "loss": 0.1146, "step": 672 }, { "epoch": 224.88, "learning_rate": 0.0001, "loss": 0.1111, "step": 675 }, { "epoch": 225.88, "learning_rate": 0.0001, "loss": 0.1132, "step": 678 }, { "epoch": 226.88, "learning_rate": 0.0001, "loss": 0.1137, "step": 681 }, { "epoch": 227.88, "learning_rate": 0.0001, "loss": 0.1102, "step": 684 }, { "epoch": 228.88, "learning_rate": 0.0001, "loss": 0.1103, "step": 687 }, { "epoch": 229.88, "learning_rate": 0.0001, "loss": 0.1122, "step": 690 }, { "epoch": 230.88, "learning_rate": 0.0001, "loss": 0.1091, "step": 693 }, { "epoch": 231.88, "learning_rate": 0.0001, "loss": 0.1067, "step": 696 }, { "epoch": 232.88, "learning_rate": 0.0001, "loss": 0.1075, "step": 699 }, { "epoch": 233.88, "learning_rate": 0.0001, "loss": 0.107, "step": 702 }, { "epoch": 234.59, "eval_exact_match": 0.437137330754352, "eval_exec": 0.44197292069632493, "eval_loss": 0.3356037437915802, "eval_runtime": 105.2625, "eval_samples_per_second": 9.823, "step": 704 }, { "epoch": 234.88, "learning_rate": 0.0001, "loss": 0.1088, "step": 705 }, { "epoch": 235.88, "learning_rate": 0.0001, "loss": 0.1054, "step": 708 }, { "epoch": 236.88, "learning_rate": 0.0001, "loss": 0.1039, "step": 711 }, { "epoch": 237.88, "learning_rate": 0.0001, "loss": 0.1053, "step": 714 }, { "epoch": 238.88, "learning_rate": 0.0001, "loss": 0.1028, "step": 717 }, { "epoch": 239.88, "learning_rate": 0.0001, "loss": 0.1064, "step": 720 }, { "epoch": 240.88, "learning_rate": 0.0001, "loss": 0.1031, "step": 723 }, { "epoch": 241.88, "learning_rate": 0.0001, "loss": 0.1019, "step": 726 }, { "epoch": 242.88, "learning_rate": 0.0001, "loss": 0.1034, "step": 729 }, { "epoch": 243.88, "learning_rate": 0.0001, "loss": 0.1021, "step": 732 }, { "epoch": 244.88, "learning_rate": 0.0001, "loss": 0.1026, "step": 735 }, { "epoch": 245.88, "learning_rate": 0.0001, "loss": 0.1, "step": 738 }, { "epoch": 246.88, "learning_rate": 0.0001, "loss": 0.1008, "step": 741 }, { "epoch": 247.88, "learning_rate": 0.0001, "loss": 0.0999, "step": 744 }, { "epoch": 248.88, "learning_rate": 0.0001, "loss": 0.1002, "step": 747 }, { "epoch": 249.88, "learning_rate": 0.0001, "loss": 0.0995, "step": 750 }, { "epoch": 250.88, "learning_rate": 0.0001, "loss": 0.0961, "step": 753 }, { "epoch": 251.88, "learning_rate": 0.0001, "loss": 0.0997, "step": 756 }, { "epoch": 252.88, "learning_rate": 0.0001, "loss": 0.0982, "step": 759 }, { "epoch": 253.88, "learning_rate": 0.0001, "loss": 0.0975, "step": 762 }, { "epoch": 254.88, "learning_rate": 0.0001, "loss": 0.0972, "step": 765 }, { "epoch": 255.88, "learning_rate": 0.0001, "loss": 0.0972, "step": 768 }, { "epoch": 255.88, "eval_exact_match": 0.45454545454545453, "eval_exec": 0.4564796905222437, "eval_loss": 0.3354557156562805, "eval_runtime": 97.9303, "eval_samples_per_second": 10.559, "step": 768 }, { "epoch": 256.88, "learning_rate": 0.0001, "loss": 0.0955, "step": 771 }, { "epoch": 257.88, "learning_rate": 0.0001, "loss": 0.0939, "step": 774 }, { "epoch": 258.88, "learning_rate": 0.0001, "loss": 0.094, "step": 777 }, { "epoch": 259.88, "learning_rate": 0.0001, "loss": 0.0947, "step": 780 }, { "epoch": 260.88, "learning_rate": 0.0001, "loss": 0.0927, "step": 783 }, { "epoch": 261.88, "learning_rate": 0.0001, "loss": 0.0918, "step": 786 }, { "epoch": 262.88, "learning_rate": 0.0001, "loss": 0.09, "step": 789 }, { "epoch": 263.88, "learning_rate": 0.0001, "loss": 0.09, "step": 792 }, { "epoch": 264.88, "learning_rate": 0.0001, "loss": 0.0915, "step": 795 }, { "epoch": 265.88, "learning_rate": 0.0001, "loss": 0.0888, "step": 798 }, { "epoch": 266.88, "learning_rate": 0.0001, "loss": 0.09, "step": 801 }, { "epoch": 267.88, "learning_rate": 0.0001, "loss": 0.0886, "step": 804 }, { "epoch": 268.88, "learning_rate": 0.0001, "loss": 0.0913, "step": 807 }, { "epoch": 269.88, "learning_rate": 0.0001, "loss": 0.0889, "step": 810 }, { "epoch": 270.88, "learning_rate": 0.0001, "loss": 0.0876, "step": 813 }, { "epoch": 271.88, "learning_rate": 0.0001, "loss": 0.0869, "step": 816 }, { "epoch": 272.88, "learning_rate": 0.0001, "loss": 0.0881, "step": 819 }, { "epoch": 273.88, "learning_rate": 0.0001, "loss": 0.0868, "step": 822 }, { "epoch": 274.88, "learning_rate": 0.0001, "loss": 0.0842, "step": 825 }, { "epoch": 275.88, "learning_rate": 0.0001, "loss": 0.0858, "step": 828 }, { "epoch": 276.88, "learning_rate": 0.0001, "loss": 0.0857, "step": 831 }, { "epoch": 277.29, "eval_exact_match": 0.4274661508704062, "eval_exec": 0.43036750483558994, "eval_loss": 0.3401657044887543, "eval_runtime": 115.2041, "eval_samples_per_second": 8.975, "step": 832 }, { "epoch": 277.88, "learning_rate": 0.0001, "loss": 0.0847, "step": 834 }, { "epoch": 278.88, "learning_rate": 0.0001, "loss": 0.0854, "step": 837 }, { "epoch": 279.88, "learning_rate": 0.0001, "loss": 0.0852, "step": 840 }, { "epoch": 280.88, "learning_rate": 0.0001, "loss": 0.0843, "step": 843 }, { "epoch": 281.88, "learning_rate": 0.0001, "loss": 0.0826, "step": 846 }, { "epoch": 282.88, "learning_rate": 0.0001, "loss": 0.0833, "step": 849 }, { "epoch": 283.88, "learning_rate": 0.0001, "loss": 0.0824, "step": 852 }, { "epoch": 284.88, "learning_rate": 0.0001, "loss": 0.0822, "step": 855 }, { "epoch": 285.88, "learning_rate": 0.0001, "loss": 0.081, "step": 858 }, { "epoch": 286.88, "learning_rate": 0.0001, "loss": 0.0826, "step": 861 }, { "epoch": 287.88, "learning_rate": 0.0001, "loss": 0.0801, "step": 864 }, { "epoch": 288.88, "learning_rate": 0.0001, "loss": 0.0806, "step": 867 }, { "epoch": 289.88, "learning_rate": 0.0001, "loss": 0.0804, "step": 870 }, { "epoch": 290.88, "learning_rate": 0.0001, "loss": 0.0824, "step": 873 }, { "epoch": 291.88, "learning_rate": 0.0001, "loss": 0.0806, "step": 876 }, { "epoch": 292.88, "learning_rate": 0.0001, "loss": 0.0791, "step": 879 }, { "epoch": 293.88, "learning_rate": 0.0001, "loss": 0.0803, "step": 882 }, { "epoch": 294.88, "learning_rate": 0.0001, "loss": 0.0782, "step": 885 }, { "epoch": 295.88, "learning_rate": 0.0001, "loss": 0.0803, "step": 888 }, { "epoch": 296.88, "learning_rate": 0.0001, "loss": 0.0764, "step": 891 }, { "epoch": 297.88, "learning_rate": 0.0001, "loss": 0.077, "step": 894 }, { "epoch": 298.59, "eval_exact_match": 0.45938104448742745, "eval_exec": 0.45357833655706, "eval_loss": 0.34239432215690613, "eval_runtime": 103.8684, "eval_samples_per_second": 9.955, "step": 896 }, { "epoch": 298.88, "learning_rate": 0.0001, "loss": 0.0766, "step": 897 }, { "epoch": 299.88, "learning_rate": 0.0001, "loss": 0.0773, "step": 900 }, { "epoch": 300.88, "learning_rate": 0.0001, "loss": 0.076, "step": 903 }, { "epoch": 301.88, "learning_rate": 0.0001, "loss": 0.0757, "step": 906 }, { "epoch": 302.88, "learning_rate": 0.0001, "loss": 0.0753, "step": 909 }, { "epoch": 303.88, "learning_rate": 0.0001, "loss": 0.0753, "step": 912 }, { "epoch": 304.88, "learning_rate": 0.0001, "loss": 0.0752, "step": 915 }, { "epoch": 305.88, "learning_rate": 0.0001, "loss": 0.0739, "step": 918 }, { "epoch": 306.88, "learning_rate": 0.0001, "loss": 0.0748, "step": 921 }, { "epoch": 307.88, "learning_rate": 0.0001, "loss": 0.074, "step": 924 }, { "epoch": 308.88, "learning_rate": 0.0001, "loss": 0.0736, "step": 927 }, { "epoch": 309.88, "learning_rate": 0.0001, "loss": 0.0734, "step": 930 }, { "epoch": 310.88, "learning_rate": 0.0001, "loss": 0.0732, "step": 933 }, { "epoch": 311.88, "learning_rate": 0.0001, "loss": 0.0732, "step": 936 }, { "epoch": 312.88, "learning_rate": 0.0001, "loss": 0.0729, "step": 939 }, { "epoch": 313.88, "learning_rate": 0.0001, "loss": 0.0708, "step": 942 }, { "epoch": 314.88, "learning_rate": 0.0001, "loss": 0.0714, "step": 945 }, { "epoch": 315.88, "learning_rate": 0.0001, "loss": 0.0711, "step": 948 }, { "epoch": 316.88, "learning_rate": 0.0001, "loss": 0.0722, "step": 951 }, { "epoch": 317.88, "learning_rate": 0.0001, "loss": 0.0705, "step": 954 }, { "epoch": 318.88, "learning_rate": 0.0001, "loss": 0.071, "step": 957 }, { "epoch": 319.88, "learning_rate": 0.0001, "loss": 0.0704, "step": 960 }, { "epoch": 319.88, "eval_exact_match": 0.45551257253384914, "eval_exec": 0.4497098646034816, "eval_loss": 0.34637653827667236, "eval_runtime": 103.6764, "eval_samples_per_second": 9.973, "step": 960 }, { "epoch": 320.88, "learning_rate": 0.0001, "loss": 0.0687, "step": 963 }, { "epoch": 321.88, "learning_rate": 0.0001, "loss": 0.069, "step": 966 }, { "epoch": 322.88, "learning_rate": 0.0001, "loss": 0.0694, "step": 969 }, { "epoch": 323.88, "learning_rate": 0.0001, "loss": 0.0692, "step": 972 }, { "epoch": 324.88, "learning_rate": 0.0001, "loss": 0.0688, "step": 975 }, { "epoch": 325.88, "learning_rate": 0.0001, "loss": 0.0694, "step": 978 }, { "epoch": 326.88, "learning_rate": 0.0001, "loss": 0.0681, "step": 981 }, { "epoch": 327.88, "learning_rate": 0.0001, "loss": 0.0676, "step": 984 }, { "epoch": 328.88, "learning_rate": 0.0001, "loss": 0.0663, "step": 987 }, { "epoch": 329.88, "learning_rate": 0.0001, "loss": 0.0665, "step": 990 }, { "epoch": 330.88, "learning_rate": 0.0001, "loss": 0.0672, "step": 993 }, { "epoch": 331.88, "learning_rate": 0.0001, "loss": 0.066, "step": 996 }, { "epoch": 332.88, "learning_rate": 0.0001, "loss": 0.0651, "step": 999 }, { "epoch": 333.88, "learning_rate": 0.0001, "loss": 0.0659, "step": 1002 }, { "epoch": 334.88, "learning_rate": 0.0001, "loss": 0.0654, "step": 1005 }, { "epoch": 335.88, "learning_rate": 0.0001, "loss": 0.0641, "step": 1008 }, { "epoch": 336.88, "learning_rate": 0.0001, "loss": 0.0648, "step": 1011 }, { "epoch": 337.88, "learning_rate": 0.0001, "loss": 0.0651, "step": 1014 }, { "epoch": 338.88, "learning_rate": 0.0001, "loss": 0.0653, "step": 1017 }, { "epoch": 339.88, "learning_rate": 0.0001, "loss": 0.0645, "step": 1020 }, { "epoch": 340.88, "learning_rate": 0.0001, "loss": 0.0641, "step": 1023 }, { "epoch": 341.29, "eval_exact_match": 0.46034816247582205, "eval_exec": 0.45164410058027077, "eval_loss": 0.35341936349868774, "eval_runtime": 117.5098, "eval_samples_per_second": 8.799, "step": 1024 }, { "epoch": 341.88, "learning_rate": 0.0001, "loss": 0.0634, "step": 1026 }, { "epoch": 342.88, "learning_rate": 0.0001, "loss": 0.0617, "step": 1029 }, { "epoch": 343.88, "learning_rate": 0.0001, "loss": 0.0625, "step": 1032 }, { "epoch": 344.88, "learning_rate": 0.0001, "loss": 0.0623, "step": 1035 }, { "epoch": 345.88, "learning_rate": 0.0001, "loss": 0.0614, "step": 1038 }, { "epoch": 346.88, "learning_rate": 0.0001, "loss": 0.0616, "step": 1041 }, { "epoch": 347.88, "learning_rate": 0.0001, "loss": 0.0613, "step": 1044 }, { "epoch": 348.88, "learning_rate": 0.0001, "loss": 0.0615, "step": 1047 }, { "epoch": 349.88, "learning_rate": 0.0001, "loss": 0.0609, "step": 1050 }, { "epoch": 350.88, "learning_rate": 0.0001, "loss": 0.0609, "step": 1053 }, { "epoch": 351.88, "learning_rate": 0.0001, "loss": 0.0606, "step": 1056 }, { "epoch": 352.88, "learning_rate": 0.0001, "loss": 0.0599, "step": 1059 }, { "epoch": 353.88, "learning_rate": 0.0001, "loss": 0.0604, "step": 1062 }, { "epoch": 354.88, "learning_rate": 0.0001, "loss": 0.0596, "step": 1065 }, { "epoch": 355.88, "learning_rate": 0.0001, "loss": 0.06, "step": 1068 }, { "epoch": 356.88, "learning_rate": 0.0001, "loss": 0.0589, "step": 1071 }, { "epoch": 357.88, "learning_rate": 0.0001, "loss": 0.0606, "step": 1074 }, { "epoch": 358.88, "learning_rate": 0.0001, "loss": 0.0591, "step": 1077 }, { "epoch": 359.88, "learning_rate": 0.0001, "loss": 0.0566, "step": 1080 }, { "epoch": 360.88, "learning_rate": 0.0001, "loss": 0.0572, "step": 1083 }, { "epoch": 361.88, "learning_rate": 0.0001, "loss": 0.0575, "step": 1086 }, { "epoch": 362.59, "eval_exact_match": 0.45164410058027077, "eval_exec": 0.4458413926499033, "eval_loss": 0.35678333044052124, "eval_runtime": 127.3225, "eval_samples_per_second": 8.121, "step": 1088 }, { "epoch": 362.88, "learning_rate": 0.0001, "loss": 0.057, "step": 1089 }, { "epoch": 363.88, "learning_rate": 0.0001, "loss": 0.0571, "step": 1092 }, { "epoch": 364.88, "learning_rate": 0.0001, "loss": 0.0568, "step": 1095 }, { "epoch": 365.88, "learning_rate": 0.0001, "loss": 0.057, "step": 1098 }, { "epoch": 366.88, "learning_rate": 0.0001, "loss": 0.0561, "step": 1101 }, { "epoch": 367.88, "learning_rate": 0.0001, "loss": 0.0555, "step": 1104 }, { "epoch": 368.88, "learning_rate": 0.0001, "loss": 0.0557, "step": 1107 }, { "epoch": 369.88, "learning_rate": 0.0001, "loss": 0.055, "step": 1110 }, { "epoch": 370.88, "learning_rate": 0.0001, "loss": 0.0556, "step": 1113 }, { "epoch": 371.88, "learning_rate": 0.0001, "loss": 0.0554, "step": 1116 }, { "epoch": 372.88, "learning_rate": 0.0001, "loss": 0.0566, "step": 1119 }, { "epoch": 373.88, "learning_rate": 0.0001, "loss": 0.0557, "step": 1122 }, { "epoch": 374.88, "learning_rate": 0.0001, "loss": 0.0552, "step": 1125 }, { "epoch": 375.88, "learning_rate": 0.0001, "loss": 0.0546, "step": 1128 }, { "epoch": 376.88, "learning_rate": 0.0001, "loss": 0.0545, "step": 1131 }, { "epoch": 377.88, "learning_rate": 0.0001, "loss": 0.0545, "step": 1134 }, { "epoch": 378.88, "learning_rate": 0.0001, "loss": 0.0527, "step": 1137 }, { "epoch": 379.88, "learning_rate": 0.0001, "loss": 0.0536, "step": 1140 }, { "epoch": 380.88, "learning_rate": 0.0001, "loss": 0.0536, "step": 1143 }, { "epoch": 381.88, "learning_rate": 0.0001, "loss": 0.0536, "step": 1146 }, { "epoch": 382.88, "learning_rate": 0.0001, "loss": 0.0532, "step": 1149 }, { "epoch": 383.88, "learning_rate": 0.0001, "loss": 0.0521, "step": 1152 }, { "epoch": 383.88, "eval_exact_match": 0.47292069632495165, "eval_exec": 0.4584139264990329, "eval_loss": 0.3651985228061676, "eval_runtime": 107.8989, "eval_samples_per_second": 9.583, "step": 1152 }, { "epoch": 384.88, "learning_rate": 0.0001, "loss": 0.0518, "step": 1155 }, { "epoch": 385.88, "learning_rate": 0.0001, "loss": 0.0523, "step": 1158 }, { "epoch": 386.88, "learning_rate": 0.0001, "loss": 0.0509, "step": 1161 }, { "epoch": 387.88, "learning_rate": 0.0001, "loss": 0.0525, "step": 1164 }, { "epoch": 388.88, "learning_rate": 0.0001, "loss": 0.0517, "step": 1167 }, { "epoch": 389.88, "learning_rate": 0.0001, "loss": 0.0507, "step": 1170 }, { "epoch": 390.88, "learning_rate": 0.0001, "loss": 0.05, "step": 1173 }, { "epoch": 391.88, "learning_rate": 0.0001, "loss": 0.0506, "step": 1176 }, { "epoch": 392.88, "learning_rate": 0.0001, "loss": 0.0505, "step": 1179 }, { "epoch": 393.88, "learning_rate": 0.0001, "loss": 0.0504, "step": 1182 }, { "epoch": 394.88, "learning_rate": 0.0001, "loss": 0.05, "step": 1185 }, { "epoch": 395.88, "learning_rate": 0.0001, "loss": 0.05, "step": 1188 }, { "epoch": 396.88, "learning_rate": 0.0001, "loss": 0.0497, "step": 1191 }, { "epoch": 397.88, "learning_rate": 0.0001, "loss": 0.049, "step": 1194 }, { "epoch": 398.88, "learning_rate": 0.0001, "loss": 0.0496, "step": 1197 }, { "epoch": 399.88, "learning_rate": 0.0001, "loss": 0.049, "step": 1200 }, { "epoch": 400.88, "learning_rate": 0.0001, "loss": 0.0487, "step": 1203 }, { "epoch": 401.88, "learning_rate": 0.0001, "loss": 0.049, "step": 1206 }, { "epoch": 402.88, "learning_rate": 0.0001, "loss": 0.0486, "step": 1209 }, { "epoch": 403.88, "learning_rate": 0.0001, "loss": 0.0484, "step": 1212 }, { "epoch": 404.88, "learning_rate": 0.0001, "loss": 0.0493, "step": 1215 }, { "epoch": 405.29, "eval_exact_match": 0.46808510638297873, "eval_exec": 0.4632495164410058, "eval_loss": 0.36478203535079956, "eval_runtime": 110.1876, "eval_samples_per_second": 9.384, "step": 1216 }, { "epoch": 405.88, "learning_rate": 0.0001, "loss": 0.0477, "step": 1218 }, { "epoch": 406.88, "learning_rate": 0.0001, "loss": 0.047, "step": 1221 }, { "epoch": 407.88, "learning_rate": 0.0001, "loss": 0.0476, "step": 1224 }, { "epoch": 408.88, "learning_rate": 0.0001, "loss": 0.047, "step": 1227 }, { "epoch": 409.88, "learning_rate": 0.0001, "loss": 0.048, "step": 1230 }, { "epoch": 410.88, "learning_rate": 0.0001, "loss": 0.0462, "step": 1233 }, { "epoch": 411.88, "learning_rate": 0.0001, "loss": 0.0468, "step": 1236 }, { "epoch": 412.88, "learning_rate": 0.0001, "loss": 0.0455, "step": 1239 }, { "epoch": 413.88, "learning_rate": 0.0001, "loss": 0.0468, "step": 1242 }, { "epoch": 414.88, "learning_rate": 0.0001, "loss": 0.0458, "step": 1245 }, { "epoch": 415.88, "learning_rate": 0.0001, "loss": 0.0461, "step": 1248 }, { "epoch": 416.88, "learning_rate": 0.0001, "loss": 0.0462, "step": 1251 }, { "epoch": 417.88, "learning_rate": 0.0001, "loss": 0.0447, "step": 1254 }, { "epoch": 418.88, "learning_rate": 0.0001, "loss": 0.0452, "step": 1257 }, { "epoch": 419.88, "learning_rate": 0.0001, "loss": 0.0439, "step": 1260 }, { "epoch": 420.88, "learning_rate": 0.0001, "loss": 0.0444, "step": 1263 }, { "epoch": 421.88, "learning_rate": 0.0001, "loss": 0.0447, "step": 1266 }, { "epoch": 422.88, "learning_rate": 0.0001, "loss": 0.0447, "step": 1269 }, { "epoch": 423.88, "learning_rate": 0.0001, "loss": 0.0448, "step": 1272 }, { "epoch": 424.88, "learning_rate": 0.0001, "loss": 0.0443, "step": 1275 }, { "epoch": 425.88, "learning_rate": 0.0001, "loss": 0.0437, "step": 1278 }, { "epoch": 426.59, "eval_exact_match": 0.47195357833655704, "eval_exec": 0.4632495164410058, "eval_loss": 0.37120428681373596, "eval_runtime": 101.6241, "eval_samples_per_second": 10.175, "step": 1280 }, { "epoch": 426.88, "learning_rate": 0.0001, "loss": 0.042, "step": 1281 }, { "epoch": 427.88, "learning_rate": 0.0001, "loss": 0.0444, "step": 1284 }, { "epoch": 428.88, "learning_rate": 0.0001, "loss": 0.0445, "step": 1287 }, { "epoch": 429.88, "learning_rate": 0.0001, "loss": 0.0427, "step": 1290 }, { "epoch": 430.88, "learning_rate": 0.0001, "loss": 0.0423, "step": 1293 }, { "epoch": 431.88, "learning_rate": 0.0001, "loss": 0.0427, "step": 1296 }, { "epoch": 432.88, "learning_rate": 0.0001, "loss": 0.0426, "step": 1299 }, { "epoch": 433.88, "learning_rate": 0.0001, "loss": 0.0427, "step": 1302 }, { "epoch": 434.88, "learning_rate": 0.0001, "loss": 0.0418, "step": 1305 }, { "epoch": 435.88, "learning_rate": 0.0001, "loss": 0.0422, "step": 1308 }, { "epoch": 436.88, "learning_rate": 0.0001, "loss": 0.0406, "step": 1311 }, { "epoch": 437.88, "learning_rate": 0.0001, "loss": 0.0413, "step": 1314 }, { "epoch": 438.88, "learning_rate": 0.0001, "loss": 0.0403, "step": 1317 }, { "epoch": 439.88, "learning_rate": 0.0001, "loss": 0.0417, "step": 1320 }, { "epoch": 440.88, "learning_rate": 0.0001, "loss": 0.0407, "step": 1323 }, { "epoch": 441.88, "learning_rate": 0.0001, "loss": 0.0416, "step": 1326 }, { "epoch": 442.88, "learning_rate": 0.0001, "loss": 0.0414, "step": 1329 }, { "epoch": 443.88, "learning_rate": 0.0001, "loss": 0.0407, "step": 1332 }, { "epoch": 444.88, "learning_rate": 0.0001, "loss": 0.0407, "step": 1335 }, { "epoch": 445.88, "learning_rate": 0.0001, "loss": 0.0404, "step": 1338 }, { "epoch": 446.88, "learning_rate": 0.0001, "loss": 0.0401, "step": 1341 }, { "epoch": 447.88, "learning_rate": 0.0001, "loss": 0.0399, "step": 1344 }, { "epoch": 447.88, "eval_exact_match": 0.47195357833655704, "eval_exec": 0.4632495164410058, "eval_loss": 0.3796737492084503, "eval_runtime": 116.7328, "eval_samples_per_second": 8.858, "step": 1344 }, { "epoch": 448.88, "learning_rate": 0.0001, "loss": 0.0403, "step": 1347 }, { "epoch": 449.88, "learning_rate": 0.0001, "loss": 0.0397, "step": 1350 }, { "epoch": 450.88, "learning_rate": 0.0001, "loss": 0.0392, "step": 1353 }, { "epoch": 451.88, "learning_rate": 0.0001, "loss": 0.0391, "step": 1356 }, { "epoch": 452.88, "learning_rate": 0.0001, "loss": 0.0405, "step": 1359 }, { "epoch": 453.88, "learning_rate": 0.0001, "loss": 0.0395, "step": 1362 }, { "epoch": 454.88, "learning_rate": 0.0001, "loss": 0.0394, "step": 1365 }, { "epoch": 455.88, "learning_rate": 0.0001, "loss": 0.0386, "step": 1368 }, { "epoch": 456.88, "learning_rate": 0.0001, "loss": 0.0381, "step": 1371 }, { "epoch": 457.88, "learning_rate": 0.0001, "loss": 0.0384, "step": 1374 }, { "epoch": 458.88, "learning_rate": 0.0001, "loss": 0.0382, "step": 1377 }, { "epoch": 459.88, "learning_rate": 0.0001, "loss": 0.0379, "step": 1380 }, { "epoch": 460.88, "learning_rate": 0.0001, "loss": 0.0381, "step": 1383 }, { "epoch": 461.88, "learning_rate": 0.0001, "loss": 0.0377, "step": 1386 }, { "epoch": 462.88, "learning_rate": 0.0001, "loss": 0.0377, "step": 1389 }, { "epoch": 463.88, "learning_rate": 0.0001, "loss": 0.0374, "step": 1392 }, { "epoch": 464.88, "learning_rate": 0.0001, "loss": 0.0369, "step": 1395 }, { "epoch": 465.88, "learning_rate": 0.0001, "loss": 0.0372, "step": 1398 }, { "epoch": 466.88, "learning_rate": 0.0001, "loss": 0.0386, "step": 1401 }, { "epoch": 467.88, "learning_rate": 0.0001, "loss": 0.0367, "step": 1404 }, { "epoch": 468.88, "learning_rate": 0.0001, "loss": 0.0365, "step": 1407 }, { "epoch": 469.29, "eval_exact_match": 0.47195357833655704, "eval_exec": 0.4622823984526112, "eval_loss": 0.38305917382240295, "eval_runtime": 123.8052, "eval_samples_per_second": 8.352, "step": 1408 }, { "epoch": 469.88, "learning_rate": 0.0001, "loss": 0.0363, "step": 1410 }, { "epoch": 470.88, "learning_rate": 0.0001, "loss": 0.037, "step": 1413 }, { "epoch": 471.88, "learning_rate": 0.0001, "loss": 0.0367, "step": 1416 }, { "epoch": 472.88, "learning_rate": 0.0001, "loss": 0.0367, "step": 1419 }, { "epoch": 473.88, "learning_rate": 0.0001, "loss": 0.0362, "step": 1422 }, { "epoch": 474.88, "learning_rate": 0.0001, "loss": 0.0359, "step": 1425 }, { "epoch": 475.88, "learning_rate": 0.0001, "loss": 0.0352, "step": 1428 }, { "epoch": 476.88, "learning_rate": 0.0001, "loss": 0.0355, "step": 1431 }, { "epoch": 477.88, "learning_rate": 0.0001, "loss": 0.0363, "step": 1434 }, { "epoch": 478.88, "learning_rate": 0.0001, "loss": 0.0342, "step": 1437 }, { "epoch": 479.88, "learning_rate": 0.0001, "loss": 0.0353, "step": 1440 }, { "epoch": 480.88, "learning_rate": 0.0001, "loss": 0.0344, "step": 1443 }, { "epoch": 481.88, "learning_rate": 0.0001, "loss": 0.0344, "step": 1446 }, { "epoch": 482.88, "learning_rate": 0.0001, "loss": 0.0342, "step": 1449 }, { "epoch": 483.88, "learning_rate": 0.0001, "loss": 0.0361, "step": 1452 }, { "epoch": 484.88, "learning_rate": 0.0001, "loss": 0.0343, "step": 1455 }, { "epoch": 485.88, "learning_rate": 0.0001, "loss": 0.0341, "step": 1458 }, { "epoch": 486.88, "learning_rate": 0.0001, "loss": 0.0332, "step": 1461 }, { "epoch": 487.88, "learning_rate": 0.0001, "loss": 0.0338, "step": 1464 }, { "epoch": 488.88, "learning_rate": 0.0001, "loss": 0.0344, "step": 1467 }, { "epoch": 489.88, "learning_rate": 0.0001, "loss": 0.0342, "step": 1470 }, { "epoch": 490.59, "eval_exact_match": 0.47292069632495165, "eval_exec": 0.46421663442940037, "eval_loss": 0.3914486765861511, "eval_runtime": 103.8318, "eval_samples_per_second": 9.958, "step": 1472 }, { "epoch": 490.88, "learning_rate": 0.0001, "loss": 0.0325, "step": 1473 }, { "epoch": 491.88, "learning_rate": 0.0001, "loss": 0.0348, "step": 1476 }, { "epoch": 492.88, "learning_rate": 0.0001, "loss": 0.0336, "step": 1479 }, { "epoch": 493.88, "learning_rate": 0.0001, "loss": 0.0337, "step": 1482 }, { "epoch": 494.88, "learning_rate": 0.0001, "loss": 0.0335, "step": 1485 }, { "epoch": 495.88, "learning_rate": 0.0001, "loss": 0.0332, "step": 1488 }, { "epoch": 496.88, "learning_rate": 0.0001, "loss": 0.0331, "step": 1491 }, { "epoch": 497.88, "learning_rate": 0.0001, "loss": 0.032, "step": 1494 }, { "epoch": 498.88, "learning_rate": 0.0001, "loss": 0.0339, "step": 1497 }, { "epoch": 499.88, "learning_rate": 0.0001, "loss": 0.0326, "step": 1500 }, { "epoch": 500.88, "learning_rate": 0.0001, "loss": 0.032, "step": 1503 }, { "epoch": 501.88, "learning_rate": 0.0001, "loss": 0.0324, "step": 1506 }, { "epoch": 502.88, "learning_rate": 0.0001, "loss": 0.0324, "step": 1509 }, { "epoch": 503.88, "learning_rate": 0.0001, "loss": 0.0326, "step": 1512 }, { "epoch": 504.88, "learning_rate": 0.0001, "loss": 0.032, "step": 1515 }, { "epoch": 505.88, "learning_rate": 0.0001, "loss": 0.0307, "step": 1518 }, { "epoch": 506.88, "learning_rate": 0.0001, "loss": 0.0311, "step": 1521 }, { "epoch": 507.88, "learning_rate": 0.0001, "loss": 0.0313, "step": 1524 }, { "epoch": 508.88, "learning_rate": 0.0001, "loss": 0.0314, "step": 1527 }, { "epoch": 509.88, "learning_rate": 0.0001, "loss": 0.0306, "step": 1530 }, { "epoch": 510.88, "learning_rate": 0.0001, "loss": 0.0305, "step": 1533 }, { "epoch": 511.88, "learning_rate": 0.0001, "loss": 0.0319, "step": 1536 }, { "epoch": 511.88, "eval_exact_match": 0.46808510638297873, "eval_exec": 0.45938104448742745, "eval_loss": 0.3986540734767914, "eval_runtime": 109.5821, "eval_samples_per_second": 9.436, "step": 1536 }, { "epoch": 512.88, "learning_rate": 0.0001, "loss": 0.0309, "step": 1539 }, { "epoch": 513.88, "learning_rate": 0.0001, "loss": 0.0316, "step": 1542 }, { "epoch": 514.88, "learning_rate": 0.0001, "loss": 0.0298, "step": 1545 }, { "epoch": 515.88, "learning_rate": 0.0001, "loss": 0.0302, "step": 1548 }, { "epoch": 516.88, "learning_rate": 0.0001, "loss": 0.0289, "step": 1551 }, { "epoch": 517.88, "learning_rate": 0.0001, "loss": 0.0302, "step": 1554 }, { "epoch": 518.88, "learning_rate": 0.0001, "loss": 0.0299, "step": 1557 }, { "epoch": 519.88, "learning_rate": 0.0001, "loss": 0.0298, "step": 1560 }, { "epoch": 520.88, "learning_rate": 0.0001, "loss": 0.0297, "step": 1563 }, { "epoch": 521.88, "learning_rate": 0.0001, "loss": 0.0292, "step": 1566 }, { "epoch": 522.88, "learning_rate": 0.0001, "loss": 0.0294, "step": 1569 }, { "epoch": 523.88, "learning_rate": 0.0001, "loss": 0.03, "step": 1572 }, { "epoch": 524.88, "learning_rate": 0.0001, "loss": 0.0293, "step": 1575 }, { "epoch": 525.88, "learning_rate": 0.0001, "loss": 0.0291, "step": 1578 }, { "epoch": 526.88, "learning_rate": 0.0001, "loss": 0.0286, "step": 1581 }, { "epoch": 527.88, "learning_rate": 0.0001, "loss": 0.029, "step": 1584 }, { "epoch": 528.88, "learning_rate": 0.0001, "loss": 0.0294, "step": 1587 }, { "epoch": 529.88, "learning_rate": 0.0001, "loss": 0.0298, "step": 1590 }, { "epoch": 530.88, "learning_rate": 0.0001, "loss": 0.0286, "step": 1593 }, { "epoch": 531.88, "learning_rate": 0.0001, "loss": 0.028, "step": 1596 }, { "epoch": 532.88, "learning_rate": 0.0001, "loss": 0.0283, "step": 1599 }, { "epoch": 533.29, "eval_exact_match": 0.46421663442940037, "eval_exec": 0.45938104448742745, "eval_loss": 0.4072656035423279, "eval_runtime": 128.9566, "eval_samples_per_second": 8.018, "step": 1600 }, { "epoch": 533.88, "learning_rate": 0.0001, "loss": 0.0292, "step": 1602 }, { "epoch": 534.88, "learning_rate": 0.0001, "loss": 0.0287, "step": 1605 }, { "epoch": 535.88, "learning_rate": 0.0001, "loss": 0.0294, "step": 1608 }, { "epoch": 536.88, "learning_rate": 0.0001, "loss": 0.0291, "step": 1611 }, { "epoch": 537.88, "learning_rate": 0.0001, "loss": 0.0282, "step": 1614 }, { "epoch": 538.88, "learning_rate": 0.0001, "loss": 0.028, "step": 1617 }, { "epoch": 539.88, "learning_rate": 0.0001, "loss": 0.0289, "step": 1620 }, { "epoch": 540.88, "learning_rate": 0.0001, "loss": 0.0272, "step": 1623 }, { "epoch": 541.88, "learning_rate": 0.0001, "loss": 0.0274, "step": 1626 }, { "epoch": 542.88, "learning_rate": 0.0001, "loss": 0.0275, "step": 1629 }, { "epoch": 543.88, "learning_rate": 0.0001, "loss": 0.0278, "step": 1632 }, { "epoch": 544.88, "learning_rate": 0.0001, "loss": 0.0278, "step": 1635 }, { "epoch": 545.88, "learning_rate": 0.0001, "loss": 0.0279, "step": 1638 }, { "epoch": 546.88, "learning_rate": 0.0001, "loss": 0.0272, "step": 1641 }, { "epoch": 547.88, "learning_rate": 0.0001, "loss": 0.0275, "step": 1644 }, { "epoch": 548.88, "learning_rate": 0.0001, "loss": 0.0262, "step": 1647 }, { "epoch": 549.88, "learning_rate": 0.0001, "loss": 0.027, "step": 1650 }, { "epoch": 550.88, "learning_rate": 0.0001, "loss": 0.0266, "step": 1653 }, { "epoch": 551.88, "learning_rate": 0.0001, "loss": 0.0265, "step": 1656 }, { "epoch": 552.88, "learning_rate": 0.0001, "loss": 0.0272, "step": 1659 }, { "epoch": 553.88, "learning_rate": 0.0001, "loss": 0.0265, "step": 1662 }, { "epoch": 554.59, "eval_exact_match": 0.488394584139265, "eval_exec": 0.4816247582205029, "eval_loss": 0.40782487392425537, "eval_runtime": 108.3403, "eval_samples_per_second": 9.544, "step": 1664 }, { "epoch": 554.88, "learning_rate": 0.0001, "loss": 0.0262, "step": 1665 }, { "epoch": 555.88, "learning_rate": 0.0001, "loss": 0.0276, "step": 1668 }, { "epoch": 556.88, "learning_rate": 0.0001, "loss": 0.0264, "step": 1671 }, { "epoch": 557.88, "learning_rate": 0.0001, "loss": 0.0256, "step": 1674 }, { "epoch": 558.88, "learning_rate": 0.0001, "loss": 0.0255, "step": 1677 }, { "epoch": 559.88, "learning_rate": 0.0001, "loss": 0.0259, "step": 1680 }, { "epoch": 560.88, "learning_rate": 0.0001, "loss": 0.0246, "step": 1683 }, { "epoch": 561.88, "learning_rate": 0.0001, "loss": 0.0257, "step": 1686 }, { "epoch": 562.88, "learning_rate": 0.0001, "loss": 0.0267, "step": 1689 }, { "epoch": 563.88, "learning_rate": 0.0001, "loss": 0.0251, "step": 1692 }, { "epoch": 564.88, "learning_rate": 0.0001, "loss": 0.0253, "step": 1695 }, { "epoch": 565.88, "learning_rate": 0.0001, "loss": 0.0248, "step": 1698 }, { "epoch": 566.88, "learning_rate": 0.0001, "loss": 0.0252, "step": 1701 }, { "epoch": 567.88, "learning_rate": 0.0001, "loss": 0.0255, "step": 1704 }, { "epoch": 568.88, "learning_rate": 0.0001, "loss": 0.0249, "step": 1707 }, { "epoch": 569.88, "learning_rate": 0.0001, "loss": 0.0254, "step": 1710 }, { "epoch": 570.88, "learning_rate": 0.0001, "loss": 0.0251, "step": 1713 }, { "epoch": 571.88, "learning_rate": 0.0001, "loss": 0.024, "step": 1716 }, { "epoch": 572.88, "learning_rate": 0.0001, "loss": 0.0239, "step": 1719 }, { "epoch": 573.88, "learning_rate": 0.0001, "loss": 0.0247, "step": 1722 }, { "epoch": 574.88, "learning_rate": 0.0001, "loss": 0.0246, "step": 1725 }, { "epoch": 575.88, "learning_rate": 0.0001, "loss": 0.0249, "step": 1728 }, { "epoch": 575.88, "eval_exact_match": 0.4738878143133462, "eval_exec": 0.4690522243713733, "eval_loss": 0.413275808095932, "eval_runtime": 120.0672, "eval_samples_per_second": 8.612, "step": 1728 }, { "epoch": 576.88, "learning_rate": 0.0001, "loss": 0.0246, "step": 1731 }, { "epoch": 577.88, "learning_rate": 0.0001, "loss": 0.0235, "step": 1734 }, { "epoch": 578.88, "learning_rate": 0.0001, "loss": 0.0239, "step": 1737 }, { "epoch": 579.88, "learning_rate": 0.0001, "loss": 0.0234, "step": 1740 }, { "epoch": 580.88, "learning_rate": 0.0001, "loss": 0.0231, "step": 1743 }, { "epoch": 581.88, "learning_rate": 0.0001, "loss": 0.0233, "step": 1746 }, { "epoch": 582.88, "learning_rate": 0.0001, "loss": 0.023, "step": 1749 }, { "epoch": 583.88, "learning_rate": 0.0001, "loss": 0.0235, "step": 1752 }, { "epoch": 584.88, "learning_rate": 0.0001, "loss": 0.0238, "step": 1755 }, { "epoch": 585.88, "learning_rate": 0.0001, "loss": 0.0254, "step": 1758 }, { "epoch": 586.88, "learning_rate": 0.0001, "loss": 0.0243, "step": 1761 }, { "epoch": 587.88, "learning_rate": 0.0001, "loss": 0.0236, "step": 1764 }, { "epoch": 588.88, "learning_rate": 0.0001, "loss": 0.0222, "step": 1767 }, { "epoch": 589.88, "learning_rate": 0.0001, "loss": 0.0228, "step": 1770 }, { "epoch": 590.88, "learning_rate": 0.0001, "loss": 0.0236, "step": 1773 }, { "epoch": 591.88, "learning_rate": 0.0001, "loss": 0.023, "step": 1776 }, { "epoch": 592.88, "learning_rate": 0.0001, "loss": 0.0233, "step": 1779 }, { "epoch": 593.88, "learning_rate": 0.0001, "loss": 0.0229, "step": 1782 }, { "epoch": 594.88, "learning_rate": 0.0001, "loss": 0.0226, "step": 1785 }, { "epoch": 595.88, "learning_rate": 0.0001, "loss": 0.0221, "step": 1788 }, { "epoch": 596.88, "learning_rate": 0.0001, "loss": 0.0228, "step": 1791 }, { "epoch": 597.29, "eval_exact_match": 0.4671179883945841, "eval_exec": 0.4622823984526112, "eval_loss": 0.421924889087677, "eval_runtime": 121.4411, "eval_samples_per_second": 8.514, "step": 1792 }, { "epoch": 597.88, "learning_rate": 0.0001, "loss": 0.0225, "step": 1794 }, { "epoch": 598.88, "learning_rate": 0.0001, "loss": 0.0221, "step": 1797 }, { "epoch": 599.88, "learning_rate": 0.0001, "loss": 0.0216, "step": 1800 }, { "epoch": 600.88, "learning_rate": 0.0001, "loss": 0.0219, "step": 1803 }, { "epoch": 601.88, "learning_rate": 0.0001, "loss": 0.0214, "step": 1806 }, { "epoch": 602.88, "learning_rate": 0.0001, "loss": 0.0219, "step": 1809 }, { "epoch": 603.88, "learning_rate": 0.0001, "loss": 0.0216, "step": 1812 }, { "epoch": 604.88, "learning_rate": 0.0001, "loss": 0.0213, "step": 1815 }, { "epoch": 605.88, "learning_rate": 0.0001, "loss": 0.0212, "step": 1818 }, { "epoch": 606.88, "learning_rate": 0.0001, "loss": 0.0218, "step": 1821 }, { "epoch": 607.88, "learning_rate": 0.0001, "loss": 0.0218, "step": 1824 }, { "epoch": 608.88, "learning_rate": 0.0001, "loss": 0.0221, "step": 1827 }, { "epoch": 609.88, "learning_rate": 0.0001, "loss": 0.0217, "step": 1830 }, { "epoch": 610.88, "learning_rate": 0.0001, "loss": 0.0224, "step": 1833 }, { "epoch": 611.88, "learning_rate": 0.0001, "loss": 0.0208, "step": 1836 }, { "epoch": 612.88, "learning_rate": 0.0001, "loss": 0.0208, "step": 1839 }, { "epoch": 613.88, "learning_rate": 0.0001, "loss": 0.0205, "step": 1842 }, { "epoch": 614.88, "learning_rate": 0.0001, "loss": 0.021, "step": 1845 }, { "epoch": 615.88, "learning_rate": 0.0001, "loss": 0.0207, "step": 1848 }, { "epoch": 616.88, "learning_rate": 0.0001, "loss": 0.0206, "step": 1851 }, { "epoch": 617.88, "learning_rate": 0.0001, "loss": 0.0211, "step": 1854 }, { "epoch": 618.59, "eval_exact_match": 0.4941972920696325, "eval_exec": 0.48936170212765956, "eval_loss": 0.42522886395454407, "eval_runtime": 108.5837, "eval_samples_per_second": 9.523, "step": 1856 }, { "epoch": 618.88, "learning_rate": 0.0001, "loss": 0.0206, "step": 1857 }, { "epoch": 619.88, "learning_rate": 0.0001, "loss": 0.0209, "step": 1860 }, { "epoch": 620.88, "learning_rate": 0.0001, "loss": 0.0209, "step": 1863 }, { "epoch": 621.88, "learning_rate": 0.0001, "loss": 0.0209, "step": 1866 }, { "epoch": 622.88, "learning_rate": 0.0001, "loss": 0.0206, "step": 1869 }, { "epoch": 623.88, "learning_rate": 0.0001, "loss": 0.0195, "step": 1872 }, { "epoch": 624.88, "learning_rate": 0.0001, "loss": 0.0194, "step": 1875 }, { "epoch": 625.88, "learning_rate": 0.0001, "loss": 0.0201, "step": 1878 }, { "epoch": 626.88, "learning_rate": 0.0001, "loss": 0.0197, "step": 1881 }, { "epoch": 627.88, "learning_rate": 0.0001, "loss": 0.0194, "step": 1884 }, { "epoch": 628.88, "learning_rate": 0.0001, "loss": 0.02, "step": 1887 }, { "epoch": 629.88, "learning_rate": 0.0001, "loss": 0.0198, "step": 1890 }, { "epoch": 630.88, "learning_rate": 0.0001, "loss": 0.0196, "step": 1893 }, { "epoch": 631.88, "learning_rate": 0.0001, "loss": 0.0185, "step": 1896 }, { "epoch": 632.88, "learning_rate": 0.0001, "loss": 0.0203, "step": 1899 }, { "epoch": 633.88, "learning_rate": 0.0001, "loss": 0.0201, "step": 1902 }, { "epoch": 634.88, "learning_rate": 0.0001, "loss": 0.0197, "step": 1905 }, { "epoch": 635.88, "learning_rate": 0.0001, "loss": 0.0196, "step": 1908 }, { "epoch": 636.88, "learning_rate": 0.0001, "loss": 0.0192, "step": 1911 }, { "epoch": 637.88, "learning_rate": 0.0001, "loss": 0.0184, "step": 1914 }, { "epoch": 638.88, "learning_rate": 0.0001, "loss": 0.0188, "step": 1917 }, { "epoch": 639.88, "learning_rate": 0.0001, "loss": 0.0185, "step": 1920 }, { "epoch": 639.88, "eval_exact_match": 0.49806576402321084, "eval_exec": 0.488394584139265, "eval_loss": 0.43099677562713623, "eval_runtime": 104.5413, "eval_samples_per_second": 9.891, "step": 1920 }, { "epoch": 640.88, "learning_rate": 0.0001, "loss": 0.0194, "step": 1923 }, { "epoch": 641.88, "learning_rate": 0.0001, "loss": 0.0189, "step": 1926 }, { "epoch": 642.88, "learning_rate": 0.0001, "loss": 0.0201, "step": 1929 }, { "epoch": 643.88, "learning_rate": 0.0001, "loss": 0.0196, "step": 1932 }, { "epoch": 644.88, "learning_rate": 0.0001, "loss": 0.0187, "step": 1935 }, { "epoch": 645.88, "learning_rate": 0.0001, "loss": 0.0192, "step": 1938 }, { "epoch": 646.88, "learning_rate": 0.0001, "loss": 0.0194, "step": 1941 }, { "epoch": 647.88, "learning_rate": 0.0001, "loss": 0.0188, "step": 1944 }, { "epoch": 648.88, "learning_rate": 0.0001, "loss": 0.0185, "step": 1947 }, { "epoch": 649.88, "learning_rate": 0.0001, "loss": 0.0182, "step": 1950 }, { "epoch": 650.88, "learning_rate": 0.0001, "loss": 0.0181, "step": 1953 }, { "epoch": 651.88, "learning_rate": 0.0001, "loss": 0.0182, "step": 1956 }, { "epoch": 652.88, "learning_rate": 0.0001, "loss": 0.0193, "step": 1959 }, { "epoch": 653.88, "learning_rate": 0.0001, "loss": 0.0179, "step": 1962 }, { "epoch": 654.88, "learning_rate": 0.0001, "loss": 0.0177, "step": 1965 }, { "epoch": 655.88, "learning_rate": 0.0001, "loss": 0.018, "step": 1968 }, { "epoch": 656.88, "learning_rate": 0.0001, "loss": 0.018, "step": 1971 }, { "epoch": 657.88, "learning_rate": 0.0001, "loss": 0.0179, "step": 1974 }, { "epoch": 658.88, "learning_rate": 0.0001, "loss": 0.0173, "step": 1977 }, { "epoch": 659.88, "learning_rate": 0.0001, "loss": 0.0179, "step": 1980 }, { "epoch": 660.88, "learning_rate": 0.0001, "loss": 0.0179, "step": 1983 }, { "epoch": 661.29, "eval_exact_match": 0.47678916827852996, "eval_exec": 0.47678916827852996, "eval_loss": 0.43502098321914673, "eval_runtime": 115.2904, "eval_samples_per_second": 8.969, "step": 1984 }, { "epoch": 661.88, "learning_rate": 0.0001, "loss": 0.0174, "step": 1986 }, { "epoch": 662.88, "learning_rate": 0.0001, "loss": 0.0181, "step": 1989 }, { "epoch": 663.88, "learning_rate": 0.0001, "loss": 0.0185, "step": 1992 }, { "epoch": 664.88, "learning_rate": 0.0001, "loss": 0.0183, "step": 1995 }, { "epoch": 665.88, "learning_rate": 0.0001, "loss": 0.0173, "step": 1998 }, { "epoch": 666.88, "learning_rate": 0.0001, "loss": 0.0169, "step": 2001 }, { "epoch": 667.88, "learning_rate": 0.0001, "loss": 0.0169, "step": 2004 }, { "epoch": 668.88, "learning_rate": 0.0001, "loss": 0.0172, "step": 2007 }, { "epoch": 669.88, "learning_rate": 0.0001, "loss": 0.0165, "step": 2010 }, { "epoch": 670.88, "learning_rate": 0.0001, "loss": 0.0168, "step": 2013 }, { "epoch": 671.88, "learning_rate": 0.0001, "loss": 0.017, "step": 2016 }, { "epoch": 672.88, "learning_rate": 0.0001, "loss": 0.0173, "step": 2019 }, { "epoch": 673.88, "learning_rate": 0.0001, "loss": 0.0178, "step": 2022 }, { "epoch": 674.88, "learning_rate": 0.0001, "loss": 0.0164, "step": 2025 }, { "epoch": 675.88, "learning_rate": 0.0001, "loss": 0.0167, "step": 2028 }, { "epoch": 676.88, "learning_rate": 0.0001, "loss": 0.0166, "step": 2031 }, { "epoch": 677.88, "learning_rate": 0.0001, "loss": 0.0163, "step": 2034 }, { "epoch": 678.88, "learning_rate": 0.0001, "loss": 0.0162, "step": 2037 }, { "epoch": 679.88, "learning_rate": 0.0001, "loss": 0.0163, "step": 2040 }, { "epoch": 680.88, "learning_rate": 0.0001, "loss": 0.0163, "step": 2043 }, { "epoch": 681.88, "learning_rate": 0.0001, "loss": 0.0162, "step": 2046 }, { "epoch": 682.59, "eval_exact_match": 0.4825918762088975, "eval_exec": 0.4816247582205029, "eval_loss": 0.4417296051979065, "eval_runtime": 103.7496, "eval_samples_per_second": 9.966, "step": 2048 }, { "epoch": 682.88, "learning_rate": 0.0001, "loss": 0.0173, "step": 2049 }, { "epoch": 683.88, "learning_rate": 0.0001, "loss": 0.0174, "step": 2052 }, { "epoch": 684.88, "learning_rate": 0.0001, "loss": 0.0153, "step": 2055 }, { "epoch": 685.88, "learning_rate": 0.0001, "loss": 0.0155, "step": 2058 }, { "epoch": 686.88, "learning_rate": 0.0001, "loss": 0.016, "step": 2061 }, { "epoch": 687.88, "learning_rate": 0.0001, "loss": 0.0161, "step": 2064 }, { "epoch": 688.88, "learning_rate": 0.0001, "loss": 0.017, "step": 2067 }, { "epoch": 689.88, "learning_rate": 0.0001, "loss": 0.0164, "step": 2070 }, { "epoch": 690.88, "learning_rate": 0.0001, "loss": 0.0165, "step": 2073 }, { "epoch": 691.88, "learning_rate": 0.0001, "loss": 0.016, "step": 2076 }, { "epoch": 692.88, "learning_rate": 0.0001, "loss": 0.0152, "step": 2079 }, { "epoch": 693.88, "learning_rate": 0.0001, "loss": 0.0164, "step": 2082 }, { "epoch": 694.88, "learning_rate": 0.0001, "loss": 0.0161, "step": 2085 }, { "epoch": 695.88, "learning_rate": 0.0001, "loss": 0.0152, "step": 2088 }, { "epoch": 696.88, "learning_rate": 0.0001, "loss": 0.0156, "step": 2091 }, { "epoch": 697.88, "learning_rate": 0.0001, "loss": 0.0151, "step": 2094 }, { "epoch": 698.88, "learning_rate": 0.0001, "loss": 0.0156, "step": 2097 }, { "epoch": 699.88, "learning_rate": 0.0001, "loss": 0.0161, "step": 2100 }, { "epoch": 700.88, "learning_rate": 0.0001, "loss": 0.0161, "step": 2103 }, { "epoch": 701.88, "learning_rate": 0.0001, "loss": 0.0158, "step": 2106 }, { "epoch": 702.88, "learning_rate": 0.0001, "loss": 0.0154, "step": 2109 }, { "epoch": 703.88, "learning_rate": 0.0001, "loss": 0.0154, "step": 2112 }, { "epoch": 703.88, "eval_exact_match": 0.4874274661508704, "eval_exec": 0.4864603481624758, "eval_loss": 0.4481361210346222, "eval_runtime": 110.2347, "eval_samples_per_second": 9.38, "step": 2112 }, { "epoch": 704.88, "learning_rate": 0.0001, "loss": 0.0154, "step": 2115 }, { "epoch": 705.88, "learning_rate": 0.0001, "loss": 0.0151, "step": 2118 }, { "epoch": 706.88, "learning_rate": 0.0001, "loss": 0.015, "step": 2121 }, { "epoch": 707.88, "learning_rate": 0.0001, "loss": 0.0152, "step": 2124 }, { "epoch": 708.88, "learning_rate": 0.0001, "loss": 0.0143, "step": 2127 }, { "epoch": 709.88, "learning_rate": 0.0001, "loss": 0.0151, "step": 2130 }, { "epoch": 710.88, "learning_rate": 0.0001, "loss": 0.0146, "step": 2133 }, { "epoch": 711.88, "learning_rate": 0.0001, "loss": 0.015, "step": 2136 }, { "epoch": 712.88, "learning_rate": 0.0001, "loss": 0.0149, "step": 2139 }, { "epoch": 713.88, "learning_rate": 0.0001, "loss": 0.0153, "step": 2142 }, { "epoch": 714.88, "learning_rate": 0.0001, "loss": 0.0147, "step": 2145 }, { "epoch": 715.88, "learning_rate": 0.0001, "loss": 0.0147, "step": 2148 }, { "epoch": 716.88, "learning_rate": 0.0001, "loss": 0.0149, "step": 2151 }, { "epoch": 717.88, "learning_rate": 0.0001, "loss": 0.0151, "step": 2154 }, { "epoch": 718.88, "learning_rate": 0.0001, "loss": 0.0145, "step": 2157 }, { "epoch": 719.88, "learning_rate": 0.0001, "loss": 0.0147, "step": 2160 }, { "epoch": 720.88, "learning_rate": 0.0001, "loss": 0.0145, "step": 2163 }, { "epoch": 721.88, "learning_rate": 0.0001, "loss": 0.0145, "step": 2166 }, { "epoch": 722.88, "learning_rate": 0.0001, "loss": 0.0142, "step": 2169 }, { "epoch": 723.88, "learning_rate": 0.0001, "loss": 0.0142, "step": 2172 }, { "epoch": 724.88, "learning_rate": 0.0001, "loss": 0.0141, "step": 2175 }, { "epoch": 725.29, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.4912959381044487, "eval_loss": 0.4548819959163666, "eval_runtime": 108.1709, "eval_samples_per_second": 9.559, "step": 2176 }, { "epoch": 725.88, "learning_rate": 0.0001, "loss": 0.0141, "step": 2178 }, { "epoch": 726.88, "learning_rate": 0.0001, "loss": 0.0153, "step": 2181 }, { "epoch": 727.88, "learning_rate": 0.0001, "loss": 0.0144, "step": 2184 }, { "epoch": 728.88, "learning_rate": 0.0001, "loss": 0.0145, "step": 2187 }, { "epoch": 729.88, "learning_rate": 0.0001, "loss": 0.0136, "step": 2190 }, { "epoch": 730.88, "learning_rate": 0.0001, "loss": 0.0136, "step": 2193 }, { "epoch": 731.88, "learning_rate": 0.0001, "loss": 0.0139, "step": 2196 }, { "epoch": 732.88, "learning_rate": 0.0001, "loss": 0.014, "step": 2199 }, { "epoch": 733.88, "learning_rate": 0.0001, "loss": 0.0137, "step": 2202 }, { "epoch": 734.88, "learning_rate": 0.0001, "loss": 0.0143, "step": 2205 }, { "epoch": 735.88, "learning_rate": 0.0001, "loss": 0.0138, "step": 2208 }, { "epoch": 736.88, "learning_rate": 0.0001, "loss": 0.0137, "step": 2211 }, { "epoch": 737.88, "learning_rate": 0.0001, "loss": 0.0142, "step": 2214 }, { "epoch": 738.88, "learning_rate": 0.0001, "loss": 0.0134, "step": 2217 }, { "epoch": 739.88, "learning_rate": 0.0001, "loss": 0.0134, "step": 2220 }, { "epoch": 740.88, "learning_rate": 0.0001, "loss": 0.0133, "step": 2223 }, { "epoch": 741.88, "learning_rate": 0.0001, "loss": 0.0137, "step": 2226 }, { "epoch": 742.88, "learning_rate": 0.0001, "loss": 0.0139, "step": 2229 }, { "epoch": 743.88, "learning_rate": 0.0001, "loss": 0.0134, "step": 2232 }, { "epoch": 744.88, "learning_rate": 0.0001, "loss": 0.0134, "step": 2235 }, { "epoch": 745.88, "learning_rate": 0.0001, "loss": 0.0135, "step": 2238 }, { "epoch": 746.59, "eval_exact_match": 0.4835589941972921, "eval_exec": 0.4864603481624758, "eval_loss": 0.4577375054359436, "eval_runtime": 101.9311, "eval_samples_per_second": 10.144, "step": 2240 }, { "epoch": 746.88, "learning_rate": 0.0001, "loss": 0.0134, "step": 2241 }, { "epoch": 747.88, "learning_rate": 0.0001, "loss": 0.0139, "step": 2244 }, { "epoch": 748.88, "learning_rate": 0.0001, "loss": 0.0136, "step": 2247 }, { "epoch": 749.88, "learning_rate": 0.0001, "loss": 0.0137, "step": 2250 }, { "epoch": 750.88, "learning_rate": 0.0001, "loss": 0.0128, "step": 2253 }, { "epoch": 751.88, "learning_rate": 0.0001, "loss": 0.0125, "step": 2256 }, { "epoch": 752.88, "learning_rate": 0.0001, "loss": 0.0132, "step": 2259 }, { "epoch": 753.88, "learning_rate": 0.0001, "loss": 0.013, "step": 2262 }, { "epoch": 754.88, "learning_rate": 0.0001, "loss": 0.0127, "step": 2265 }, { "epoch": 755.88, "learning_rate": 0.0001, "loss": 0.0125, "step": 2268 }, { "epoch": 756.88, "learning_rate": 0.0001, "loss": 0.0126, "step": 2271 }, { "epoch": 757.88, "learning_rate": 0.0001, "loss": 0.0136, "step": 2274 }, { "epoch": 758.88, "learning_rate": 0.0001, "loss": 0.0125, "step": 2277 }, { "epoch": 759.88, "learning_rate": 0.0001, "loss": 0.0126, "step": 2280 }, { "epoch": 760.88, "learning_rate": 0.0001, "loss": 0.0122, "step": 2283 }, { "epoch": 761.88, "learning_rate": 0.0001, "loss": 0.0123, "step": 2286 }, { "epoch": 762.88, "learning_rate": 0.0001, "loss": 0.0125, "step": 2289 }, { "epoch": 763.88, "learning_rate": 0.0001, "loss": 0.0117, "step": 2292 }, { "epoch": 764.88, "learning_rate": 0.0001, "loss": 0.0121, "step": 2295 }, { "epoch": 765.88, "learning_rate": 0.0001, "loss": 0.0124, "step": 2298 }, { "epoch": 766.88, "learning_rate": 0.0001, "loss": 0.0122, "step": 2301 }, { "epoch": 767.88, "learning_rate": 0.0001, "loss": 0.0126, "step": 2304 }, { "epoch": 767.88, "eval_exact_match": 0.48936170212765956, "eval_exec": 0.488394584139265, "eval_loss": 0.46691325306892395, "eval_runtime": 106.1611, "eval_samples_per_second": 9.74, "step": 2304 }, { "epoch": 768.88, "learning_rate": 0.0001, "loss": 0.0123, "step": 2307 }, { "epoch": 769.88, "learning_rate": 0.0001, "loss": 0.0114, "step": 2310 }, { "epoch": 770.88, "learning_rate": 0.0001, "loss": 0.0123, "step": 2313 }, { "epoch": 771.88, "learning_rate": 0.0001, "loss": 0.0128, "step": 2316 }, { "epoch": 772.88, "learning_rate": 0.0001, "loss": 0.0124, "step": 2319 }, { "epoch": 773.88, "learning_rate": 0.0001, "loss": 0.0125, "step": 2322 }, { "epoch": 774.88, "learning_rate": 0.0001, "loss": 0.0124, "step": 2325 }, { "epoch": 775.88, "learning_rate": 0.0001, "loss": 0.0117, "step": 2328 }, { "epoch": 776.88, "learning_rate": 0.0001, "loss": 0.0126, "step": 2331 }, { "epoch": 777.88, "learning_rate": 0.0001, "loss": 0.012, "step": 2334 }, { "epoch": 778.88, "learning_rate": 0.0001, "loss": 0.0126, "step": 2337 }, { "epoch": 779.88, "learning_rate": 0.0001, "loss": 0.0123, "step": 2340 }, { "epoch": 780.88, "learning_rate": 0.0001, "loss": 0.011, "step": 2343 }, { "epoch": 781.88, "learning_rate": 0.0001, "loss": 0.0116, "step": 2346 }, { "epoch": 782.88, "learning_rate": 0.0001, "loss": 0.0117, "step": 2349 }, { "epoch": 783.88, "learning_rate": 0.0001, "loss": 0.012, "step": 2352 }, { "epoch": 784.88, "learning_rate": 0.0001, "loss": 0.0114, "step": 2355 }, { "epoch": 785.88, "learning_rate": 0.0001, "loss": 0.0126, "step": 2358 }, { "epoch": 786.88, "learning_rate": 0.0001, "loss": 0.0112, "step": 2361 }, { "epoch": 787.88, "learning_rate": 0.0001, "loss": 0.0116, "step": 2364 }, { "epoch": 788.88, "learning_rate": 0.0001, "loss": 0.0114, "step": 2367 }, { "epoch": 789.29, "eval_exact_match": 0.4951644100580271, "eval_exec": 0.4912959381044487, "eval_loss": 0.4785517156124115, "eval_runtime": 101.2749, "eval_samples_per_second": 10.21, "step": 2368 }, { "epoch": 789.88, "learning_rate": 0.0001, "loss": 0.0109, "step": 2370 }, { "epoch": 790.88, "learning_rate": 0.0001, "loss": 0.0114, "step": 2373 }, { "epoch": 791.88, "learning_rate": 0.0001, "loss": 0.0114, "step": 2376 }, { "epoch": 792.88, "learning_rate": 0.0001, "loss": 0.0114, "step": 2379 }, { "epoch": 793.88, "learning_rate": 0.0001, "loss": 0.0109, "step": 2382 }, { "epoch": 794.88, "learning_rate": 0.0001, "loss": 0.0116, "step": 2385 }, { "epoch": 795.88, "learning_rate": 0.0001, "loss": 0.0115, "step": 2388 }, { "epoch": 796.88, "learning_rate": 0.0001, "loss": 0.011, "step": 2391 }, { "epoch": 797.88, "learning_rate": 0.0001, "loss": 0.011, "step": 2394 }, { "epoch": 798.88, "learning_rate": 0.0001, "loss": 0.0113, "step": 2397 }, { "epoch": 799.88, "learning_rate": 0.0001, "loss": 0.0114, "step": 2400 }, { "epoch": 800.88, "learning_rate": 0.0001, "loss": 0.011, "step": 2403 }, { "epoch": 801.88, "learning_rate": 0.0001, "loss": 0.0108, "step": 2406 }, { "epoch": 802.88, "learning_rate": 0.0001, "loss": 0.0112, "step": 2409 }, { "epoch": 803.88, "learning_rate": 0.0001, "loss": 0.0106, "step": 2412 }, { "epoch": 804.88, "learning_rate": 0.0001, "loss": 0.0108, "step": 2415 }, { "epoch": 805.88, "learning_rate": 0.0001, "loss": 0.0106, "step": 2418 }, { "epoch": 806.88, "learning_rate": 0.0001, "loss": 0.0109, "step": 2421 }, { "epoch": 807.88, "learning_rate": 0.0001, "loss": 0.0108, "step": 2424 }, { "epoch": 808.88, "learning_rate": 0.0001, "loss": 0.0113, "step": 2427 }, { "epoch": 809.88, "learning_rate": 0.0001, "loss": 0.0105, "step": 2430 }, { "epoch": 810.59, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.4874274661508704, "eval_loss": 0.47889411449432373, "eval_runtime": 106.781, "eval_samples_per_second": 9.683, "step": 2432 }, { "epoch": 810.88, "learning_rate": 0.0001, "loss": 0.0109, "step": 2433 }, { "epoch": 811.88, "learning_rate": 0.0001, "loss": 0.0105, "step": 2436 }, { "epoch": 812.88, "learning_rate": 0.0001, "loss": 0.0112, "step": 2439 }, { "epoch": 813.88, "learning_rate": 0.0001, "loss": 0.0102, "step": 2442 }, { "epoch": 814.88, "learning_rate": 0.0001, "loss": 0.0104, "step": 2445 }, { "epoch": 815.88, "learning_rate": 0.0001, "loss": 0.0105, "step": 2448 }, { "epoch": 816.88, "learning_rate": 0.0001, "loss": 0.0101, "step": 2451 }, { "epoch": 817.88, "learning_rate": 0.0001, "loss": 0.0107, "step": 2454 }, { "epoch": 818.88, "learning_rate": 0.0001, "loss": 0.0104, "step": 2457 }, { "epoch": 819.88, "learning_rate": 0.0001, "loss": 0.01, "step": 2460 }, { "epoch": 820.88, "learning_rate": 0.0001, "loss": 0.0098, "step": 2463 }, { "epoch": 821.88, "learning_rate": 0.0001, "loss": 0.0102, "step": 2466 }, { "epoch": 822.88, "learning_rate": 0.0001, "loss": 0.0104, "step": 2469 }, { "epoch": 823.88, "learning_rate": 0.0001, "loss": 0.0118, "step": 2472 }, { "epoch": 824.88, "learning_rate": 0.0001, "loss": 0.0111, "step": 2475 }, { "epoch": 825.88, "learning_rate": 0.0001, "loss": 0.0101, "step": 2478 }, { "epoch": 826.88, "learning_rate": 0.0001, "loss": 0.0099, "step": 2481 }, { "epoch": 827.88, "learning_rate": 0.0001, "loss": 0.0101, "step": 2484 }, { "epoch": 828.88, "learning_rate": 0.0001, "loss": 0.0108, "step": 2487 }, { "epoch": 829.88, "learning_rate": 0.0001, "loss": 0.0109, "step": 2490 }, { "epoch": 830.88, "learning_rate": 0.0001, "loss": 0.0102, "step": 2493 }, { "epoch": 831.88, "learning_rate": 0.0001, "loss": 0.0106, "step": 2496 }, { "epoch": 831.88, "eval_exact_match": 0.4941972920696325, "eval_exec": 0.4922630560928433, "eval_loss": 0.47770604491233826, "eval_runtime": 109.549, "eval_samples_per_second": 9.439, "step": 2496 }, { "epoch": 832.88, "learning_rate": 0.0001, "loss": 0.0097, "step": 2499 }, { "epoch": 833.88, "learning_rate": 0.0001, "loss": 0.0098, "step": 2502 }, { "epoch": 834.88, "learning_rate": 0.0001, "loss": 0.0102, "step": 2505 }, { "epoch": 835.88, "learning_rate": 0.0001, "loss": 0.0097, "step": 2508 }, { "epoch": 836.88, "learning_rate": 0.0001, "loss": 0.0097, "step": 2511 }, { "epoch": 837.88, "learning_rate": 0.0001, "loss": 0.0102, "step": 2514 }, { "epoch": 838.88, "learning_rate": 0.0001, "loss": 0.0092, "step": 2517 }, { "epoch": 839.88, "learning_rate": 0.0001, "loss": 0.0096, "step": 2520 }, { "epoch": 840.88, "learning_rate": 0.0001, "loss": 0.0101, "step": 2523 }, { "epoch": 841.88, "learning_rate": 0.0001, "loss": 0.0098, "step": 2526 }, { "epoch": 842.88, "learning_rate": 0.0001, "loss": 0.0101, "step": 2529 }, { "epoch": 843.88, "learning_rate": 0.0001, "loss": 0.0098, "step": 2532 }, { "epoch": 844.88, "learning_rate": 0.0001, "loss": 0.0096, "step": 2535 }, { "epoch": 845.88, "learning_rate": 0.0001, "loss": 0.0096, "step": 2538 }, { "epoch": 846.88, "learning_rate": 0.0001, "loss": 0.0094, "step": 2541 }, { "epoch": 847.88, "learning_rate": 0.0001, "loss": 0.0096, "step": 2544 }, { "epoch": 848.88, "learning_rate": 0.0001, "loss": 0.0101, "step": 2547 }, { "epoch": 849.88, "learning_rate": 0.0001, "loss": 0.0099, "step": 2550 }, { "epoch": 850.88, "learning_rate": 0.0001, "loss": 0.0102, "step": 2553 }, { "epoch": 851.88, "learning_rate": 0.0001, "loss": 0.0107, "step": 2556 }, { "epoch": 852.88, "learning_rate": 0.0001, "loss": 0.0095, "step": 2559 }, { "epoch": 853.29, "eval_exact_match": 0.4922630560928433, "eval_exec": 0.4932301740812379, "eval_loss": 0.4875582158565521, "eval_runtime": 106.2482, "eval_samples_per_second": 9.732, "step": 2560 }, { "epoch": 853.88, "learning_rate": 0.0001, "loss": 0.0093, "step": 2562 }, { "epoch": 854.88, "learning_rate": 0.0001, "loss": 0.0097, "step": 2565 }, { "epoch": 855.88, "learning_rate": 0.0001, "loss": 0.0096, "step": 2568 }, { "epoch": 856.88, "learning_rate": 0.0001, "loss": 0.0097, "step": 2571 }, { "epoch": 857.88, "learning_rate": 0.0001, "loss": 0.0094, "step": 2574 }, { "epoch": 858.88, "learning_rate": 0.0001, "loss": 0.0095, "step": 2577 }, { "epoch": 859.88, "learning_rate": 0.0001, "loss": 0.0094, "step": 2580 }, { "epoch": 860.88, "learning_rate": 0.0001, "loss": 0.009, "step": 2583 }, { "epoch": 861.88, "learning_rate": 0.0001, "loss": 0.0096, "step": 2586 }, { "epoch": 862.88, "learning_rate": 0.0001, "loss": 0.0091, "step": 2589 }, { "epoch": 863.88, "learning_rate": 0.0001, "loss": 0.0087, "step": 2592 }, { "epoch": 864.88, "learning_rate": 0.0001, "loss": 0.0086, "step": 2595 }, { "epoch": 865.88, "learning_rate": 0.0001, "loss": 0.0089, "step": 2598 }, { "epoch": 866.88, "learning_rate": 0.0001, "loss": 0.0093, "step": 2601 }, { "epoch": 867.88, "learning_rate": 0.0001, "loss": 0.0094, "step": 2604 }, { "epoch": 868.88, "learning_rate": 0.0001, "loss": 0.0093, "step": 2607 }, { "epoch": 869.88, "learning_rate": 0.0001, "loss": 0.0092, "step": 2610 }, { "epoch": 870.88, "learning_rate": 0.0001, "loss": 0.0092, "step": 2613 }, { "epoch": 871.88, "learning_rate": 0.0001, "loss": 0.0087, "step": 2616 }, { "epoch": 872.88, "learning_rate": 0.0001, "loss": 0.0088, "step": 2619 }, { "epoch": 873.88, "learning_rate": 0.0001, "loss": 0.0093, "step": 2622 }, { "epoch": 874.59, "eval_exact_match": 0.48936170212765956, "eval_exec": 0.49032882011605416, "eval_loss": 0.4897403120994568, "eval_runtime": 109.6459, "eval_samples_per_second": 9.43, "step": 2624 }, { "epoch": 874.88, "learning_rate": 0.0001, "loss": 0.009, "step": 2625 }, { "epoch": 875.88, "learning_rate": 0.0001, "loss": 0.0085, "step": 2628 }, { "epoch": 876.88, "learning_rate": 0.0001, "loss": 0.0086, "step": 2631 }, { "epoch": 877.88, "learning_rate": 0.0001, "loss": 0.0085, "step": 2634 }, { "epoch": 878.88, "learning_rate": 0.0001, "loss": 0.0093, "step": 2637 }, { "epoch": 879.88, "learning_rate": 0.0001, "loss": 0.0091, "step": 2640 }, { "epoch": 880.88, "learning_rate": 0.0001, "loss": 0.0086, "step": 2643 }, { "epoch": 881.88, "learning_rate": 0.0001, "loss": 0.0086, "step": 2646 }, { "epoch": 882.88, "learning_rate": 0.0001, "loss": 0.0089, "step": 2649 }, { "epoch": 883.88, "learning_rate": 0.0001, "loss": 0.0082, "step": 2652 }, { "epoch": 884.88, "learning_rate": 0.0001, "loss": 0.0085, "step": 2655 }, { "epoch": 885.88, "learning_rate": 0.0001, "loss": 0.0084, "step": 2658 }, { "epoch": 886.88, "learning_rate": 0.0001, "loss": 0.0086, "step": 2661 }, { "epoch": 887.88, "learning_rate": 0.0001, "loss": 0.008, "step": 2664 }, { "epoch": 888.88, "learning_rate": 0.0001, "loss": 0.0082, "step": 2667 }, { "epoch": 889.88, "learning_rate": 0.0001, "loss": 0.0082, "step": 2670 }, { "epoch": 890.88, "learning_rate": 0.0001, "loss": 0.0087, "step": 2673 }, { "epoch": 891.88, "learning_rate": 0.0001, "loss": 0.0083, "step": 2676 }, { "epoch": 892.88, "learning_rate": 0.0001, "loss": 0.0084, "step": 2679 }, { "epoch": 893.88, "learning_rate": 0.0001, "loss": 0.0087, "step": 2682 }, { "epoch": 894.88, "learning_rate": 0.0001, "loss": 0.0085, "step": 2685 }, { "epoch": 895.88, "learning_rate": 0.0001, "loss": 0.0083, "step": 2688 }, { "epoch": 895.88, "eval_exact_match": 0.5, "eval_exec": 0.4961315280464217, "eval_loss": 0.4995100796222687, "eval_runtime": 115.5484, "eval_samples_per_second": 8.949, "step": 2688 }, { "epoch": 896.88, "learning_rate": 0.0001, "loss": 0.0081, "step": 2691 }, { "epoch": 897.88, "learning_rate": 0.0001, "loss": 0.0081, "step": 2694 }, { "epoch": 898.88, "learning_rate": 0.0001, "loss": 0.0088, "step": 2697 }, { "epoch": 899.88, "learning_rate": 0.0001, "loss": 0.0086, "step": 2700 }, { "epoch": 900.88, "learning_rate": 0.0001, "loss": 0.008, "step": 2703 }, { "epoch": 901.88, "learning_rate": 0.0001, "loss": 0.0088, "step": 2706 }, { "epoch": 902.88, "learning_rate": 0.0001, "loss": 0.0083, "step": 2709 }, { "epoch": 903.88, "learning_rate": 0.0001, "loss": 0.0084, "step": 2712 }, { "epoch": 904.88, "learning_rate": 0.0001, "loss": 0.0079, "step": 2715 }, { "epoch": 905.88, "learning_rate": 0.0001, "loss": 0.0084, "step": 2718 }, { "epoch": 906.88, "learning_rate": 0.0001, "loss": 0.0079, "step": 2721 }, { "epoch": 907.88, "learning_rate": 0.0001, "loss": 0.0082, "step": 2724 }, { "epoch": 908.88, "learning_rate": 0.0001, "loss": 0.0079, "step": 2727 }, { "epoch": 909.88, "learning_rate": 0.0001, "loss": 0.0081, "step": 2730 }, { "epoch": 910.88, "learning_rate": 0.0001, "loss": 0.008, "step": 2733 }, { "epoch": 911.88, "learning_rate": 0.0001, "loss": 0.0078, "step": 2736 }, { "epoch": 912.88, "learning_rate": 0.0001, "loss": 0.008, "step": 2739 }, { "epoch": 913.88, "learning_rate": 0.0001, "loss": 0.0083, "step": 2742 }, { "epoch": 914.88, "learning_rate": 0.0001, "loss": 0.0085, "step": 2745 }, { "epoch": 915.88, "learning_rate": 0.0001, "loss": 0.0079, "step": 2748 }, { "epoch": 916.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2751 }, { "epoch": 917.29, "eval_exact_match": 0.49709864603481624, "eval_exec": 0.4941972920696325, "eval_loss": 0.4965713918209076, "eval_runtime": 103.1798, "eval_samples_per_second": 10.021, "step": 2752 }, { "epoch": 917.88, "learning_rate": 0.0001, "loss": 0.0077, "step": 2754 }, { "epoch": 918.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2757 }, { "epoch": 919.88, "learning_rate": 0.0001, "loss": 0.008, "step": 2760 }, { "epoch": 920.88, "learning_rate": 0.0001, "loss": 0.0083, "step": 2763 }, { "epoch": 921.88, "learning_rate": 0.0001, "loss": 0.008, "step": 2766 }, { "epoch": 922.88, "learning_rate": 0.0001, "loss": 0.0073, "step": 2769 }, { "epoch": 923.88, "learning_rate": 0.0001, "loss": 0.0074, "step": 2772 }, { "epoch": 924.88, "learning_rate": 0.0001, "loss": 0.0075, "step": 2775 }, { "epoch": 925.88, "learning_rate": 0.0001, "loss": 0.0079, "step": 2778 }, { "epoch": 926.88, "learning_rate": 0.0001, "loss": 0.0077, "step": 2781 }, { "epoch": 927.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2784 }, { "epoch": 928.88, "learning_rate": 0.0001, "loss": 0.0075, "step": 2787 }, { "epoch": 929.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2790 }, { "epoch": 930.88, "learning_rate": 0.0001, "loss": 0.0079, "step": 2793 }, { "epoch": 931.88, "learning_rate": 0.0001, "loss": 0.0078, "step": 2796 }, { "epoch": 932.88, "learning_rate": 0.0001, "loss": 0.007, "step": 2799 }, { "epoch": 933.88, "learning_rate": 0.0001, "loss": 0.0077, "step": 2802 }, { "epoch": 934.88, "learning_rate": 0.0001, "loss": 0.0072, "step": 2805 }, { "epoch": 935.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2808 }, { "epoch": 936.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2811 }, { "epoch": 937.88, "learning_rate": 0.0001, "loss": 0.0075, "step": 2814 }, { "epoch": 938.59, "eval_exact_match": 0.4912959381044487, "eval_exec": 0.49032882011605416, "eval_loss": 0.5068889856338501, "eval_runtime": 114.9149, "eval_samples_per_second": 8.998, "step": 2816 }, { "epoch": 938.88, "learning_rate": 0.0001, "loss": 0.0077, "step": 2817 }, { "epoch": 939.88, "learning_rate": 0.0001, "loss": 0.0074, "step": 2820 }, { "epoch": 940.88, "learning_rate": 0.0001, "loss": 0.0077, "step": 2823 }, { "epoch": 941.88, "learning_rate": 0.0001, "loss": 0.008, "step": 2826 }, { "epoch": 942.88, "learning_rate": 0.0001, "loss": 0.0073, "step": 2829 }, { "epoch": 943.88, "learning_rate": 0.0001, "loss": 0.0073, "step": 2832 }, { "epoch": 944.88, "learning_rate": 0.0001, "loss": 0.007, "step": 2835 }, { "epoch": 945.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2838 }, { "epoch": 946.88, "learning_rate": 0.0001, "loss": 0.0071, "step": 2841 }, { "epoch": 947.88, "learning_rate": 0.0001, "loss": 0.0071, "step": 2844 }, { "epoch": 948.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2847 }, { "epoch": 949.88, "learning_rate": 0.0001, "loss": 0.0078, "step": 2850 }, { "epoch": 950.88, "learning_rate": 0.0001, "loss": 0.0082, "step": 2853 }, { "epoch": 951.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2856 }, { "epoch": 952.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2859 }, { "epoch": 953.88, "learning_rate": 0.0001, "loss": 0.007, "step": 2862 }, { "epoch": 954.88, "learning_rate": 0.0001, "loss": 0.0066, "step": 2865 }, { "epoch": 955.88, "learning_rate": 0.0001, "loss": 0.0071, "step": 2868 }, { "epoch": 956.88, "learning_rate": 0.0001, "loss": 0.0073, "step": 2871 }, { "epoch": 957.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2874 }, { "epoch": 958.88, "learning_rate": 0.0001, "loss": 0.0064, "step": 2877 }, { "epoch": 959.88, "learning_rate": 0.0001, "loss": 0.0076, "step": 2880 }, { "epoch": 959.88, "eval_exact_match": 0.4835589941972921, "eval_exec": 0.488394584139265, "eval_loss": 0.5026101469993591, "eval_runtime": 106.021, "eval_samples_per_second": 9.753, "step": 2880 }, { "epoch": 960.88, "learning_rate": 0.0001, "loss": 0.0072, "step": 2883 }, { "epoch": 961.88, "learning_rate": 0.0001, "loss": 0.0065, "step": 2886 }, { "epoch": 962.88, "learning_rate": 0.0001, "loss": 0.0074, "step": 2889 }, { "epoch": 963.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 2892 }, { "epoch": 964.88, "learning_rate": 0.0001, "loss": 0.0072, "step": 2895 }, { "epoch": 965.88, "learning_rate": 0.0001, "loss": 0.0074, "step": 2898 }, { "epoch": 966.88, "learning_rate": 0.0001, "loss": 0.007, "step": 2901 }, { "epoch": 967.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2904 }, { "epoch": 968.88, "learning_rate": 0.0001, "loss": 0.0065, "step": 2907 }, { "epoch": 969.88, "learning_rate": 0.0001, "loss": 0.0069, "step": 2910 }, { "epoch": 970.88, "learning_rate": 0.0001, "loss": 0.0066, "step": 2913 }, { "epoch": 971.88, "learning_rate": 0.0001, "loss": 0.007, "step": 2916 }, { "epoch": 972.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2919 }, { "epoch": 973.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 2922 }, { "epoch": 974.88, "learning_rate": 0.0001, "loss": 0.0067, "step": 2925 }, { "epoch": 975.88, "learning_rate": 0.0001, "loss": 0.0066, "step": 2928 }, { "epoch": 976.88, "learning_rate": 0.0001, "loss": 0.0067, "step": 2931 }, { "epoch": 977.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2934 }, { "epoch": 978.88, "learning_rate": 0.0001, "loss": 0.0066, "step": 2937 }, { "epoch": 979.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2940 }, { "epoch": 980.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2943 }, { "epoch": 981.29, "eval_exact_match": 0.4796905222437137, "eval_exec": 0.4874274661508704, "eval_loss": 0.5093928575515747, "eval_runtime": 102.014, "eval_samples_per_second": 10.136, "step": 2944 }, { "epoch": 981.88, "learning_rate": 0.0001, "loss": 0.0064, "step": 2946 }, { "epoch": 982.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 2949 }, { "epoch": 983.88, "learning_rate": 0.0001, "loss": 0.0065, "step": 2952 }, { "epoch": 984.88, "learning_rate": 0.0001, "loss": 0.0067, "step": 2955 }, { "epoch": 985.88, "learning_rate": 0.0001, "loss": 0.0064, "step": 2958 }, { "epoch": 986.88, "learning_rate": 0.0001, "loss": 0.0064, "step": 2961 }, { "epoch": 987.88, "learning_rate": 0.0001, "loss": 0.0058, "step": 2964 }, { "epoch": 988.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 2967 }, { "epoch": 989.88, "learning_rate": 0.0001, "loss": 0.0068, "step": 2970 }, { "epoch": 990.88, "learning_rate": 0.0001, "loss": 0.0065, "step": 2973 }, { "epoch": 991.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 2976 }, { "epoch": 992.88, "learning_rate": 0.0001, "loss": 0.006, "step": 2979 }, { "epoch": 993.88, "learning_rate": 0.0001, "loss": 0.006, "step": 2982 }, { "epoch": 994.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 2985 }, { "epoch": 995.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 2988 }, { "epoch": 996.88, "learning_rate": 0.0001, "loss": 0.006, "step": 2991 }, { "epoch": 997.88, "learning_rate": 0.0001, "loss": 0.0061, "step": 2994 }, { "epoch": 998.88, "learning_rate": 0.0001, "loss": 0.0065, "step": 2997 }, { "epoch": 999.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 3000 }, { "epoch": 1000.88, "learning_rate": 0.0001, "loss": 0.0065, "step": 3003 }, { "epoch": 1001.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 3006 }, { "epoch": 1002.59, "eval_exact_match": 0.49032882011605416, "eval_exec": 0.4874274661508704, "eval_loss": 0.5153567790985107, "eval_runtime": 112.3969, "eval_samples_per_second": 9.2, "step": 3008 }, { "epoch": 1002.88, "learning_rate": 0.0001, "loss": 0.0067, "step": 3009 }, { "epoch": 1003.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 3012 }, { "epoch": 1004.88, "learning_rate": 0.0001, "loss": 0.0064, "step": 3015 }, { "epoch": 1005.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3018 }, { "epoch": 1006.88, "learning_rate": 0.0001, "loss": 0.0067, "step": 3021 }, { "epoch": 1007.88, "learning_rate": 0.0001, "loss": 0.0061, "step": 3024 }, { "epoch": 1008.88, "learning_rate": 0.0001, "loss": 0.0066, "step": 3027 }, { "epoch": 1009.88, "learning_rate": 0.0001, "loss": 0.0064, "step": 3030 }, { "epoch": 1010.88, "learning_rate": 0.0001, "loss": 0.0066, "step": 3033 }, { "epoch": 1011.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 3036 }, { "epoch": 1012.88, "learning_rate": 0.0001, "loss": 0.006, "step": 3039 }, { "epoch": 1013.88, "learning_rate": 0.0001, "loss": 0.0061, "step": 3042 }, { "epoch": 1014.88, "learning_rate": 0.0001, "loss": 0.006, "step": 3045 }, { "epoch": 1015.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 3048 }, { "epoch": 1016.88, "learning_rate": 0.0001, "loss": 0.0063, "step": 3051 }, { "epoch": 1017.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3054 }, { "epoch": 1018.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 3057 }, { "epoch": 1019.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 3060 }, { "epoch": 1020.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 3063 }, { "epoch": 1021.88, "learning_rate": 0.0001, "loss": 0.006, "step": 3066 }, { "epoch": 1022.88, "learning_rate": 0.0001, "loss": 0.0058, "step": 3069 }, { "epoch": 1023.88, "learning_rate": 0.0001, "loss": 0.006, "step": 3072 }, { "epoch": 1023.88, "eval_exact_match": 0.4864603481624758, "eval_exec": 0.4864603481624758, "eval_loss": 0.5245723724365234, "eval_runtime": 108.9392, "eval_samples_per_second": 9.492, "step": 3072 }, { "epoch": 1024.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3075 }, { "epoch": 1025.88, "learning_rate": 0.0001, "loss": 0.0061, "step": 3078 }, { "epoch": 1026.88, "learning_rate": 0.0001, "loss": 0.0064, "step": 3081 }, { "epoch": 1027.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3084 }, { "epoch": 1028.88, "learning_rate": 0.0001, "loss": 0.0061, "step": 3087 }, { "epoch": 1029.88, "learning_rate": 0.0001, "loss": 0.0056, "step": 3090 }, { "epoch": 1030.88, "learning_rate": 0.0001, "loss": 0.0057, "step": 3093 }, { "epoch": 1031.88, "learning_rate": 0.0001, "loss": 0.006, "step": 3096 }, { "epoch": 1032.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3099 }, { "epoch": 1033.88, "learning_rate": 0.0001, "loss": 0.006, "step": 3102 }, { "epoch": 1034.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 3105 }, { "epoch": 1035.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3108 }, { "epoch": 1036.88, "learning_rate": 0.0001, "loss": 0.0057, "step": 3111 }, { "epoch": 1037.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3114 }, { "epoch": 1038.88, "learning_rate": 0.0001, "loss": 0.0061, "step": 3117 }, { "epoch": 1039.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3120 }, { "epoch": 1040.88, "learning_rate": 0.0001, "loss": 0.0057, "step": 3123 }, { "epoch": 1041.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3126 }, { "epoch": 1042.88, "learning_rate": 0.0001, "loss": 0.0056, "step": 3129 }, { "epoch": 1043.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3132 }, { "epoch": 1044.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3135 }, { "epoch": 1045.29, "eval_exact_match": 0.49032882011605416, "eval_exec": 0.4912959381044487, "eval_loss": 0.5266330242156982, "eval_runtime": 100.7584, "eval_samples_per_second": 10.262, "step": 3136 }, { "epoch": 1045.88, "learning_rate": 0.0001, "loss": 0.0065, "step": 3138 }, { "epoch": 1046.88, "learning_rate": 0.0001, "loss": 0.0062, "step": 3141 }, { "epoch": 1047.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3144 }, { "epoch": 1048.88, "learning_rate": 0.0001, "loss": 0.0056, "step": 3147 }, { "epoch": 1049.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3150 }, { "epoch": 1050.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3153 }, { "epoch": 1051.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3156 }, { "epoch": 1052.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3159 }, { "epoch": 1053.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3162 }, { "epoch": 1054.88, "learning_rate": 0.0001, "loss": 0.0057, "step": 3165 }, { "epoch": 1055.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3168 }, { "epoch": 1056.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3171 }, { "epoch": 1057.88, "learning_rate": 0.0001, "loss": 0.006, "step": 3174 }, { "epoch": 1058.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3177 }, { "epoch": 1059.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3180 }, { "epoch": 1060.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3183 }, { "epoch": 1061.88, "learning_rate": 0.0001, "loss": 0.0056, "step": 3186 }, { "epoch": 1062.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3189 }, { "epoch": 1063.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3192 }, { "epoch": 1064.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3195 }, { "epoch": 1065.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3198 }, { "epoch": 1066.59, "eval_exact_match": 0.4864603481624758, "eval_exec": 0.48549323017408125, "eval_loss": 0.5267293453216553, "eval_runtime": 104.4326, "eval_samples_per_second": 9.901, "step": 3200 }, { "epoch": 1066.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3201 }, { "epoch": 1067.88, "learning_rate": 0.0001, "loss": 0.0058, "step": 3204 }, { "epoch": 1068.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3207 }, { "epoch": 1069.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3210 }, { "epoch": 1070.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3213 }, { "epoch": 1071.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3216 }, { "epoch": 1072.88, "learning_rate": 0.0001, "loss": 0.0056, "step": 3219 }, { "epoch": 1073.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3222 }, { "epoch": 1074.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3225 }, { "epoch": 1075.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3228 }, { "epoch": 1076.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3231 }, { "epoch": 1077.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3234 }, { "epoch": 1078.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3237 }, { "epoch": 1079.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3240 }, { "epoch": 1080.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3243 }, { "epoch": 1081.88, "learning_rate": 0.0001, "loss": 0.0055, "step": 3246 }, { "epoch": 1082.88, "learning_rate": 0.0001, "loss": 0.0056, "step": 3249 }, { "epoch": 1083.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3252 }, { "epoch": 1084.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3255 }, { "epoch": 1085.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3258 }, { "epoch": 1086.88, "learning_rate": 0.0001, "loss": 0.0057, "step": 3261 }, { "epoch": 1087.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3264 }, { "epoch": 1087.88, "eval_exact_match": 0.488394584139265, "eval_exec": 0.4835589941972921, "eval_loss": 0.5323160290718079, "eval_runtime": 100.2092, "eval_samples_per_second": 10.318, "step": 3264 }, { "epoch": 1088.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3267 }, { "epoch": 1089.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3270 }, { "epoch": 1090.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3273 }, { "epoch": 1091.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3276 }, { "epoch": 1092.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3279 }, { "epoch": 1093.88, "learning_rate": 0.0001, "loss": 0.0056, "step": 3282 }, { "epoch": 1094.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3285 }, { "epoch": 1095.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3288 }, { "epoch": 1096.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3291 }, { "epoch": 1097.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3294 }, { "epoch": 1098.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3297 }, { "epoch": 1099.88, "learning_rate": 0.0001, "loss": 0.0059, "step": 3300 }, { "epoch": 1100.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3303 }, { "epoch": 1101.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3306 }, { "epoch": 1102.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3309 }, { "epoch": 1103.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3312 }, { "epoch": 1104.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3315 }, { "epoch": 1105.88, "learning_rate": 0.0001, "loss": 0.0054, "step": 3318 }, { "epoch": 1106.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3321 }, { "epoch": 1107.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3324 }, { "epoch": 1108.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3327 }, { "epoch": 1109.29, "eval_exact_match": 0.48452611218568664, "eval_exec": 0.4796905222437137, "eval_loss": 0.5343111157417297, "eval_runtime": 99.4552, "eval_samples_per_second": 10.397, "step": 3328 }, { "epoch": 1109.88, "learning_rate": 0.0001, "loss": 0.0053, "step": 3330 }, { "epoch": 1110.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3333 }, { "epoch": 1111.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3336 }, { "epoch": 1112.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3339 }, { "epoch": 1113.88, "learning_rate": 0.0001, "loss": 0.0047, "step": 3342 }, { "epoch": 1114.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3345 }, { "epoch": 1115.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3348 }, { "epoch": 1116.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3351 }, { "epoch": 1117.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3354 }, { "epoch": 1118.88, "learning_rate": 0.0001, "loss": 0.0047, "step": 3357 }, { "epoch": 1119.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3360 }, { "epoch": 1120.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3363 }, { "epoch": 1121.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3366 }, { "epoch": 1122.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3369 }, { "epoch": 1123.88, "learning_rate": 0.0001, "loss": 0.0047, "step": 3372 }, { "epoch": 1124.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3375 }, { "epoch": 1125.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3378 }, { "epoch": 1126.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3381 }, { "epoch": 1127.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3384 }, { "epoch": 1128.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3387 }, { "epoch": 1129.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3390 }, { "epoch": 1130.59, "eval_exact_match": 0.488394584139265, "eval_exec": 0.488394584139265, "eval_loss": 0.5409371256828308, "eval_runtime": 104.8508, "eval_samples_per_second": 9.862, "step": 3392 }, { "epoch": 1130.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3393 }, { "epoch": 1131.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3396 }, { "epoch": 1132.88, "learning_rate": 0.0001, "loss": 0.0046, "step": 3399 }, { "epoch": 1133.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3402 }, { "epoch": 1134.88, "learning_rate": 0.0001, "loss": 0.0047, "step": 3405 }, { "epoch": 1135.88, "learning_rate": 0.0001, "loss": 0.0048, "step": 3408 }, { "epoch": 1136.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3411 }, { "epoch": 1137.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3414 }, { "epoch": 1138.88, "learning_rate": 0.0001, "loss": 0.0046, "step": 3417 }, { "epoch": 1139.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3420 }, { "epoch": 1140.88, "learning_rate": 0.0001, "loss": 0.005, "step": 3423 }, { "epoch": 1141.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3426 }, { "epoch": 1142.88, "learning_rate": 0.0001, "loss": 0.0046, "step": 3429 }, { "epoch": 1143.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3432 }, { "epoch": 1144.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3435 }, { "epoch": 1145.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3438 }, { "epoch": 1146.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3441 }, { "epoch": 1147.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3444 }, { "epoch": 1148.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3447 }, { "epoch": 1149.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3450 }, { "epoch": 1150.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3453 }, { "epoch": 1151.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3456 }, { "epoch": 1151.88, "eval_exact_match": 0.4941972920696325, "eval_exec": 0.488394584139265, "eval_loss": 0.5484944581985474, "eval_runtime": 103.3732, "eval_samples_per_second": 10.003, "step": 3456 }, { "epoch": 1152.88, "learning_rate": 0.0001, "loss": 0.0051, "step": 3459 }, { "epoch": 1153.88, "learning_rate": 0.0001, "loss": 0.0052, "step": 3462 }, { "epoch": 1154.88, "learning_rate": 0.0001, "loss": 0.0046, "step": 3465 }, { "epoch": 1155.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3468 }, { "epoch": 1156.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3471 }, { "epoch": 1157.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3474 }, { "epoch": 1158.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3477 }, { "epoch": 1159.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3480 }, { "epoch": 1160.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3483 }, { "epoch": 1161.88, "learning_rate": 0.0001, "loss": 0.0046, "step": 3486 }, { "epoch": 1162.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3489 }, { "epoch": 1163.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3492 }, { "epoch": 1164.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3495 }, { "epoch": 1165.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3498 }, { "epoch": 1166.88, "learning_rate": 0.0001, "loss": 0.0049, "step": 3501 }, { "epoch": 1167.88, "learning_rate": 0.0001, "loss": 0.0042, "step": 3504 }, { "epoch": 1168.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3507 }, { "epoch": 1169.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3510 }, { "epoch": 1170.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3513 }, { "epoch": 1171.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3516 }, { "epoch": 1172.88, "learning_rate": 0.0001, "loss": 0.0042, "step": 3519 }, { "epoch": 1173.29, "eval_exact_match": 0.4990328820116054, "eval_exec": 0.4941972920696325, "eval_loss": 0.547235369682312, "eval_runtime": 96.1089, "eval_samples_per_second": 10.759, "step": 3520 }, { "epoch": 1173.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3522 }, { "epoch": 1174.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3525 }, { "epoch": 1175.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3528 }, { "epoch": 1176.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3531 }, { "epoch": 1177.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3534 }, { "epoch": 1178.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3537 }, { "epoch": 1179.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3540 }, { "epoch": 1180.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3543 }, { "epoch": 1181.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3546 }, { "epoch": 1182.88, "learning_rate": 0.0001, "loss": 0.0046, "step": 3549 }, { "epoch": 1183.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3552 }, { "epoch": 1184.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3555 }, { "epoch": 1185.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3558 }, { "epoch": 1186.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3561 }, { "epoch": 1187.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3564 }, { "epoch": 1188.88, "learning_rate": 0.0001, "loss": 0.0042, "step": 3567 }, { "epoch": 1189.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3570 }, { "epoch": 1190.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3573 }, { "epoch": 1191.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3576 }, { "epoch": 1192.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3579 }, { "epoch": 1193.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3582 }, { "epoch": 1194.59, "eval_exact_match": 0.5009671179883946, "eval_exec": 0.49709864603481624, "eval_loss": 0.5491827130317688, "eval_runtime": 100.0201, "eval_samples_per_second": 10.338, "step": 3584 }, { "epoch": 1194.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3585 }, { "epoch": 1195.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3588 }, { "epoch": 1196.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3591 }, { "epoch": 1197.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3594 }, { "epoch": 1198.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3597 }, { "epoch": 1199.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3600 }, { "epoch": 1200.88, "learning_rate": 0.0001, "loss": 0.0042, "step": 3603 }, { "epoch": 1201.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3606 }, { "epoch": 1202.88, "learning_rate": 0.0001, "loss": 0.0042, "step": 3609 }, { "epoch": 1203.88, "learning_rate": 0.0001, "loss": 0.0044, "step": 3612 }, { "epoch": 1204.88, "learning_rate": 0.0001, "loss": 0.0045, "step": 3615 }, { "epoch": 1205.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3618 }, { "epoch": 1206.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3621 }, { "epoch": 1207.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3624 }, { "epoch": 1208.88, "learning_rate": 0.0001, "loss": 0.0042, "step": 3627 }, { "epoch": 1209.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3630 }, { "epoch": 1210.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3633 }, { "epoch": 1211.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3636 }, { "epoch": 1212.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3639 }, { "epoch": 1213.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3642 }, { "epoch": 1214.88, "learning_rate": 0.0001, "loss": 0.0042, "step": 3645 }, { "epoch": 1215.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3648 }, { "epoch": 1215.88, "eval_exact_match": 0.4864603481624758, "eval_exec": 0.48549323017408125, "eval_loss": 0.5521473288536072, "eval_runtime": 101.5945, "eval_samples_per_second": 10.178, "step": 3648 }, { "epoch": 1216.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3651 }, { "epoch": 1217.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3654 }, { "epoch": 1218.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3657 }, { "epoch": 1219.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3660 }, { "epoch": 1220.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3663 }, { "epoch": 1221.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3666 }, { "epoch": 1222.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3669 }, { "epoch": 1223.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3672 }, { "epoch": 1224.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3675 }, { "epoch": 1225.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3678 }, { "epoch": 1226.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3681 }, { "epoch": 1227.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3684 }, { "epoch": 1228.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3687 }, { "epoch": 1229.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3690 }, { "epoch": 1230.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3693 }, { "epoch": 1231.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3696 }, { "epoch": 1232.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3699 }, { "epoch": 1233.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3702 }, { "epoch": 1234.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3705 }, { "epoch": 1235.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3708 }, { "epoch": 1236.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3711 }, { "epoch": 1237.29, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.48549323017408125, "eval_loss": 0.5529308319091797, "eval_runtime": 103.2003, "eval_samples_per_second": 10.019, "step": 3712 }, { "epoch": 1237.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3714 }, { "epoch": 1238.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3717 }, { "epoch": 1239.88, "learning_rate": 0.0001, "loss": 0.0041, "step": 3720 }, { "epoch": 1240.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3723 }, { "epoch": 1241.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3726 }, { "epoch": 1242.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3729 }, { "epoch": 1243.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3732 }, { "epoch": 1244.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3735 }, { "epoch": 1245.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3738 }, { "epoch": 1246.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3741 }, { "epoch": 1247.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3744 }, { "epoch": 1248.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3747 }, { "epoch": 1249.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3750 }, { "epoch": 1250.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3753 }, { "epoch": 1251.88, "learning_rate": 0.0001, "loss": 0.0043, "step": 3756 }, { "epoch": 1252.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3759 }, { "epoch": 1253.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3762 }, { "epoch": 1254.88, "learning_rate": 0.0001, "loss": 0.004, "step": 3765 }, { "epoch": 1255.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3768 }, { "epoch": 1256.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3771 }, { "epoch": 1257.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3774 }, { "epoch": 1258.59, "eval_exact_match": 0.48936170212765956, "eval_exec": 0.4864603481624758, "eval_loss": 0.5576500296592712, "eval_runtime": 102.4554, "eval_samples_per_second": 10.092, "step": 3776 }, { "epoch": 1258.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3777 }, { "epoch": 1259.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3780 }, { "epoch": 1260.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3783 }, { "epoch": 1261.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3786 }, { "epoch": 1262.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3789 }, { "epoch": 1263.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3792 }, { "epoch": 1264.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3795 }, { "epoch": 1265.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3798 }, { "epoch": 1266.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3801 }, { "epoch": 1267.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3804 }, { "epoch": 1268.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3807 }, { "epoch": 1269.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3810 }, { "epoch": 1270.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3813 }, { "epoch": 1271.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3816 }, { "epoch": 1272.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3819 }, { "epoch": 1273.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3822 }, { "epoch": 1274.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3825 }, { "epoch": 1275.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3828 }, { "epoch": 1276.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3831 }, { "epoch": 1277.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3834 }, { "epoch": 1278.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3837 }, { "epoch": 1279.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3840 }, { "epoch": 1279.88, "eval_exact_match": 0.4990328820116054, "eval_exec": 0.4912959381044487, "eval_loss": 0.5551109910011292, "eval_runtime": 108.2571, "eval_samples_per_second": 9.551, "step": 3840 }, { "epoch": 1280.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3843 }, { "epoch": 1281.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3846 }, { "epoch": 1282.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3849 }, { "epoch": 1283.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3852 }, { "epoch": 1284.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3855 }, { "epoch": 1285.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3858 }, { "epoch": 1286.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3861 }, { "epoch": 1287.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 3864 }, { "epoch": 1288.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3867 }, { "epoch": 1289.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3870 }, { "epoch": 1290.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3873 }, { "epoch": 1291.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3876 }, { "epoch": 1292.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3879 }, { "epoch": 1293.88, "learning_rate": 0.0001, "loss": 0.0039, "step": 3882 }, { "epoch": 1294.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3885 }, { "epoch": 1295.88, "learning_rate": 0.0001, "loss": 0.0037, "step": 3888 }, { "epoch": 1296.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3891 }, { "epoch": 1297.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3894 }, { "epoch": 1298.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3897 }, { "epoch": 1299.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3900 }, { "epoch": 1300.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3903 }, { "epoch": 1301.29, "eval_exact_match": 0.49806576402321084, "eval_exec": 0.4941972920696325, "eval_loss": 0.5643026232719421, "eval_runtime": 100.8652, "eval_samples_per_second": 10.251, "step": 3904 }, { "epoch": 1301.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 3906 }, { "epoch": 1302.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3909 }, { "epoch": 1303.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3912 }, { "epoch": 1304.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3915 }, { "epoch": 1305.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3918 }, { "epoch": 1306.88, "learning_rate": 0.0001, "loss": 0.0038, "step": 3921 }, { "epoch": 1307.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3924 }, { "epoch": 1308.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3927 }, { "epoch": 1309.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 3930 }, { "epoch": 1310.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3933 }, { "epoch": 1311.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3936 }, { "epoch": 1312.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3939 }, { "epoch": 1313.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 3942 }, { "epoch": 1314.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3945 }, { "epoch": 1315.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3948 }, { "epoch": 1316.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3951 }, { "epoch": 1317.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 3954 }, { "epoch": 1318.88, "learning_rate": 0.0001, "loss": 0.0036, "step": 3957 }, { "epoch": 1319.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 3960 }, { "epoch": 1320.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3963 }, { "epoch": 1321.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3966 }, { "epoch": 1322.59, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.48549323017408125, "eval_loss": 0.5721480250358582, "eval_runtime": 106.1276, "eval_samples_per_second": 9.743, "step": 3968 }, { "epoch": 1322.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 3969 }, { "epoch": 1323.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3972 }, { "epoch": 1324.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 3975 }, { "epoch": 1325.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3978 }, { "epoch": 1326.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 3981 }, { "epoch": 1327.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 3984 }, { "epoch": 1328.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 3987 }, { "epoch": 1329.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3990 }, { "epoch": 1330.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 3993 }, { "epoch": 1331.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 3996 }, { "epoch": 1332.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 3999 }, { "epoch": 1333.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4002 }, { "epoch": 1334.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 4005 }, { "epoch": 1335.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4008 }, { "epoch": 1336.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4011 }, { "epoch": 1337.88, "learning_rate": 0.0001, "loss": 0.0034, "step": 4014 }, { "epoch": 1338.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4017 }, { "epoch": 1339.88, "learning_rate": 0.0001, "loss": 0.0035, "step": 4020 }, { "epoch": 1340.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4023 }, { "epoch": 1341.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4026 }, { "epoch": 1342.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4029 }, { "epoch": 1343.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4032 }, { "epoch": 1343.88, "eval_exact_match": 0.4912959381044487, "eval_exec": 0.4864603481624758, "eval_loss": 0.5649085640907288, "eval_runtime": 100.2657, "eval_samples_per_second": 10.313, "step": 4032 }, { "epoch": 1344.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4035 }, { "epoch": 1345.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4038 }, { "epoch": 1346.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4041 }, { "epoch": 1347.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4044 }, { "epoch": 1348.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4047 }, { "epoch": 1349.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4050 }, { "epoch": 1350.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4053 }, { "epoch": 1351.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4056 }, { "epoch": 1352.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4059 }, { "epoch": 1353.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4062 }, { "epoch": 1354.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4065 }, { "epoch": 1355.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4068 }, { "epoch": 1356.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4071 }, { "epoch": 1357.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4074 }, { "epoch": 1358.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4077 }, { "epoch": 1359.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4080 }, { "epoch": 1360.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4083 }, { "epoch": 1361.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4086 }, { "epoch": 1362.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4089 }, { "epoch": 1363.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4092 }, { "epoch": 1364.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4095 }, { "epoch": 1365.29, "eval_exact_match": 0.49806576402321084, "eval_exec": 0.4922630560928433, "eval_loss": 0.5747038722038269, "eval_runtime": 108.1776, "eval_samples_per_second": 9.558, "step": 4096 }, { "epoch": 1365.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4098 }, { "epoch": 1366.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4101 }, { "epoch": 1367.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4104 }, { "epoch": 1368.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4107 }, { "epoch": 1369.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4110 }, { "epoch": 1370.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4113 }, { "epoch": 1371.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4116 }, { "epoch": 1372.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4119 }, { "epoch": 1373.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4122 }, { "epoch": 1374.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4125 }, { "epoch": 1375.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4128 }, { "epoch": 1376.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4131 }, { "epoch": 1377.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4134 }, { "epoch": 1378.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4137 }, { "epoch": 1379.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4140 }, { "epoch": 1380.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4143 }, { "epoch": 1381.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4146 }, { "epoch": 1382.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4149 }, { "epoch": 1383.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4152 }, { "epoch": 1384.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4155 }, { "epoch": 1385.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4158 }, { "epoch": 1386.59, "eval_exact_match": 0.49032882011605416, "eval_exec": 0.48549323017408125, "eval_loss": 0.5771034359931946, "eval_runtime": 105.7502, "eval_samples_per_second": 9.778, "step": 4160 }, { "epoch": 1386.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4161 }, { "epoch": 1387.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4164 }, { "epoch": 1388.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4167 }, { "epoch": 1389.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4170 }, { "epoch": 1390.88, "learning_rate": 0.0001, "loss": 0.0032, "step": 4173 }, { "epoch": 1391.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4176 }, { "epoch": 1392.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4179 }, { "epoch": 1393.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4182 }, { "epoch": 1394.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4185 }, { "epoch": 1395.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4188 }, { "epoch": 1396.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4191 }, { "epoch": 1397.88, "learning_rate": 0.0001, "loss": 0.0033, "step": 4194 }, { "epoch": 1398.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4197 }, { "epoch": 1399.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4200 }, { "epoch": 1400.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4203 }, { "epoch": 1401.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4206 }, { "epoch": 1402.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4209 }, { "epoch": 1403.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4212 }, { "epoch": 1404.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4215 }, { "epoch": 1405.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4218 }, { "epoch": 1406.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4221 }, { "epoch": 1407.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4224 }, { "epoch": 1407.88, "eval_exact_match": 0.4922630560928433, "eval_exec": 0.4874274661508704, "eval_loss": 0.5785483717918396, "eval_runtime": 117.2042, "eval_samples_per_second": 8.822, "step": 4224 }, { "epoch": 1408.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4227 }, { "epoch": 1409.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4230 }, { "epoch": 1410.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4233 }, { "epoch": 1411.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4236 }, { "epoch": 1412.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4239 }, { "epoch": 1413.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4242 }, { "epoch": 1414.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4245 }, { "epoch": 1415.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4248 }, { "epoch": 1416.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4251 }, { "epoch": 1417.88, "learning_rate": 0.0001, "loss": 0.0031, "step": 4254 }, { "epoch": 1418.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4257 }, { "epoch": 1419.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4260 }, { "epoch": 1420.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4263 }, { "epoch": 1421.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4266 }, { "epoch": 1422.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4269 }, { "epoch": 1423.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4272 }, { "epoch": 1424.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4275 }, { "epoch": 1425.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4278 }, { "epoch": 1426.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4281 }, { "epoch": 1427.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4284 }, { "epoch": 1428.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4287 }, { "epoch": 1429.29, "eval_exact_match": 0.4874274661508704, "eval_exec": 0.48549323017408125, "eval_loss": 0.5841559171676636, "eval_runtime": 96.7174, "eval_samples_per_second": 10.691, "step": 4288 }, { "epoch": 1429.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4290 }, { "epoch": 1430.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4293 }, { "epoch": 1431.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4296 }, { "epoch": 1432.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4299 }, { "epoch": 1433.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4302 }, { "epoch": 1434.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4305 }, { "epoch": 1435.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4308 }, { "epoch": 1436.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4311 }, { "epoch": 1437.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4314 }, { "epoch": 1438.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4317 }, { "epoch": 1439.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4320 }, { "epoch": 1440.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4323 }, { "epoch": 1441.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4326 }, { "epoch": 1442.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4329 }, { "epoch": 1443.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4332 }, { "epoch": 1444.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4335 }, { "epoch": 1445.88, "learning_rate": 0.0001, "loss": 0.003, "step": 4338 }, { "epoch": 1446.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4341 }, { "epoch": 1447.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4344 }, { "epoch": 1448.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4347 }, { "epoch": 1449.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4350 }, { "epoch": 1450.59, "eval_exact_match": 0.49709864603481624, "eval_exec": 0.49806576402321084, "eval_loss": 0.5847323536872864, "eval_runtime": 104.9047, "eval_samples_per_second": 9.857, "step": 4352 }, { "epoch": 1450.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4353 }, { "epoch": 1451.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4356 }, { "epoch": 1452.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4359 }, { "epoch": 1453.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4362 }, { "epoch": 1454.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4365 }, { "epoch": 1455.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4368 }, { "epoch": 1456.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4371 }, { "epoch": 1457.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4374 }, { "epoch": 1458.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4377 }, { "epoch": 1459.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4380 }, { "epoch": 1460.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4383 }, { "epoch": 1461.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4386 }, { "epoch": 1462.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4389 }, { "epoch": 1463.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4392 }, { "epoch": 1464.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4395 }, { "epoch": 1465.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4398 }, { "epoch": 1466.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4401 }, { "epoch": 1467.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4404 }, { "epoch": 1468.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4407 }, { "epoch": 1469.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4410 }, { "epoch": 1470.88, "learning_rate": 0.0001, "loss": 0.0028, "step": 4413 }, { "epoch": 1471.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4416 }, { "epoch": 1471.88, "eval_exact_match": 0.48452611218568664, "eval_exec": 0.48452611218568664, "eval_loss": 0.590592622756958, "eval_runtime": 105.9184, "eval_samples_per_second": 9.762, "step": 4416 }, { "epoch": 1472.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4419 }, { "epoch": 1473.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4422 }, { "epoch": 1474.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4425 }, { "epoch": 1475.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4428 }, { "epoch": 1476.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4431 }, { "epoch": 1477.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4434 }, { "epoch": 1478.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4437 }, { "epoch": 1479.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4440 }, { "epoch": 1480.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4443 }, { "epoch": 1481.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4446 }, { "epoch": 1482.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4449 }, { "epoch": 1483.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4452 }, { "epoch": 1484.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4455 }, { "epoch": 1485.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4458 }, { "epoch": 1486.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4461 }, { "epoch": 1487.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4464 }, { "epoch": 1488.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4467 }, { "epoch": 1489.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4470 }, { "epoch": 1490.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4473 }, { "epoch": 1491.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4476 }, { "epoch": 1492.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4479 }, { "epoch": 1493.29, "eval_exact_match": 0.48549323017408125, "eval_exec": 0.4874274661508704, "eval_loss": 0.5873758792877197, "eval_runtime": 99.7821, "eval_samples_per_second": 10.363, "step": 4480 }, { "epoch": 1493.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4482 }, { "epoch": 1494.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4485 }, { "epoch": 1495.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4488 }, { "epoch": 1496.88, "learning_rate": 0.0001, "loss": 0.0029, "step": 4491 }, { "epoch": 1497.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4494 }, { "epoch": 1498.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4497 }, { "epoch": 1499.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4500 }, { "epoch": 1500.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4503 }, { "epoch": 1501.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4506 }, { "epoch": 1502.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4509 }, { "epoch": 1503.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4512 }, { "epoch": 1504.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4515 }, { "epoch": 1505.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4518 }, { "epoch": 1506.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4521 }, { "epoch": 1507.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4524 }, { "epoch": 1508.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4527 }, { "epoch": 1509.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4530 }, { "epoch": 1510.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4533 }, { "epoch": 1511.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4536 }, { "epoch": 1512.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4539 }, { "epoch": 1513.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4542 }, { "epoch": 1514.59, "eval_exact_match": 0.4816247582205029, "eval_exec": 0.4796905222437137, "eval_loss": 0.603107750415802, "eval_runtime": 100.2594, "eval_samples_per_second": 10.313, "step": 4544 }, { "epoch": 1514.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4545 }, { "epoch": 1515.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4548 }, { "epoch": 1516.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4551 }, { "epoch": 1517.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4554 }, { "epoch": 1518.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4557 }, { "epoch": 1519.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4560 }, { "epoch": 1520.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4563 }, { "epoch": 1521.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4566 }, { "epoch": 1522.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4569 }, { "epoch": 1523.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4572 }, { "epoch": 1524.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4575 }, { "epoch": 1525.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4578 }, { "epoch": 1526.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4581 }, { "epoch": 1527.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4584 }, { "epoch": 1528.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4587 }, { "epoch": 1529.88, "learning_rate": 0.0001, "loss": 0.0026, "step": 4590 }, { "epoch": 1530.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4593 }, { "epoch": 1531.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4596 }, { "epoch": 1532.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4599 }, { "epoch": 1533.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4602 }, { "epoch": 1534.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4605 }, { "epoch": 1535.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4608 }, { "epoch": 1535.88, "eval_exact_match": 0.49032882011605416, "eval_exec": 0.4932301740812379, "eval_loss": 0.5945437550544739, "eval_runtime": 131.4626, "eval_samples_per_second": 7.865, "step": 4608 }, { "epoch": 1536.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4611 }, { "epoch": 1537.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4614 }, { "epoch": 1538.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4617 }, { "epoch": 1539.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4620 }, { "epoch": 1540.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4623 }, { "epoch": 1541.88, "learning_rate": 0.0001, "loss": 0.0027, "step": 4626 }, { "epoch": 1542.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4629 }, { "epoch": 1543.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4632 }, { "epoch": 1544.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4635 }, { "epoch": 1545.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4638 }, { "epoch": 1546.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4641 }, { "epoch": 1547.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4644 }, { "epoch": 1548.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4647 }, { "epoch": 1549.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4650 }, { "epoch": 1550.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4653 }, { "epoch": 1551.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4656 }, { "epoch": 1552.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4659 }, { "epoch": 1553.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4662 }, { "epoch": 1554.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4665 }, { "epoch": 1555.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4668 }, { "epoch": 1556.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4671 }, { "epoch": 1557.29, "eval_exact_match": 0.4922630560928433, "eval_exec": 0.4912959381044487, "eval_loss": 0.5930950045585632, "eval_runtime": 99.7074, "eval_samples_per_second": 10.37, "step": 4672 }, { "epoch": 1557.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4674 }, { "epoch": 1558.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4677 }, { "epoch": 1559.88, "learning_rate": 0.0001, "loss": 0.0024, "step": 4680 }, { "epoch": 1560.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4683 }, { "epoch": 1561.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4686 }, { "epoch": 1562.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4689 }, { "epoch": 1563.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4692 }, { "epoch": 1564.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4695 }, { "epoch": 1565.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4698 }, { "epoch": 1566.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4701 }, { "epoch": 1567.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4704 }, { "epoch": 1568.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4707 }, { "epoch": 1569.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4710 }, { "epoch": 1570.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4713 }, { "epoch": 1571.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4716 }, { "epoch": 1572.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4719 }, { "epoch": 1573.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4722 }, { "epoch": 1574.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4725 }, { "epoch": 1575.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4728 }, { "epoch": 1576.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4731 }, { "epoch": 1577.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4734 }, { "epoch": 1578.59, "eval_exact_match": 0.5, "eval_exec": 0.5009671179883946, "eval_loss": 0.6037657856941223, "eval_runtime": 102.1529, "eval_samples_per_second": 10.122, "step": 4736 }, { "epoch": 1578.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4737 }, { "epoch": 1579.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4740 }, { "epoch": 1580.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4743 }, { "epoch": 1581.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4746 }, { "epoch": 1582.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4749 }, { "epoch": 1583.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4752 }, { "epoch": 1584.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4755 }, { "epoch": 1585.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4758 }, { "epoch": 1586.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4761 }, { "epoch": 1587.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4764 }, { "epoch": 1588.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4767 }, { "epoch": 1589.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4770 }, { "epoch": 1590.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4773 }, { "epoch": 1591.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4776 }, { "epoch": 1592.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4779 }, { "epoch": 1593.88, "learning_rate": 0.0001, "loss": 0.0025, "step": 4782 }, { "epoch": 1594.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4785 }, { "epoch": 1595.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4788 }, { "epoch": 1596.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4791 }, { "epoch": 1597.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4794 }, { "epoch": 1598.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4797 }, { "epoch": 1599.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4800 }, { "epoch": 1599.88, "eval_exact_match": 0.49032882011605416, "eval_exec": 0.4922630560928433, "eval_loss": 0.5997296571731567, "eval_runtime": 100.5407, "eval_samples_per_second": 10.284, "step": 4800 }, { "epoch": 1600.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4803 }, { "epoch": 1601.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4806 }, { "epoch": 1602.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4809 }, { "epoch": 1603.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4812 }, { "epoch": 1604.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4815 }, { "epoch": 1605.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4818 }, { "epoch": 1606.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4821 }, { "epoch": 1607.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4824 }, { "epoch": 1608.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4827 }, { "epoch": 1609.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4830 }, { "epoch": 1610.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4833 }, { "epoch": 1611.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4836 }, { "epoch": 1612.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4839 }, { "epoch": 1613.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4842 }, { "epoch": 1614.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 4845 }, { "epoch": 1615.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4848 }, { "epoch": 1616.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4851 }, { "epoch": 1617.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4854 }, { "epoch": 1618.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4857 }, { "epoch": 1619.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4860 }, { "epoch": 1620.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4863 }, { "epoch": 1621.29, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.4932301740812379, "eval_loss": 0.6005607843399048, "eval_runtime": 103.9716, "eval_samples_per_second": 9.945, "step": 4864 }, { "epoch": 1621.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4866 }, { "epoch": 1622.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4869 }, { "epoch": 1623.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4872 }, { "epoch": 1624.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 4875 }, { "epoch": 1625.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4878 }, { "epoch": 1626.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4881 }, { "epoch": 1627.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4884 }, { "epoch": 1628.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4887 }, { "epoch": 1629.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4890 }, { "epoch": 1630.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4893 }, { "epoch": 1631.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4896 }, { "epoch": 1632.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4899 }, { "epoch": 1633.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4902 }, { "epoch": 1634.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4905 }, { "epoch": 1635.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4908 }, { "epoch": 1636.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4911 }, { "epoch": 1637.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4914 }, { "epoch": 1638.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4917 }, { "epoch": 1639.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4920 }, { "epoch": 1640.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4923 }, { "epoch": 1641.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4926 }, { "epoch": 1642.59, "eval_exact_match": 0.4961315280464217, "eval_exec": 0.4874274661508704, "eval_loss": 0.6110011339187622, "eval_runtime": 100.0167, "eval_samples_per_second": 10.338, "step": 4928 }, { "epoch": 1642.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4929 }, { "epoch": 1643.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4932 }, { "epoch": 1644.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4935 }, { "epoch": 1645.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4938 }, { "epoch": 1646.88, "learning_rate": 0.0001, "loss": 0.0023, "step": 4941 }, { "epoch": 1647.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4944 }, { "epoch": 1648.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4947 }, { "epoch": 1649.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4950 }, { "epoch": 1650.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4953 }, { "epoch": 1651.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4956 }, { "epoch": 1652.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 4959 }, { "epoch": 1653.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 4962 }, { "epoch": 1654.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4965 }, { "epoch": 1655.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4968 }, { "epoch": 1656.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4971 }, { "epoch": 1657.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 4974 }, { "epoch": 1658.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4977 }, { "epoch": 1659.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 4980 }, { "epoch": 1660.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4983 }, { "epoch": 1661.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4986 }, { "epoch": 1662.88, "learning_rate": 0.0001, "loss": 0.002, "step": 4989 }, { "epoch": 1663.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4992 }, { "epoch": 1663.88, "eval_exact_match": 0.5, "eval_exec": 0.4912959381044487, "eval_loss": 0.6110185980796814, "eval_runtime": 102.0442, "eval_samples_per_second": 10.133, "step": 4992 }, { "epoch": 1664.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4995 }, { "epoch": 1665.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 4998 }, { "epoch": 1666.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5001 }, { "epoch": 1667.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5004 }, { "epoch": 1668.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5007 }, { "epoch": 1669.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5010 }, { "epoch": 1670.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5013 }, { "epoch": 1671.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5016 }, { "epoch": 1672.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5019 }, { "epoch": 1673.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5022 }, { "epoch": 1674.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5025 }, { "epoch": 1675.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5028 }, { "epoch": 1676.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 5031 }, { "epoch": 1677.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5034 }, { "epoch": 1678.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5037 }, { "epoch": 1679.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5040 }, { "epoch": 1680.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5043 }, { "epoch": 1681.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5046 }, { "epoch": 1682.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5049 }, { "epoch": 1683.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5052 }, { "epoch": 1684.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5055 }, { "epoch": 1685.29, "eval_exact_match": 0.4825918762088975, "eval_exec": 0.4864603481624758, "eval_loss": 0.6093866229057312, "eval_runtime": 103.7246, "eval_samples_per_second": 9.969, "step": 5056 }, { "epoch": 1685.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5058 }, { "epoch": 1686.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5061 }, { "epoch": 1687.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5064 }, { "epoch": 1688.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5067 }, { "epoch": 1689.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5070 }, { "epoch": 1690.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5073 }, { "epoch": 1691.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5076 }, { "epoch": 1692.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5079 }, { "epoch": 1693.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5082 }, { "epoch": 1694.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5085 }, { "epoch": 1695.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5088 }, { "epoch": 1696.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5091 }, { "epoch": 1697.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5094 }, { "epoch": 1698.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5097 }, { "epoch": 1699.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5100 }, { "epoch": 1700.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5103 }, { "epoch": 1701.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5106 }, { "epoch": 1702.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5109 }, { "epoch": 1703.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5112 }, { "epoch": 1704.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5115 }, { "epoch": 1705.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5118 }, { "epoch": 1706.59, "eval_exact_match": 0.488394584139265, "eval_exec": 0.488394584139265, "eval_loss": 0.6172391176223755, "eval_runtime": 100.9408, "eval_samples_per_second": 10.244, "step": 5120 }, { "epoch": 1706.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5121 }, { "epoch": 1707.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5124 }, { "epoch": 1708.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5127 }, { "epoch": 1709.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 5130 }, { "epoch": 1710.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5133 }, { "epoch": 1711.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5136 }, { "epoch": 1712.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5139 }, { "epoch": 1713.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5142 }, { "epoch": 1714.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5145 }, { "epoch": 1715.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5148 }, { "epoch": 1716.88, "learning_rate": 0.0001, "loss": 0.0022, "step": 5151 }, { "epoch": 1717.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5154 }, { "epoch": 1718.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5157 }, { "epoch": 1719.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5160 }, { "epoch": 1720.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5163 }, { "epoch": 1721.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5166 }, { "epoch": 1722.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5169 }, { "epoch": 1723.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5172 }, { "epoch": 1724.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5175 }, { "epoch": 1725.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5178 }, { "epoch": 1726.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5181 }, { "epoch": 1727.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5184 }, { "epoch": 1727.88, "eval_exact_match": 0.49032882011605416, "eval_exec": 0.48452611218568664, "eval_loss": 0.6174488663673401, "eval_runtime": 103.1102, "eval_samples_per_second": 10.028, "step": 5184 }, { "epoch": 1728.88, "learning_rate": 0.0001, "loss": 0.002, "step": 5187 }, { "epoch": 1729.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5190 }, { "epoch": 1730.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5193 }, { "epoch": 1731.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5196 }, { "epoch": 1732.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5199 }, { "epoch": 1733.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5202 }, { "epoch": 1734.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5205 }, { "epoch": 1735.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5208 }, { "epoch": 1736.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5211 }, { "epoch": 1737.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5214 }, { "epoch": 1738.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5217 }, { "epoch": 1739.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5220 }, { "epoch": 1740.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5223 }, { "epoch": 1741.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5226 }, { "epoch": 1742.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5229 }, { "epoch": 1743.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5232 }, { "epoch": 1744.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5235 }, { "epoch": 1745.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5238 }, { "epoch": 1746.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5241 }, { "epoch": 1747.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5244 }, { "epoch": 1748.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5247 }, { "epoch": 1749.29, "eval_exact_match": 0.4825918762088975, "eval_exec": 0.4816247582205029, "eval_loss": 0.6244661211967468, "eval_runtime": 105.1481, "eval_samples_per_second": 9.834, "step": 5248 }, { "epoch": 1749.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5250 }, { "epoch": 1750.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5253 }, { "epoch": 1751.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5256 }, { "epoch": 1752.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 5259 }, { "epoch": 1753.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5262 }, { "epoch": 1754.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5265 }, { "epoch": 1755.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5268 }, { "epoch": 1756.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5271 }, { "epoch": 1757.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5274 }, { "epoch": 1758.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5277 }, { "epoch": 1759.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5280 }, { "epoch": 1760.88, "learning_rate": 0.0001, "loss": 0.0021, "step": 5283 }, { "epoch": 1761.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5286 }, { "epoch": 1762.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5289 }, { "epoch": 1763.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5292 }, { "epoch": 1764.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5295 }, { "epoch": 1765.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5298 }, { "epoch": 1766.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5301 }, { "epoch": 1767.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5304 }, { "epoch": 1768.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5307 }, { "epoch": 1769.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5310 }, { "epoch": 1770.59, "eval_exact_match": 0.48936170212765956, "eval_exec": 0.4864603481624758, "eval_loss": 0.6090367436408997, "eval_runtime": 104.7443, "eval_samples_per_second": 9.872, "step": 5312 }, { "epoch": 1770.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5313 }, { "epoch": 1771.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5316 }, { "epoch": 1772.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5319 }, { "epoch": 1773.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5322 }, { "epoch": 1774.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5325 }, { "epoch": 1775.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5328 }, { "epoch": 1776.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5331 }, { "epoch": 1777.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5334 }, { "epoch": 1778.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5337 }, { "epoch": 1779.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5340 }, { "epoch": 1780.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5343 }, { "epoch": 1781.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5346 }, { "epoch": 1782.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5349 }, { "epoch": 1783.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5352 }, { "epoch": 1784.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5355 }, { "epoch": 1785.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5358 }, { "epoch": 1786.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5361 }, { "epoch": 1787.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5364 }, { "epoch": 1788.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5367 }, { "epoch": 1789.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5370 }, { "epoch": 1790.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5373 }, { "epoch": 1791.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5376 }, { "epoch": 1791.88, "eval_exact_match": 0.49806576402321084, "eval_exec": 0.4961315280464217, "eval_loss": 0.6232331395149231, "eval_runtime": 102.2321, "eval_samples_per_second": 10.114, "step": 5376 }, { "epoch": 1792.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5379 }, { "epoch": 1793.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5382 }, { "epoch": 1794.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5385 }, { "epoch": 1795.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5388 }, { "epoch": 1796.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5391 }, { "epoch": 1797.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5394 }, { "epoch": 1798.88, "learning_rate": 0.0001, "loss": 0.0019, "step": 5397 }, { "epoch": 1799.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5400 }, { "epoch": 1800.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5403 }, { "epoch": 1801.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5406 }, { "epoch": 1802.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5409 }, { "epoch": 1803.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5412 }, { "epoch": 1804.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5415 }, { "epoch": 1805.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5418 }, { "epoch": 1806.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5421 }, { "epoch": 1807.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5424 }, { "epoch": 1808.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5427 }, { "epoch": 1809.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5430 }, { "epoch": 1810.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5433 }, { "epoch": 1811.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5436 }, { "epoch": 1812.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5439 }, { "epoch": 1813.29, "eval_exact_match": 0.49806576402321084, "eval_exec": 0.4941972920696325, "eval_loss": 0.6267974376678467, "eval_runtime": 100.3635, "eval_samples_per_second": 10.303, "step": 5440 }, { "epoch": 1813.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5442 }, { "epoch": 1814.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5445 }, { "epoch": 1815.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5448 }, { "epoch": 1816.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5451 }, { "epoch": 1817.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5454 }, { "epoch": 1818.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5457 }, { "epoch": 1819.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5460 }, { "epoch": 1820.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5463 }, { "epoch": 1821.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5466 }, { "epoch": 1822.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5469 }, { "epoch": 1823.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5472 }, { "epoch": 1824.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5475 }, { "epoch": 1825.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5478 }, { "epoch": 1826.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5481 }, { "epoch": 1827.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5484 }, { "epoch": 1828.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5487 }, { "epoch": 1829.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5490 }, { "epoch": 1830.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5493 }, { "epoch": 1831.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5496 }, { "epoch": 1832.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5499 }, { "epoch": 1833.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5502 }, { "epoch": 1834.59, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.4912959381044487, "eval_loss": 0.6204285025596619, "eval_runtime": 99.4678, "eval_samples_per_second": 10.395, "step": 5504 }, { "epoch": 1834.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5505 }, { "epoch": 1835.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5508 }, { "epoch": 1836.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5511 }, { "epoch": 1837.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5514 }, { "epoch": 1838.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5517 }, { "epoch": 1839.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5520 }, { "epoch": 1840.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5523 }, { "epoch": 1841.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5526 }, { "epoch": 1842.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5529 }, { "epoch": 1843.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5532 }, { "epoch": 1844.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5535 }, { "epoch": 1845.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5538 }, { "epoch": 1846.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5541 }, { "epoch": 1847.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5544 }, { "epoch": 1848.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5547 }, { "epoch": 1849.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5550 }, { "epoch": 1850.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5553 }, { "epoch": 1851.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5556 }, { "epoch": 1852.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5559 }, { "epoch": 1853.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5562 }, { "epoch": 1854.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5565 }, { "epoch": 1855.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5568 }, { "epoch": 1855.88, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.4951644100580271, "eval_loss": 0.6250240802764893, "eval_runtime": 98.8362, "eval_samples_per_second": 10.462, "step": 5568 }, { "epoch": 1856.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5571 }, { "epoch": 1857.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5574 }, { "epoch": 1858.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5577 }, { "epoch": 1859.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5580 }, { "epoch": 1860.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5583 }, { "epoch": 1861.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5586 }, { "epoch": 1862.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5589 }, { "epoch": 1863.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5592 }, { "epoch": 1864.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5595 }, { "epoch": 1865.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5598 }, { "epoch": 1866.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5601 }, { "epoch": 1867.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5604 }, { "epoch": 1868.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5607 }, { "epoch": 1869.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5610 }, { "epoch": 1870.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5613 }, { "epoch": 1871.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5616 }, { "epoch": 1872.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 5619 }, { "epoch": 1873.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5622 }, { "epoch": 1874.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5625 }, { "epoch": 1875.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5628 }, { "epoch": 1876.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5631 }, { "epoch": 1877.29, "eval_exact_match": 0.504835589941973, "eval_exec": 0.4961315280464217, "eval_loss": 0.6261150240898132, "eval_runtime": 102.3617, "eval_samples_per_second": 10.101, "step": 5632 }, { "epoch": 1877.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5634 }, { "epoch": 1878.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5637 }, { "epoch": 1879.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5640 }, { "epoch": 1880.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5643 }, { "epoch": 1881.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5646 }, { "epoch": 1882.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5649 }, { "epoch": 1883.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5652 }, { "epoch": 1884.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5655 }, { "epoch": 1885.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5658 }, { "epoch": 1886.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5661 }, { "epoch": 1887.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5664 }, { "epoch": 1888.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5667 }, { "epoch": 1889.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5670 }, { "epoch": 1890.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5673 }, { "epoch": 1891.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5676 }, { "epoch": 1892.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5679 }, { "epoch": 1893.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5682 }, { "epoch": 1894.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5685 }, { "epoch": 1895.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5688 }, { "epoch": 1896.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5691 }, { "epoch": 1897.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5694 }, { "epoch": 1898.59, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.48549323017408125, "eval_loss": 0.6312097907066345, "eval_runtime": 102.3467, "eval_samples_per_second": 10.103, "step": 5696 }, { "epoch": 1898.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5697 }, { "epoch": 1899.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5700 }, { "epoch": 1900.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5703 }, { "epoch": 1901.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5706 }, { "epoch": 1902.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5709 }, { "epoch": 1903.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5712 }, { "epoch": 1904.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5715 }, { "epoch": 1905.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5718 }, { "epoch": 1906.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5721 }, { "epoch": 1907.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5724 }, { "epoch": 1908.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5727 }, { "epoch": 1909.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5730 }, { "epoch": 1910.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5733 }, { "epoch": 1911.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5736 }, { "epoch": 1912.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5739 }, { "epoch": 1913.88, "learning_rate": 0.0001, "loss": 0.0018, "step": 5742 }, { "epoch": 1914.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5745 }, { "epoch": 1915.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5748 }, { "epoch": 1916.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5751 }, { "epoch": 1917.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5754 }, { "epoch": 1918.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5757 }, { "epoch": 1919.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5760 }, { "epoch": 1919.88, "eval_exact_match": 0.4932301740812379, "eval_exec": 0.49032882011605416, "eval_loss": 0.6297084093093872, "eval_runtime": 102.7251, "eval_samples_per_second": 10.066, "step": 5760 }, { "epoch": 1920.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5763 }, { "epoch": 1921.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5766 }, { "epoch": 1922.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5769 }, { "epoch": 1923.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5772 }, { "epoch": 1924.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5775 }, { "epoch": 1925.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5778 }, { "epoch": 1926.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5781 }, { "epoch": 1927.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5784 }, { "epoch": 1928.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5787 }, { "epoch": 1929.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5790 }, { "epoch": 1930.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5793 }, { "epoch": 1931.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5796 }, { "epoch": 1932.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5799 }, { "epoch": 1933.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5802 }, { "epoch": 1934.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5805 }, { "epoch": 1935.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5808 }, { "epoch": 1936.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5811 }, { "epoch": 1937.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5814 }, { "epoch": 1938.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5817 }, { "epoch": 1939.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5820 }, { "epoch": 1940.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5823 }, { "epoch": 1941.29, "eval_exact_match": 0.5029013539651838, "eval_exec": 0.49806576402321084, "eval_loss": 0.6355636715888977, "eval_runtime": 101.7003, "eval_samples_per_second": 10.167, "step": 5824 }, { "epoch": 1941.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5826 }, { "epoch": 1942.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 5829 }, { "epoch": 1943.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5832 }, { "epoch": 1944.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5835 }, { "epoch": 1945.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5838 }, { "epoch": 1946.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5841 }, { "epoch": 1947.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5844 }, { "epoch": 1948.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5847 }, { "epoch": 1949.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5850 }, { "epoch": 1950.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5853 }, { "epoch": 1951.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5856 }, { "epoch": 1952.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5859 }, { "epoch": 1953.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5862 }, { "epoch": 1954.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5865 }, { "epoch": 1955.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5868 }, { "epoch": 1956.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5871 }, { "epoch": 1957.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5874 }, { "epoch": 1958.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5877 }, { "epoch": 1959.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5880 }, { "epoch": 1960.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5883 }, { "epoch": 1961.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5886 }, { "epoch": 1962.59, "eval_exact_match": 0.49709864603481624, "eval_exec": 0.4941972920696325, "eval_loss": 0.6439603567123413, "eval_runtime": 98.8258, "eval_samples_per_second": 10.463, "step": 5888 }, { "epoch": 1962.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5889 }, { "epoch": 1963.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5892 }, { "epoch": 1964.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5895 }, { "epoch": 1965.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5898 }, { "epoch": 1966.88, "learning_rate": 0.0001, "loss": 0.0017, "step": 5901 }, { "epoch": 1967.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5904 }, { "epoch": 1968.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5907 }, { "epoch": 1969.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5910 }, { "epoch": 1970.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5913 }, { "epoch": 1971.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5916 }, { "epoch": 1972.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5919 }, { "epoch": 1973.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5922 }, { "epoch": 1974.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5925 }, { "epoch": 1975.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5928 }, { "epoch": 1976.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5931 }, { "epoch": 1977.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5934 }, { "epoch": 1978.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5937 }, { "epoch": 1979.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5940 }, { "epoch": 1980.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5943 }, { "epoch": 1981.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5946 }, { "epoch": 1982.88, "learning_rate": 0.0001, "loss": 0.0016, "step": 5949 }, { "epoch": 1983.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5952 }, { "epoch": 1983.88, "eval_exact_match": 0.5019342359767892, "eval_exec": 0.4932301740812379, "eval_loss": 0.6456257104873657, "eval_runtime": 103.1728, "eval_samples_per_second": 10.022, "step": 5952 }, { "epoch": 1984.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 5955 }, { "epoch": 1985.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5958 }, { "epoch": 1986.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5961 }, { "epoch": 1987.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5964 }, { "epoch": 1988.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5967 }, { "epoch": 1989.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5970 }, { "epoch": 1990.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5973 }, { "epoch": 1991.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5976 }, { "epoch": 1992.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 5979 }, { "epoch": 1993.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5982 }, { "epoch": 1994.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 5985 }, { "epoch": 1995.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5988 }, { "epoch": 1996.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5991 }, { "epoch": 1997.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 5994 }, { "epoch": 1998.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 5997 }, { "epoch": 1999.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6000 }, { "epoch": 2000.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6003 }, { "epoch": 2001.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6006 }, { "epoch": 2002.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6009 }, { "epoch": 2003.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6012 }, { "epoch": 2004.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 6015 }, { "epoch": 2005.29, "eval_exact_match": 0.4990328820116054, "eval_exec": 0.4941972920696325, "eval_loss": 0.6428639888763428, "eval_runtime": 103.19, "eval_samples_per_second": 10.02, "step": 6016 }, { "epoch": 2005.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6018 }, { "epoch": 2006.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6021 }, { "epoch": 2007.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6024 }, { "epoch": 2008.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6027 }, { "epoch": 2009.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6030 }, { "epoch": 2010.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6033 }, { "epoch": 2011.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6036 }, { "epoch": 2012.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6039 }, { "epoch": 2013.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6042 }, { "epoch": 2014.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6045 }, { "epoch": 2015.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6048 }, { "epoch": 2016.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6051 }, { "epoch": 2017.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6054 }, { "epoch": 2018.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6057 }, { "epoch": 2019.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6060 }, { "epoch": 2020.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6063 }, { "epoch": 2021.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6066 }, { "epoch": 2022.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6069 }, { "epoch": 2023.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6072 }, { "epoch": 2024.88, "learning_rate": 0.0001, "loss": 0.0015, "step": 6075 }, { "epoch": 2025.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6078 }, { "epoch": 2026.59, "eval_exact_match": 0.5067698259187621, "eval_exec": 0.4990328820116054, "eval_loss": 0.6382647156715393, "eval_runtime": 102.8692, "eval_samples_per_second": 10.052, "step": 6080 }, { "epoch": 2026.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6081 }, { "epoch": 2027.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6084 }, { "epoch": 2028.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6087 }, { "epoch": 2029.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6090 }, { "epoch": 2030.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6093 }, { "epoch": 2031.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6096 }, { "epoch": 2032.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6099 }, { "epoch": 2033.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6102 }, { "epoch": 2034.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6105 }, { "epoch": 2035.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6108 }, { "epoch": 2036.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6111 }, { "epoch": 2037.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6114 }, { "epoch": 2038.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6117 }, { "epoch": 2039.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6120 }, { "epoch": 2040.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6123 }, { "epoch": 2041.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6126 }, { "epoch": 2042.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6129 }, { "epoch": 2043.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6132 }, { "epoch": 2044.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6135 }, { "epoch": 2045.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6138 }, { "epoch": 2046.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6141 }, { "epoch": 2047.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6144 }, { "epoch": 2047.88, "eval_exact_match": 0.5009671179883946, "eval_exec": 0.4961315280464217, "eval_loss": 0.6453941464424133, "eval_runtime": 118.2755, "eval_samples_per_second": 8.742, "step": 6144 }, { "epoch": 2048.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6147 }, { "epoch": 2049.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6150 }, { "epoch": 2050.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6153 }, { "epoch": 2051.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6156 }, { "epoch": 2052.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6159 }, { "epoch": 2053.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6162 }, { "epoch": 2054.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6165 }, { "epoch": 2055.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6168 }, { "epoch": 2056.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6171 }, { "epoch": 2057.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6174 }, { "epoch": 2058.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6177 }, { "epoch": 2059.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6180 }, { "epoch": 2060.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6183 }, { "epoch": 2061.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6186 }, { "epoch": 2062.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6189 }, { "epoch": 2063.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6192 }, { "epoch": 2064.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6195 }, { "epoch": 2065.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6198 }, { "epoch": 2066.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6201 }, { "epoch": 2067.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6204 }, { "epoch": 2068.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6207 }, { "epoch": 2069.29, "eval_exact_match": 0.5067698259187621, "eval_exec": 0.49709864603481624, "eval_loss": 0.651779055595398, "eval_runtime": 105.2474, "eval_samples_per_second": 9.824, "step": 6208 }, { "epoch": 2069.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6210 }, { "epoch": 2070.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6213 }, { "epoch": 2071.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6216 }, { "epoch": 2072.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6219 }, { "epoch": 2073.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6222 }, { "epoch": 2074.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6225 }, { "epoch": 2075.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6228 }, { "epoch": 2076.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6231 }, { "epoch": 2077.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6234 }, { "epoch": 2078.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6237 }, { "epoch": 2079.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6240 }, { "epoch": 2080.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6243 }, { "epoch": 2081.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6246 }, { "epoch": 2082.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6249 }, { "epoch": 2083.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6252 }, { "epoch": 2084.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6255 }, { "epoch": 2085.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6258 }, { "epoch": 2086.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6261 }, { "epoch": 2087.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6264 }, { "epoch": 2088.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6267 }, { "epoch": 2089.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6270 }, { "epoch": 2090.59, "eval_exact_match": 0.504835589941973, "eval_exec": 0.49709864603481624, "eval_loss": 0.6524325013160706, "eval_runtime": 103.384, "eval_samples_per_second": 10.002, "step": 6272 }, { "epoch": 2090.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6273 }, { "epoch": 2091.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6276 }, { "epoch": 2092.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6279 }, { "epoch": 2093.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6282 }, { "epoch": 2094.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6285 }, { "epoch": 2095.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6288 }, { "epoch": 2096.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6291 }, { "epoch": 2097.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6294 }, { "epoch": 2098.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6297 }, { "epoch": 2099.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6300 }, { "epoch": 2100.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6303 }, { "epoch": 2101.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6306 }, { "epoch": 2102.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6309 }, { "epoch": 2103.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6312 }, { "epoch": 2104.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6315 }, { "epoch": 2105.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6318 }, { "epoch": 2106.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6321 }, { "epoch": 2107.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6324 }, { "epoch": 2108.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6327 }, { "epoch": 2109.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6330 }, { "epoch": 2110.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6333 }, { "epoch": 2111.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6336 }, { "epoch": 2111.88, "eval_exact_match": 0.5067698259187621, "eval_exec": 0.4961315280464217, "eval_loss": 0.657222330570221, "eval_runtime": 105.2034, "eval_samples_per_second": 9.829, "step": 6336 }, { "epoch": 2112.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6339 }, { "epoch": 2113.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6342 }, { "epoch": 2114.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6345 }, { "epoch": 2115.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6348 }, { "epoch": 2116.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6351 }, { "epoch": 2117.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6354 }, { "epoch": 2118.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6357 }, { "epoch": 2119.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6360 }, { "epoch": 2120.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6363 }, { "epoch": 2121.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6366 }, { "epoch": 2122.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6369 }, { "epoch": 2123.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6372 }, { "epoch": 2124.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6375 }, { "epoch": 2125.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6378 }, { "epoch": 2126.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6381 }, { "epoch": 2127.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6384 }, { "epoch": 2128.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6387 }, { "epoch": 2129.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6390 }, { "epoch": 2130.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6393 }, { "epoch": 2131.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6396 }, { "epoch": 2132.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6399 }, { "epoch": 2133.29, "eval_exact_match": 0.5029013539651838, "eval_exec": 0.4961315280464217, "eval_loss": 0.6573466062545776, "eval_runtime": 102.6054, "eval_samples_per_second": 10.077, "step": 6400 }, { "epoch": 2133.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6402 }, { "epoch": 2134.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6405 }, { "epoch": 2135.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6408 }, { "epoch": 2136.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6411 }, { "epoch": 2137.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6414 }, { "epoch": 2138.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6417 }, { "epoch": 2139.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6420 }, { "epoch": 2140.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6423 }, { "epoch": 2141.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6426 }, { "epoch": 2142.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6429 }, { "epoch": 2143.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6432 }, { "epoch": 2144.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6435 }, { "epoch": 2145.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6438 }, { "epoch": 2146.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6441 }, { "epoch": 2147.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6444 }, { "epoch": 2148.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6447 }, { "epoch": 2149.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6450 }, { "epoch": 2150.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6453 }, { "epoch": 2151.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6456 }, { "epoch": 2152.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6459 }, { "epoch": 2153.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6462 }, { "epoch": 2154.59, "eval_exact_match": 0.5125725338491296, "eval_exec": 0.4990328820116054, "eval_loss": 0.6498933434486389, "eval_runtime": 103.9046, "eval_samples_per_second": 9.951, "step": 6464 }, { "epoch": 2154.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6465 }, { "epoch": 2155.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6468 }, { "epoch": 2156.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6471 }, { "epoch": 2157.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6474 }, { "epoch": 2158.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6477 }, { "epoch": 2159.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6480 }, { "epoch": 2160.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6483 }, { "epoch": 2161.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6486 }, { "epoch": 2162.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6489 }, { "epoch": 2163.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6492 }, { "epoch": 2164.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6495 }, { "epoch": 2165.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6498 }, { "epoch": 2166.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6501 }, { "epoch": 2167.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6504 }, { "epoch": 2168.88, "learning_rate": 0.0001, "loss": 0.0014, "step": 6507 }, { "epoch": 2169.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6510 }, { "epoch": 2170.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6513 }, { "epoch": 2171.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6516 }, { "epoch": 2172.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6519 }, { "epoch": 2173.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6522 }, { "epoch": 2174.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6525 }, { "epoch": 2175.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6528 }, { "epoch": 2175.88, "eval_exact_match": 0.5096711798839458, "eval_exec": 0.5, "eval_loss": 0.6579024195671082, "eval_runtime": 103.7204, "eval_samples_per_second": 9.969, "step": 6528 }, { "epoch": 2176.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6531 }, { "epoch": 2177.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6534 }, { "epoch": 2178.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6537 }, { "epoch": 2179.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6540 }, { "epoch": 2180.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6543 }, { "epoch": 2181.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6546 }, { "epoch": 2182.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6549 }, { "epoch": 2183.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6552 }, { "epoch": 2184.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6555 }, { "epoch": 2185.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6558 }, { "epoch": 2186.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6561 }, { "epoch": 2187.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6564 }, { "epoch": 2188.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6567 }, { "epoch": 2189.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6570 }, { "epoch": 2190.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6573 }, { "epoch": 2191.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6576 }, { "epoch": 2192.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6579 }, { "epoch": 2193.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6582 }, { "epoch": 2194.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6585 }, { "epoch": 2195.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6588 }, { "epoch": 2196.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6591 }, { "epoch": 2197.29, "eval_exact_match": 0.5067698259187621, "eval_exec": 0.4990328820116054, "eval_loss": 0.6636134386062622, "eval_runtime": 104.9592, "eval_samples_per_second": 9.851, "step": 6592 }, { "epoch": 2197.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6594 }, { "epoch": 2198.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6597 }, { "epoch": 2199.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6600 }, { "epoch": 2200.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6603 }, { "epoch": 2201.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6606 }, { "epoch": 2202.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6609 }, { "epoch": 2203.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6612 }, { "epoch": 2204.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6615 }, { "epoch": 2205.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6618 }, { "epoch": 2206.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6621 }, { "epoch": 2207.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6624 }, { "epoch": 2208.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6627 }, { "epoch": 2209.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6630 }, { "epoch": 2210.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6633 }, { "epoch": 2211.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6636 }, { "epoch": 2212.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6639 }, { "epoch": 2213.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6642 }, { "epoch": 2214.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6645 }, { "epoch": 2215.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6648 }, { "epoch": 2216.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6651 }, { "epoch": 2217.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6654 }, { "epoch": 2218.59, "eval_exact_match": 0.5029013539651838, "eval_exec": 0.4951644100580271, "eval_loss": 0.6537144780158997, "eval_runtime": 101.4907, "eval_samples_per_second": 10.188, "step": 6656 }, { "epoch": 2218.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6657 }, { "epoch": 2219.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6660 }, { "epoch": 2220.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6663 }, { "epoch": 2221.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6666 }, { "epoch": 2222.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6669 }, { "epoch": 2223.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6672 }, { "epoch": 2224.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6675 }, { "epoch": 2225.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6678 }, { "epoch": 2226.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6681 }, { "epoch": 2227.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6684 }, { "epoch": 2228.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6687 }, { "epoch": 2229.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6690 }, { "epoch": 2230.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6693 }, { "epoch": 2231.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6696 }, { "epoch": 2232.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6699 }, { "epoch": 2233.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6702 }, { "epoch": 2234.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6705 }, { "epoch": 2235.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6708 }, { "epoch": 2236.88, "learning_rate": 0.0001, "loss": 0.0013, "step": 6711 }, { "epoch": 2237.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6714 }, { "epoch": 2238.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6717 }, { "epoch": 2239.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6720 }, { "epoch": 2239.88, "eval_exact_match": 0.511605415860735, "eval_exec": 0.5019342359767892, "eval_loss": 0.6580149531364441, "eval_runtime": 101.3481, "eval_samples_per_second": 10.202, "step": 6720 }, { "epoch": 2240.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6723 }, { "epoch": 2241.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6726 }, { "epoch": 2242.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6729 }, { "epoch": 2243.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6732 }, { "epoch": 2244.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6735 }, { "epoch": 2245.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6738 }, { "epoch": 2246.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6741 }, { "epoch": 2247.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6744 }, { "epoch": 2248.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6747 }, { "epoch": 2249.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6750 }, { "epoch": 2250.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6753 }, { "epoch": 2251.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6756 }, { "epoch": 2252.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6759 }, { "epoch": 2253.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6762 }, { "epoch": 2254.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6765 }, { "epoch": 2255.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6768 }, { "epoch": 2256.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6771 }, { "epoch": 2257.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6774 }, { "epoch": 2258.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6777 }, { "epoch": 2259.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6780 }, { "epoch": 2260.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6783 }, { "epoch": 2261.29, "eval_exact_match": 0.49806576402321084, "eval_exec": 0.4922630560928433, "eval_loss": 0.656693696975708, "eval_runtime": 103.6205, "eval_samples_per_second": 9.979, "step": 6784 }, { "epoch": 2261.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6786 }, { "epoch": 2262.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6789 }, { "epoch": 2263.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6792 }, { "epoch": 2264.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6795 }, { "epoch": 2265.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6798 }, { "epoch": 2266.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6801 }, { "epoch": 2267.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6804 }, { "epoch": 2268.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6807 }, { "epoch": 2269.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6810 }, { "epoch": 2270.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6813 }, { "epoch": 2271.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6816 }, { "epoch": 2272.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6819 }, { "epoch": 2273.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6822 }, { "epoch": 2274.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6825 }, { "epoch": 2275.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6828 }, { "epoch": 2276.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6831 }, { "epoch": 2277.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6834 }, { "epoch": 2278.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6837 }, { "epoch": 2279.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6840 }, { "epoch": 2280.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6843 }, { "epoch": 2281.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6846 }, { "epoch": 2282.59, "eval_exact_match": 0.49709864603481624, "eval_exec": 0.4912959381044487, "eval_loss": 0.6702226996421814, "eval_runtime": 100.3881, "eval_samples_per_second": 10.3, "step": 6848 }, { "epoch": 2282.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6849 }, { "epoch": 2283.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6852 }, { "epoch": 2284.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6855 }, { "epoch": 2285.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6858 }, { "epoch": 2286.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6861 }, { "epoch": 2287.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6864 }, { "epoch": 2288.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6867 }, { "epoch": 2289.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6870 }, { "epoch": 2290.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6873 }, { "epoch": 2291.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 6876 }, { "epoch": 2292.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6879 }, { "epoch": 2293.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6882 }, { "epoch": 2294.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6885 }, { "epoch": 2295.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6888 }, { "epoch": 2296.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6891 }, { "epoch": 2297.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6894 }, { "epoch": 2298.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6897 }, { "epoch": 2299.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6900 }, { "epoch": 2300.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6903 }, { "epoch": 2301.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6906 }, { "epoch": 2302.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6909 }, { "epoch": 2303.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6912 }, { "epoch": 2303.88, "eval_exact_match": 0.49806576402321084, "eval_exec": 0.49032882011605416, "eval_loss": 0.6657952666282654, "eval_runtime": 102.7872, "eval_samples_per_second": 10.06, "step": 6912 }, { "epoch": 2304.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6915 }, { "epoch": 2305.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6918 }, { "epoch": 2306.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6921 }, { "epoch": 2307.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6924 }, { "epoch": 2308.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6927 }, { "epoch": 2309.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 6930 }, { "epoch": 2310.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6933 }, { "epoch": 2311.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6936 }, { "epoch": 2312.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6939 }, { "epoch": 2313.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6942 }, { "epoch": 2314.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6945 }, { "epoch": 2315.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6948 }, { "epoch": 2316.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6951 }, { "epoch": 2317.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6954 }, { "epoch": 2318.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6957 }, { "epoch": 2319.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6960 }, { "epoch": 2320.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6963 }, { "epoch": 2321.88, "learning_rate": 0.0001, "loss": 0.0012, "step": 6966 }, { "epoch": 2322.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6969 }, { "epoch": 2323.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6972 }, { "epoch": 2324.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6975 }, { "epoch": 2325.29, "eval_exact_match": 0.4951644100580271, "eval_exec": 0.4951644100580271, "eval_loss": 0.6729605197906494, "eval_runtime": 101.8227, "eval_samples_per_second": 10.155, "step": 6976 }, { "epoch": 2325.88, "learning_rate": 0.0001, "loss": 0.001, "step": 6978 }, { "epoch": 2326.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6981 }, { "epoch": 2327.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6984 }, { "epoch": 2328.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6987 }, { "epoch": 2329.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 6990 }, { "epoch": 2330.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 6993 }, { "epoch": 2331.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 6996 }, { "epoch": 2332.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 6999 }, { "epoch": 2333.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7002 }, { "epoch": 2334.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7005 }, { "epoch": 2335.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7008 }, { "epoch": 2336.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7011 }, { "epoch": 2337.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7014 }, { "epoch": 2338.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7017 }, { "epoch": 2339.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7020 }, { "epoch": 2340.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7023 }, { "epoch": 2341.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7026 }, { "epoch": 2342.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7029 }, { "epoch": 2343.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7032 }, { "epoch": 2344.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7035 }, { "epoch": 2345.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7038 }, { "epoch": 2346.59, "eval_exact_match": 0.5038684719535783, "eval_exec": 0.5, "eval_loss": 0.6706193685531616, "eval_runtime": 107.1601, "eval_samples_per_second": 9.649, "step": 7040 }, { "epoch": 2346.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7041 }, { "epoch": 2347.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7044 }, { "epoch": 2348.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7047 }, { "epoch": 2349.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7050 }, { "epoch": 2350.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7053 }, { "epoch": 2351.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7056 }, { "epoch": 2352.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7059 }, { "epoch": 2353.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7062 }, { "epoch": 2354.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7065 }, { "epoch": 2355.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7068 }, { "epoch": 2356.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7071 }, { "epoch": 2357.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7074 }, { "epoch": 2358.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7077 }, { "epoch": 2359.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7080 }, { "epoch": 2360.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7083 }, { "epoch": 2361.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7086 }, { "epoch": 2362.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7089 }, { "epoch": 2363.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7092 }, { "epoch": 2364.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7095 }, { "epoch": 2365.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7098 }, { "epoch": 2366.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7101 }, { "epoch": 2367.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7104 }, { "epoch": 2367.88, "eval_exact_match": 0.5058027079303675, "eval_exec": 0.49709864603481624, "eval_loss": 0.6719130277633667, "eval_runtime": 103.7435, "eval_samples_per_second": 9.967, "step": 7104 }, { "epoch": 2368.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7107 }, { "epoch": 2369.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7110 }, { "epoch": 2370.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7113 }, { "epoch": 2371.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7116 }, { "epoch": 2372.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7119 }, { "epoch": 2373.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7122 }, { "epoch": 2374.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7125 }, { "epoch": 2375.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7128 }, { "epoch": 2376.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7131 }, { "epoch": 2377.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7134 }, { "epoch": 2378.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7137 }, { "epoch": 2379.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7140 }, { "epoch": 2380.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7143 }, { "epoch": 2381.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7146 }, { "epoch": 2382.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7149 }, { "epoch": 2383.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7152 }, { "epoch": 2384.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7155 }, { "epoch": 2385.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7158 }, { "epoch": 2386.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7161 }, { "epoch": 2387.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7164 }, { "epoch": 2388.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7167 }, { "epoch": 2389.29, "eval_exact_match": 0.5, "eval_exec": 0.49032882011605416, "eval_loss": 0.6656604409217834, "eval_runtime": 110.2501, "eval_samples_per_second": 9.379, "step": 7168 }, { "epoch": 2389.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7170 }, { "epoch": 2390.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7173 }, { "epoch": 2391.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7176 }, { "epoch": 2392.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7179 }, { "epoch": 2393.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7182 }, { "epoch": 2394.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7185 }, { "epoch": 2395.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7188 }, { "epoch": 2396.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7191 }, { "epoch": 2397.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7194 }, { "epoch": 2398.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7197 }, { "epoch": 2399.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7200 }, { "epoch": 2400.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7203 }, { "epoch": 2401.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7206 }, { "epoch": 2402.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7209 }, { "epoch": 2403.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7212 }, { "epoch": 2404.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7215 }, { "epoch": 2405.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7218 }, { "epoch": 2406.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7221 }, { "epoch": 2407.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7224 }, { "epoch": 2408.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7227 }, { "epoch": 2409.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7230 }, { "epoch": 2410.59, "eval_exact_match": 0.5067698259187621, "eval_exec": 0.49806576402321084, "eval_loss": 0.6692262291908264, "eval_runtime": 107.2383, "eval_samples_per_second": 9.642, "step": 7232 }, { "epoch": 2410.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7233 }, { "epoch": 2411.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7236 }, { "epoch": 2412.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7239 }, { "epoch": 2413.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7242 }, { "epoch": 2414.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7245 }, { "epoch": 2415.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7248 }, { "epoch": 2416.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7251 }, { "epoch": 2417.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7254 }, { "epoch": 2418.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7257 }, { "epoch": 2419.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7260 }, { "epoch": 2420.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7263 }, { "epoch": 2421.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7266 }, { "epoch": 2422.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7269 }, { "epoch": 2423.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7272 }, { "epoch": 2424.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7275 }, { "epoch": 2425.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7278 }, { "epoch": 2426.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7281 }, { "epoch": 2427.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7284 }, { "epoch": 2428.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7287 }, { "epoch": 2429.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7290 }, { "epoch": 2430.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7293 }, { "epoch": 2431.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7296 }, { "epoch": 2431.88, "eval_exact_match": 0.5038684719535783, "eval_exec": 0.4912959381044487, "eval_loss": 0.672451376914978, "eval_runtime": 102.0344, "eval_samples_per_second": 10.134, "step": 7296 }, { "epoch": 2432.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7299 }, { "epoch": 2433.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7302 }, { "epoch": 2434.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7305 }, { "epoch": 2435.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7308 }, { "epoch": 2436.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7311 }, { "epoch": 2437.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7314 }, { "epoch": 2438.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7317 }, { "epoch": 2439.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7320 }, { "epoch": 2440.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7323 }, { "epoch": 2441.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7326 }, { "epoch": 2442.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7329 }, { "epoch": 2443.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7332 }, { "epoch": 2444.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7335 }, { "epoch": 2445.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7338 }, { "epoch": 2446.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7341 }, { "epoch": 2447.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7344 }, { "epoch": 2448.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7347 }, { "epoch": 2449.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7350 }, { "epoch": 2450.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7353 }, { "epoch": 2451.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7356 }, { "epoch": 2452.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7359 }, { "epoch": 2453.29, "eval_exact_match": 0.5087040618955513, "eval_exec": 0.4941972920696325, "eval_loss": 0.6790467500686646, "eval_runtime": 105.5575, "eval_samples_per_second": 9.796, "step": 7360 }, { "epoch": 2453.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7362 }, { "epoch": 2454.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7365 }, { "epoch": 2455.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7368 }, { "epoch": 2456.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7371 }, { "epoch": 2457.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7374 }, { "epoch": 2458.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7377 }, { "epoch": 2459.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7380 }, { "epoch": 2460.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7383 }, { "epoch": 2461.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7386 }, { "epoch": 2462.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7389 }, { "epoch": 2463.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7392 }, { "epoch": 2464.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7395 }, { "epoch": 2465.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7398 }, { "epoch": 2466.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7401 }, { "epoch": 2467.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7404 }, { "epoch": 2468.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7407 }, { "epoch": 2469.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7410 }, { "epoch": 2470.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7413 }, { "epoch": 2471.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7416 }, { "epoch": 2472.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7419 }, { "epoch": 2473.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7422 }, { "epoch": 2474.59, "eval_exact_match": 0.5087040618955513, "eval_exec": 0.4990328820116054, "eval_loss": 0.6767649054527283, "eval_runtime": 101.2746, "eval_samples_per_second": 10.21, "step": 7424 }, { "epoch": 2474.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7425 }, { "epoch": 2475.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7428 }, { "epoch": 2476.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7431 }, { "epoch": 2477.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7434 }, { "epoch": 2478.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7437 }, { "epoch": 2479.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7440 }, { "epoch": 2480.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7443 }, { "epoch": 2481.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7446 }, { "epoch": 2482.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7449 }, { "epoch": 2483.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7452 }, { "epoch": 2484.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7455 }, { "epoch": 2485.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7458 }, { "epoch": 2486.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7461 }, { "epoch": 2487.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7464 }, { "epoch": 2488.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7467 }, { "epoch": 2489.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7470 }, { "epoch": 2490.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7473 }, { "epoch": 2491.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7476 }, { "epoch": 2492.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7479 }, { "epoch": 2493.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7482 }, { "epoch": 2494.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7485 }, { "epoch": 2495.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7488 }, { "epoch": 2495.88, "eval_exact_match": 0.5029013539651838, "eval_exec": 0.49806576402321084, "eval_loss": 0.6734866499900818, "eval_runtime": 98.1491, "eval_samples_per_second": 10.535, "step": 7488 }, { "epoch": 2496.88, "learning_rate": 0.0001, "loss": 0.0011, "step": 7491 }, { "epoch": 2497.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7494 }, { "epoch": 2498.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7497 }, { "epoch": 2499.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7500 }, { "epoch": 2500.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7503 }, { "epoch": 2501.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7506 }, { "epoch": 2502.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7509 }, { "epoch": 2503.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7512 }, { "epoch": 2504.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7515 }, { "epoch": 2505.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7518 }, { "epoch": 2506.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7521 }, { "epoch": 2507.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7524 }, { "epoch": 2508.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7527 }, { "epoch": 2509.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7530 }, { "epoch": 2510.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7533 }, { "epoch": 2511.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7536 }, { "epoch": 2512.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7539 }, { "epoch": 2513.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7542 }, { "epoch": 2514.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7545 }, { "epoch": 2515.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7548 }, { "epoch": 2516.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7551 }, { "epoch": 2517.29, "eval_exact_match": 0.5058027079303675, "eval_exec": 0.4951644100580271, "eval_loss": 0.6706563830375671, "eval_runtime": 104.1289, "eval_samples_per_second": 9.93, "step": 7552 }, { "epoch": 2517.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7554 }, { "epoch": 2518.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7557 }, { "epoch": 2519.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7560 }, { "epoch": 2520.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7563 }, { "epoch": 2521.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7566 }, { "epoch": 2522.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7569 }, { "epoch": 2523.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7572 }, { "epoch": 2524.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7575 }, { "epoch": 2525.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7578 }, { "epoch": 2526.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7581 }, { "epoch": 2527.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7584 }, { "epoch": 2528.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7587 }, { "epoch": 2529.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7590 }, { "epoch": 2530.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7593 }, { "epoch": 2531.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7596 }, { "epoch": 2532.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7599 }, { "epoch": 2533.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7602 }, { "epoch": 2534.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7605 }, { "epoch": 2535.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7608 }, { "epoch": 2536.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7611 }, { "epoch": 2537.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7614 }, { "epoch": 2538.59, "eval_exact_match": 0.5135396518375241, "eval_exec": 0.4951644100580271, "eval_loss": 0.6734728813171387, "eval_runtime": 103.6866, "eval_samples_per_second": 9.972, "step": 7616 }, { "epoch": 2538.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7617 }, { "epoch": 2539.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7620 }, { "epoch": 2540.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7623 }, { "epoch": 2541.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7626 }, { "epoch": 2542.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7629 }, { "epoch": 2543.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7632 }, { "epoch": 2544.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7635 }, { "epoch": 2545.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7638 }, { "epoch": 2546.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7641 }, { "epoch": 2547.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7644 }, { "epoch": 2548.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7647 }, { "epoch": 2549.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7650 }, { "epoch": 2550.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7653 }, { "epoch": 2551.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7656 }, { "epoch": 2552.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7659 }, { "epoch": 2553.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7662 }, { "epoch": 2554.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7665 }, { "epoch": 2555.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7668 }, { "epoch": 2556.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7671 }, { "epoch": 2557.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7674 }, { "epoch": 2558.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7677 }, { "epoch": 2559.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7680 }, { "epoch": 2559.88, "eval_exact_match": 0.4951644100580271, "eval_exec": 0.4922630560928433, "eval_loss": 0.6788745522499084, "eval_runtime": 100.2149, "eval_samples_per_second": 10.318, "step": 7680 }, { "epoch": 2560.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7683 }, { "epoch": 2561.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7686 }, { "epoch": 2562.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7689 }, { "epoch": 2563.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7692 }, { "epoch": 2564.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7695 }, { "epoch": 2565.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7698 }, { "epoch": 2566.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7701 }, { "epoch": 2567.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7704 }, { "epoch": 2568.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7707 }, { "epoch": 2569.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7710 }, { "epoch": 2570.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7713 }, { "epoch": 2571.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7716 }, { "epoch": 2572.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7719 }, { "epoch": 2573.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7722 }, { "epoch": 2574.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7725 }, { "epoch": 2575.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7728 }, { "epoch": 2576.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7731 }, { "epoch": 2577.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7734 }, { "epoch": 2578.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7737 }, { "epoch": 2579.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7740 }, { "epoch": 2580.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7743 }, { "epoch": 2581.29, "eval_exact_match": 0.5, "eval_exec": 0.488394584139265, "eval_loss": 0.6870007514953613, "eval_runtime": 103.442, "eval_samples_per_second": 9.996, "step": 7744 }, { "epoch": 2581.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7746 }, { "epoch": 2582.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7749 }, { "epoch": 2583.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7752 }, { "epoch": 2584.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7755 }, { "epoch": 2585.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7758 }, { "epoch": 2586.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7761 }, { "epoch": 2587.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7764 }, { "epoch": 2588.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7767 }, { "epoch": 2589.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7770 }, { "epoch": 2590.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7773 }, { "epoch": 2591.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7776 }, { "epoch": 2592.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7779 }, { "epoch": 2593.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7782 }, { "epoch": 2594.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7785 }, { "epoch": 2595.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7788 }, { "epoch": 2596.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7791 }, { "epoch": 2597.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7794 }, { "epoch": 2598.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7797 }, { "epoch": 2599.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7800 }, { "epoch": 2600.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7803 }, { "epoch": 2601.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7806 }, { "epoch": 2602.59, "eval_exact_match": 0.5125725338491296, "eval_exec": 0.49806576402321084, "eval_loss": 0.6841245889663696, "eval_runtime": 100.6823, "eval_samples_per_second": 10.27, "step": 7808 }, { "epoch": 2602.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7809 }, { "epoch": 2603.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7812 }, { "epoch": 2604.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7815 }, { "epoch": 2605.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7818 }, { "epoch": 2606.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7821 }, { "epoch": 2607.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7824 }, { "epoch": 2608.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7827 }, { "epoch": 2609.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7830 }, { "epoch": 2610.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7833 }, { "epoch": 2611.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7836 }, { "epoch": 2612.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 7839 }, { "epoch": 2613.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7842 }, { "epoch": 2614.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7845 }, { "epoch": 2615.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7848 }, { "epoch": 2616.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7851 }, { "epoch": 2617.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7854 }, { "epoch": 2618.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7857 }, { "epoch": 2619.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7860 }, { "epoch": 2620.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7863 }, { "epoch": 2621.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7866 }, { "epoch": 2622.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7869 }, { "epoch": 2623.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7872 }, { "epoch": 2623.88, "eval_exact_match": 0.5058027079303675, "eval_exec": 0.4922630560928433, "eval_loss": 0.6852383017539978, "eval_runtime": 102.8761, "eval_samples_per_second": 10.051, "step": 7872 }, { "epoch": 2624.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7875 }, { "epoch": 2625.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7878 }, { "epoch": 2626.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7881 }, { "epoch": 2627.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7884 }, { "epoch": 2628.88, "learning_rate": 0.0001, "loss": 0.0005, "step": 7887 }, { "epoch": 2629.88, "learning_rate": 0.0001, "loss": 0.001, "step": 7890 }, { "epoch": 2630.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7893 }, { "epoch": 2631.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7896 }, { "epoch": 2632.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7899 }, { "epoch": 2633.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7902 }, { "epoch": 2634.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7905 }, { "epoch": 2635.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7908 }, { "epoch": 2636.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7911 }, { "epoch": 2637.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7914 }, { "epoch": 2638.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7917 }, { "epoch": 2639.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7920 }, { "epoch": 2640.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7923 }, { "epoch": 2641.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7926 }, { "epoch": 2642.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7929 }, { "epoch": 2643.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7932 }, { "epoch": 2644.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7935 }, { "epoch": 2645.29, "eval_exact_match": 0.5087040618955513, "eval_exec": 0.5, "eval_loss": 0.678929328918457, "eval_runtime": 101.2205, "eval_samples_per_second": 10.215, "step": 7936 }, { "epoch": 2645.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7938 }, { "epoch": 2646.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7941 }, { "epoch": 2647.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7944 }, { "epoch": 2648.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7947 }, { "epoch": 2649.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7950 }, { "epoch": 2650.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7953 }, { "epoch": 2651.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7956 }, { "epoch": 2652.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7959 }, { "epoch": 2653.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7962 }, { "epoch": 2654.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7965 }, { "epoch": 2655.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7968 }, { "epoch": 2656.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7971 }, { "epoch": 2657.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7974 }, { "epoch": 2658.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7977 }, { "epoch": 2659.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7980 }, { "epoch": 2660.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7983 }, { "epoch": 2661.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7986 }, { "epoch": 2662.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7989 }, { "epoch": 2663.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 7992 }, { "epoch": 2664.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 7995 }, { "epoch": 2665.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 7998 }, { "epoch": 2666.59, "eval_exact_match": 0.5125725338491296, "eval_exec": 0.5029013539651838, "eval_loss": 0.6847764849662781, "eval_runtime": 104.2805, "eval_samples_per_second": 9.916, "step": 8000 }, { "epoch": 2666.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8001 }, { "epoch": 2667.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8004 }, { "epoch": 2668.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8007 }, { "epoch": 2669.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8010 }, { "epoch": 2670.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8013 }, { "epoch": 2671.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8016 }, { "epoch": 2672.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8019 }, { "epoch": 2673.88, "learning_rate": 0.0001, "loss": 0.0005, "step": 8022 }, { "epoch": 2674.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8025 }, { "epoch": 2675.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8028 }, { "epoch": 2676.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8031 }, { "epoch": 2677.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8034 }, { "epoch": 2678.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8037 }, { "epoch": 2679.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8040 }, { "epoch": 2680.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8043 }, { "epoch": 2681.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8046 }, { "epoch": 2682.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8049 }, { "epoch": 2683.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8052 }, { "epoch": 2684.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8055 }, { "epoch": 2685.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8058 }, { "epoch": 2686.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8061 }, { "epoch": 2687.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8064 }, { "epoch": 2687.88, "eval_exact_match": 0.5058027079303675, "eval_exec": 0.5, "eval_loss": 0.6950146555900574, "eval_runtime": 103.8342, "eval_samples_per_second": 9.958, "step": 8064 }, { "epoch": 2688.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8067 }, { "epoch": 2689.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8070 }, { "epoch": 2690.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8073 }, { "epoch": 2691.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8076 }, { "epoch": 2692.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8079 }, { "epoch": 2693.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8082 }, { "epoch": 2694.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8085 }, { "epoch": 2695.88, "learning_rate": 0.0001, "loss": 0.0009, "step": 8088 }, { "epoch": 2696.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8091 }, { "epoch": 2697.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8094 }, { "epoch": 2698.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8097 }, { "epoch": 2699.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8100 }, { "epoch": 2700.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8103 }, { "epoch": 2701.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8106 }, { "epoch": 2702.88, "learning_rate": 0.0001, "loss": 0.0005, "step": 8109 }, { "epoch": 2703.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8112 }, { "epoch": 2704.88, "learning_rate": 0.0001, "loss": 0.0005, "step": 8115 }, { "epoch": 2705.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8118 }, { "epoch": 2706.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8121 }, { "epoch": 2707.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8124 }, { "epoch": 2708.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8127 }, { "epoch": 2709.29, "eval_exact_match": 0.4990328820116054, "eval_exec": 0.4874274661508704, "eval_loss": 0.6891441941261292, "eval_runtime": 107.0055, "eval_samples_per_second": 9.663, "step": 8128 }, { "epoch": 2709.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8130 }, { "epoch": 2710.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8133 }, { "epoch": 2711.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8136 }, { "epoch": 2712.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8139 }, { "epoch": 2713.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8142 }, { "epoch": 2714.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8145 }, { "epoch": 2715.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8148 }, { "epoch": 2716.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8151 }, { "epoch": 2717.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8154 }, { "epoch": 2718.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8157 }, { "epoch": 2719.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8160 }, { "epoch": 2720.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8163 }, { "epoch": 2721.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8166 }, { "epoch": 2722.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8169 }, { "epoch": 2723.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8172 }, { "epoch": 2724.88, "learning_rate": 0.0001, "loss": 0.0008, "step": 8175 }, { "epoch": 2725.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8178 }, { "epoch": 2726.88, "learning_rate": 0.0001, "loss": 0.0007, "step": 8181 }, { "epoch": 2727.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8184 }, { "epoch": 2728.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8187 }, { "epoch": 2729.88, "learning_rate": 0.0001, "loss": 0.0006, "step": 8190 }, { "epoch": 2730.59, "eval_exact_match": 0.5174081237911026, "eval_exec": 0.5067698259187621, "eval_loss": 0.6930547952651978, "eval_runtime": 100.8541, "eval_samples_per_second": 10.252, "step": 8192 } ], "max_steps": 9216, "num_train_epochs": 3072, "total_flos": 1.627321267788972e+18, "trial_name": null, "trial_params": null }