{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0004804814424052901, "eval_steps": 6, "global_step": 60, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 8.008024040088168e-06, "grad_norm": 282.1022644042969, "learning_rate": 0.0, "loss": 7.5794, "num_input_tokens_seen": 406, "step": 1, "train_runtime": 5.5308, "train_tokens_per_second": 73.407 }, { "epoch": 1.6016048080176336e-05, "grad_norm": 367.8074645996094, "learning_rate": 4.000000000000001e-06, "loss": 7.2589, "num_input_tokens_seen": 798, "step": 2, "train_runtime": 6.2015, "train_tokens_per_second": 128.678 }, { "epoch": 2.4024072120264505e-05, "grad_norm": 183.4268035888672, "learning_rate": 8.000000000000001e-06, "loss": 7.2901, "num_input_tokens_seen": 1236, "step": 3, "train_runtime": 6.8675, "train_tokens_per_second": 179.978 }, { "epoch": 3.203209616035267e-05, "grad_norm": 157.8712158203125, "learning_rate": 1.2e-05, "loss": 4.8904, "num_input_tokens_seen": 1676, "step": 4, "train_runtime": 7.5348, "train_tokens_per_second": 222.434 }, { "epoch": 4.0040120200440844e-05, "grad_norm": 153.35537719726562, "learning_rate": 1.6000000000000003e-05, "loss": 4.4882, "num_input_tokens_seen": 2068, "step": 5, "train_runtime": 8.1988, "train_tokens_per_second": 252.231 }, { "epoch": 4.804814424052901e-05, "grad_norm": 154.29891967773438, "learning_rate": 2e-05, "loss": 4.2164, "num_input_tokens_seen": 2496, "step": 6, "train_runtime": 8.8628, "train_tokens_per_second": 281.628 }, { "epoch": 4.804814424052901e-05, "eval_loss": 3.4333748817443848, "eval_runtime": 17.1905, "eval_samples_per_second": 58.172, "eval_steps_per_second": 29.086, "num_input_tokens_seen": 2496, "step": 6 }, { "epoch": 5.605616828061718e-05, "grad_norm": 43.233089447021484, "learning_rate": 1.963636363636364e-05, "loss": 2.0546, "num_input_tokens_seen": 3238, "step": 7, "train_runtime": 26.7603, "train_tokens_per_second": 121.0 }, { "epoch": 6.406419232070534e-05, "grad_norm": 41.88556671142578, "learning_rate": 1.9272727272727275e-05, "loss": 2.372, "num_input_tokens_seen": 3828, "step": 8, "train_runtime": 27.4263, "train_tokens_per_second": 139.574 }, { "epoch": 7.207221636079351e-05, "grad_norm": 48.73846435546875, "learning_rate": 1.8909090909090912e-05, "loss": 2.7182, "num_input_tokens_seen": 4280, "step": 9, "train_runtime": 28.0921, "train_tokens_per_second": 152.356 }, { "epoch": 8.008024040088169e-05, "grad_norm": 46.16472244262695, "learning_rate": 1.8545454545454545e-05, "loss": 2.7735, "num_input_tokens_seen": 4702, "step": 10, "train_runtime": 28.7563, "train_tokens_per_second": 163.512 }, { "epoch": 8.808826444096985e-05, "grad_norm": 25.96290397644043, "learning_rate": 1.8181818181818182e-05, "loss": 1.8736, "num_input_tokens_seen": 5366, "step": 11, "train_runtime": 29.4216, "train_tokens_per_second": 182.383 }, { "epoch": 9.609628848105802e-05, "grad_norm": 35.26546096801758, "learning_rate": 1.781818181818182e-05, "loss": 2.4054, "num_input_tokens_seen": 5898, "step": 12, "train_runtime": 30.0864, "train_tokens_per_second": 196.036 }, { "epoch": 9.609628848105802e-05, "eval_loss": 2.551903486251831, "eval_runtime": 16.1332, "eval_samples_per_second": 61.984, "eval_steps_per_second": 30.992, "num_input_tokens_seen": 5898, "step": 12 }, { "epoch": 0.00010410431252114619, "grad_norm": 45.30570983886719, "learning_rate": 1.7454545454545456e-05, "loss": 2.6956, "num_input_tokens_seen": 6368, "step": 13, "train_runtime": 46.917, "train_tokens_per_second": 135.729 }, { "epoch": 0.00011211233656123435, "grad_norm": 25.79911231994629, "learning_rate": 1.7090909090909092e-05, "loss": 1.9536, "num_input_tokens_seen": 7166, "step": 14, "train_runtime": 47.6787, "train_tokens_per_second": 150.298 }, { "epoch": 0.00012012036060132252, "grad_norm": 35.28297805786133, "learning_rate": 1.672727272727273e-05, "loss": 1.8325, "num_input_tokens_seen": 7580, "step": 15, "train_runtime": 48.3409, "train_tokens_per_second": 156.803 }, { "epoch": 0.00012812838464141069, "grad_norm": 33.03861618041992, "learning_rate": 1.6363636363636366e-05, "loss": 2.3691, "num_input_tokens_seen": 8078, "step": 16, "train_runtime": 49.006, "train_tokens_per_second": 164.837 }, { "epoch": 0.00013613640868149885, "grad_norm": 45.185157775878906, "learning_rate": 1.6000000000000003e-05, "loss": 2.3737, "num_input_tokens_seen": 8448, "step": 17, "train_runtime": 49.6695, "train_tokens_per_second": 170.084 }, { "epoch": 0.00014414443272158702, "grad_norm": 31.473684310913086, "learning_rate": 1.563636363636364e-05, "loss": 2.427, "num_input_tokens_seen": 8936, "step": 18, "train_runtime": 50.3334, "train_tokens_per_second": 177.536 }, { "epoch": 0.00014414443272158702, "eval_loss": 2.4002556800842285, "eval_runtime": 15.9406, "eval_samples_per_second": 62.733, "eval_steps_per_second": 31.366, "num_input_tokens_seen": 8936, "step": 18 }, { "epoch": 0.0001521524567616752, "grad_norm": 33.58867263793945, "learning_rate": 1.5272727272727276e-05, "loss": 2.1379, "num_input_tokens_seen": 9360, "step": 19, "train_runtime": 66.9757, "train_tokens_per_second": 139.752 }, { "epoch": 0.00016016048080176338, "grad_norm": 33.38470458984375, "learning_rate": 1.4909090909090911e-05, "loss": 2.8262, "num_input_tokens_seen": 9786, "step": 20, "train_runtime": 67.641, "train_tokens_per_second": 144.676 }, { "epoch": 0.00016816850484185154, "grad_norm": 33.72075271606445, "learning_rate": 1.4545454545454546e-05, "loss": 2.515, "num_input_tokens_seen": 10198, "step": 21, "train_runtime": 68.304, "train_tokens_per_second": 149.303 }, { "epoch": 0.0001761765288819397, "grad_norm": 35.71574401855469, "learning_rate": 1.4181818181818183e-05, "loss": 2.4477, "num_input_tokens_seen": 10644, "step": 22, "train_runtime": 68.9749, "train_tokens_per_second": 154.317 }, { "epoch": 0.00018418455292202788, "grad_norm": 33.68728256225586, "learning_rate": 1.381818181818182e-05, "loss": 2.4155, "num_input_tokens_seen": 11096, "step": 23, "train_runtime": 69.64, "train_tokens_per_second": 159.334 }, { "epoch": 0.00019219257696211604, "grad_norm": 35.62799072265625, "learning_rate": 1.3454545454545455e-05, "loss": 2.4388, "num_input_tokens_seen": 11546, "step": 24, "train_runtime": 70.3069, "train_tokens_per_second": 164.223 }, { "epoch": 0.00019219257696211604, "eval_loss": 2.3586089611053467, "eval_runtime": 15.9544, "eval_samples_per_second": 62.679, "eval_steps_per_second": 31.339, "num_input_tokens_seen": 11546, "step": 24 }, { "epoch": 0.0002002006010022042, "grad_norm": 33.08585739135742, "learning_rate": 1.3090909090909092e-05, "loss": 2.0016, "num_input_tokens_seen": 12020, "step": 25, "train_runtime": 86.9671, "train_tokens_per_second": 138.213 }, { "epoch": 0.00020820862504229237, "grad_norm": 37.98166275024414, "learning_rate": 1.2727272727272728e-05, "loss": 2.5803, "num_input_tokens_seen": 12430, "step": 26, "train_runtime": 87.6331, "train_tokens_per_second": 141.841 }, { "epoch": 0.00021621664908238054, "grad_norm": 36.4505729675293, "learning_rate": 1.2363636363636364e-05, "loss": 3.0606, "num_input_tokens_seen": 12860, "step": 27, "train_runtime": 88.295, "train_tokens_per_second": 145.648 }, { "epoch": 0.0002242246731224687, "grad_norm": 34.81946563720703, "learning_rate": 1.2e-05, "loss": 1.7622, "num_input_tokens_seen": 13302, "step": 28, "train_runtime": 88.9585, "train_tokens_per_second": 149.53 }, { "epoch": 0.00023223269716255687, "grad_norm": 31.250852584838867, "learning_rate": 1.1636363636363637e-05, "loss": 2.3633, "num_input_tokens_seen": 13796, "step": 29, "train_runtime": 89.6239, "train_tokens_per_second": 153.932 }, { "epoch": 0.00024024072120264504, "grad_norm": 32.98413848876953, "learning_rate": 1.1272727272727272e-05, "loss": 2.5788, "num_input_tokens_seen": 14286, "step": 30, "train_runtime": 90.2907, "train_tokens_per_second": 158.222 }, { "epoch": 0.00024024072120264504, "eval_loss": 2.321453332901001, "eval_runtime": 15.9524, "eval_samples_per_second": 62.686, "eval_steps_per_second": 31.343, "num_input_tokens_seen": 14286, "step": 30 }, { "epoch": 0.0002482487452427332, "grad_norm": 36.93943405151367, "learning_rate": 1.0909090909090909e-05, "loss": 2.5933, "num_input_tokens_seen": 14690, "step": 31, "train_runtime": 125.5173, "train_tokens_per_second": 117.036 }, { "epoch": 0.00025625676928282137, "grad_norm": 29.403127670288086, "learning_rate": 1.0545454545454546e-05, "loss": 1.8715, "num_input_tokens_seen": 15182, "step": 32, "train_runtime": 126.1813, "train_tokens_per_second": 120.319 }, { "epoch": 0.00026426479332290954, "grad_norm": 26.887046813964844, "learning_rate": 1.0181818181818182e-05, "loss": 2.3258, "num_input_tokens_seen": 15742, "step": 33, "train_runtime": 126.8482, "train_tokens_per_second": 124.101 }, { "epoch": 0.0002722728173629977, "grad_norm": 35.79985046386719, "learning_rate": 9.81818181818182e-06, "loss": 2.6422, "num_input_tokens_seen": 16170, "step": 34, "train_runtime": 127.5112, "train_tokens_per_second": 126.812 }, { "epoch": 0.00028028084140308587, "grad_norm": 29.967466354370117, "learning_rate": 9.454545454545456e-06, "loss": 2.1683, "num_input_tokens_seen": 16602, "step": 35, "train_runtime": 128.1746, "train_tokens_per_second": 129.526 }, { "epoch": 0.00028828886544317404, "grad_norm": 23.023691177368164, "learning_rate": 9.090909090909091e-06, "loss": 2.2433, "num_input_tokens_seen": 17328, "step": 36, "train_runtime": 128.8377, "train_tokens_per_second": 134.495 }, { "epoch": 0.00028828886544317404, "eval_loss": 2.3060390949249268, "eval_runtime": 15.9837, "eval_samples_per_second": 62.564, "eval_steps_per_second": 31.282, "num_input_tokens_seen": 17328, "step": 36 }, { "epoch": 0.0002962968894832622, "grad_norm": 36.571800231933594, "learning_rate": 8.727272727272728e-06, "loss": 2.2402, "num_input_tokens_seen": 17764, "step": 37, "train_runtime": 145.5214, "train_tokens_per_second": 122.071 }, { "epoch": 0.0003043049135233504, "grad_norm": 33.204383850097656, "learning_rate": 8.363636363636365e-06, "loss": 2.469, "num_input_tokens_seen": 18190, "step": 38, "train_runtime": 146.1828, "train_tokens_per_second": 124.433 }, { "epoch": 0.0003123129375634386, "grad_norm": 42.04680252075195, "learning_rate": 8.000000000000001e-06, "loss": 2.7519, "num_input_tokens_seen": 18618, "step": 39, "train_runtime": 146.8516, "train_tokens_per_second": 126.781 }, { "epoch": 0.00032032096160352676, "grad_norm": 30.66261100769043, "learning_rate": 7.636363636363638e-06, "loss": 2.5034, "num_input_tokens_seen": 19024, "step": 40, "train_runtime": 147.5219, "train_tokens_per_second": 128.957 }, { "epoch": 0.0003283289856436149, "grad_norm": 30.992774963378906, "learning_rate": 7.272727272727273e-06, "loss": 1.8883, "num_input_tokens_seen": 19492, "step": 41, "train_runtime": 148.1868, "train_tokens_per_second": 131.537 }, { "epoch": 0.0003363370096837031, "grad_norm": 33.176795959472656, "learning_rate": 6.90909090909091e-06, "loss": 2.329, "num_input_tokens_seen": 19906, "step": 42, "train_runtime": 148.8521, "train_tokens_per_second": 133.73 }, { "epoch": 0.0003363370096837031, "eval_loss": 2.2987871170043945, "eval_runtime": 15.9526, "eval_samples_per_second": 62.686, "eval_steps_per_second": 31.343, "num_input_tokens_seen": 19906, "step": 42 }, { "epoch": 0.00034434503372379125, "grad_norm": 36.44293975830078, "learning_rate": 6.545454545454546e-06, "loss": 2.4833, "num_input_tokens_seen": 20328, "step": 43, "train_runtime": 165.5052, "train_tokens_per_second": 122.824 }, { "epoch": 0.0003523530577638794, "grad_norm": 32.9749870300293, "learning_rate": 6.181818181818182e-06, "loss": 2.1394, "num_input_tokens_seen": 20756, "step": 44, "train_runtime": 166.1716, "train_tokens_per_second": 124.907 }, { "epoch": 0.0003603610818039676, "grad_norm": 28.772348403930664, "learning_rate": 5.8181818181818185e-06, "loss": 2.0539, "num_input_tokens_seen": 21202, "step": 45, "train_runtime": 166.8343, "train_tokens_per_second": 127.084 }, { "epoch": 0.00036836910584405575, "grad_norm": 28.623464584350586, "learning_rate": 5.4545454545454545e-06, "loss": 2.2397, "num_input_tokens_seen": 21836, "step": 46, "train_runtime": 167.5037, "train_tokens_per_second": 130.361 }, { "epoch": 0.0003763771298841439, "grad_norm": 24.052433013916016, "learning_rate": 5.090909090909091e-06, "loss": 2.3161, "num_input_tokens_seen": 22416, "step": 47, "train_runtime": 168.1683, "train_tokens_per_second": 133.295 }, { "epoch": 0.0003843851539242321, "grad_norm": 27.369709014892578, "learning_rate": 4.727272727272728e-06, "loss": 1.9488, "num_input_tokens_seen": 23096, "step": 48, "train_runtime": 168.8317, "train_tokens_per_second": 136.799 }, { "epoch": 0.0003843851539242321, "eval_loss": 2.295372486114502, "eval_runtime": 15.9296, "eval_samples_per_second": 62.776, "eval_steps_per_second": 31.388, "num_input_tokens_seen": 23096, "step": 48 }, { "epoch": 0.00039239317796432025, "grad_norm": 21.76813507080078, "learning_rate": 4.363636363636364e-06, "loss": 2.3741, "num_input_tokens_seen": 23970, "step": 49, "train_runtime": 185.4643, "train_tokens_per_second": 129.243 }, { "epoch": 0.0004004012020044084, "grad_norm": 28.296794891357422, "learning_rate": 4.000000000000001e-06, "loss": 1.7647, "num_input_tokens_seen": 24458, "step": 50, "train_runtime": 186.1284, "train_tokens_per_second": 131.404 }, { "epoch": 0.0004084092260444966, "grad_norm": 34.54985427856445, "learning_rate": 3.6363636363636366e-06, "loss": 2.2798, "num_input_tokens_seen": 24884, "step": 51, "train_runtime": 186.7918, "train_tokens_per_second": 133.218 }, { "epoch": 0.00041641725008458475, "grad_norm": 25.983028411865234, "learning_rate": 3.272727272727273e-06, "loss": 1.8212, "num_input_tokens_seen": 25394, "step": 52, "train_runtime": 187.454, "train_tokens_per_second": 135.468 }, { "epoch": 0.0004244252741246729, "grad_norm": 33.13299560546875, "learning_rate": 2.9090909090909093e-06, "loss": 2.4243, "num_input_tokens_seen": 25814, "step": 53, "train_runtime": 188.1191, "train_tokens_per_second": 137.222 }, { "epoch": 0.0004324332981647611, "grad_norm": 32.00737380981445, "learning_rate": 2.5454545454545456e-06, "loss": 2.0507, "num_input_tokens_seen": 26232, "step": 54, "train_runtime": 188.7874, "train_tokens_per_second": 138.95 }, { "epoch": 0.0004324332981647611, "eval_loss": 2.2933812141418457, "eval_runtime": 15.8975, "eval_samples_per_second": 62.903, "eval_steps_per_second": 31.451, "num_input_tokens_seen": 26232, "step": 54 }, { "epoch": 0.00044044132220484925, "grad_norm": 29.870973587036133, "learning_rate": 2.181818181818182e-06, "loss": 2.7572, "num_input_tokens_seen": 26724, "step": 55, "train_runtime": 205.3777, "train_tokens_per_second": 130.121 }, { "epoch": 0.0004484493462449374, "grad_norm": 32.467864990234375, "learning_rate": 1.8181818181818183e-06, "loss": 2.5342, "num_input_tokens_seen": 27188, "step": 56, "train_runtime": 206.0422, "train_tokens_per_second": 131.954 }, { "epoch": 0.0004564573702850256, "grad_norm": 23.056095123291016, "learning_rate": 1.4545454545454546e-06, "loss": 1.8859, "num_input_tokens_seen": 27760, "step": 57, "train_runtime": 206.7074, "train_tokens_per_second": 134.296 }, { "epoch": 0.00046446539432511375, "grad_norm": 28.30994415283203, "learning_rate": 1.090909090909091e-06, "loss": 2.0119, "num_input_tokens_seen": 28288, "step": 58, "train_runtime": 207.3729, "train_tokens_per_second": 136.411 }, { "epoch": 0.0004724734183652019, "grad_norm": 32.38734817504883, "learning_rate": 7.272727272727273e-07, "loss": 2.3612, "num_input_tokens_seen": 28672, "step": 59, "train_runtime": 208.0357, "train_tokens_per_second": 137.822 }, { "epoch": 0.0004804814424052901, "grad_norm": 25.652999877929688, "learning_rate": 3.6363636363636366e-07, "loss": 1.8457, "num_input_tokens_seen": 29110, "step": 60, "train_runtime": 208.6978, "train_tokens_per_second": 139.484 }, { "epoch": 0.0004804814424052901, "eval_loss": 2.2931265830993652, "eval_runtime": 15.8795, "eval_samples_per_second": 62.974, "eval_steps_per_second": 31.487, "num_input_tokens_seen": 29110, "step": 60 } ], "logging_steps": 1, "max_steps": 60, "num_input_tokens_seen": 29110, "num_train_epochs": 1, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 484641984921600.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }