{ "best_metric": 0.2948146462440491, "best_model_checkpoint": "ckpt/llama3_8b_other/object_counting_no_sys/checkpoint-400", "epoch": 6.0, "eval_steps": 200, "global_step": 510, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.11764705882352941, "grad_norm": 23.17191505432129, "learning_rate": 2.5e-05, "loss": 7.0189, "step": 10 }, { "epoch": 0.23529411764705882, "grad_norm": 8.94247055053711, "learning_rate": 5e-05, "loss": 3.2984, "step": 20 }, { "epoch": 0.35294117647058826, "grad_norm": 9.85525894165039, "learning_rate": 4.994863481875841e-05, "loss": 0.7046, "step": 30 }, { "epoch": 0.47058823529411764, "grad_norm": 5.321958065032959, "learning_rate": 4.979475034558115e-05, "loss": 0.5767, "step": 40 }, { "epoch": 0.5882352941176471, "grad_norm": 8.481945037841797, "learning_rate": 4.9538978924776634e-05, "loss": 0.5266, "step": 50 }, { "epoch": 0.7058823529411765, "grad_norm": 18.951034545898438, "learning_rate": 4.9182371575975736e-05, "loss": 0.5439, "step": 60 }, { "epoch": 0.8235294117647058, "grad_norm": 8.39922046661377, "learning_rate": 4.8726393675266716e-05, "loss": 0.4045, "step": 70 }, { "epoch": 0.9411764705882353, "grad_norm": 7.662684917449951, "learning_rate": 4.817291893365055e-05, "loss": 0.3646, "step": 80 }, { "epoch": 1.0588235294117647, "grad_norm": 5.594130992889404, "learning_rate": 4.752422169756048e-05, "loss": 0.4374, "step": 90 }, { "epoch": 1.1764705882352942, "grad_norm": 14.85095500946045, "learning_rate": 4.678296760308474e-05, "loss": 0.3521, "step": 100 }, { "epoch": 1.2941176470588236, "grad_norm": 7.1303606033325195, "learning_rate": 4.595220262229601e-05, "loss": 0.3584, "step": 110 }, { "epoch": 1.4117647058823528, "grad_norm": 9.753626823425293, "learning_rate": 4.503534054669892e-05, "loss": 0.4017, "step": 120 }, { "epoch": 1.5294117647058822, "grad_norm": 8.411559104919434, "learning_rate": 4.4036148959228365e-05, "loss": 0.4192, "step": 130 }, { "epoch": 1.6470588235294117, "grad_norm": 10.687651634216309, "learning_rate": 4.2958733752443195e-05, "loss": 0.3832, "step": 140 }, { "epoch": 1.7647058823529411, "grad_norm": 15.22123908996582, "learning_rate": 4.180752225653292e-05, "loss": 0.2871, "step": 150 }, { "epoch": 1.8823529411764706, "grad_norm": 7.608785629272461, "learning_rate": 4.058724504646834e-05, "loss": 0.2344, "step": 160 }, { "epoch": 2.0, "grad_norm": 2.1389312744140625, "learning_rate": 3.9302916503054246e-05, "loss": 0.2686, "step": 170 }, { "epoch": 2.1176470588235294, "grad_norm": 25.7930908203125, "learning_rate": 3.7959814207763135e-05, "loss": 0.3129, "step": 180 }, { "epoch": 2.235294117647059, "grad_norm": 4.136214733123779, "learning_rate": 3.656345725602089e-05, "loss": 0.2146, "step": 190 }, { "epoch": 2.3529411764705883, "grad_norm": 3.397460699081421, "learning_rate": 3.5119583578059846e-05, "loss": 0.1766, "step": 200 }, { "epoch": 2.3529411764705883, "eval_loss": 0.4584803879261017, "eval_runtime": 0.7658, "eval_samples_per_second": 156.69, "eval_steps_per_second": 19.586, "step": 200 }, { "epoch": 2.4705882352941178, "grad_norm": 15.182618141174316, "learning_rate": 3.363412636053269e-05, "loss": 0.1984, "step": 210 }, { "epoch": 2.588235294117647, "grad_norm": 7.012846946716309, "learning_rate": 3.211318966577581e-05, "loss": 0.1822, "step": 220 }, { "epoch": 2.7058823529411766, "grad_norm": 10.27369499206543, "learning_rate": 3.056302334890786e-05, "loss": 0.2768, "step": 230 }, { "epoch": 2.8235294117647056, "grad_norm": 7.723974704742432, "learning_rate": 2.8989997375834482e-05, "loss": 0.1146, "step": 240 }, { "epoch": 2.9411764705882355, "grad_norm": 16.098949432373047, "learning_rate": 2.7400575647692046e-05, "loss": 0.2341, "step": 250 }, { "epoch": 3.0588235294117645, "grad_norm": 3.3051462173461914, "learning_rate": 2.5801289439291388e-05, "loss": 0.2811, "step": 260 }, { "epoch": 3.176470588235294, "grad_norm": 14.433158874511719, "learning_rate": 2.419871056070862e-05, "loss": 0.1915, "step": 270 }, { "epoch": 3.2941176470588234, "grad_norm": 3.7534849643707275, "learning_rate": 2.2599424352307957e-05, "loss": 0.1292, "step": 280 }, { "epoch": 3.411764705882353, "grad_norm": 15.175636291503906, "learning_rate": 2.1010002624165527e-05, "loss": 0.1015, "step": 290 }, { "epoch": 3.5294117647058822, "grad_norm": 11.786360740661621, "learning_rate": 1.9436976651092144e-05, "loss": 0.1129, "step": 300 }, { "epoch": 3.6470588235294117, "grad_norm": 13.687607765197754, "learning_rate": 1.7886810334224192e-05, "loss": 0.1072, "step": 310 }, { "epoch": 3.764705882352941, "grad_norm": 6.054112434387207, "learning_rate": 1.6365873639467315e-05, "loss": 0.1333, "step": 320 }, { "epoch": 3.8823529411764706, "grad_norm": 12.263951301574707, "learning_rate": 1.4880416421940155e-05, "loss": 0.1509, "step": 330 }, { "epoch": 4.0, "grad_norm": 0.6237934827804565, "learning_rate": 1.3436542743979125e-05, "loss": 0.0754, "step": 340 }, { "epoch": 4.117647058823529, "grad_norm": 2.395211935043335, "learning_rate": 1.2040185792236874e-05, "loss": 0.0869, "step": 350 }, { "epoch": 4.235294117647059, "grad_norm": 7.990754127502441, "learning_rate": 1.0697083496945765e-05, "loss": 0.1263, "step": 360 }, { "epoch": 4.352941176470588, "grad_norm": 5.7818779945373535, "learning_rate": 9.412754953531663e-06, "loss": 0.0479, "step": 370 }, { "epoch": 4.470588235294118, "grad_norm": 8.458385467529297, "learning_rate": 8.192477743467078e-06, "loss": 0.0401, "step": 380 }, { "epoch": 4.588235294117647, "grad_norm": 4.223268032073975, "learning_rate": 7.041266247556813e-06, "loss": 0.0774, "step": 390 }, { "epoch": 4.705882352941177, "grad_norm": 2.8907740116119385, "learning_rate": 5.9638510407716394e-06, "loss": 0.0726, "step": 400 }, { "epoch": 4.705882352941177, "eval_loss": 0.2948146462440491, "eval_runtime": 0.7657, "eval_samples_per_second": 156.723, "eval_steps_per_second": 19.59, "step": 400 }, { "epoch": 4.823529411764706, "grad_norm": 7.116231441497803, "learning_rate": 4.9646594533010875e-06, "loss": 0.0701, "step": 410 }, { "epoch": 4.9411764705882355, "grad_norm": 15.119770050048828, "learning_rate": 4.047797377703985e-06, "loss": 0.0393, "step": 420 }, { "epoch": 5.0588235294117645, "grad_norm": 11.085099220275879, "learning_rate": 3.217032396915265e-06, "loss": 0.0839, "step": 430 }, { "epoch": 5.176470588235294, "grad_norm": 4.78342342376709, "learning_rate": 2.475778302439524e-06, "loss": 0.0348, "step": 440 }, { "epoch": 5.294117647058823, "grad_norm": 0.49753427505493164, "learning_rate": 1.827081066349459e-06, "loss": 0.0429, "step": 450 }, { "epoch": 5.411764705882353, "grad_norm": 4.4141693115234375, "learning_rate": 1.273606324733284e-06, "loss": 0.0493, "step": 460 }, { "epoch": 5.529411764705882, "grad_norm": 5.7931413650512695, "learning_rate": 8.176284240242638e-07, "loss": 0.0158, "step": 470 }, { "epoch": 5.647058823529412, "grad_norm": 6.445806980133057, "learning_rate": 4.6102107522336403e-07, "loss": 0.026, "step": 480 }, { "epoch": 5.764705882352941, "grad_norm": 0.24533455073833466, "learning_rate": 2.052496544188487e-07, "loss": 0.0267, "step": 490 }, { "epoch": 5.882352941176471, "grad_norm": 13.630054473876953, "learning_rate": 5.136518124159162e-08, "loss": 0.0317, "step": 500 }, { "epoch": 6.0, "grad_norm": 1.213211178779602, "learning_rate": 0.0, "loss": 0.0259, "step": 510 }, { "epoch": 6.0, "step": 510, "total_flos": 1.0415358657691648e+16, "train_loss": 0.4013917989882768, "train_runtime": 114.995, "train_samples_per_second": 35.48, "train_steps_per_second": 4.435 } ], "logging_steps": 10, "max_steps": 510, "num_input_tokens_seen": 0, "num_train_epochs": 6, "save_steps": 200, "total_flos": 1.0415358657691648e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }