{ "best_metric": 0.0001896605535876006, "best_model_checkpoint": "ckpt/llama3_8b_fuze27_no_sys/tracking_shuffled_objects_no_sys/checkpoint-700", "epoch": 2.8011204481792715, "eval_steps": 100, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.028011204481792718, "grad_norm": 11.68239974975586, "learning_rate": 2.5e-05, "loss": 3.5808, "step": 10 }, { "epoch": 0.056022408963585436, "grad_norm": 2.8469760417938232, "learning_rate": 5e-05, "loss": 1.4653, "step": 20 }, { "epoch": 0.08403361344537816, "grad_norm": 2.9564781188964844, "learning_rate": 4.9996039875197146e-05, "loss": 0.4603, "step": 30 }, { "epoch": 0.11204481792717087, "grad_norm": 1.9116700887680054, "learning_rate": 4.9984160755395636e-05, "loss": 0.4233, "step": 40 }, { "epoch": 0.1400560224089636, "grad_norm": 1.8749676942825317, "learning_rate": 4.9964366404019245e-05, "loss": 0.4279, "step": 50 }, { "epoch": 0.16806722689075632, "grad_norm": 2.9393470287323, "learning_rate": 4.9936663092116105e-05, "loss": 0.4078, "step": 60 }, { "epoch": 0.19607843137254902, "grad_norm": 1.5631835460662842, "learning_rate": 4.9901059596372036e-05, "loss": 0.3969, "step": 70 }, { "epoch": 0.22408963585434175, "grad_norm": 2.325085401535034, "learning_rate": 4.985756719632996e-05, "loss": 0.4476, "step": 80 }, { "epoch": 0.25210084033613445, "grad_norm": 1.209677815437317, "learning_rate": 4.9806199670816445e-05, "loss": 0.4109, "step": 90 }, { "epoch": 0.2801120448179272, "grad_norm": 1.1088253259658813, "learning_rate": 4.974697329357644e-05, "loss": 0.4079, "step": 100 }, { "epoch": 0.2801120448179272, "eval_loss": 0.408916711807251, "eval_runtime": 2.8461, "eval_samples_per_second": 52.704, "eval_steps_per_second": 6.676, "step": 100 }, { "epoch": 0.3081232492997199, "grad_norm": 1.0425214767456055, "learning_rate": 4.967990682811758e-05, "loss": 0.4324, "step": 110 }, { "epoch": 0.33613445378151263, "grad_norm": 1.5861892700195312, "learning_rate": 4.960502152176574e-05, "loss": 0.4116, "step": 120 }, { "epoch": 0.3641456582633053, "grad_norm": 1.4320331811904907, "learning_rate": 4.9522341098933635e-05, "loss": 0.4096, "step": 130 }, { "epoch": 0.39215686274509803, "grad_norm": 1.3361800909042358, "learning_rate": 4.943189175360472e-05, "loss": 0.4016, "step": 140 }, { "epoch": 0.42016806722689076, "grad_norm": 1.3678736686706543, "learning_rate": 4.933370214103467e-05, "loss": 0.4113, "step": 150 }, { "epoch": 0.4481792717086835, "grad_norm": 1.5625993013381958, "learning_rate": 4.922780336867309e-05, "loss": 0.4015, "step": 160 }, { "epoch": 0.47619047619047616, "grad_norm": 1.4297890663146973, "learning_rate": 4.9114228986308374e-05, "loss": 0.3892, "step": 170 }, { "epoch": 0.5042016806722689, "grad_norm": 2.283721446990967, "learning_rate": 4.8993014975438814e-05, "loss": 0.3936, "step": 180 }, { "epoch": 0.5322128851540616, "grad_norm": 3.531468629837036, "learning_rate": 4.8864199737873287e-05, "loss": 0.3261, "step": 190 }, { "epoch": 0.5602240896358543, "grad_norm": 2.091176748275757, "learning_rate": 4.872782408356517e-05, "loss": 0.3343, "step": 200 }, { "epoch": 0.5602240896358543, "eval_loss": 0.3214447498321533, "eval_runtime": 2.8697, "eval_samples_per_second": 52.27, "eval_steps_per_second": 6.621, "step": 200 }, { "epoch": 0.5882352941176471, "grad_norm": 2.5533387660980225, "learning_rate": 4.858393121768335e-05, "loss": 0.3283, "step": 210 }, { "epoch": 0.6162464985994398, "grad_norm": 8.215011596679688, "learning_rate": 4.843256672692441e-05, "loss": 0.3155, "step": 220 }, { "epoch": 0.6442577030812325, "grad_norm": 6.319694519042969, "learning_rate": 4.827377856507026e-05, "loss": 0.2806, "step": 230 }, { "epoch": 0.6722689075630253, "grad_norm": 4.542545318603516, "learning_rate": 4.8107617037795965e-05, "loss": 0.2884, "step": 240 }, { "epoch": 0.7002801120448179, "grad_norm": 17.7308292388916, "learning_rate": 4.7934134786732365e-05, "loss": 0.286, "step": 250 }, { "epoch": 0.7282913165266106, "grad_norm": 2.3095180988311768, "learning_rate": 4.775338677278867e-05, "loss": 0.2215, "step": 260 }, { "epoch": 0.7563025210084033, "grad_norm": 5.083682060241699, "learning_rate": 4.756543025874034e-05, "loss": 0.2529, "step": 270 }, { "epoch": 0.7843137254901961, "grad_norm": 10.334514617919922, "learning_rate": 4.7370324791087616e-05, "loss": 0.1804, "step": 280 }, { "epoch": 0.8123249299719888, "grad_norm": 3.9857237339019775, "learning_rate": 4.716813218119064e-05, "loss": 0.1956, "step": 290 }, { "epoch": 0.8403361344537815, "grad_norm": 6.7719855308532715, "learning_rate": 4.6958916485686956e-05, "loss": 0.1914, "step": 300 }, { "epoch": 0.8403361344537815, "eval_loss": 0.1493147313594818, "eval_runtime": 2.8736, "eval_samples_per_second": 52.198, "eval_steps_per_second": 6.612, "step": 300 }, { "epoch": 0.8683473389355743, "grad_norm": 4.405186176300049, "learning_rate": 4.6742743986197757e-05, "loss": 0.1808, "step": 310 }, { "epoch": 0.896358543417367, "grad_norm": 6.499341011047363, "learning_rate": 4.65196831683292e-05, "loss": 0.154, "step": 320 }, { "epoch": 0.9243697478991597, "grad_norm": 3.253216505050659, "learning_rate": 4.628980469997547e-05, "loss": 0.1339, "step": 330 }, { "epoch": 0.9523809523809523, "grad_norm": 8.81497573852539, "learning_rate": 4.60531814089305e-05, "loss": 0.109, "step": 340 }, { "epoch": 0.9803921568627451, "grad_norm": 15.7227144241333, "learning_rate": 4.580988825981541e-05, "loss": 0.092, "step": 350 }, { "epoch": 1.0084033613445378, "grad_norm": 9.170595169067383, "learning_rate": 4.556000233032892e-05, "loss": 0.1479, "step": 360 }, { "epoch": 1.0364145658263306, "grad_norm": 14.895033836364746, "learning_rate": 4.530360278682842e-05, "loss": 0.0871, "step": 370 }, { "epoch": 1.0644257703081232, "grad_norm": 0.1763153076171875, "learning_rate": 4.504077085924922e-05, "loss": 0.0982, "step": 380 }, { "epoch": 1.092436974789916, "grad_norm": 9.751165390014648, "learning_rate": 4.477158981537017e-05, "loss": 0.0851, "step": 390 }, { "epoch": 1.1204481792717087, "grad_norm": 0.1843680888414383, "learning_rate": 4.449614493443354e-05, "loss": 0.034, "step": 400 }, { "epoch": 1.1204481792717087, "eval_loss": 0.04679349809885025, "eval_runtime": 2.873, "eval_samples_per_second": 52.21, "eval_steps_per_second": 6.613, "step": 400 }, { "epoch": 1.1484593837535013, "grad_norm": 6.5383501052856445, "learning_rate": 4.421452348012771e-05, "loss": 0.0584, "step": 410 }, { "epoch": 1.1764705882352942, "grad_norm": 0.003353311913087964, "learning_rate": 4.392681467294117e-05, "loss": 0.0344, "step": 420 }, { "epoch": 1.2044817927170868, "grad_norm": 0.0053819697350263596, "learning_rate": 4.3633109661896595e-05, "loss": 0.0111, "step": 430 }, { "epoch": 1.2324929971988796, "grad_norm": 32.45022201538086, "learning_rate": 4.33335014956739e-05, "loss": 0.1152, "step": 440 }, { "epoch": 1.2605042016806722, "grad_norm": 7.157898902893066, "learning_rate": 4.30280850931315e-05, "loss": 0.0524, "step": 450 }, { "epoch": 1.2885154061624648, "grad_norm": 0.7617452144622803, "learning_rate": 4.271695721323506e-05, "loss": 0.0121, "step": 460 }, { "epoch": 1.3165266106442577, "grad_norm": 23.683460235595703, "learning_rate": 4.240021642440333e-05, "loss": 0.0947, "step": 470 }, { "epoch": 1.3445378151260505, "grad_norm": 0.007763392757624388, "learning_rate": 4.207796307328059e-05, "loss": 0.0011, "step": 480 }, { "epoch": 1.3725490196078431, "grad_norm": 0.14272698760032654, "learning_rate": 4.175029925294595e-05, "loss": 0.0433, "step": 490 }, { "epoch": 1.4005602240896358, "grad_norm": 0.22110269963741302, "learning_rate": 4.141732877056915e-05, "loss": 0.0276, "step": 500 }, { "epoch": 1.4005602240896358, "eval_loss": 0.008394874632358551, "eval_runtime": 2.8698, "eval_samples_per_second": 52.269, "eval_steps_per_second": 6.621, "step": 500 }, { "epoch": 1.4285714285714286, "grad_norm": 0.014582260511815548, "learning_rate": 4.107915711452347e-05, "loss": 0.0156, "step": 510 }, { "epoch": 1.4565826330532212, "grad_norm": 0.0064322990365326405, "learning_rate": 4.073589142096592e-05, "loss": 0.0092, "step": 520 }, { "epoch": 1.484593837535014, "grad_norm": 0.006550009828060865, "learning_rate": 4.038764043989548e-05, "loss": 0.0056, "step": 530 }, { "epoch": 1.5126050420168067, "grad_norm": 0.00899260863661766, "learning_rate": 4.003451450069994e-05, "loss": 0.0001, "step": 540 }, { "epoch": 1.5406162464985993, "grad_norm": 0.0009019902790896595, "learning_rate": 3.9676625477202554e-05, "loss": 0.0081, "step": 550 }, { "epoch": 1.5686274509803921, "grad_norm": 0.005392414517700672, "learning_rate": 3.9314086752219195e-05, "loss": 0.0259, "step": 560 }, { "epoch": 1.596638655462185, "grad_norm": 0.0008008493459783494, "learning_rate": 3.8947013181637624e-05, "loss": 0.0008, "step": 570 }, { "epoch": 1.6246498599439776, "grad_norm": 0.014637362211942673, "learning_rate": 3.857552105802994e-05, "loss": 0.0006, "step": 580 }, { "epoch": 1.6526610644257702, "grad_norm": 0.0004757639835588634, "learning_rate": 3.819972807380995e-05, "loss": 0.0053, "step": 590 }, { "epoch": 1.680672268907563, "grad_norm": 0.0002963497245218605, "learning_rate": 3.781975328394708e-05, "loss": 0.0001, "step": 600 }, { "epoch": 1.680672268907563, "eval_loss": 0.01559663750231266, "eval_runtime": 2.8686, "eval_samples_per_second": 52.29, "eval_steps_per_second": 6.623, "step": 600 }, { "epoch": 1.708683473389356, "grad_norm": 3.8546576499938965, "learning_rate": 3.74357170682485e-05, "loss": 0.0094, "step": 610 }, { "epoch": 1.7366946778711485, "grad_norm": 0.38633355498313904, "learning_rate": 3.704774109322166e-05, "loss": 0.034, "step": 620 }, { "epoch": 1.7647058823529411, "grad_norm": 0.0008682355983182788, "learning_rate": 3.665594827352908e-05, "loss": 0.0004, "step": 630 }, { "epoch": 1.7927170868347337, "grad_norm": 0.01699518784880638, "learning_rate": 3.626046273304779e-05, "loss": 0.0146, "step": 640 }, { "epoch": 1.8207282913165266, "grad_norm": 0.0713791772723198, "learning_rate": 3.586140976554564e-05, "loss": 0.0001, "step": 650 }, { "epoch": 1.8487394957983194, "grad_norm": 0.0003395811072550714, "learning_rate": 3.545891579498695e-05, "loss": 0.0001, "step": 660 }, { "epoch": 1.876750700280112, "grad_norm": 0.0010548827704042196, "learning_rate": 3.5053108335480206e-05, "loss": 0.0022, "step": 670 }, { "epoch": 1.9047619047619047, "grad_norm": 9.065557242138311e-05, "learning_rate": 3.4644115950880254e-05, "loss": 0.0389, "step": 680 }, { "epoch": 1.9327731092436975, "grad_norm": 0.010628440417349339, "learning_rate": 3.423206821405799e-05, "loss": 0.0002, "step": 690 }, { "epoch": 1.9607843137254903, "grad_norm": 0.0003508552326820791, "learning_rate": 3.381709566585044e-05, "loss": 0.0, "step": 700 }, { "epoch": 1.9607843137254903, "eval_loss": 0.0001896605535876006, "eval_runtime": 2.8723, "eval_samples_per_second": 52.223, "eval_steps_per_second": 6.615, "step": 700 }, { "epoch": 1.988795518207283, "grad_norm": 0.00045208673691377044, "learning_rate": 3.339932977370404e-05, "loss": 0.0548, "step": 710 }, { "epoch": 2.0168067226890756, "grad_norm": 0.0002967917826026678, "learning_rate": 3.297890289002451e-05, "loss": 0.0669, "step": 720 }, { "epoch": 2.044817927170868, "grad_norm": 0.0014003561809659004, "learning_rate": 3.255594821024622e-05, "loss": 0.0137, "step": 730 }, { "epoch": 2.0728291316526612, "grad_norm": 0.029797283932566643, "learning_rate": 3.2130599730634606e-05, "loss": 0.005, "step": 740 }, { "epoch": 2.100840336134454, "grad_norm": 0.0008940272382460535, "learning_rate": 3.170299220583479e-05, "loss": 0.0006, "step": 750 }, { "epoch": 2.1288515406162465, "grad_norm": 0.0002603277680464089, "learning_rate": 3.127326110617996e-05, "loss": 0.0002, "step": 760 }, { "epoch": 2.156862745098039, "grad_norm": 0.000504830852150917, "learning_rate": 3.084154257477301e-05, "loss": 0.0, "step": 770 }, { "epoch": 2.184873949579832, "grad_norm": 0.0018955356208607554, "learning_rate": 3.0407973384355088e-05, "loss": 0.0165, "step": 780 }, { "epoch": 2.212885154061625, "grad_norm": 0.0010648163734003901, "learning_rate": 2.997269089397455e-05, "loss": 0.0, "step": 790 }, { "epoch": 2.2408963585434174, "grad_norm": 0.0006610855343751609, "learning_rate": 2.9535833005470315e-05, "loss": 0.0022, "step": 800 }, { "epoch": 2.2408963585434174, "eval_loss": 0.012090143747627735, "eval_runtime": 2.8741, "eval_samples_per_second": 52.189, "eval_steps_per_second": 6.611, "step": 800 }, { "epoch": 2.26890756302521, "grad_norm": 0.0001721924199955538, "learning_rate": 2.9097538119783152e-05, "loss": 0.0, "step": 810 }, { "epoch": 2.2969187675070026, "grad_norm": 0.0006904829642735422, "learning_rate": 2.8657945093108886e-05, "loss": 0.0161, "step": 820 }, { "epoch": 2.3249299719887957, "grad_norm": 31.687515258789062, "learning_rate": 2.821719319290736e-05, "loss": 0.0684, "step": 830 }, { "epoch": 2.3529411764705883, "grad_norm": 0.002737673930823803, "learning_rate": 2.777542205378113e-05, "loss": 0.0001, "step": 840 }, { "epoch": 2.380952380952381, "grad_norm": 0.005815234035253525, "learning_rate": 2.733277163323782e-05, "loss": 0.0038, "step": 850 }, { "epoch": 2.4089635854341735, "grad_norm": 0.0005296830786392093, "learning_rate": 2.6889382167350154e-05, "loss": 0.0001, "step": 860 }, { "epoch": 2.4369747899159666, "grad_norm": 0.001167680835351348, "learning_rate": 2.6445394126327865e-05, "loss": 0.0, "step": 870 }, { "epoch": 2.4649859943977592, "grad_norm": 0.0011337065370753407, "learning_rate": 2.6000948170015205e-05, "loss": 0.016, "step": 880 }, { "epoch": 2.492997198879552, "grad_norm": 0.002113680588081479, "learning_rate": 2.555618510332859e-05, "loss": 0.0, "step": 890 }, { "epoch": 2.5210084033613445, "grad_norm": 0.00770913390442729, "learning_rate": 2.511124583164816e-05, "loss": 0.0, "step": 900 }, { "epoch": 2.5210084033613445, "eval_loss": 0.005274456925690174, "eval_runtime": 2.873, "eval_samples_per_second": 52.21, "eval_steps_per_second": 6.613, "step": 900 }, { "epoch": 2.549019607843137, "grad_norm": 0.0025718784891068935, "learning_rate": 2.4666271316177557e-05, "loss": 0.0001, "step": 910 }, { "epoch": 2.5770308123249297, "grad_norm": 0.00034481892362236977, "learning_rate": 2.422140252928601e-05, "loss": 0.0002, "step": 920 }, { "epoch": 2.6050420168067228, "grad_norm": 0.00020677850989159197, "learning_rate": 2.3776780409846888e-05, "loss": 0.0001, "step": 930 }, { "epoch": 2.6330532212885154, "grad_norm": 0.0001574026100570336, "learning_rate": 2.3332545818586827e-05, "loss": 0.0, "step": 940 }, { "epoch": 2.661064425770308, "grad_norm": 0.017475171014666557, "learning_rate": 2.2888839493459684e-05, "loss": 0.0, "step": 950 }, { "epoch": 2.689075630252101, "grad_norm": 0.006330742035061121, "learning_rate": 2.2445802005059328e-05, "loss": 0.0, "step": 960 }, { "epoch": 2.7170868347338937, "grad_norm": 0.0004552874306682497, "learning_rate": 2.2003573712085457e-05, "loss": 0.0, "step": 970 }, { "epoch": 2.7450980392156863, "grad_norm": 0.0009258923237212002, "learning_rate": 2.1562294716876596e-05, "loss": 0.0, "step": 980 }, { "epoch": 2.773109243697479, "grad_norm": 0.0004848680691793561, "learning_rate": 2.112210482102428e-05, "loss": 0.0, "step": 990 }, { "epoch": 2.8011204481792715, "grad_norm": 0.0008731464040465653, "learning_rate": 2.0683143481082452e-05, "loss": 0.0, "step": 1000 }, { "epoch": 2.8011204481792715, "eval_loss": 0.005379769951105118, "eval_runtime": 2.8678, "eval_samples_per_second": 52.304, "eval_steps_per_second": 6.625, "step": 1000 }, { "epoch": 2.8011204481792715, "step": 1000, "total_flos": 8.23229487073198e+16, "train_loss": 0.1688887168551737, "train_runtime": 530.2932, "train_samples_per_second": 26.872, "train_steps_per_second": 3.366 } ], "logging_steps": 10, "max_steps": 1785, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "total_flos": 8.23229487073198e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }