| { |
| "best_metric": 0.0001896605535876006, |
| "best_model_checkpoint": "ckpt/llama3_8b_fuze27_no_sys/tracking_shuffled_objects_no_sys/checkpoint-700", |
| "epoch": 2.8011204481792715, |
| "eval_steps": 100, |
| "global_step": 1000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.028011204481792718, |
| "grad_norm": 11.68239974975586, |
| "learning_rate": 2.5e-05, |
| "loss": 3.5808, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.056022408963585436, |
| "grad_norm": 2.8469760417938232, |
| "learning_rate": 5e-05, |
| "loss": 1.4653, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.08403361344537816, |
| "grad_norm": 2.9564781188964844, |
| "learning_rate": 4.9996039875197146e-05, |
| "loss": 0.4603, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.11204481792717087, |
| "grad_norm": 1.9116700887680054, |
| "learning_rate": 4.9984160755395636e-05, |
| "loss": 0.4233, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.1400560224089636, |
| "grad_norm": 1.8749676942825317, |
| "learning_rate": 4.9964366404019245e-05, |
| "loss": 0.4279, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.16806722689075632, |
| "grad_norm": 2.9393470287323, |
| "learning_rate": 4.9936663092116105e-05, |
| "loss": 0.4078, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.19607843137254902, |
| "grad_norm": 1.5631835460662842, |
| "learning_rate": 4.9901059596372036e-05, |
| "loss": 0.3969, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.22408963585434175, |
| "grad_norm": 2.325085401535034, |
| "learning_rate": 4.985756719632996e-05, |
| "loss": 0.4476, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.25210084033613445, |
| "grad_norm": 1.209677815437317, |
| "learning_rate": 4.9806199670816445e-05, |
| "loss": 0.4109, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.2801120448179272, |
| "grad_norm": 1.1088253259658813, |
| "learning_rate": 4.974697329357644e-05, |
| "loss": 0.4079, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.2801120448179272, |
| "eval_loss": 0.408916711807251, |
| "eval_runtime": 2.8461, |
| "eval_samples_per_second": 52.704, |
| "eval_steps_per_second": 6.676, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.3081232492997199, |
| "grad_norm": 1.0425214767456055, |
| "learning_rate": 4.967990682811758e-05, |
| "loss": 0.4324, |
| "step": 110 |
| }, |
| { |
| "epoch": 0.33613445378151263, |
| "grad_norm": 1.5861892700195312, |
| "learning_rate": 4.960502152176574e-05, |
| "loss": 0.4116, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.3641456582633053, |
| "grad_norm": 1.4320331811904907, |
| "learning_rate": 4.9522341098933635e-05, |
| "loss": 0.4096, |
| "step": 130 |
| }, |
| { |
| "epoch": 0.39215686274509803, |
| "grad_norm": 1.3361800909042358, |
| "learning_rate": 4.943189175360472e-05, |
| "loss": 0.4016, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.42016806722689076, |
| "grad_norm": 1.3678736686706543, |
| "learning_rate": 4.933370214103467e-05, |
| "loss": 0.4113, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.4481792717086835, |
| "grad_norm": 1.5625993013381958, |
| "learning_rate": 4.922780336867309e-05, |
| "loss": 0.4015, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.47619047619047616, |
| "grad_norm": 1.4297890663146973, |
| "learning_rate": 4.9114228986308374e-05, |
| "loss": 0.3892, |
| "step": 170 |
| }, |
| { |
| "epoch": 0.5042016806722689, |
| "grad_norm": 2.283721446990967, |
| "learning_rate": 4.8993014975438814e-05, |
| "loss": 0.3936, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.5322128851540616, |
| "grad_norm": 3.531468629837036, |
| "learning_rate": 4.8864199737873287e-05, |
| "loss": 0.3261, |
| "step": 190 |
| }, |
| { |
| "epoch": 0.5602240896358543, |
| "grad_norm": 2.091176748275757, |
| "learning_rate": 4.872782408356517e-05, |
| "loss": 0.3343, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.5602240896358543, |
| "eval_loss": 0.3214447498321533, |
| "eval_runtime": 2.8697, |
| "eval_samples_per_second": 52.27, |
| "eval_steps_per_second": 6.621, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.5882352941176471, |
| "grad_norm": 2.5533387660980225, |
| "learning_rate": 4.858393121768335e-05, |
| "loss": 0.3283, |
| "step": 210 |
| }, |
| { |
| "epoch": 0.6162464985994398, |
| "grad_norm": 8.215011596679688, |
| "learning_rate": 4.843256672692441e-05, |
| "loss": 0.3155, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.6442577030812325, |
| "grad_norm": 6.319694519042969, |
| "learning_rate": 4.827377856507026e-05, |
| "loss": 0.2806, |
| "step": 230 |
| }, |
| { |
| "epoch": 0.6722689075630253, |
| "grad_norm": 4.542545318603516, |
| "learning_rate": 4.8107617037795965e-05, |
| "loss": 0.2884, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.7002801120448179, |
| "grad_norm": 17.7308292388916, |
| "learning_rate": 4.7934134786732365e-05, |
| "loss": 0.286, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.7282913165266106, |
| "grad_norm": 2.3095180988311768, |
| "learning_rate": 4.775338677278867e-05, |
| "loss": 0.2215, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.7563025210084033, |
| "grad_norm": 5.083682060241699, |
| "learning_rate": 4.756543025874034e-05, |
| "loss": 0.2529, |
| "step": 270 |
| }, |
| { |
| "epoch": 0.7843137254901961, |
| "grad_norm": 10.334514617919922, |
| "learning_rate": 4.7370324791087616e-05, |
| "loss": 0.1804, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.8123249299719888, |
| "grad_norm": 3.9857237339019775, |
| "learning_rate": 4.716813218119064e-05, |
| "loss": 0.1956, |
| "step": 290 |
| }, |
| { |
| "epoch": 0.8403361344537815, |
| "grad_norm": 6.7719855308532715, |
| "learning_rate": 4.6958916485686956e-05, |
| "loss": 0.1914, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.8403361344537815, |
| "eval_loss": 0.1493147313594818, |
| "eval_runtime": 2.8736, |
| "eval_samples_per_second": 52.198, |
| "eval_steps_per_second": 6.612, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.8683473389355743, |
| "grad_norm": 4.405186176300049, |
| "learning_rate": 4.6742743986197757e-05, |
| "loss": 0.1808, |
| "step": 310 |
| }, |
| { |
| "epoch": 0.896358543417367, |
| "grad_norm": 6.499341011047363, |
| "learning_rate": 4.65196831683292e-05, |
| "loss": 0.154, |
| "step": 320 |
| }, |
| { |
| "epoch": 0.9243697478991597, |
| "grad_norm": 3.253216505050659, |
| "learning_rate": 4.628980469997547e-05, |
| "loss": 0.1339, |
| "step": 330 |
| }, |
| { |
| "epoch": 0.9523809523809523, |
| "grad_norm": 8.81497573852539, |
| "learning_rate": 4.60531814089305e-05, |
| "loss": 0.109, |
| "step": 340 |
| }, |
| { |
| "epoch": 0.9803921568627451, |
| "grad_norm": 15.7227144241333, |
| "learning_rate": 4.580988825981541e-05, |
| "loss": 0.092, |
| "step": 350 |
| }, |
| { |
| "epoch": 1.0084033613445378, |
| "grad_norm": 9.170595169067383, |
| "learning_rate": 4.556000233032892e-05, |
| "loss": 0.1479, |
| "step": 360 |
| }, |
| { |
| "epoch": 1.0364145658263306, |
| "grad_norm": 14.895033836364746, |
| "learning_rate": 4.530360278682842e-05, |
| "loss": 0.0871, |
| "step": 370 |
| }, |
| { |
| "epoch": 1.0644257703081232, |
| "grad_norm": 0.1763153076171875, |
| "learning_rate": 4.504077085924922e-05, |
| "loss": 0.0982, |
| "step": 380 |
| }, |
| { |
| "epoch": 1.092436974789916, |
| "grad_norm": 9.751165390014648, |
| "learning_rate": 4.477158981537017e-05, |
| "loss": 0.0851, |
| "step": 390 |
| }, |
| { |
| "epoch": 1.1204481792717087, |
| "grad_norm": 0.1843680888414383, |
| "learning_rate": 4.449614493443354e-05, |
| "loss": 0.034, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.1204481792717087, |
| "eval_loss": 0.04679349809885025, |
| "eval_runtime": 2.873, |
| "eval_samples_per_second": 52.21, |
| "eval_steps_per_second": 6.613, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.1484593837535013, |
| "grad_norm": 6.5383501052856445, |
| "learning_rate": 4.421452348012771e-05, |
| "loss": 0.0584, |
| "step": 410 |
| }, |
| { |
| "epoch": 1.1764705882352942, |
| "grad_norm": 0.003353311913087964, |
| "learning_rate": 4.392681467294117e-05, |
| "loss": 0.0344, |
| "step": 420 |
| }, |
| { |
| "epoch": 1.2044817927170868, |
| "grad_norm": 0.0053819697350263596, |
| "learning_rate": 4.3633109661896595e-05, |
| "loss": 0.0111, |
| "step": 430 |
| }, |
| { |
| "epoch": 1.2324929971988796, |
| "grad_norm": 32.45022201538086, |
| "learning_rate": 4.33335014956739e-05, |
| "loss": 0.1152, |
| "step": 440 |
| }, |
| { |
| "epoch": 1.2605042016806722, |
| "grad_norm": 7.157898902893066, |
| "learning_rate": 4.30280850931315e-05, |
| "loss": 0.0524, |
| "step": 450 |
| }, |
| { |
| "epoch": 1.2885154061624648, |
| "grad_norm": 0.7617452144622803, |
| "learning_rate": 4.271695721323506e-05, |
| "loss": 0.0121, |
| "step": 460 |
| }, |
| { |
| "epoch": 1.3165266106442577, |
| "grad_norm": 23.683460235595703, |
| "learning_rate": 4.240021642440333e-05, |
| "loss": 0.0947, |
| "step": 470 |
| }, |
| { |
| "epoch": 1.3445378151260505, |
| "grad_norm": 0.007763392757624388, |
| "learning_rate": 4.207796307328059e-05, |
| "loss": 0.0011, |
| "step": 480 |
| }, |
| { |
| "epoch": 1.3725490196078431, |
| "grad_norm": 0.14272698760032654, |
| "learning_rate": 4.175029925294595e-05, |
| "loss": 0.0433, |
| "step": 490 |
| }, |
| { |
| "epoch": 1.4005602240896358, |
| "grad_norm": 0.22110269963741302, |
| "learning_rate": 4.141732877056915e-05, |
| "loss": 0.0276, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.4005602240896358, |
| "eval_loss": 0.008394874632358551, |
| "eval_runtime": 2.8698, |
| "eval_samples_per_second": 52.269, |
| "eval_steps_per_second": 6.621, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.4285714285714286, |
| "grad_norm": 0.014582260511815548, |
| "learning_rate": 4.107915711452347e-05, |
| "loss": 0.0156, |
| "step": 510 |
| }, |
| { |
| "epoch": 1.4565826330532212, |
| "grad_norm": 0.0064322990365326405, |
| "learning_rate": 4.073589142096592e-05, |
| "loss": 0.0092, |
| "step": 520 |
| }, |
| { |
| "epoch": 1.484593837535014, |
| "grad_norm": 0.006550009828060865, |
| "learning_rate": 4.038764043989548e-05, |
| "loss": 0.0056, |
| "step": 530 |
| }, |
| { |
| "epoch": 1.5126050420168067, |
| "grad_norm": 0.00899260863661766, |
| "learning_rate": 4.003451450069994e-05, |
| "loss": 0.0001, |
| "step": 540 |
| }, |
| { |
| "epoch": 1.5406162464985993, |
| "grad_norm": 0.0009019902790896595, |
| "learning_rate": 3.9676625477202554e-05, |
| "loss": 0.0081, |
| "step": 550 |
| }, |
| { |
| "epoch": 1.5686274509803921, |
| "grad_norm": 0.005392414517700672, |
| "learning_rate": 3.9314086752219195e-05, |
| "loss": 0.0259, |
| "step": 560 |
| }, |
| { |
| "epoch": 1.596638655462185, |
| "grad_norm": 0.0008008493459783494, |
| "learning_rate": 3.8947013181637624e-05, |
| "loss": 0.0008, |
| "step": 570 |
| }, |
| { |
| "epoch": 1.6246498599439776, |
| "grad_norm": 0.014637362211942673, |
| "learning_rate": 3.857552105802994e-05, |
| "loss": 0.0006, |
| "step": 580 |
| }, |
| { |
| "epoch": 1.6526610644257702, |
| "grad_norm": 0.0004757639835588634, |
| "learning_rate": 3.819972807380995e-05, |
| "loss": 0.0053, |
| "step": 590 |
| }, |
| { |
| "epoch": 1.680672268907563, |
| "grad_norm": 0.0002963497245218605, |
| "learning_rate": 3.781975328394708e-05, |
| "loss": 0.0001, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.680672268907563, |
| "eval_loss": 0.01559663750231266, |
| "eval_runtime": 2.8686, |
| "eval_samples_per_second": 52.29, |
| "eval_steps_per_second": 6.623, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.708683473389356, |
| "grad_norm": 3.8546576499938965, |
| "learning_rate": 3.74357170682485e-05, |
| "loss": 0.0094, |
| "step": 610 |
| }, |
| { |
| "epoch": 1.7366946778711485, |
| "grad_norm": 0.38633355498313904, |
| "learning_rate": 3.704774109322166e-05, |
| "loss": 0.034, |
| "step": 620 |
| }, |
| { |
| "epoch": 1.7647058823529411, |
| "grad_norm": 0.0008682355983182788, |
| "learning_rate": 3.665594827352908e-05, |
| "loss": 0.0004, |
| "step": 630 |
| }, |
| { |
| "epoch": 1.7927170868347337, |
| "grad_norm": 0.01699518784880638, |
| "learning_rate": 3.626046273304779e-05, |
| "loss": 0.0146, |
| "step": 640 |
| }, |
| { |
| "epoch": 1.8207282913165266, |
| "grad_norm": 0.0713791772723198, |
| "learning_rate": 3.586140976554564e-05, |
| "loss": 0.0001, |
| "step": 650 |
| }, |
| { |
| "epoch": 1.8487394957983194, |
| "grad_norm": 0.0003395811072550714, |
| "learning_rate": 3.545891579498695e-05, |
| "loss": 0.0001, |
| "step": 660 |
| }, |
| { |
| "epoch": 1.876750700280112, |
| "grad_norm": 0.0010548827704042196, |
| "learning_rate": 3.5053108335480206e-05, |
| "loss": 0.0022, |
| "step": 670 |
| }, |
| { |
| "epoch": 1.9047619047619047, |
| "grad_norm": 9.065557242138311e-05, |
| "learning_rate": 3.4644115950880254e-05, |
| "loss": 0.0389, |
| "step": 680 |
| }, |
| { |
| "epoch": 1.9327731092436975, |
| "grad_norm": 0.010628440417349339, |
| "learning_rate": 3.423206821405799e-05, |
| "loss": 0.0002, |
| "step": 690 |
| }, |
| { |
| "epoch": 1.9607843137254903, |
| "grad_norm": 0.0003508552326820791, |
| "learning_rate": 3.381709566585044e-05, |
| "loss": 0.0, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.9607843137254903, |
| "eval_loss": 0.0001896605535876006, |
| "eval_runtime": 2.8723, |
| "eval_samples_per_second": 52.223, |
| "eval_steps_per_second": 6.615, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.988795518207283, |
| "grad_norm": 0.00045208673691377044, |
| "learning_rate": 3.339932977370404e-05, |
| "loss": 0.0548, |
| "step": 710 |
| }, |
| { |
| "epoch": 2.0168067226890756, |
| "grad_norm": 0.0002967917826026678, |
| "learning_rate": 3.297890289002451e-05, |
| "loss": 0.0669, |
| "step": 720 |
| }, |
| { |
| "epoch": 2.044817927170868, |
| "grad_norm": 0.0014003561809659004, |
| "learning_rate": 3.255594821024622e-05, |
| "loss": 0.0137, |
| "step": 730 |
| }, |
| { |
| "epoch": 2.0728291316526612, |
| "grad_norm": 0.029797283932566643, |
| "learning_rate": 3.2130599730634606e-05, |
| "loss": 0.005, |
| "step": 740 |
| }, |
| { |
| "epoch": 2.100840336134454, |
| "grad_norm": 0.0008940272382460535, |
| "learning_rate": 3.170299220583479e-05, |
| "loss": 0.0006, |
| "step": 750 |
| }, |
| { |
| "epoch": 2.1288515406162465, |
| "grad_norm": 0.0002603277680464089, |
| "learning_rate": 3.127326110617996e-05, |
| "loss": 0.0002, |
| "step": 760 |
| }, |
| { |
| "epoch": 2.156862745098039, |
| "grad_norm": 0.000504830852150917, |
| "learning_rate": 3.084154257477301e-05, |
| "loss": 0.0, |
| "step": 770 |
| }, |
| { |
| "epoch": 2.184873949579832, |
| "grad_norm": 0.0018955356208607554, |
| "learning_rate": 3.0407973384355088e-05, |
| "loss": 0.0165, |
| "step": 780 |
| }, |
| { |
| "epoch": 2.212885154061625, |
| "grad_norm": 0.0010648163734003901, |
| "learning_rate": 2.997269089397455e-05, |
| "loss": 0.0, |
| "step": 790 |
| }, |
| { |
| "epoch": 2.2408963585434174, |
| "grad_norm": 0.0006610855343751609, |
| "learning_rate": 2.9535833005470315e-05, |
| "loss": 0.0022, |
| "step": 800 |
| }, |
| { |
| "epoch": 2.2408963585434174, |
| "eval_loss": 0.012090143747627735, |
| "eval_runtime": 2.8741, |
| "eval_samples_per_second": 52.189, |
| "eval_steps_per_second": 6.611, |
| "step": 800 |
| }, |
| { |
| "epoch": 2.26890756302521, |
| "grad_norm": 0.0001721924199955538, |
| "learning_rate": 2.9097538119783152e-05, |
| "loss": 0.0, |
| "step": 810 |
| }, |
| { |
| "epoch": 2.2969187675070026, |
| "grad_norm": 0.0006904829642735422, |
| "learning_rate": 2.8657945093108886e-05, |
| "loss": 0.0161, |
| "step": 820 |
| }, |
| { |
| "epoch": 2.3249299719887957, |
| "grad_norm": 31.687515258789062, |
| "learning_rate": 2.821719319290736e-05, |
| "loss": 0.0684, |
| "step": 830 |
| }, |
| { |
| "epoch": 2.3529411764705883, |
| "grad_norm": 0.002737673930823803, |
| "learning_rate": 2.777542205378113e-05, |
| "loss": 0.0001, |
| "step": 840 |
| }, |
| { |
| "epoch": 2.380952380952381, |
| "grad_norm": 0.005815234035253525, |
| "learning_rate": 2.733277163323782e-05, |
| "loss": 0.0038, |
| "step": 850 |
| }, |
| { |
| "epoch": 2.4089635854341735, |
| "grad_norm": 0.0005296830786392093, |
| "learning_rate": 2.6889382167350154e-05, |
| "loss": 0.0001, |
| "step": 860 |
| }, |
| { |
| "epoch": 2.4369747899159666, |
| "grad_norm": 0.001167680835351348, |
| "learning_rate": 2.6445394126327865e-05, |
| "loss": 0.0, |
| "step": 870 |
| }, |
| { |
| "epoch": 2.4649859943977592, |
| "grad_norm": 0.0011337065370753407, |
| "learning_rate": 2.6000948170015205e-05, |
| "loss": 0.016, |
| "step": 880 |
| }, |
| { |
| "epoch": 2.492997198879552, |
| "grad_norm": 0.002113680588081479, |
| "learning_rate": 2.555618510332859e-05, |
| "loss": 0.0, |
| "step": 890 |
| }, |
| { |
| "epoch": 2.5210084033613445, |
| "grad_norm": 0.00770913390442729, |
| "learning_rate": 2.511124583164816e-05, |
| "loss": 0.0, |
| "step": 900 |
| }, |
| { |
| "epoch": 2.5210084033613445, |
| "eval_loss": 0.005274456925690174, |
| "eval_runtime": 2.873, |
| "eval_samples_per_second": 52.21, |
| "eval_steps_per_second": 6.613, |
| "step": 900 |
| }, |
| { |
| "epoch": 2.549019607843137, |
| "grad_norm": 0.0025718784891068935, |
| "learning_rate": 2.4666271316177557e-05, |
| "loss": 0.0001, |
| "step": 910 |
| }, |
| { |
| "epoch": 2.5770308123249297, |
| "grad_norm": 0.00034481892362236977, |
| "learning_rate": 2.422140252928601e-05, |
| "loss": 0.0002, |
| "step": 920 |
| }, |
| { |
| "epoch": 2.6050420168067228, |
| "grad_norm": 0.00020677850989159197, |
| "learning_rate": 2.3776780409846888e-05, |
| "loss": 0.0001, |
| "step": 930 |
| }, |
| { |
| "epoch": 2.6330532212885154, |
| "grad_norm": 0.0001574026100570336, |
| "learning_rate": 2.3332545818586827e-05, |
| "loss": 0.0, |
| "step": 940 |
| }, |
| { |
| "epoch": 2.661064425770308, |
| "grad_norm": 0.017475171014666557, |
| "learning_rate": 2.2888839493459684e-05, |
| "loss": 0.0, |
| "step": 950 |
| }, |
| { |
| "epoch": 2.689075630252101, |
| "grad_norm": 0.006330742035061121, |
| "learning_rate": 2.2445802005059328e-05, |
| "loss": 0.0, |
| "step": 960 |
| }, |
| { |
| "epoch": 2.7170868347338937, |
| "grad_norm": 0.0004552874306682497, |
| "learning_rate": 2.2003573712085457e-05, |
| "loss": 0.0, |
| "step": 970 |
| }, |
| { |
| "epoch": 2.7450980392156863, |
| "grad_norm": 0.0009258923237212002, |
| "learning_rate": 2.1562294716876596e-05, |
| "loss": 0.0, |
| "step": 980 |
| }, |
| { |
| "epoch": 2.773109243697479, |
| "grad_norm": 0.0004848680691793561, |
| "learning_rate": 2.112210482102428e-05, |
| "loss": 0.0, |
| "step": 990 |
| }, |
| { |
| "epoch": 2.8011204481792715, |
| "grad_norm": 0.0008731464040465653, |
| "learning_rate": 2.0683143481082452e-05, |
| "loss": 0.0, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.8011204481792715, |
| "eval_loss": 0.005379769951105118, |
| "eval_runtime": 2.8678, |
| "eval_samples_per_second": 52.304, |
| "eval_steps_per_second": 6.625, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.8011204481792715, |
| "step": 1000, |
| "total_flos": 8.23229487073198e+16, |
| "train_loss": 0.1688887168551737, |
| "train_runtime": 530.2932, |
| "train_samples_per_second": 26.872, |
| "train_steps_per_second": 3.366 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 1785, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "total_flos": 8.23229487073198e+16, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|