{ "best_metric": 3.648681376944296e-05, "best_model_checkpoint": "ckpt/llama3_8b_fuze27_no_sys/contextual_parametric_knowledge_conflicts_no_sys/checkpoint-1000", "epoch": 2.4161073825503356, "eval_steps": 200, "global_step": 1800, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.013422818791946308, "grad_norm": 14.714207649230957, "learning_rate": 5e-06, "loss": 1.9703, "step": 10 }, { "epoch": 0.026845637583892617, "grad_norm": 18.66051483154297, "learning_rate": 1e-05, "loss": 1.7696, "step": 20 }, { "epoch": 0.040268456375838924, "grad_norm": 5.510164260864258, "learning_rate": 9.999955304738815e-06, "loss": 0.8218, "step": 30 }, { "epoch": 0.053691275167785234, "grad_norm": 2.901658773422241, "learning_rate": 9.999821219754324e-06, "loss": 0.2814, "step": 40 }, { "epoch": 0.06711409395973154, "grad_norm": 3.764986991882324, "learning_rate": 9.999597747443714e-06, "loss": 0.1097, "step": 50 }, { "epoch": 0.08053691275167785, "grad_norm": 0.4956361949443817, "learning_rate": 9.999284891802246e-06, "loss": 0.0313, "step": 60 }, { "epoch": 0.09395973154362416, "grad_norm": 0.07353239506483078, "learning_rate": 9.998882658423185e-06, "loss": 0.0179, "step": 70 }, { "epoch": 0.10738255033557047, "grad_norm": 0.12591932713985443, "learning_rate": 9.998391054497703e-06, "loss": 0.0013, "step": 80 }, { "epoch": 0.12080536912751678, "grad_norm": 0.04427539184689522, "learning_rate": 9.997810088814745e-06, "loss": 0.0019, "step": 90 }, { "epoch": 0.1342281879194631, "grad_norm": 0.01067450549453497, "learning_rate": 9.997139771760876e-06, "loss": 0.0005, "step": 100 }, { "epoch": 0.1476510067114094, "grad_norm": 0.0212077796459198, "learning_rate": 9.996380115320095e-06, "loss": 0.0005, "step": 110 }, { "epoch": 0.1610738255033557, "grad_norm": 0.01207214966416359, "learning_rate": 9.995531133073619e-06, "loss": 0.0001, "step": 120 }, { "epoch": 0.174496644295302, "grad_norm": 0.1107475608587265, "learning_rate": 9.994592840199642e-06, "loss": 0.0002, "step": 130 }, { "epoch": 0.18791946308724833, "grad_norm": 0.00909244641661644, "learning_rate": 9.99356525347306e-06, "loss": 0.01, "step": 140 }, { "epoch": 0.20134228187919462, "grad_norm": 0.0034464739728718996, "learning_rate": 9.99244839126518e-06, "loss": 0.0003, "step": 150 }, { "epoch": 0.21476510067114093, "grad_norm": 0.01978999376296997, "learning_rate": 9.991242273543376e-06, "loss": 0.0068, "step": 160 }, { "epoch": 0.22818791946308725, "grad_norm": 0.005352655425667763, "learning_rate": 9.989946921870749e-06, "loss": 0.0034, "step": 170 }, { "epoch": 0.24161073825503357, "grad_norm": 0.002363240346312523, "learning_rate": 9.988562359405733e-06, "loss": 0.0004, "step": 180 }, { "epoch": 0.2550335570469799, "grad_norm": 0.04204447194933891, "learning_rate": 9.987088610901678e-06, "loss": 0.0051, "step": 190 }, { "epoch": 0.2684563758389262, "grad_norm": 0.0113844508305192, "learning_rate": 9.985525702706415e-06, "loss": 0.0001, "step": 200 }, { "epoch": 0.2684563758389262, "eval_loss": 0.0006864700117148459, "eval_runtime": 36.5199, "eval_samples_per_second": 57.612, "eval_steps_per_second": 3.614, "step": 200 }, { "epoch": 0.28187919463087246, "grad_norm": 0.014903889037668705, "learning_rate": 9.98387366276178e-06, "loss": 0.0086, "step": 210 }, { "epoch": 0.2953020134228188, "grad_norm": 0.04282082989811897, "learning_rate": 9.982132520603115e-06, "loss": 0.0001, "step": 220 }, { "epoch": 0.3087248322147651, "grad_norm": 0.0007326242630369961, "learning_rate": 9.980302307358743e-06, "loss": 0.0066, "step": 230 }, { "epoch": 0.3221476510067114, "grad_norm": 0.0007314328686334193, "learning_rate": 9.978383055749407e-06, "loss": 0.0001, "step": 240 }, { "epoch": 0.33557046979865773, "grad_norm": 0.07381263375282288, "learning_rate": 9.976374800087687e-06, "loss": 0.0001, "step": 250 }, { "epoch": 0.348993288590604, "grad_norm": 0.0032492601312696934, "learning_rate": 9.974277576277386e-06, "loss": 0.0001, "step": 260 }, { "epoch": 0.3624161073825503, "grad_norm": 0.0010357198771089315, "learning_rate": 9.972091421812893e-06, "loss": 0.0001, "step": 270 }, { "epoch": 0.37583892617449666, "grad_norm": 0.002767580561339855, "learning_rate": 9.969816375778504e-06, "loss": 0.0002, "step": 280 }, { "epoch": 0.38926174496644295, "grad_norm": 0.05809437856078148, "learning_rate": 9.967452478847735e-06, "loss": 0.0001, "step": 290 }, { "epoch": 0.40268456375838924, "grad_norm": 0.0023956859949976206, "learning_rate": 9.964999773282574e-06, "loss": 0.0091, "step": 300 }, { "epoch": 0.4161073825503356, "grad_norm": 0.002156985690817237, "learning_rate": 9.962458302932753e-06, "loss": 0.0001, "step": 310 }, { "epoch": 0.42953020134228187, "grad_norm": 0.002653814386576414, "learning_rate": 9.959828113234945e-06, "loss": 0.0001, "step": 320 }, { "epoch": 0.4429530201342282, "grad_norm": 0.0016466390807181597, "learning_rate": 9.95710925121195e-06, "loss": 0.0001, "step": 330 }, { "epoch": 0.4563758389261745, "grad_norm": 0.0011488753370940685, "learning_rate": 9.954301765471874e-06, "loss": 0.0003, "step": 340 }, { "epoch": 0.4697986577181208, "grad_norm": 0.0007752739475108683, "learning_rate": 9.951405706207236e-06, "loss": 0.0, "step": 350 }, { "epoch": 0.48322147651006714, "grad_norm": 0.0023285429924726486, "learning_rate": 9.948421125194089e-06, "loss": 0.0001, "step": 360 }, { "epoch": 0.4966442953020134, "grad_norm": 0.015918292105197906, "learning_rate": 9.945348075791084e-06, "loss": 0.0, "step": 370 }, { "epoch": 0.5100671140939598, "grad_norm": 0.0003664461546577513, "learning_rate": 9.942186612938515e-06, "loss": 0.0001, "step": 380 }, { "epoch": 0.5234899328859061, "grad_norm": 0.0018171434057876468, "learning_rate": 9.938936793157351e-06, "loss": 0.0018, "step": 390 }, { "epoch": 0.5369127516778524, "grad_norm": 0.005321137141436338, "learning_rate": 9.935598674548208e-06, "loss": 0.0, "step": 400 }, { "epoch": 0.5369127516778524, "eval_loss": 0.0006335359648801386, "eval_runtime": 37.8172, "eval_samples_per_second": 55.636, "eval_steps_per_second": 3.49, "step": 400 }, { "epoch": 0.5503355704697986, "grad_norm": 0.0010172220645472407, "learning_rate": 9.932172316790317e-06, "loss": 0.0021, "step": 410 }, { "epoch": 0.5637583892617449, "grad_norm": 0.0016757710836827755, "learning_rate": 9.928657781140461e-06, "loss": 0.0, "step": 420 }, { "epoch": 0.5771812080536913, "grad_norm": 0.0011584250023588538, "learning_rate": 9.925055130431876e-06, "loss": 0.0, "step": 430 }, { "epoch": 0.5906040268456376, "grad_norm": 0.0007248067413456738, "learning_rate": 9.921364429073128e-06, "loss": 0.0, "step": 440 }, { "epoch": 0.6040268456375839, "grad_norm": 0.0004155105270911008, "learning_rate": 9.91758574304696e-06, "loss": 0.0, "step": 450 }, { "epoch": 0.6174496644295302, "grad_norm": 0.0006713890470564365, "learning_rate": 9.913719139909118e-06, "loss": 0.0, "step": 460 }, { "epoch": 0.6308724832214765, "grad_norm": 0.0022148373536765575, "learning_rate": 9.909764688787133e-06, "loss": 0.0001, "step": 470 }, { "epoch": 0.6442953020134228, "grad_norm": 0.02001265622675419, "learning_rate": 9.9057224603791e-06, "loss": 0.0001, "step": 480 }, { "epoch": 0.6577181208053692, "grad_norm": 0.002333961194381118, "learning_rate": 9.901592526952397e-06, "loss": 0.0001, "step": 490 }, { "epoch": 0.6711409395973155, "grad_norm": 0.001215808093547821, "learning_rate": 9.897374962342407e-06, "loss": 0.0, "step": 500 }, { "epoch": 0.6845637583892618, "grad_norm": 0.009857764467597008, "learning_rate": 9.89306984195119e-06, "loss": 0.0, "step": 510 }, { "epoch": 0.697986577181208, "grad_norm": 0.0007901525241322815, "learning_rate": 9.88867724274614e-06, "loss": 0.0, "step": 520 }, { "epoch": 0.7114093959731543, "grad_norm": 0.0030371681787073612, "learning_rate": 9.884197243258604e-06, "loss": 0.0001, "step": 530 }, { "epoch": 0.7248322147651006, "grad_norm": 0.008034367114305496, "learning_rate": 9.87962992358248e-06, "loss": 0.0, "step": 540 }, { "epoch": 0.738255033557047, "grad_norm": 0.0002114562230417505, "learning_rate": 9.874975365372782e-06, "loss": 0.0, "step": 550 }, { "epoch": 0.7516778523489933, "grad_norm": 0.0004826551885344088, "learning_rate": 9.870233651844197e-06, "loss": 0.0001, "step": 560 }, { "epoch": 0.7651006711409396, "grad_norm": 0.004415383096784353, "learning_rate": 9.865404867769567e-06, "loss": 0.0012, "step": 570 }, { "epoch": 0.7785234899328859, "grad_norm": 0.0016952032456174493, "learning_rate": 9.860489099478404e-06, "loss": 0.0001, "step": 580 }, { "epoch": 0.7919463087248322, "grad_norm": 0.306771844625473, "learning_rate": 9.855486434855323e-06, "loss": 0.0001, "step": 590 }, { "epoch": 0.8053691275167785, "grad_norm": 0.00039068079786375165, "learning_rate": 9.850396963338486e-06, "loss": 0.0009, "step": 600 }, { "epoch": 0.8053691275167785, "eval_loss": 0.0002706491795834154, "eval_runtime": 36.315, "eval_samples_per_second": 57.937, "eval_steps_per_second": 3.635, "step": 600 }, { "epoch": 0.8187919463087249, "grad_norm": 0.0022268325556069613, "learning_rate": 9.845220775917997e-06, "loss": 0.0, "step": 610 }, { "epoch": 0.8322147651006712, "grad_norm": 0.00018392472702544183, "learning_rate": 9.839957965134276e-06, "loss": 0.0103, "step": 620 }, { "epoch": 0.8456375838926175, "grad_norm": 0.000130903281387873, "learning_rate": 9.834608625076402e-06, "loss": 0.0027, "step": 630 }, { "epoch": 0.8590604026845637, "grad_norm": 0.0025654262863099575, "learning_rate": 9.829172851380438e-06, "loss": 0.0, "step": 640 }, { "epoch": 0.87248322147651, "grad_norm": 0.0009044542675837874, "learning_rate": 9.82365074122771e-06, "loss": 0.0, "step": 650 }, { "epoch": 0.8859060402684564, "grad_norm": 0.011315861716866493, "learning_rate": 9.818042393343086e-06, "loss": 0.0001, "step": 660 }, { "epoch": 0.8993288590604027, "grad_norm": 0.001662239315919578, "learning_rate": 9.812347907993191e-06, "loss": 0.0, "step": 670 }, { "epoch": 0.912751677852349, "grad_norm": 0.0006356589146889746, "learning_rate": 9.806567386984629e-06, "loss": 0.0, "step": 680 }, { "epoch": 0.9261744966442953, "grad_norm": 0.004927029367536306, "learning_rate": 9.800700933662162e-06, "loss": 0.0, "step": 690 }, { "epoch": 0.9395973154362416, "grad_norm": 0.001120736706070602, "learning_rate": 9.79474865290685e-06, "loss": 0.0001, "step": 700 }, { "epoch": 0.9530201342281879, "grad_norm": 0.0011548739857971668, "learning_rate": 9.788710651134197e-06, "loss": 0.0, "step": 710 }, { "epoch": 0.9664429530201343, "grad_norm": 0.0007091641309671104, "learning_rate": 9.782587036292224e-06, "loss": 0.0, "step": 720 }, { "epoch": 0.9798657718120806, "grad_norm": 0.0025191467721015215, "learning_rate": 9.77637791785956e-06, "loss": 0.0, "step": 730 }, { "epoch": 0.9932885906040269, "grad_norm": 0.0007312273373827338, "learning_rate": 9.77008340684347e-06, "loss": 0.0, "step": 740 }, { "epoch": 1.0067114093959733, "grad_norm": 0.001142745721153915, "learning_rate": 9.763703615777881e-06, "loss": 0.0, "step": 750 }, { "epoch": 1.0201342281879195, "grad_norm": 0.002548090647906065, "learning_rate": 9.757238658721368e-06, "loss": 0.0001, "step": 760 }, { "epoch": 1.0335570469798658, "grad_norm": 0.000620865379460156, "learning_rate": 9.750688651255102e-06, "loss": 0.0001, "step": 770 }, { "epoch": 1.0469798657718121, "grad_norm": 0.01897359825670719, "learning_rate": 9.744053710480806e-06, "loss": 0.0, "step": 780 }, { "epoch": 1.0604026845637584, "grad_norm": 0.0007367522921413183, "learning_rate": 9.737333955018641e-06, "loss": 0.0, "step": 790 }, { "epoch": 1.0738255033557047, "grad_norm": 0.000936626922339201, "learning_rate": 9.7305295050051e-06, "loss": 0.0, "step": 800 }, { "epoch": 1.0738255033557047, "eval_loss": 5.021028846385889e-05, "eval_runtime": 35.3959, "eval_samples_per_second": 59.442, "eval_steps_per_second": 3.729, "step": 800 }, { "epoch": 1.087248322147651, "grad_norm": 0.0032772677950561047, "learning_rate": 9.723640482090849e-06, "loss": 0.0, "step": 810 }, { "epoch": 1.1006711409395973, "grad_norm": 0.0012591411359608173, "learning_rate": 9.71666700943856e-06, "loss": 0.0, "step": 820 }, { "epoch": 1.1140939597315436, "grad_norm": 0.0003189941344317049, "learning_rate": 9.709609211720707e-06, "loss": 0.0, "step": 830 }, { "epoch": 1.1275167785234899, "grad_norm": 0.004900411702692509, "learning_rate": 9.702467215117333e-06, "loss": 0.0001, "step": 840 }, { "epoch": 1.1409395973154361, "grad_norm": 0.005429003853350878, "learning_rate": 9.6952411473138e-06, "loss": 0.0, "step": 850 }, { "epoch": 1.1543624161073827, "grad_norm": 0.004705165047198534, "learning_rate": 9.687931137498505e-06, "loss": 0.0, "step": 860 }, { "epoch": 1.167785234899329, "grad_norm": 0.0001935947366291657, "learning_rate": 9.680537316360563e-06, "loss": 0.0, "step": 870 }, { "epoch": 1.1812080536912752, "grad_norm": 0.0003382129652891308, "learning_rate": 9.673059816087485e-06, "loss": 0.0, "step": 880 }, { "epoch": 1.1946308724832215, "grad_norm": 0.0031510302796959877, "learning_rate": 9.6654987703628e-06, "loss": 0.0, "step": 890 }, { "epoch": 1.2080536912751678, "grad_norm": 0.00032090378226712346, "learning_rate": 9.657854314363673e-06, "loss": 0.0, "step": 900 }, { "epoch": 1.221476510067114, "grad_norm": 0.000652803631965071, "learning_rate": 9.650126584758488e-06, "loss": 0.0, "step": 910 }, { "epoch": 1.2348993288590604, "grad_norm": 0.0010263837175443769, "learning_rate": 9.642315719704402e-06, "loss": 0.0, "step": 920 }, { "epoch": 1.2483221476510067, "grad_norm": 0.0048846108838915825, "learning_rate": 9.634421858844877e-06, "loss": 0.0, "step": 930 }, { "epoch": 1.261744966442953, "grad_norm": 0.004617949482053518, "learning_rate": 9.626445143307183e-06, "loss": 0.0, "step": 940 }, { "epoch": 1.2751677852348993, "grad_norm": 0.011888934299349785, "learning_rate": 9.618385715699872e-06, "loss": 0.0, "step": 950 }, { "epoch": 1.2885906040268456, "grad_norm": 0.0007617058581672609, "learning_rate": 9.610243720110231e-06, "loss": 0.0, "step": 960 }, { "epoch": 1.302013422818792, "grad_norm": 0.002630546223372221, "learning_rate": 9.602019302101711e-06, "loss": 0.0, "step": 970 }, { "epoch": 1.3154362416107381, "grad_norm": 0.00037842453457415104, "learning_rate": 9.593712608711316e-06, "loss": 0.0, "step": 980 }, { "epoch": 1.3288590604026846, "grad_norm": 0.00104868458583951, "learning_rate": 9.585323788446977e-06, "loss": 0.0, "step": 990 }, { "epoch": 1.342281879194631, "grad_norm": 0.0007262201397679746, "learning_rate": 9.5768529912849e-06, "loss": 0.0, "step": 1000 }, { "epoch": 1.342281879194631, "eval_loss": 3.648681376944296e-05, "eval_runtime": 35.3334, "eval_samples_per_second": 59.547, "eval_steps_per_second": 3.736, "step": 1000 }, { "epoch": 1.3557046979865772, "grad_norm": 0.0010115931509062648, "learning_rate": 9.56830036866688e-06, "loss": 0.0, "step": 1010 }, { "epoch": 1.3691275167785235, "grad_norm": 0.0012278178473934531, "learning_rate": 9.559666073497602e-06, "loss": 0.0, "step": 1020 }, { "epoch": 1.3825503355704698, "grad_norm": 0.0025386980269104242, "learning_rate": 9.550950260141893e-06, "loss": 0.0, "step": 1030 }, { "epoch": 1.395973154362416, "grad_norm": 0.004029413219541311, "learning_rate": 9.542153084421974e-06, "loss": 0.0, "step": 1040 }, { "epoch": 1.4093959731543624, "grad_norm": 0.0012687516864389181, "learning_rate": 9.533274703614675e-06, "loss": 0.0, "step": 1050 }, { "epoch": 1.4228187919463087, "grad_norm": 0.0002910475595854223, "learning_rate": 9.524315276448615e-06, "loss": 0.0, "step": 1060 }, { "epoch": 1.436241610738255, "grad_norm": 0.0001882436336018145, "learning_rate": 9.515274963101366e-06, "loss": 0.0, "step": 1070 }, { "epoch": 1.4496644295302015, "grad_norm": 0.004969654604792595, "learning_rate": 9.506153925196599e-06, "loss": 0.0, "step": 1080 }, { "epoch": 1.4630872483221475, "grad_norm": 0.00046876867418177426, "learning_rate": 9.496952325801178e-06, "loss": 0.0, "step": 1090 }, { "epoch": 1.476510067114094, "grad_norm": 0.0035596322268247604, "learning_rate": 9.487670329422262e-06, "loss": 0.0, "step": 1100 }, { "epoch": 1.4899328859060403, "grad_norm": 0.001743100001476705, "learning_rate": 9.47830810200435e-06, "loss": 0.0, "step": 1110 }, { "epoch": 1.5033557046979866, "grad_norm": 0.0005936401430517435, "learning_rate": 9.46886581092632e-06, "loss": 0.0, "step": 1120 }, { "epoch": 1.516778523489933, "grad_norm": 0.0004633254138752818, "learning_rate": 9.459343624998444e-06, "loss": 0.0003, "step": 1130 }, { "epoch": 1.5302013422818792, "grad_norm": 0.000729815277736634, "learning_rate": 9.449741714459353e-06, "loss": 0.0, "step": 1140 }, { "epoch": 1.5436241610738255, "grad_norm": 0.002619138453155756, "learning_rate": 9.440060250973006e-06, "loss": 0.0, "step": 1150 }, { "epoch": 1.5570469798657718, "grad_norm": 0.0005363261443562806, "learning_rate": 9.430299407625621e-06, "loss": 0.0, "step": 1160 }, { "epoch": 1.570469798657718, "grad_norm": 0.002522964496165514, "learning_rate": 9.420459358922573e-06, "loss": 0.0, "step": 1170 }, { "epoch": 1.5838926174496644, "grad_norm": 0.0003401544236112386, "learning_rate": 9.410540280785281e-06, "loss": 0.0, "step": 1180 }, { "epoch": 1.5973154362416109, "grad_norm": 0.0032590986229479313, "learning_rate": 9.400542350548064e-06, "loss": 0.0, "step": 1190 }, { "epoch": 1.610738255033557, "grad_norm": 0.000724705052562058, "learning_rate": 9.39046574695496e-06, "loss": 0.0, "step": 1200 }, { "epoch": 1.610738255033557, "eval_loss": 2.2967349650571123e-05, "eval_runtime": 35.3562, "eval_samples_per_second": 59.509, "eval_steps_per_second": 3.733, "step": 1200 }, { "epoch": 1.6241610738255035, "grad_norm": 0.0012911584926769137, "learning_rate": 9.380310650156539e-06, "loss": 0.0, "step": 1210 }, { "epoch": 1.6375838926174495, "grad_norm": 0.0004712361260317266, "learning_rate": 9.370077241706685e-06, "loss": 0.0, "step": 1220 }, { "epoch": 1.651006711409396, "grad_norm": 0.021958833560347557, "learning_rate": 9.359765704559345e-06, "loss": 0.0, "step": 1230 }, { "epoch": 1.6644295302013423, "grad_norm": 0.0022053795401006937, "learning_rate": 9.349376223065254e-06, "loss": 0.0, "step": 1240 }, { "epoch": 1.6778523489932886, "grad_norm": 0.0005478787934407592, "learning_rate": 9.338908982968648e-06, "loss": 0.0, "step": 1250 }, { "epoch": 1.691275167785235, "grad_norm": 0.0007460885099135339, "learning_rate": 9.328364171403942e-06, "loss": 0.0, "step": 1260 }, { "epoch": 1.7046979865771812, "grad_norm": 0.0019455490401014686, "learning_rate": 9.317741976892378e-06, "loss": 0.0, "step": 1270 }, { "epoch": 1.7181208053691275, "grad_norm": 0.00035590690094977617, "learning_rate": 9.307042589338656e-06, "loss": 0.0, "step": 1280 }, { "epoch": 1.7315436241610738, "grad_norm": 0.012004991061985493, "learning_rate": 9.296266200027547e-06, "loss": 0.0, "step": 1290 }, { "epoch": 1.7449664429530203, "grad_norm": 0.0004085991531610489, "learning_rate": 9.285413001620465e-06, "loss": 0.0, "step": 1300 }, { "epoch": 1.7583892617449663, "grad_norm": 0.00010755215043900535, "learning_rate": 9.274483188152024e-06, "loss": 0.0, "step": 1310 }, { "epoch": 1.7718120805369129, "grad_norm": 0.00267704832367599, "learning_rate": 9.263476955026571e-06, "loss": 0.0, "step": 1320 }, { "epoch": 1.785234899328859, "grad_norm": 0.0034030245151370764, "learning_rate": 9.252394499014694e-06, "loss": 0.0, "step": 1330 }, { "epoch": 1.7986577181208054, "grad_norm": 0.00013984985707793385, "learning_rate": 9.241236018249697e-06, "loss": 0.0, "step": 1340 }, { "epoch": 1.8120805369127517, "grad_norm": 0.0002011173201026395, "learning_rate": 9.230001712224065e-06, "loss": 0.0, "step": 1350 }, { "epoch": 1.825503355704698, "grad_norm": 0.00010617657972034067, "learning_rate": 9.218691781785895e-06, "loss": 0.0007, "step": 1360 }, { "epoch": 1.8389261744966443, "grad_norm": 0.0009955656714737415, "learning_rate": 9.207306429135308e-06, "loss": 0.0, "step": 1370 }, { "epoch": 1.8523489932885906, "grad_norm": 0.0036702740471810102, "learning_rate": 9.195845857820824e-06, "loss": 0.0, "step": 1380 }, { "epoch": 1.8657718120805369, "grad_norm": 0.0002426176652079448, "learning_rate": 9.184310272735734e-06, "loss": 0.0001, "step": 1390 }, { "epoch": 1.8791946308724832, "grad_norm": 0.00634851586073637, "learning_rate": 9.172699880114439e-06, "loss": 0.0002, "step": 1400 }, { "epoch": 1.8791946308724832, "eval_loss": 0.00027104900800623, "eval_runtime": 35.3598, "eval_samples_per_second": 59.503, "eval_steps_per_second": 3.733, "step": 1400 }, { "epoch": 1.8926174496644297, "grad_norm": 0.0036746342666447163, "learning_rate": 9.161014887528745e-06, "loss": 0.0, "step": 1410 }, { "epoch": 1.9060402684563758, "grad_norm": 0.000249032280407846, "learning_rate": 9.149255503884173e-06, "loss": 0.0027, "step": 1420 }, { "epoch": 1.9194630872483223, "grad_norm": 0.000549475138541311, "learning_rate": 9.137421939416213e-06, "loss": 0.0, "step": 1430 }, { "epoch": 1.9328859060402683, "grad_norm": 0.0003771043266169727, "learning_rate": 9.125514405686565e-06, "loss": 0.0, "step": 1440 }, { "epoch": 1.9463087248322148, "grad_norm": 0.0006280411034822464, "learning_rate": 9.113533115579362e-06, "loss": 0.0, "step": 1450 }, { "epoch": 1.959731543624161, "grad_norm": 0.0007881259662099183, "learning_rate": 9.10147828329736e-06, "loss": 0.0001, "step": 1460 }, { "epoch": 1.9731543624161074, "grad_norm": 0.0020082280971109867, "learning_rate": 9.089350124358112e-06, "loss": 0.0, "step": 1470 }, { "epoch": 1.9865771812080537, "grad_norm": 0.0006154579459689558, "learning_rate": 9.077148855590107e-06, "loss": 0.0, "step": 1480 }, { "epoch": 2.0, "grad_norm": 0.00037393253296613693, "learning_rate": 9.064874695128905e-06, "loss": 0.0, "step": 1490 }, { "epoch": 2.0134228187919465, "grad_norm": 0.00029199194977991283, "learning_rate": 9.052527862413227e-06, "loss": 0.0, "step": 1500 }, { "epoch": 2.0268456375838926, "grad_norm": 0.000314797624014318, "learning_rate": 9.040108578181043e-06, "loss": 0.0, "step": 1510 }, { "epoch": 2.040268456375839, "grad_norm": 0.0012662105727940798, "learning_rate": 9.027617064465609e-06, "loss": 0.0, "step": 1520 }, { "epoch": 2.053691275167785, "grad_norm": 0.003268664237111807, "learning_rate": 9.015053544591515e-06, "loss": 0.0, "step": 1530 }, { "epoch": 2.0671140939597317, "grad_norm": 0.0001988365693250671, "learning_rate": 9.00241824317068e-06, "loss": 0.0, "step": 1540 }, { "epoch": 2.0805369127516777, "grad_norm": 0.0001061362199834548, "learning_rate": 8.989711386098342e-06, "loss": 0.0, "step": 1550 }, { "epoch": 2.0939597315436242, "grad_norm": 0.0002688623790163547, "learning_rate": 8.976933200549025e-06, "loss": 0.0, "step": 1560 }, { "epoch": 2.1073825503355703, "grad_norm": 0.00019378861179575324, "learning_rate": 8.964083914972458e-06, "loss": 0.0, "step": 1570 }, { "epoch": 2.120805369127517, "grad_norm": 0.0033799654338508844, "learning_rate": 8.951163759089518e-06, "loss": 0.0, "step": 1580 }, { "epoch": 2.134228187919463, "grad_norm": 0.00018397756502963603, "learning_rate": 8.938172963888095e-06, "loss": 0.0, "step": 1590 }, { "epoch": 2.1476510067114094, "grad_norm": 0.04040246829390526, "learning_rate": 8.925111761618987e-06, "loss": 0.0, "step": 1600 }, { "epoch": 2.1476510067114094, "eval_loss": 2.1961919628665783e-05, "eval_runtime": 35.3554, "eval_samples_per_second": 59.51, "eval_steps_per_second": 3.734, "step": 1600 }, { "epoch": 2.1610738255033555, "grad_norm": 0.00038172732456587255, "learning_rate": 8.911980385791731e-06, "loss": 0.0, "step": 1610 }, { "epoch": 2.174496644295302, "grad_norm": 0.0001361399336019531, "learning_rate": 8.898779071170435e-06, "loss": 0.0, "step": 1620 }, { "epoch": 2.1879194630872485, "grad_norm": 0.0005550897913053632, "learning_rate": 8.885508053769586e-06, "loss": 0.0, "step": 1630 }, { "epoch": 2.2013422818791946, "grad_norm": 0.004139598459005356, "learning_rate": 8.872167570849814e-06, "loss": 0.0, "step": 1640 }, { "epoch": 2.214765100671141, "grad_norm": 0.0013187492731958628, "learning_rate": 8.858757860913669e-06, "loss": 0.0, "step": 1650 }, { "epoch": 2.228187919463087, "grad_norm": 0.0012508869403973222, "learning_rate": 8.845279163701344e-06, "loss": 0.0, "step": 1660 }, { "epoch": 2.2416107382550337, "grad_norm": 0.0005907061859034002, "learning_rate": 8.831731720186398e-06, "loss": 0.0, "step": 1670 }, { "epoch": 2.2550335570469797, "grad_norm": 0.0005804875981993973, "learning_rate": 8.818115772571444e-06, "loss": 0.0, "step": 1680 }, { "epoch": 2.2684563758389262, "grad_norm": 0.0011968908365815878, "learning_rate": 8.804431564283808e-06, "loss": 0.0, "step": 1690 }, { "epoch": 2.2818791946308723, "grad_norm": 0.0004881023778580129, "learning_rate": 8.790679339971205e-06, "loss": 0.0, "step": 1700 }, { "epoch": 2.295302013422819, "grad_norm": 0.0005363011150620878, "learning_rate": 8.776859345497331e-06, "loss": 0.0, "step": 1710 }, { "epoch": 2.3087248322147653, "grad_norm": 0.0028747557662427425, "learning_rate": 8.762971827937494e-06, "loss": 0.0, "step": 1720 }, { "epoch": 2.3221476510067114, "grad_norm": 0.0003347527817822993, "learning_rate": 8.749017035574183e-06, "loss": 0.0, "step": 1730 }, { "epoch": 2.335570469798658, "grad_norm": 0.00023599617998115718, "learning_rate": 8.734995217892636e-06, "loss": 0.0, "step": 1740 }, { "epoch": 2.348993288590604, "grad_norm": 0.0033915615640580654, "learning_rate": 8.72090662557637e-06, "loss": 0.0, "step": 1750 }, { "epoch": 2.3624161073825505, "grad_norm": 9.387471800437197e-05, "learning_rate": 8.706751510502716e-06, "loss": 0.0, "step": 1760 }, { "epoch": 2.3758389261744965, "grad_norm": 0.0018768429290503263, "learning_rate": 8.692530125738294e-06, "loss": 0.0, "step": 1770 }, { "epoch": 2.389261744966443, "grad_norm": 0.006376422941684723, "learning_rate": 8.678242725534512e-06, "loss": 0.0, "step": 1780 }, { "epoch": 2.402684563758389, "grad_norm": 0.0060360003262758255, "learning_rate": 8.663889565322998e-06, "loss": 0.0, "step": 1790 }, { "epoch": 2.4161073825503356, "grad_norm": 9.72438501776196e-05, "learning_rate": 8.649470901711056e-06, "loss": 0.0, "step": 1800 }, { "epoch": 2.4161073825503356, "eval_loss": 2.182549360441044e-05, "eval_runtime": 35.3454, "eval_samples_per_second": 59.527, "eval_steps_per_second": 3.735, "step": 1800 }, { "epoch": 2.4161073825503356, "step": 1800, "total_flos": 4.781788253483172e+17, "train_loss": 0.028248545922963077, "train_runtime": 1989.9374, "train_samples_per_second": 59.896, "train_steps_per_second": 3.744 } ], "logging_steps": 10, "max_steps": 7450, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 1000, "total_flos": 4.781788253483172e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }