{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9836065573770492, "eval_steps": 1000, "global_step": 18000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00546448087431694, "grad_norm": 0.33557644486427307, "learning_rate": 0.00014918852459016392, "loss": 3.2997506713867186, "step": 100 }, { "epoch": 0.01092896174863388, "grad_norm": 0.3691432774066925, "learning_rate": 0.00014836885245901637, "loss": 3.297074279785156, "step": 200 }, { "epoch": 0.01639344262295082, "grad_norm": 0.33957722783088684, "learning_rate": 0.00014754918032786884, "loss": 3.284024353027344, "step": 300 }, { "epoch": 0.02185792349726776, "grad_norm": 0.324457049369812, "learning_rate": 0.0001467295081967213, "loss": 3.2819815063476563, "step": 400 }, { "epoch": 0.0273224043715847, "grad_norm": 0.3473037779331207, "learning_rate": 0.00014590983606557376, "loss": 3.273143005371094, "step": 500 }, { "epoch": 0.03278688524590164, "grad_norm": 0.33360302448272705, "learning_rate": 0.0001450901639344262, "loss": 3.2673272705078125, "step": 600 }, { "epoch": 0.03825136612021858, "grad_norm": 0.35968998074531555, "learning_rate": 0.00014427049180327868, "loss": 3.2718386840820313, "step": 700 }, { "epoch": 0.04371584699453552, "grad_norm": 0.34233754873275757, "learning_rate": 0.00014345081967213113, "loss": 3.2761669921875, "step": 800 }, { "epoch": 0.04918032786885246, "grad_norm": 0.34049418568611145, "learning_rate": 0.00014263114754098358, "loss": 3.2359161376953125, "step": 900 }, { "epoch": 0.0546448087431694, "grad_norm": 0.3437342047691345, "learning_rate": 0.00014181147540983605, "loss": 3.2309716796875, "step": 1000 }, { "epoch": 0.0546448087431694, "eval_loss": 3.141683578491211, "eval_runtime": 167.5376, "eval_samples_per_second": 51.851, "eval_steps_per_second": 1.624, "step": 1000 }, { "epoch": 0.060109289617486336, "grad_norm": 0.3368486166000366, "learning_rate": 0.00014099180327868853, "loss": 3.2491357421875, "step": 1100 }, { "epoch": 0.06557377049180328, "grad_norm": 0.3406209945678711, "learning_rate": 0.00014017213114754097, "loss": 3.241882629394531, "step": 1200 }, { "epoch": 0.07103825136612021, "grad_norm": 0.36890581250190735, "learning_rate": 0.00013935245901639345, "loss": 3.21847412109375, "step": 1300 }, { "epoch": 0.07650273224043716, "grad_norm": 0.32925161719322205, "learning_rate": 0.0001385327868852459, "loss": 3.247527770996094, "step": 1400 }, { "epoch": 0.08196721311475409, "grad_norm": 0.3606502115726471, "learning_rate": 0.00013771311475409834, "loss": 3.2279705810546875, "step": 1500 }, { "epoch": 0.08743169398907104, "grad_norm": 0.35976818203926086, "learning_rate": 0.00013689344262295082, "loss": 3.2205975341796873, "step": 1600 }, { "epoch": 0.09289617486338798, "grad_norm": 0.35467588901519775, "learning_rate": 0.00013607377049180326, "loss": 3.23948486328125, "step": 1700 }, { "epoch": 0.09836065573770492, "grad_norm": 0.33707618713378906, "learning_rate": 0.00013525409836065574, "loss": 3.22716796875, "step": 1800 }, { "epoch": 0.10382513661202186, "grad_norm": 0.34896889328956604, "learning_rate": 0.00013443442622950818, "loss": 3.254466247558594, "step": 1900 }, { "epoch": 0.1092896174863388, "grad_norm": 0.33358848094940186, "learning_rate": 0.00013361475409836063, "loss": 3.235157470703125, "step": 2000 }, { "epoch": 0.1092896174863388, "eval_loss": 3.129152297973633, "eval_runtime": 166.3667, "eval_samples_per_second": 52.216, "eval_steps_per_second": 1.635, "step": 2000 }, { "epoch": 0.11475409836065574, "grad_norm": 0.36108165979385376, "learning_rate": 0.0001327950819672131, "loss": 3.2411184692382813, "step": 2100 }, { "epoch": 0.12021857923497267, "grad_norm": 0.33732327818870544, "learning_rate": 0.00013197540983606555, "loss": 3.2485076904296877, "step": 2200 }, { "epoch": 0.12568306010928962, "grad_norm": 0.35349759459495544, "learning_rate": 0.00013115573770491803, "loss": 3.2446453857421873, "step": 2300 }, { "epoch": 0.13114754098360656, "grad_norm": 0.33498039841651917, "learning_rate": 0.00013033606557377047, "loss": 3.2644442749023437, "step": 2400 }, { "epoch": 0.1366120218579235, "grad_norm": 0.3694196939468384, "learning_rate": 0.00012951639344262292, "loss": 3.235172119140625, "step": 2500 }, { "epoch": 0.14207650273224043, "grad_norm": 0.34429556131362915, "learning_rate": 0.0001286967213114754, "loss": 3.2346224975585938, "step": 2600 }, { "epoch": 0.14754098360655737, "grad_norm": 0.3450092673301697, "learning_rate": 0.00012787704918032784, "loss": 3.2645361328125, "step": 2700 }, { "epoch": 0.15300546448087432, "grad_norm": 0.3353455662727356, "learning_rate": 0.00012705737704918032, "loss": 3.259942626953125, "step": 2800 }, { "epoch": 0.15846994535519127, "grad_norm": 0.3381529450416565, "learning_rate": 0.0001262377049180328, "loss": 3.219759826660156, "step": 2900 }, { "epoch": 0.16393442622950818, "grad_norm": 0.3392621576786041, "learning_rate": 0.00012541803278688524, "loss": 3.2325253295898437, "step": 3000 }, { "epoch": 0.16393442622950818, "eval_loss": 3.116848945617676, "eval_runtime": 167.4485, "eval_samples_per_second": 51.879, "eval_steps_per_second": 1.624, "step": 3000 }, { "epoch": 0.16939890710382513, "grad_norm": 0.3316171169281006, "learning_rate": 0.0001245983606557377, "loss": 3.2304959106445312, "step": 3100 }, { "epoch": 0.17486338797814208, "grad_norm": 0.3558633625507355, "learning_rate": 0.00012377868852459016, "loss": 3.233113098144531, "step": 3200 }, { "epoch": 0.18032786885245902, "grad_norm": 0.3265064060688019, "learning_rate": 0.0001229590163934426, "loss": 3.2334609985351563, "step": 3300 }, { "epoch": 0.18579234972677597, "grad_norm": 0.3422014117240906, "learning_rate": 0.00012213934426229508, "loss": 3.2320993041992185, "step": 3400 }, { "epoch": 0.1912568306010929, "grad_norm": 0.3564997911453247, "learning_rate": 0.00012131967213114753, "loss": 3.24385009765625, "step": 3500 }, { "epoch": 0.19672131147540983, "grad_norm": 0.350437730550766, "learning_rate": 0.00012049999999999999, "loss": 3.2268707275390627, "step": 3600 }, { "epoch": 0.20218579234972678, "grad_norm": 0.3819025158882141, "learning_rate": 0.00011968032786885245, "loss": 3.2548171997070314, "step": 3700 }, { "epoch": 0.20765027322404372, "grad_norm": 0.3577027916908264, "learning_rate": 0.00011886065573770491, "loss": 3.242948303222656, "step": 3800 }, { "epoch": 0.21311475409836064, "grad_norm": 0.34992942214012146, "learning_rate": 0.00011804098360655737, "loss": 3.247112121582031, "step": 3900 }, { "epoch": 0.2185792349726776, "grad_norm": 0.33957329392433167, "learning_rate": 0.00011722131147540982, "loss": 3.2855084228515623, "step": 4000 }, { "epoch": 0.2185792349726776, "eval_loss": 3.1081910133361816, "eval_runtime": 166.2296, "eval_samples_per_second": 52.259, "eval_steps_per_second": 1.636, "step": 4000 }, { "epoch": 0.22404371584699453, "grad_norm": 0.39298462867736816, "learning_rate": 0.00011640163934426228, "loss": 3.2725079345703123, "step": 4100 }, { "epoch": 0.22950819672131148, "grad_norm": 0.3378917872905731, "learning_rate": 0.00011558196721311474, "loss": 3.2375408935546877, "step": 4200 }, { "epoch": 0.23497267759562843, "grad_norm": 0.34373924136161804, "learning_rate": 0.0001147622950819672, "loss": 3.264992980957031, "step": 4300 }, { "epoch": 0.24043715846994534, "grad_norm": 0.3387899398803711, "learning_rate": 0.00011394262295081966, "loss": 3.25844482421875, "step": 4400 }, { "epoch": 0.2459016393442623, "grad_norm": 0.35700681805610657, "learning_rate": 0.00011312295081967212, "loss": 3.262210693359375, "step": 4500 }, { "epoch": 0.25136612021857924, "grad_norm": 0.3377688229084015, "learning_rate": 0.00011230327868852457, "loss": 3.2448056030273436, "step": 4600 }, { "epoch": 0.2568306010928962, "grad_norm": 0.3596217930316925, "learning_rate": 0.00011148360655737704, "loss": 3.2498098754882814, "step": 4700 }, { "epoch": 0.26229508196721313, "grad_norm": 0.33321240544319153, "learning_rate": 0.0001106639344262295, "loss": 3.23698486328125, "step": 4800 }, { "epoch": 0.2677595628415301, "grad_norm": 0.3356533944606781, "learning_rate": 0.00010984426229508196, "loss": 3.2359185791015626, "step": 4900 }, { "epoch": 0.273224043715847, "grad_norm": 0.3382013142108917, "learning_rate": 0.00010902459016393442, "loss": 3.17927978515625, "step": 5000 }, { "epoch": 0.273224043715847, "eval_loss": 3.099688768386841, "eval_runtime": 167.6483, "eval_samples_per_second": 51.817, "eval_steps_per_second": 1.622, "step": 5000 }, { "epoch": 0.2786885245901639, "grad_norm": 0.3593096435070038, "learning_rate": 0.00010820491803278688, "loss": 3.2057940673828127, "step": 5100 }, { "epoch": 0.28415300546448086, "grad_norm": 0.3411197364330292, "learning_rate": 0.00010738524590163934, "loss": 3.1890634155273436, "step": 5200 }, { "epoch": 0.2896174863387978, "grad_norm": 0.3614797592163086, "learning_rate": 0.00010656557377049179, "loss": 3.1959136962890624, "step": 5300 }, { "epoch": 0.29508196721311475, "grad_norm": 0.3614165782928467, "learning_rate": 0.00010574590163934425, "loss": 3.190245361328125, "step": 5400 }, { "epoch": 0.3005464480874317, "grad_norm": 0.34652748703956604, "learning_rate": 0.00010492622950819671, "loss": 3.170889892578125, "step": 5500 }, { "epoch": 0.30601092896174864, "grad_norm": 0.3489515781402588, "learning_rate": 0.00010410655737704917, "loss": 3.202828063964844, "step": 5600 }, { "epoch": 0.3114754098360656, "grad_norm": 0.33419397473335266, "learning_rate": 0.00010328688524590163, "loss": 3.1874429321289064, "step": 5700 }, { "epoch": 0.31693989071038253, "grad_norm": 0.33504703640937805, "learning_rate": 0.00010246721311475408, "loss": 3.180716857910156, "step": 5800 }, { "epoch": 0.3224043715846995, "grad_norm": 0.3674669861793518, "learning_rate": 0.00010164754098360654, "loss": 3.1808792114257813, "step": 5900 }, { "epoch": 0.32786885245901637, "grad_norm": 0.3543224036693573, "learning_rate": 0.000100827868852459, "loss": 3.2052008056640626, "step": 6000 }, { "epoch": 0.32786885245901637, "eval_loss": 3.0916807651519775, "eval_runtime": 167.0778, "eval_samples_per_second": 51.994, "eval_steps_per_second": 1.628, "step": 6000 }, { "epoch": 0.3333333333333333, "grad_norm": 0.34399476647377014, "learning_rate": 0.00010000819672131146, "loss": 3.2100375366210936, "step": 6100 }, { "epoch": 0.33879781420765026, "grad_norm": 0.33845406770706177, "learning_rate": 9.918852459016392e-05, "loss": 3.2021624755859377, "step": 6200 }, { "epoch": 0.3442622950819672, "grad_norm": 0.35047417879104614, "learning_rate": 9.836885245901638e-05, "loss": 3.1676751708984376, "step": 6300 }, { "epoch": 0.34972677595628415, "grad_norm": 0.3295944929122925, "learning_rate": 9.754918032786883e-05, "loss": 3.191239929199219, "step": 6400 }, { "epoch": 0.3551912568306011, "grad_norm": 0.35513830184936523, "learning_rate": 9.672950819672129e-05, "loss": 3.2161325073242186, "step": 6500 }, { "epoch": 0.36065573770491804, "grad_norm": 0.34763020277023315, "learning_rate": 9.590983606557377e-05, "loss": 3.1975909423828126, "step": 6600 }, { "epoch": 0.366120218579235, "grad_norm": 0.35204017162323, "learning_rate": 9.509016393442623e-05, "loss": 3.2129571533203123, "step": 6700 }, { "epoch": 0.37158469945355194, "grad_norm": 0.3598620295524597, "learning_rate": 9.427049180327869e-05, "loss": 3.233637390136719, "step": 6800 }, { "epoch": 0.3770491803278688, "grad_norm": 0.3516027331352234, "learning_rate": 9.345081967213115e-05, "loss": 3.236307373046875, "step": 6900 }, { "epoch": 0.3825136612021858, "grad_norm": 0.3794242739677429, "learning_rate": 9.26311475409836e-05, "loss": 3.2149234008789063, "step": 7000 }, { "epoch": 0.3825136612021858, "eval_loss": 3.0852153301239014, "eval_runtime": 166.2243, "eval_samples_per_second": 52.261, "eval_steps_per_second": 1.636, "step": 7000 }, { "epoch": 0.3879781420765027, "grad_norm": 0.355341374874115, "learning_rate": 9.181147540983606e-05, "loss": 3.2003558349609373, "step": 7100 }, { "epoch": 0.39344262295081966, "grad_norm": 0.3544386029243469, "learning_rate": 9.099180327868852e-05, "loss": 3.183940734863281, "step": 7200 }, { "epoch": 0.3989071038251366, "grad_norm": 0.35201796889305115, "learning_rate": 9.017213114754098e-05, "loss": 3.2111468505859375, "step": 7300 }, { "epoch": 0.40437158469945356, "grad_norm": 0.3590731918811798, "learning_rate": 8.935245901639344e-05, "loss": 3.2194284057617186, "step": 7400 }, { "epoch": 0.4098360655737705, "grad_norm": 0.34875085949897766, "learning_rate": 8.85327868852459e-05, "loss": 3.2164602661132813, "step": 7500 }, { "epoch": 0.41530054644808745, "grad_norm": 0.36371952295303345, "learning_rate": 8.771311475409835e-05, "loss": 3.1858474731445314, "step": 7600 }, { "epoch": 0.4207650273224044, "grad_norm": 0.3518809974193573, "learning_rate": 8.68934426229508e-05, "loss": 3.15969970703125, "step": 7700 }, { "epoch": 0.4262295081967213, "grad_norm": 0.3700133264064789, "learning_rate": 8.607377049180327e-05, "loss": 3.1636505126953125, "step": 7800 }, { "epoch": 0.43169398907103823, "grad_norm": 0.34737807512283325, "learning_rate": 8.525409836065573e-05, "loss": 3.15463623046875, "step": 7900 }, { "epoch": 0.4371584699453552, "grad_norm": 0.36737293004989624, "learning_rate": 8.443442622950819e-05, "loss": 3.138258056640625, "step": 8000 }, { "epoch": 0.4371584699453552, "eval_loss": 3.0774519443511963, "eval_runtime": 166.4678, "eval_samples_per_second": 52.184, "eval_steps_per_second": 1.634, "step": 8000 }, { "epoch": 0.4426229508196721, "grad_norm": 0.34968650341033936, "learning_rate": 8.361475409836064e-05, "loss": 3.1346026611328126, "step": 8100 }, { "epoch": 0.44808743169398907, "grad_norm": 0.347873330116272, "learning_rate": 8.27950819672131e-05, "loss": 3.1654531860351565, "step": 8200 }, { "epoch": 0.453551912568306, "grad_norm": 0.3486824929714203, "learning_rate": 8.197540983606556e-05, "loss": 3.158487548828125, "step": 8300 }, { "epoch": 0.45901639344262296, "grad_norm": 0.34259742498397827, "learning_rate": 8.115573770491803e-05, "loss": 3.1289462280273437, "step": 8400 }, { "epoch": 0.4644808743169399, "grad_norm": 0.34342944622039795, "learning_rate": 8.033606557377049e-05, "loss": 3.1434490966796873, "step": 8500 }, { "epoch": 0.46994535519125685, "grad_norm": 0.35807445645332336, "learning_rate": 7.951639344262295e-05, "loss": 3.1603570556640626, "step": 8600 }, { "epoch": 0.47540983606557374, "grad_norm": 0.3534564971923828, "learning_rate": 7.869672131147541e-05, "loss": 3.176658020019531, "step": 8700 }, { "epoch": 0.4808743169398907, "grad_norm": 0.36163410544395447, "learning_rate": 7.787704918032786e-05, "loss": 3.1730413818359375, "step": 8800 }, { "epoch": 0.48633879781420764, "grad_norm": 0.3280462920665741, "learning_rate": 7.705737704918032e-05, "loss": 3.1541357421875, "step": 8900 }, { "epoch": 0.4918032786885246, "grad_norm": 0.34871619939804077, "learning_rate": 7.623770491803278e-05, "loss": 3.1691409301757814, "step": 9000 }, { "epoch": 0.4918032786885246, "eval_loss": 3.0718374252319336, "eval_runtime": 165.8669, "eval_samples_per_second": 52.373, "eval_steps_per_second": 1.64, "step": 9000 }, { "epoch": 0.4972677595628415, "grad_norm": 0.37653326988220215, "learning_rate": 7.541803278688524e-05, "loss": 3.173928527832031, "step": 9100 }, { "epoch": 0.5027322404371585, "grad_norm": 0.3302043676376343, "learning_rate": 7.45983606557377e-05, "loss": 3.185494689941406, "step": 9200 }, { "epoch": 0.5081967213114754, "grad_norm": 0.35126709938049316, "learning_rate": 7.377868852459016e-05, "loss": 3.16490234375, "step": 9300 }, { "epoch": 0.5136612021857924, "grad_norm": 0.38984546065330505, "learning_rate": 7.295901639344261e-05, "loss": 3.20061279296875, "step": 9400 }, { "epoch": 0.5191256830601093, "grad_norm": 0.3627556264400482, "learning_rate": 7.213934426229507e-05, "loss": 3.2119021606445313, "step": 9500 }, { "epoch": 0.5245901639344263, "grad_norm": 0.34836238622665405, "learning_rate": 7.131967213114753e-05, "loss": 3.192005920410156, "step": 9600 }, { "epoch": 0.5300546448087432, "grad_norm": 0.362745463848114, "learning_rate": 7.049999999999999e-05, "loss": 3.2035980224609375, "step": 9700 }, { "epoch": 0.5355191256830601, "grad_norm": 0.35114485025405884, "learning_rate": 6.968032786885245e-05, "loss": 3.200631103515625, "step": 9800 }, { "epoch": 0.5409836065573771, "grad_norm": 0.45677778124809265, "learning_rate": 6.886065573770491e-05, "loss": 3.2338800048828125, "step": 9900 }, { "epoch": 0.546448087431694, "grad_norm": 0.38240864872932434, "learning_rate": 6.804098360655737e-05, "loss": 3.2340545654296875, "step": 10000 }, { "epoch": 0.546448087431694, "eval_loss": 3.064678907394409, "eval_runtime": 166.0237, "eval_samples_per_second": 52.324, "eval_steps_per_second": 1.638, "step": 10000 }, { "epoch": 0.5519125683060109, "grad_norm": 0.36993658542633057, "learning_rate": 6.722131147540984e-05, "loss": 3.217573547363281, "step": 10100 }, { "epoch": 0.5573770491803278, "grad_norm": 0.34514835476875305, "learning_rate": 6.64016393442623e-05, "loss": 3.228822937011719, "step": 10200 }, { "epoch": 0.5628415300546448, "grad_norm": 0.3509940803050995, "learning_rate": 6.558196721311474e-05, "loss": 3.224437561035156, "step": 10300 }, { "epoch": 0.5683060109289617, "grad_norm": 0.34477314352989197, "learning_rate": 6.47622950819672e-05, "loss": 3.226252136230469, "step": 10400 }, { "epoch": 0.5737704918032787, "grad_norm": 0.3412553071975708, "learning_rate": 6.394262295081966e-05, "loss": 3.2269625854492188, "step": 10500 }, { "epoch": 0.5792349726775956, "grad_norm": 0.3485320508480072, "learning_rate": 6.312295081967212e-05, "loss": 3.2041766357421877, "step": 10600 }, { "epoch": 0.5846994535519126, "grad_norm": 0.33190447092056274, "learning_rate": 6.230327868852459e-05, "loss": 3.1985888671875, "step": 10700 }, { "epoch": 0.5901639344262295, "grad_norm": 0.36425039172172546, "learning_rate": 6.148360655737705e-05, "loss": 3.208878479003906, "step": 10800 }, { "epoch": 0.5956284153005464, "grad_norm": 0.3473658859729767, "learning_rate": 6.066393442622951e-05, "loss": 3.2074591064453126, "step": 10900 }, { "epoch": 0.6010928961748634, "grad_norm": 0.43133220076560974, "learning_rate": 5.984426229508196e-05, "loss": 3.2229376220703125, "step": 11000 }, { "epoch": 0.6010928961748634, "eval_loss": 3.0597853660583496, "eval_runtime": 165.5808, "eval_samples_per_second": 52.464, "eval_steps_per_second": 1.643, "step": 11000 }, { "epoch": 0.6065573770491803, "grad_norm": 0.37588736414909363, "learning_rate": 5.902459016393442e-05, "loss": 3.1838412475585938, "step": 11100 }, { "epoch": 0.6120218579234973, "grad_norm": 0.34238529205322266, "learning_rate": 5.820491803278688e-05, "loss": 3.1839044189453123, "step": 11200 }, { "epoch": 0.6174863387978142, "grad_norm": 0.3399714231491089, "learning_rate": 5.7385245901639336e-05, "loss": 3.2120074462890624, "step": 11300 }, { "epoch": 0.6229508196721312, "grad_norm": 0.3523642420768738, "learning_rate": 5.6565573770491796e-05, "loss": 3.1816641235351564, "step": 11400 }, { "epoch": 0.6284153005464481, "grad_norm": 0.3372739255428314, "learning_rate": 5.574590163934426e-05, "loss": 3.194277038574219, "step": 11500 }, { "epoch": 0.6338797814207651, "grad_norm": 0.36970576643943787, "learning_rate": 5.492622950819672e-05, "loss": 3.183469543457031, "step": 11600 }, { "epoch": 0.639344262295082, "grad_norm": 0.3468629717826843, "learning_rate": 5.410655737704918e-05, "loss": 3.1655535888671875, "step": 11700 }, { "epoch": 0.644808743169399, "grad_norm": 0.3488897979259491, "learning_rate": 5.328688524590164e-05, "loss": 3.1525448608398436, "step": 11800 }, { "epoch": 0.6502732240437158, "grad_norm": 0.3539671301841736, "learning_rate": 5.246721311475409e-05, "loss": 3.1822393798828124, "step": 11900 }, { "epoch": 0.6557377049180327, "grad_norm": 0.3764471709728241, "learning_rate": 5.164754098360655e-05, "loss": 3.1826312255859377, "step": 12000 }, { "epoch": 0.6557377049180327, "eval_loss": 3.053892135620117, "eval_runtime": 169.2137, "eval_samples_per_second": 51.337, "eval_steps_per_second": 1.607, "step": 12000 }, { "epoch": 0.6612021857923497, "grad_norm": 0.36165982484817505, "learning_rate": 5.0827868852459014e-05, "loss": 3.1621029663085936, "step": 12100 }, { "epoch": 0.6666666666666666, "grad_norm": 0.3601846694946289, "learning_rate": 5.000819672131147e-05, "loss": 3.136105651855469, "step": 12200 }, { "epoch": 0.6721311475409836, "grad_norm": 0.3468482196331024, "learning_rate": 4.918852459016393e-05, "loss": 3.1172000122070314, "step": 12300 }, { "epoch": 0.6775956284153005, "grad_norm": 0.3401918411254883, "learning_rate": 4.836885245901638e-05, "loss": 3.1227383422851562, "step": 12400 }, { "epoch": 0.6830601092896175, "grad_norm": 0.3300206661224365, "learning_rate": 4.754918032786885e-05, "loss": 3.1588729858398437, "step": 12500 }, { "epoch": 0.6885245901639344, "grad_norm": 0.33165860176086426, "learning_rate": 4.672950819672131e-05, "loss": 3.163753662109375, "step": 12600 }, { "epoch": 0.6939890710382514, "grad_norm": 0.35165345668792725, "learning_rate": 4.590983606557377e-05, "loss": 3.1771914672851564, "step": 12700 }, { "epoch": 0.6994535519125683, "grad_norm": 0.37126895785331726, "learning_rate": 4.5090163934426225e-05, "loss": 3.182335205078125, "step": 12800 }, { "epoch": 0.7049180327868853, "grad_norm": 0.355465292930603, "learning_rate": 4.4270491803278686e-05, "loss": 3.1645904541015626, "step": 12900 }, { "epoch": 0.7103825136612022, "grad_norm": 0.34211593866348267, "learning_rate": 4.3450819672131146e-05, "loss": 3.160174560546875, "step": 13000 }, { "epoch": 0.7103825136612022, "eval_loss": 3.048466444015503, "eval_runtime": 170.5338, "eval_samples_per_second": 50.94, "eval_steps_per_second": 1.595, "step": 13000 }, { "epoch": 0.7158469945355191, "grad_norm": 0.351980984210968, "learning_rate": 4.26311475409836e-05, "loss": 3.180731201171875, "step": 13100 }, { "epoch": 0.7213114754098361, "grad_norm": 0.3479735851287842, "learning_rate": 4.181147540983606e-05, "loss": 3.199087829589844, "step": 13200 }, { "epoch": 0.726775956284153, "grad_norm": 0.34766390919685364, "learning_rate": 4.0991803278688515e-05, "loss": 3.2096636962890623, "step": 13300 }, { "epoch": 0.73224043715847, "grad_norm": 0.3618048429489136, "learning_rate": 4.017213114754098e-05, "loss": 3.214843444824219, "step": 13400 }, { "epoch": 0.7377049180327869, "grad_norm": 0.36265110969543457, "learning_rate": 3.935245901639344e-05, "loss": 3.1923486328125, "step": 13500 }, { "epoch": 0.7431693989071039, "grad_norm": 0.36705461144447327, "learning_rate": 3.85327868852459e-05, "loss": 3.206243591308594, "step": 13600 }, { "epoch": 0.7486338797814208, "grad_norm": 0.3736395835876465, "learning_rate": 3.771311475409836e-05, "loss": 3.1797048950195315, "step": 13700 }, { "epoch": 0.7540983606557377, "grad_norm": 0.353672593832016, "learning_rate": 3.689344262295082e-05, "loss": 3.199601745605469, "step": 13800 }, { "epoch": 0.7595628415300546, "grad_norm": 0.3430495858192444, "learning_rate": 3.607377049180327e-05, "loss": 3.2101876831054685, "step": 13900 }, { "epoch": 0.7650273224043715, "grad_norm": 0.36116746068000793, "learning_rate": 3.525409836065573e-05, "loss": 3.2108331298828126, "step": 14000 }, { "epoch": 0.7650273224043715, "eval_loss": 3.0441460609436035, "eval_runtime": 169.191, "eval_samples_per_second": 51.344, "eval_steps_per_second": 1.608, "step": 14000 }, { "epoch": 0.7704918032786885, "grad_norm": 0.37100476026535034, "learning_rate": 3.443442622950819e-05, "loss": 3.2165988159179686, "step": 14100 }, { "epoch": 0.7759562841530054, "grad_norm": 0.36540594696998596, "learning_rate": 3.3614754098360654e-05, "loss": 3.193106994628906, "step": 14200 }, { "epoch": 0.7814207650273224, "grad_norm": 0.340986043214798, "learning_rate": 3.2795081967213114e-05, "loss": 3.205763244628906, "step": 14300 }, { "epoch": 0.7868852459016393, "grad_norm": 0.35636964440345764, "learning_rate": 3.197540983606557e-05, "loss": 3.220958251953125, "step": 14400 }, { "epoch": 0.7923497267759563, "grad_norm": 0.35717952251434326, "learning_rate": 3.115573770491803e-05, "loss": 3.225035400390625, "step": 14500 }, { "epoch": 0.7978142076502732, "grad_norm": 0.3586474061012268, "learning_rate": 3.033606557377049e-05, "loss": 3.205286560058594, "step": 14600 }, { "epoch": 0.8032786885245902, "grad_norm": 0.3829101324081421, "learning_rate": 2.951639344262295e-05, "loss": 3.2143185424804686, "step": 14700 }, { "epoch": 0.8087431693989071, "grad_norm": 0.3761688768863678, "learning_rate": 2.8696721311475407e-05, "loss": 3.189816589355469, "step": 14800 }, { "epoch": 0.8142076502732241, "grad_norm": 0.3838573396205902, "learning_rate": 2.7877049180327865e-05, "loss": 3.1748077392578127, "step": 14900 }, { "epoch": 0.819672131147541, "grad_norm": 0.3493940532207489, "learning_rate": 2.705737704918033e-05, "loss": 3.18576171875, "step": 15000 }, { "epoch": 0.819672131147541, "eval_loss": 3.040698766708374, "eval_runtime": 168.2186, "eval_samples_per_second": 51.641, "eval_steps_per_second": 1.617, "step": 15000 }, { "epoch": 0.825136612021858, "grad_norm": 0.34466949105262756, "learning_rate": 2.6237704918032786e-05, "loss": 3.1684368896484374, "step": 15100 }, { "epoch": 0.8306010928961749, "grad_norm": 0.3771664798259735, "learning_rate": 2.5418032786885243e-05, "loss": 3.202015075683594, "step": 15200 }, { "epoch": 0.8360655737704918, "grad_norm": 0.37019965052604675, "learning_rate": 2.45983606557377e-05, "loss": 3.203460693359375, "step": 15300 }, { "epoch": 0.8415300546448088, "grad_norm": 0.3610929250717163, "learning_rate": 2.377868852459016e-05, "loss": 3.1997000122070314, "step": 15400 }, { "epoch": 0.8469945355191257, "grad_norm": 0.35692885518074036, "learning_rate": 2.2959016393442622e-05, "loss": 3.1686630249023438, "step": 15500 }, { "epoch": 0.8524590163934426, "grad_norm": 0.36669033765792847, "learning_rate": 2.213934426229508e-05, "loss": 3.165161437988281, "step": 15600 }, { "epoch": 0.8579234972677595, "grad_norm": 0.35931694507598877, "learning_rate": 2.131967213114754e-05, "loss": 3.1681549072265627, "step": 15700 }, { "epoch": 0.8633879781420765, "grad_norm": 0.36468565464019775, "learning_rate": 2.0499999999999997e-05, "loss": 3.150556945800781, "step": 15800 }, { "epoch": 0.8688524590163934, "grad_norm": 0.3460843861103058, "learning_rate": 1.968032786885246e-05, "loss": 3.1520755004882814, "step": 15900 }, { "epoch": 0.8743169398907104, "grad_norm": 0.355943888425827, "learning_rate": 1.8860655737704918e-05, "loss": 3.151009521484375, "step": 16000 }, { "epoch": 0.8743169398907104, "eval_loss": 3.03753924369812, "eval_runtime": 169.1323, "eval_samples_per_second": 51.362, "eval_steps_per_second": 1.608, "step": 16000 }, { "epoch": 0.8797814207650273, "grad_norm": 0.3545354902744293, "learning_rate": 1.8040983606557375e-05, "loss": 3.127799072265625, "step": 16100 }, { "epoch": 0.8852459016393442, "grad_norm": 0.3566863536834717, "learning_rate": 1.7221311475409833e-05, "loss": 3.1025897216796876, "step": 16200 }, { "epoch": 0.8907103825136612, "grad_norm": 0.337934285402298, "learning_rate": 1.6401639344262293e-05, "loss": 3.1121600341796873, "step": 16300 }, { "epoch": 0.8961748633879781, "grad_norm": 0.34477803111076355, "learning_rate": 1.5581967213114754e-05, "loss": 3.130706787109375, "step": 16400 }, { "epoch": 0.9016393442622951, "grad_norm": 0.3452692925930023, "learning_rate": 1.4762295081967213e-05, "loss": 3.1331210327148438, "step": 16500 }, { "epoch": 0.907103825136612, "grad_norm": 0.348063200712204, "learning_rate": 1.394262295081967e-05, "loss": 3.1176373291015627, "step": 16600 }, { "epoch": 0.912568306010929, "grad_norm": 0.335582971572876, "learning_rate": 1.312295081967213e-05, "loss": 3.1302474975585937, "step": 16700 }, { "epoch": 0.9180327868852459, "grad_norm": 0.34352442622184753, "learning_rate": 1.230327868852459e-05, "loss": 3.119664306640625, "step": 16800 }, { "epoch": 0.9234972677595629, "grad_norm": 0.370101660490036, "learning_rate": 1.1483606557377047e-05, "loss": 3.11188720703125, "step": 16900 }, { "epoch": 0.9289617486338798, "grad_norm": 0.35088032484054565, "learning_rate": 1.0663934426229508e-05, "loss": 3.13305908203125, "step": 17000 }, { "epoch": 0.9289617486338798, "eval_loss": 3.0354855060577393, "eval_runtime": 166.8874, "eval_samples_per_second": 52.053, "eval_steps_per_second": 1.63, "step": 17000 }, { "epoch": 0.9344262295081968, "grad_norm": 0.35557523369789124, "learning_rate": 9.844262295081967e-06, "loss": 3.1132748413085936, "step": 17100 }, { "epoch": 0.9398907103825137, "grad_norm": 0.3398247957229614, "learning_rate": 9.024590163934426e-06, "loss": 3.141661376953125, "step": 17200 }, { "epoch": 0.9453551912568307, "grad_norm": 0.34634870290756226, "learning_rate": 8.204918032786884e-06, "loss": 3.1398541259765627, "step": 17300 }, { "epoch": 0.9508196721311475, "grad_norm": 0.3561513423919678, "learning_rate": 7.3852459016393434e-06, "loss": 3.1273211669921874, "step": 17400 }, { "epoch": 0.9562841530054644, "grad_norm": 0.35161858797073364, "learning_rate": 6.565573770491802e-06, "loss": 3.1056549072265627, "step": 17500 }, { "epoch": 0.9617486338797814, "grad_norm": 0.3520038425922394, "learning_rate": 5.745901639344262e-06, "loss": 3.1260693359375, "step": 17600 }, { "epoch": 0.9672131147540983, "grad_norm": 0.34525951743125916, "learning_rate": 4.926229508196721e-06, "loss": 3.1003762817382814, "step": 17700 }, { "epoch": 0.9726775956284153, "grad_norm": 0.35116466879844666, "learning_rate": 4.10655737704918e-06, "loss": 3.1081192016601564, "step": 17800 }, { "epoch": 0.9781420765027322, "grad_norm": 0.36404362320899963, "learning_rate": 3.286885245901639e-06, "loss": 3.123824462890625, "step": 17900 }, { "epoch": 0.9836065573770492, "grad_norm": 0.3350881338119507, "learning_rate": 2.4672131147540984e-06, "loss": 3.122076110839844, "step": 18000 }, { "epoch": 0.9836065573770492, "eval_loss": 3.033825397491455, "eval_runtime": 163.9316, "eval_samples_per_second": 52.992, "eval_steps_per_second": 1.659, "step": 18000 } ], "logging_steps": 100, "max_steps": 18300, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.01008420864e+17, "train_batch_size": 32, "trial_name": null, "trial_params": null }