{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.09528938003371418, "eval_steps": 500, "global_step": 2035, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0004682524817381532, "grad_norm": 0.7815176248550415, "learning_rate": 2.910112359550562e-06, "loss": 0.8415, "step": 10 }, { "epoch": 0.0009365049634763064, "grad_norm": 0.8108879327774048, "learning_rate": 3.921348314606742e-06, "loss": 0.8485, "step": 20 }, { "epoch": 0.0014047574452144597, "grad_norm": 0.8000619411468506, "learning_rate": 4.932584269662922e-06, "loss": 0.83, "step": 30 }, { "epoch": 0.0018730099269526129, "grad_norm": 0.7511084675788879, "learning_rate": 5.943820224719102e-06, "loss": 0.8517, "step": 40 }, { "epoch": 0.002341262408690766, "grad_norm": 0.7430337071418762, "learning_rate": 6.955056179775282e-06, "loss": 0.847, "step": 50 }, { "epoch": 0.0028095148904289193, "grad_norm": 0.8726410269737244, "learning_rate": 7.966292134831462e-06, "loss": 0.8172, "step": 60 }, { "epoch": 0.0032777673721670723, "grad_norm": 0.8567508459091187, "learning_rate": 8.977528089887641e-06, "loss": 0.8377, "step": 70 }, { "epoch": 0.0037460198539052258, "grad_norm": 0.7639268040657043, "learning_rate": 9.988764044943822e-06, "loss": 0.8184, "step": 80 }, { "epoch": 0.004214272335643379, "grad_norm": 0.9645025134086609, "learning_rate": 1.1000000000000001e-05, "loss": 0.8178, "step": 90 }, { "epoch": 0.004682524817381532, "grad_norm": 0.801426887512207, "learning_rate": 1.2011235955056182e-05, "loss": 0.8351, "step": 100 }, { "epoch": 0.005150777299119685, "grad_norm": 0.8018251061439514, "learning_rate": 1.3022471910112362e-05, "loss": 0.8493, "step": 110 }, { "epoch": 0.005619029780857839, "grad_norm": 1.6218419075012207, "learning_rate": 1.403370786516854e-05, "loss": 0.8367, "step": 120 }, { "epoch": 0.006087282262595992, "grad_norm": 0.738893449306488, "learning_rate": 1.504494382022472e-05, "loss": 0.8622, "step": 130 }, { "epoch": 0.006555534744334145, "grad_norm": 0.9413527846336365, "learning_rate": 1.60561797752809e-05, "loss": 0.8024, "step": 140 }, { "epoch": 0.007023787226072298, "grad_norm": 0.8190211653709412, "learning_rate": 1.706741573033708e-05, "loss": 0.8216, "step": 150 }, { "epoch": 0.0074920397078104516, "grad_norm": 0.6878272294998169, "learning_rate": 1.8078651685393256e-05, "loss": 0.8609, "step": 160 }, { "epoch": 0.007960292189548605, "grad_norm": 0.7031309008598328, "learning_rate": 1.908988764044944e-05, "loss": 0.8954, "step": 170 }, { "epoch": 0.008428544671286758, "grad_norm": 0.7149655818939209, "learning_rate": 2e-05, "loss": 0.8378, "step": 180 }, { "epoch": 0.008896797153024912, "grad_norm": 0.6629250645637512, "learning_rate": 2e-05, "loss": 0.8002, "step": 190 }, { "epoch": 0.009365049634763064, "grad_norm": 0.6915798783302307, "learning_rate": 2e-05, "loss": 0.8358, "step": 200 }, { "epoch": 0.009833302116501217, "grad_norm": 0.6538642644882202, "learning_rate": 2e-05, "loss": 0.8535, "step": 210 }, { "epoch": 0.01030155459823937, "grad_norm": 0.584514856338501, "learning_rate": 2e-05, "loss": 0.8362, "step": 220 }, { "epoch": 0.010769807079977524, "grad_norm": 1.3603894710540771, "learning_rate": 2e-05, "loss": 0.8086, "step": 230 }, { "epoch": 0.011238059561715677, "grad_norm": 0.5758199691772461, "learning_rate": 2e-05, "loss": 0.8336, "step": 240 }, { "epoch": 0.01170631204345383, "grad_norm": 0.6881021857261658, "learning_rate": 2e-05, "loss": 0.8444, "step": 250 }, { "epoch": 0.012174564525191984, "grad_norm": 1.9581451416015625, "learning_rate": 2e-05, "loss": 0.8433, "step": 260 }, { "epoch": 0.012642817006930136, "grad_norm": 0.5425940752029419, "learning_rate": 2e-05, "loss": 0.8213, "step": 270 }, { "epoch": 0.01311106948866829, "grad_norm": 0.5425044298171997, "learning_rate": 2e-05, "loss": 0.8179, "step": 280 }, { "epoch": 0.013579321970406443, "grad_norm": 0.657163143157959, "learning_rate": 2e-05, "loss": 0.8649, "step": 290 }, { "epoch": 0.014047574452144596, "grad_norm": 0.569369375705719, "learning_rate": 2e-05, "loss": 0.8438, "step": 300 }, { "epoch": 0.01451582693388275, "grad_norm": 0.554995059967041, "learning_rate": 2e-05, "loss": 0.8085, "step": 310 }, { "epoch": 0.014984079415620903, "grad_norm": 0.5484607219696045, "learning_rate": 2e-05, "loss": 0.8089, "step": 320 }, { "epoch": 0.015452331897359057, "grad_norm": 0.5753210186958313, "learning_rate": 2e-05, "loss": 0.8142, "step": 330 }, { "epoch": 0.01592058437909721, "grad_norm": 0.7434160113334656, "learning_rate": 2e-05, "loss": 0.8188, "step": 340 }, { "epoch": 0.01638883686083536, "grad_norm": 0.574074923992157, "learning_rate": 2e-05, "loss": 0.8563, "step": 350 }, { "epoch": 0.016857089342573517, "grad_norm": 0.5934783816337585, "learning_rate": 2e-05, "loss": 0.839, "step": 360 }, { "epoch": 0.01732534182431167, "grad_norm": 2.1430094242095947, "learning_rate": 2e-05, "loss": 0.8244, "step": 370 }, { "epoch": 0.017793594306049824, "grad_norm": 0.5127322673797607, "learning_rate": 2e-05, "loss": 0.7979, "step": 380 }, { "epoch": 0.018261846787787975, "grad_norm": 0.5187241435050964, "learning_rate": 2e-05, "loss": 0.8122, "step": 390 }, { "epoch": 0.018730099269526127, "grad_norm": 0.5075030326843262, "learning_rate": 2e-05, "loss": 0.8645, "step": 400 }, { "epoch": 0.019198351751264282, "grad_norm": 0.4950161576271057, "learning_rate": 2e-05, "loss": 0.8418, "step": 410 }, { "epoch": 0.019666604233002434, "grad_norm": 0.5396143794059753, "learning_rate": 2e-05, "loss": 0.8152, "step": 420 }, { "epoch": 0.02013485671474059, "grad_norm": 0.5515366196632385, "learning_rate": 2e-05, "loss": 0.7911, "step": 430 }, { "epoch": 0.02060310919647874, "grad_norm": 0.5184299945831299, "learning_rate": 2e-05, "loss": 0.8403, "step": 440 }, { "epoch": 0.021071361678216896, "grad_norm": 0.4794081449508667, "learning_rate": 2e-05, "loss": 0.8233, "step": 450 }, { "epoch": 0.021539614159955048, "grad_norm": 0.7160170674324036, "learning_rate": 2e-05, "loss": 0.8302, "step": 460 }, { "epoch": 0.0220078666416932, "grad_norm": 0.6666805148124695, "learning_rate": 2e-05, "loss": 0.8202, "step": 470 }, { "epoch": 0.022476119123431355, "grad_norm": 0.5356866717338562, "learning_rate": 2e-05, "loss": 0.8418, "step": 480 }, { "epoch": 0.022944371605169506, "grad_norm": 0.4900036156177521, "learning_rate": 2e-05, "loss": 0.829, "step": 490 }, { "epoch": 0.02341262408690766, "grad_norm": 0.47087252140045166, "learning_rate": 2e-05, "loss": 0.8418, "step": 500 }, { "epoch": 0.023880876568645813, "grad_norm": 0.5223408341407776, "learning_rate": 2e-05, "loss": 0.7874, "step": 510 }, { "epoch": 0.02434912905038397, "grad_norm": 0.5723909735679626, "learning_rate": 2e-05, "loss": 0.8552, "step": 520 }, { "epoch": 0.02481738153212212, "grad_norm": 0.4538605213165283, "learning_rate": 2e-05, "loss": 0.7783, "step": 530 }, { "epoch": 0.025285634013860272, "grad_norm": 0.4878973960876465, "learning_rate": 2e-05, "loss": 0.8085, "step": 540 }, { "epoch": 0.025753886495598427, "grad_norm": 0.5102939605712891, "learning_rate": 2e-05, "loss": 0.799, "step": 550 }, { "epoch": 0.02622213897733658, "grad_norm": 0.5069881081581116, "learning_rate": 2e-05, "loss": 0.8201, "step": 560 }, { "epoch": 0.026690391459074734, "grad_norm": 0.45733290910720825, "learning_rate": 2e-05, "loss": 0.844, "step": 570 }, { "epoch": 0.027158643940812886, "grad_norm": 0.4658640921115875, "learning_rate": 2e-05, "loss": 0.8291, "step": 580 }, { "epoch": 0.02762689642255104, "grad_norm": 0.48104459047317505, "learning_rate": 2e-05, "loss": 0.8432, "step": 590 }, { "epoch": 0.028095148904289192, "grad_norm": 0.46297943592071533, "learning_rate": 2e-05, "loss": 0.8192, "step": 600 }, { "epoch": 0.028563401386027348, "grad_norm": 0.450825959444046, "learning_rate": 2e-05, "loss": 0.7987, "step": 610 }, { "epoch": 0.0290316538677655, "grad_norm": 0.4797734022140503, "learning_rate": 2e-05, "loss": 0.8325, "step": 620 }, { "epoch": 0.02949990634950365, "grad_norm": 0.481893390417099, "learning_rate": 2e-05, "loss": 0.7837, "step": 630 }, { "epoch": 0.029968158831241806, "grad_norm": 0.47477421164512634, "learning_rate": 2e-05, "loss": 0.8278, "step": 640 }, { "epoch": 0.030436411312979958, "grad_norm": 0.5964585542678833, "learning_rate": 2e-05, "loss": 0.7969, "step": 650 }, { "epoch": 0.030904663794718113, "grad_norm": 0.46593981981277466, "learning_rate": 2e-05, "loss": 0.8307, "step": 660 }, { "epoch": 0.03137291627645627, "grad_norm": 0.48121365904808044, "learning_rate": 2e-05, "loss": 0.8174, "step": 670 }, { "epoch": 0.03184116875819442, "grad_norm": 0.5038956999778748, "learning_rate": 2e-05, "loss": 0.8339, "step": 680 }, { "epoch": 0.03230942123993257, "grad_norm": 0.5365706086158752, "learning_rate": 2e-05, "loss": 0.8291, "step": 690 }, { "epoch": 0.03277767372167072, "grad_norm": 0.5319100618362427, "learning_rate": 2e-05, "loss": 0.7953, "step": 700 }, { "epoch": 0.033245926203408875, "grad_norm": 0.4542364776134491, "learning_rate": 2e-05, "loss": 0.8263, "step": 710 }, { "epoch": 0.033714178685147034, "grad_norm": 0.47826236486434937, "learning_rate": 2e-05, "loss": 0.8321, "step": 720 }, { "epoch": 0.034182431166885185, "grad_norm": 0.44108861684799194, "learning_rate": 2e-05, "loss": 0.7989, "step": 730 }, { "epoch": 0.03465068364862334, "grad_norm": 0.4653085172176361, "learning_rate": 2e-05, "loss": 0.7994, "step": 740 }, { "epoch": 0.03511893613036149, "grad_norm": 0.5099039077758789, "learning_rate": 2e-05, "loss": 0.7591, "step": 750 }, { "epoch": 0.03558718861209965, "grad_norm": 0.48215553164482117, "learning_rate": 2e-05, "loss": 0.7921, "step": 760 }, { "epoch": 0.0360554410938378, "grad_norm": 0.46062806248664856, "learning_rate": 2e-05, "loss": 0.8244, "step": 770 }, { "epoch": 0.03652369357557595, "grad_norm": 0.5108964443206787, "learning_rate": 2e-05, "loss": 0.8667, "step": 780 }, { "epoch": 0.0369919460573141, "grad_norm": 0.47737154364585876, "learning_rate": 2e-05, "loss": 0.8246, "step": 790 }, { "epoch": 0.037460198539052254, "grad_norm": 0.5114936828613281, "learning_rate": 2e-05, "loss": 0.8188, "step": 800 }, { "epoch": 0.03792845102079041, "grad_norm": 0.47046583890914917, "learning_rate": 2e-05, "loss": 0.8393, "step": 810 }, { "epoch": 0.038396703502528565, "grad_norm": 0.4314744472503662, "learning_rate": 2e-05, "loss": 0.7953, "step": 820 }, { "epoch": 0.038864955984266716, "grad_norm": 0.4930090308189392, "learning_rate": 2e-05, "loss": 0.8048, "step": 830 }, { "epoch": 0.03933320846600487, "grad_norm": 0.4331071078777313, "learning_rate": 2e-05, "loss": 0.8389, "step": 840 }, { "epoch": 0.03980146094774302, "grad_norm": 0.4713480472564697, "learning_rate": 2e-05, "loss": 0.8165, "step": 850 }, { "epoch": 0.04026971342948118, "grad_norm": 0.4679141938686371, "learning_rate": 2e-05, "loss": 0.8198, "step": 860 }, { "epoch": 0.04073796591121933, "grad_norm": 0.7808457612991333, "learning_rate": 2e-05, "loss": 0.8528, "step": 870 }, { "epoch": 0.04120621839295748, "grad_norm": 0.44788986444473267, "learning_rate": 2e-05, "loss": 0.8225, "step": 880 }, { "epoch": 0.041674470874695634, "grad_norm": 0.480165034532547, "learning_rate": 2e-05, "loss": 0.8185, "step": 890 }, { "epoch": 0.04214272335643379, "grad_norm": 0.46314555406570435, "learning_rate": 2e-05, "loss": 0.8116, "step": 900 }, { "epoch": 0.042610975838171944, "grad_norm": 0.6263248920440674, "learning_rate": 2e-05, "loss": 0.8418, "step": 910 }, { "epoch": 0.043079228319910096, "grad_norm": 0.4619986414909363, "learning_rate": 2e-05, "loss": 0.8378, "step": 920 }, { "epoch": 0.04354748080164825, "grad_norm": 0.4389607906341553, "learning_rate": 2e-05, "loss": 0.8153, "step": 930 }, { "epoch": 0.0440157332833864, "grad_norm": 0.5322599411010742, "learning_rate": 2e-05, "loss": 0.8049, "step": 940 }, { "epoch": 0.04448398576512456, "grad_norm": 0.4362427890300751, "learning_rate": 2e-05, "loss": 0.7895, "step": 950 }, { "epoch": 0.04495223824686271, "grad_norm": 0.560736358165741, "learning_rate": 2e-05, "loss": 0.7834, "step": 960 }, { "epoch": 0.04542049072860086, "grad_norm": 0.49655383825302124, "learning_rate": 2e-05, "loss": 0.8419, "step": 970 }, { "epoch": 0.04588874321033901, "grad_norm": 0.447719931602478, "learning_rate": 2e-05, "loss": 0.8268, "step": 980 }, { "epoch": 0.04635699569207717, "grad_norm": 0.472380131483078, "learning_rate": 2e-05, "loss": 0.797, "step": 990 }, { "epoch": 0.04682524817381532, "grad_norm": 0.4404251277446747, "learning_rate": 2e-05, "loss": 0.8216, "step": 1000 }, { "epoch": 0.047293500655553475, "grad_norm": 0.8469703793525696, "learning_rate": 2e-05, "loss": 0.8061, "step": 1010 }, { "epoch": 0.047761753137291627, "grad_norm": 0.49690261483192444, "learning_rate": 2e-05, "loss": 0.8739, "step": 1020 }, { "epoch": 0.04823000561902978, "grad_norm": 0.4546132981777191, "learning_rate": 2e-05, "loss": 0.8611, "step": 1030 }, { "epoch": 0.04869825810076794, "grad_norm": 0.9852249026298523, "learning_rate": 2e-05, "loss": 0.8151, "step": 1040 }, { "epoch": 0.04916651058250609, "grad_norm": 0.4317361116409302, "learning_rate": 2e-05, "loss": 0.8253, "step": 1050 }, { "epoch": 0.04963476306424424, "grad_norm": 0.48968589305877686, "learning_rate": 2e-05, "loss": 0.8241, "step": 1060 }, { "epoch": 0.05010301554598239, "grad_norm": 0.5702976584434509, "learning_rate": 2e-05, "loss": 0.788, "step": 1070 }, { "epoch": 0.050571268027720544, "grad_norm": 0.4381064474582672, "learning_rate": 2e-05, "loss": 0.7815, "step": 1080 }, { "epoch": 0.0510395205094587, "grad_norm": 0.48637041449546814, "learning_rate": 2e-05, "loss": 0.8424, "step": 1090 }, { "epoch": 0.051507772991196854, "grad_norm": 0.4259801506996155, "learning_rate": 2e-05, "loss": 0.817, "step": 1100 }, { "epoch": 0.051976025472935006, "grad_norm": 0.4507712423801422, "learning_rate": 2e-05, "loss": 0.856, "step": 1110 }, { "epoch": 0.05244427795467316, "grad_norm": 0.4860295057296753, "learning_rate": 2e-05, "loss": 0.8139, "step": 1120 }, { "epoch": 0.052912530436411316, "grad_norm": 0.5244073271751404, "learning_rate": 2e-05, "loss": 0.8165, "step": 1130 }, { "epoch": 0.05338078291814947, "grad_norm": 0.4211806654930115, "learning_rate": 2e-05, "loss": 0.7845, "step": 1140 }, { "epoch": 0.05384903539988762, "grad_norm": 0.4540943205356598, "learning_rate": 2e-05, "loss": 0.7812, "step": 1150 }, { "epoch": 0.05431728788162577, "grad_norm": 0.4845108985900879, "learning_rate": 2e-05, "loss": 0.8138, "step": 1160 }, { "epoch": 0.05478554036336392, "grad_norm": 0.46812689304351807, "learning_rate": 2e-05, "loss": 0.8065, "step": 1170 }, { "epoch": 0.05525379284510208, "grad_norm": 0.42959365248680115, "learning_rate": 2e-05, "loss": 0.8089, "step": 1180 }, { "epoch": 0.05572204532684023, "grad_norm": 0.7998138070106506, "learning_rate": 2e-05, "loss": 0.8137, "step": 1190 }, { "epoch": 0.056190297808578385, "grad_norm": 0.46024176478385925, "learning_rate": 2e-05, "loss": 0.8341, "step": 1200 }, { "epoch": 0.05665855029031654, "grad_norm": 0.4920409023761749, "learning_rate": 2e-05, "loss": 0.8328, "step": 1210 }, { "epoch": 0.057126802772054695, "grad_norm": 0.44345328211784363, "learning_rate": 2e-05, "loss": 0.8242, "step": 1220 }, { "epoch": 0.05759505525379285, "grad_norm": 0.4638558030128479, "learning_rate": 2e-05, "loss": 0.8111, "step": 1230 }, { "epoch": 0.058063307735531, "grad_norm": 0.6508961319923401, "learning_rate": 2e-05, "loss": 0.809, "step": 1240 }, { "epoch": 0.05853156021726915, "grad_norm": 0.4465144872665405, "learning_rate": 2e-05, "loss": 0.8195, "step": 1250 }, { "epoch": 0.0589998126990073, "grad_norm": 0.4405592978000641, "learning_rate": 2e-05, "loss": 0.8352, "step": 1260 }, { "epoch": 0.05946806518074546, "grad_norm": 0.43743807077407837, "learning_rate": 2e-05, "loss": 0.8149, "step": 1270 }, { "epoch": 0.05993631766248361, "grad_norm": 0.5173885226249695, "learning_rate": 2e-05, "loss": 0.8421, "step": 1280 }, { "epoch": 0.060404570144221764, "grad_norm": 0.41101977229118347, "learning_rate": 2e-05, "loss": 0.8493, "step": 1290 }, { "epoch": 0.060872822625959916, "grad_norm": 0.41480135917663574, "learning_rate": 2e-05, "loss": 0.7971, "step": 1300 }, { "epoch": 0.06134107510769807, "grad_norm": 0.5274170637130737, "learning_rate": 2e-05, "loss": 0.8106, "step": 1310 }, { "epoch": 0.061809327589436226, "grad_norm": 0.4326211214065552, "learning_rate": 2e-05, "loss": 0.7927, "step": 1320 }, { "epoch": 0.06227758007117438, "grad_norm": 0.4117155373096466, "learning_rate": 2e-05, "loss": 0.7877, "step": 1330 }, { "epoch": 0.06274583255291254, "grad_norm": 0.4453534483909607, "learning_rate": 2e-05, "loss": 0.8417, "step": 1340 }, { "epoch": 0.06321408503465069, "grad_norm": 0.6158928871154785, "learning_rate": 2e-05, "loss": 0.7797, "step": 1350 }, { "epoch": 0.06368233751638884, "grad_norm": 0.43932247161865234, "learning_rate": 2e-05, "loss": 0.8042, "step": 1360 }, { "epoch": 0.06415058999812699, "grad_norm": 0.5323647856712341, "learning_rate": 2e-05, "loss": 0.798, "step": 1370 }, { "epoch": 0.06461884247986514, "grad_norm": 0.4197414517402649, "learning_rate": 2e-05, "loss": 0.8223, "step": 1380 }, { "epoch": 0.0650870949616033, "grad_norm": 0.48507630825042725, "learning_rate": 2e-05, "loss": 0.8105, "step": 1390 }, { "epoch": 0.06555534744334145, "grad_norm": 0.47112739086151123, "learning_rate": 2e-05, "loss": 0.8249, "step": 1400 }, { "epoch": 0.0660235999250796, "grad_norm": 0.48371198773384094, "learning_rate": 2e-05, "loss": 0.8105, "step": 1410 }, { "epoch": 0.06649185240681775, "grad_norm": 0.43702569603919983, "learning_rate": 2e-05, "loss": 0.7906, "step": 1420 }, { "epoch": 0.06696010488855592, "grad_norm": 0.44430628418922424, "learning_rate": 2e-05, "loss": 0.8313, "step": 1430 }, { "epoch": 0.06742835737029407, "grad_norm": 0.4579251706600189, "learning_rate": 2e-05, "loss": 0.8415, "step": 1440 }, { "epoch": 0.06789660985203222, "grad_norm": 0.48323583602905273, "learning_rate": 2e-05, "loss": 0.8341, "step": 1450 }, { "epoch": 0.06836486233377037, "grad_norm": 0.427022248506546, "learning_rate": 2e-05, "loss": 0.8007, "step": 1460 }, { "epoch": 0.06883311481550852, "grad_norm": 0.4505695104598999, "learning_rate": 2e-05, "loss": 0.8095, "step": 1470 }, { "epoch": 0.06930136729724667, "grad_norm": 0.45807015895843506, "learning_rate": 2e-05, "loss": 0.7785, "step": 1480 }, { "epoch": 0.06976961977898483, "grad_norm": 0.5102551579475403, "learning_rate": 2e-05, "loss": 0.806, "step": 1490 }, { "epoch": 0.07023787226072298, "grad_norm": 0.42989158630371094, "learning_rate": 2e-05, "loss": 0.8295, "step": 1500 }, { "epoch": 0.07070612474246113, "grad_norm": 0.5128605961799622, "learning_rate": 2e-05, "loss": 0.8218, "step": 1510 }, { "epoch": 0.0711743772241993, "grad_norm": 0.4889835715293884, "learning_rate": 2e-05, "loss": 0.7938, "step": 1520 }, { "epoch": 0.07164262970593745, "grad_norm": 0.4175378680229187, "learning_rate": 2e-05, "loss": 0.8033, "step": 1530 }, { "epoch": 0.0721108821876756, "grad_norm": 0.4378540813922882, "learning_rate": 2e-05, "loss": 0.8042, "step": 1540 }, { "epoch": 0.07257913466941375, "grad_norm": 0.4375297427177429, "learning_rate": 2e-05, "loss": 0.8218, "step": 1550 }, { "epoch": 0.0730473871511519, "grad_norm": 0.49845996499061584, "learning_rate": 2e-05, "loss": 0.8044, "step": 1560 }, { "epoch": 0.07351563963289005, "grad_norm": 0.46285390853881836, "learning_rate": 2e-05, "loss": 0.7989, "step": 1570 }, { "epoch": 0.0739838921146282, "grad_norm": 0.46297210454940796, "learning_rate": 2e-05, "loss": 0.8065, "step": 1580 }, { "epoch": 0.07445214459636636, "grad_norm": 0.5150440335273743, "learning_rate": 2e-05, "loss": 0.8284, "step": 1590 }, { "epoch": 0.07492039707810451, "grad_norm": 0.47179800271987915, "learning_rate": 2e-05, "loss": 0.8059, "step": 1600 }, { "epoch": 0.07538864955984266, "grad_norm": 0.4652591347694397, "learning_rate": 2e-05, "loss": 0.8229, "step": 1610 }, { "epoch": 0.07585690204158083, "grad_norm": 0.4540858864784241, "learning_rate": 2e-05, "loss": 0.7697, "step": 1620 }, { "epoch": 0.07632515452331898, "grad_norm": 0.4078024923801422, "learning_rate": 2e-05, "loss": 0.8106, "step": 1630 }, { "epoch": 0.07679340700505713, "grad_norm": 0.44727492332458496, "learning_rate": 2e-05, "loss": 0.8216, "step": 1640 }, { "epoch": 0.07726165948679528, "grad_norm": 0.46308594942092896, "learning_rate": 2e-05, "loss": 0.8184, "step": 1650 }, { "epoch": 0.07772991196853343, "grad_norm": 0.4770665764808655, "learning_rate": 2e-05, "loss": 0.7977, "step": 1660 }, { "epoch": 0.07819816445027158, "grad_norm": 0.4776230752468109, "learning_rate": 2e-05, "loss": 0.7921, "step": 1670 }, { "epoch": 0.07866641693200974, "grad_norm": 0.5174942016601562, "learning_rate": 2e-05, "loss": 0.8066, "step": 1680 }, { "epoch": 0.07913466941374789, "grad_norm": 0.43850815296173096, "learning_rate": 2e-05, "loss": 0.8068, "step": 1690 }, { "epoch": 0.07960292189548604, "grad_norm": 1.0964583158493042, "learning_rate": 2e-05, "loss": 0.7769, "step": 1700 }, { "epoch": 0.0800711743772242, "grad_norm": 0.4482307434082031, "learning_rate": 2e-05, "loss": 0.7822, "step": 1710 }, { "epoch": 0.08053942685896236, "grad_norm": 0.5412369966506958, "learning_rate": 2e-05, "loss": 0.7915, "step": 1720 }, { "epoch": 0.08100767934070051, "grad_norm": 0.4515257179737091, "learning_rate": 2e-05, "loss": 0.8215, "step": 1730 }, { "epoch": 0.08147593182243866, "grad_norm": 0.4404001533985138, "learning_rate": 2e-05, "loss": 0.8162, "step": 1740 }, { "epoch": 0.08194418430417681, "grad_norm": 0.4400689899921417, "learning_rate": 2e-05, "loss": 0.7876, "step": 1750 }, { "epoch": 0.08241243678591496, "grad_norm": 0.4302707314491272, "learning_rate": 2e-05, "loss": 0.8352, "step": 1760 }, { "epoch": 0.08288068926765312, "grad_norm": 0.4659354090690613, "learning_rate": 2e-05, "loss": 0.7758, "step": 1770 }, { "epoch": 0.08334894174939127, "grad_norm": 0.4827459752559662, "learning_rate": 2e-05, "loss": 0.7892, "step": 1780 }, { "epoch": 0.08381719423112942, "grad_norm": 1.0690308809280396, "learning_rate": 2e-05, "loss": 0.8228, "step": 1790 }, { "epoch": 0.08428544671286758, "grad_norm": 0.4485591650009155, "learning_rate": 2e-05, "loss": 0.7583, "step": 1800 }, { "epoch": 0.08475369919460574, "grad_norm": 0.44925209879875183, "learning_rate": 2e-05, "loss": 0.7587, "step": 1810 }, { "epoch": 0.08522195167634389, "grad_norm": 0.4562433063983917, "learning_rate": 2e-05, "loss": 0.7677, "step": 1820 }, { "epoch": 0.08569020415808204, "grad_norm": 0.45940324664115906, "learning_rate": 2e-05, "loss": 0.7985, "step": 1830 }, { "epoch": 0.08615845663982019, "grad_norm": 0.4248304069042206, "learning_rate": 2e-05, "loss": 0.7445, "step": 1840 }, { "epoch": 0.08662670912155834, "grad_norm": 0.48499906063079834, "learning_rate": 2e-05, "loss": 0.8037, "step": 1850 }, { "epoch": 0.0870949616032965, "grad_norm": 0.43459802865982056, "learning_rate": 2e-05, "loss": 0.7893, "step": 1860 }, { "epoch": 0.08756321408503465, "grad_norm": 0.521557629108429, "learning_rate": 2e-05, "loss": 0.79, "step": 1870 }, { "epoch": 0.0880314665667728, "grad_norm": 0.424723744392395, "learning_rate": 2e-05, "loss": 0.7598, "step": 1880 }, { "epoch": 0.08849971904851096, "grad_norm": 0.4430510401725769, "learning_rate": 2e-05, "loss": 0.8156, "step": 1890 }, { "epoch": 0.08896797153024912, "grad_norm": 0.43703287839889526, "learning_rate": 2e-05, "loss": 0.8031, "step": 1900 }, { "epoch": 0.08943622401198727, "grad_norm": 0.46375030279159546, "learning_rate": 2e-05, "loss": 0.7903, "step": 1910 }, { "epoch": 0.08990447649372542, "grad_norm": 0.46522295475006104, "learning_rate": 2e-05, "loss": 0.7418, "step": 1920 }, { "epoch": 0.09037272897546357, "grad_norm": 0.40295276045799255, "learning_rate": 2e-05, "loss": 0.781, "step": 1930 }, { "epoch": 0.09084098145720172, "grad_norm": 0.42140400409698486, "learning_rate": 2e-05, "loss": 0.7899, "step": 1940 }, { "epoch": 0.09130923393893987, "grad_norm": 0.6773248314857483, "learning_rate": 2e-05, "loss": 0.8514, "step": 1950 }, { "epoch": 0.09177748642067803, "grad_norm": 0.46820682287216187, "learning_rate": 2e-05, "loss": 0.8016, "step": 1960 }, { "epoch": 0.09224573890241618, "grad_norm": 0.4235709011554718, "learning_rate": 2e-05, "loss": 0.7933, "step": 1970 }, { "epoch": 0.09271399138415434, "grad_norm": 0.43302154541015625, "learning_rate": 2e-05, "loss": 0.7481, "step": 1980 }, { "epoch": 0.0931822438658925, "grad_norm": 0.4129074215888977, "learning_rate": 2e-05, "loss": 0.7644, "step": 1990 }, { "epoch": 0.09365049634763065, "grad_norm": 0.47755202651023865, "learning_rate": 2e-05, "loss": 0.7979, "step": 2000 }, { "epoch": 0.0941187488293688, "grad_norm": 0.4275096356868744, "learning_rate": 2e-05, "loss": 0.7869, "step": 2010 }, { "epoch": 0.09458700131110695, "grad_norm": 0.41398802399635315, "learning_rate": 2e-05, "loss": 0.7833, "step": 2020 }, { "epoch": 0.0950552537928451, "grad_norm": 0.4200058877468109, "learning_rate": 2e-05, "loss": 0.791, "step": 2030 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.084295122442519e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }