{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.27790784791159395, "eval_steps": 500, "global_step": 5935, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0004682524817381532, "grad_norm": 0.7815176248550415, "learning_rate": 2.910112359550562e-06, "loss": 0.8415, "step": 10 }, { "epoch": 0.0009365049634763064, "grad_norm": 0.8108879327774048, "learning_rate": 3.921348314606742e-06, "loss": 0.8485, "step": 20 }, { "epoch": 0.0014047574452144597, "grad_norm": 0.8000619411468506, "learning_rate": 4.932584269662922e-06, "loss": 0.83, "step": 30 }, { "epoch": 0.0018730099269526129, "grad_norm": 0.7511084675788879, "learning_rate": 5.943820224719102e-06, "loss": 0.8517, "step": 40 }, { "epoch": 0.002341262408690766, "grad_norm": 0.7430337071418762, "learning_rate": 6.955056179775282e-06, "loss": 0.847, "step": 50 }, { "epoch": 0.0028095148904289193, "grad_norm": 0.8726410269737244, "learning_rate": 7.966292134831462e-06, "loss": 0.8172, "step": 60 }, { "epoch": 0.0032777673721670723, "grad_norm": 0.8567508459091187, "learning_rate": 8.977528089887641e-06, "loss": 0.8377, "step": 70 }, { "epoch": 0.0037460198539052258, "grad_norm": 0.7639268040657043, "learning_rate": 9.988764044943822e-06, "loss": 0.8184, "step": 80 }, { "epoch": 0.004214272335643379, "grad_norm": 0.9645025134086609, "learning_rate": 1.1000000000000001e-05, "loss": 0.8178, "step": 90 }, { "epoch": 0.004682524817381532, "grad_norm": 0.801426887512207, "learning_rate": 1.2011235955056182e-05, "loss": 0.8351, "step": 100 }, { "epoch": 0.005150777299119685, "grad_norm": 0.8018251061439514, "learning_rate": 1.3022471910112362e-05, "loss": 0.8493, "step": 110 }, { "epoch": 0.005619029780857839, "grad_norm": 1.6218419075012207, "learning_rate": 1.403370786516854e-05, "loss": 0.8367, "step": 120 }, { "epoch": 0.006087282262595992, "grad_norm": 0.738893449306488, "learning_rate": 1.504494382022472e-05, "loss": 0.8622, "step": 130 }, { "epoch": 0.006555534744334145, "grad_norm": 0.9413527846336365, "learning_rate": 1.60561797752809e-05, "loss": 0.8024, "step": 140 }, { "epoch": 0.007023787226072298, "grad_norm": 0.8190211653709412, "learning_rate": 1.706741573033708e-05, "loss": 0.8216, "step": 150 }, { "epoch": 0.0074920397078104516, "grad_norm": 0.6878272294998169, "learning_rate": 1.8078651685393256e-05, "loss": 0.8609, "step": 160 }, { "epoch": 0.007960292189548605, "grad_norm": 0.7031309008598328, "learning_rate": 1.908988764044944e-05, "loss": 0.8954, "step": 170 }, { "epoch": 0.008428544671286758, "grad_norm": 0.7149655818939209, "learning_rate": 2e-05, "loss": 0.8378, "step": 180 }, { "epoch": 0.008896797153024912, "grad_norm": 0.6629250645637512, "learning_rate": 2e-05, "loss": 0.8002, "step": 190 }, { "epoch": 0.009365049634763064, "grad_norm": 0.6915798783302307, "learning_rate": 2e-05, "loss": 0.8358, "step": 200 }, { "epoch": 0.009833302116501217, "grad_norm": 0.6538642644882202, "learning_rate": 2e-05, "loss": 0.8535, "step": 210 }, { "epoch": 0.01030155459823937, "grad_norm": 0.584514856338501, "learning_rate": 2e-05, "loss": 0.8362, "step": 220 }, { "epoch": 0.010769807079977524, "grad_norm": 1.3603894710540771, "learning_rate": 2e-05, "loss": 0.8086, "step": 230 }, { "epoch": 0.011238059561715677, "grad_norm": 0.5758199691772461, "learning_rate": 2e-05, "loss": 0.8336, "step": 240 }, { "epoch": 0.01170631204345383, "grad_norm": 0.6881021857261658, "learning_rate": 2e-05, "loss": 0.8444, "step": 250 }, { "epoch": 0.012174564525191984, "grad_norm": 1.9581451416015625, "learning_rate": 2e-05, "loss": 0.8433, "step": 260 }, { "epoch": 0.012642817006930136, "grad_norm": 0.5425940752029419, "learning_rate": 2e-05, "loss": 0.8213, "step": 270 }, { "epoch": 0.01311106948866829, "grad_norm": 0.5425044298171997, "learning_rate": 2e-05, "loss": 0.8179, "step": 280 }, { "epoch": 0.013579321970406443, "grad_norm": 0.657163143157959, "learning_rate": 2e-05, "loss": 0.8649, "step": 290 }, { "epoch": 0.014047574452144596, "grad_norm": 0.569369375705719, "learning_rate": 2e-05, "loss": 0.8438, "step": 300 }, { "epoch": 0.01451582693388275, "grad_norm": 0.554995059967041, "learning_rate": 2e-05, "loss": 0.8085, "step": 310 }, { "epoch": 0.014984079415620903, "grad_norm": 0.5484607219696045, "learning_rate": 2e-05, "loss": 0.8089, "step": 320 }, { "epoch": 0.015452331897359057, "grad_norm": 0.5753210186958313, "learning_rate": 2e-05, "loss": 0.8142, "step": 330 }, { "epoch": 0.01592058437909721, "grad_norm": 0.7434160113334656, "learning_rate": 2e-05, "loss": 0.8188, "step": 340 }, { "epoch": 0.01638883686083536, "grad_norm": 0.574074923992157, "learning_rate": 2e-05, "loss": 0.8563, "step": 350 }, { "epoch": 0.016857089342573517, "grad_norm": 0.5934783816337585, "learning_rate": 2e-05, "loss": 0.839, "step": 360 }, { "epoch": 0.01732534182431167, "grad_norm": 2.1430094242095947, "learning_rate": 2e-05, "loss": 0.8244, "step": 370 }, { "epoch": 0.017793594306049824, "grad_norm": 0.5127322673797607, "learning_rate": 2e-05, "loss": 0.7979, "step": 380 }, { "epoch": 0.018261846787787975, "grad_norm": 0.5187241435050964, "learning_rate": 2e-05, "loss": 0.8122, "step": 390 }, { "epoch": 0.018730099269526127, "grad_norm": 0.5075030326843262, "learning_rate": 2e-05, "loss": 0.8645, "step": 400 }, { "epoch": 0.019198351751264282, "grad_norm": 0.4950161576271057, "learning_rate": 2e-05, "loss": 0.8418, "step": 410 }, { "epoch": 0.019666604233002434, "grad_norm": 0.5396143794059753, "learning_rate": 2e-05, "loss": 0.8152, "step": 420 }, { "epoch": 0.02013485671474059, "grad_norm": 0.5515366196632385, "learning_rate": 2e-05, "loss": 0.7911, "step": 430 }, { "epoch": 0.02060310919647874, "grad_norm": 0.5184299945831299, "learning_rate": 2e-05, "loss": 0.8403, "step": 440 }, { "epoch": 0.021071361678216896, "grad_norm": 0.4794081449508667, "learning_rate": 2e-05, "loss": 0.8233, "step": 450 }, { "epoch": 0.021539614159955048, "grad_norm": 0.7160170674324036, "learning_rate": 2e-05, "loss": 0.8302, "step": 460 }, { "epoch": 0.0220078666416932, "grad_norm": 0.6666805148124695, "learning_rate": 2e-05, "loss": 0.8202, "step": 470 }, { "epoch": 0.022476119123431355, "grad_norm": 0.5356866717338562, "learning_rate": 2e-05, "loss": 0.8418, "step": 480 }, { "epoch": 0.022944371605169506, "grad_norm": 0.4900036156177521, "learning_rate": 2e-05, "loss": 0.829, "step": 490 }, { "epoch": 0.02341262408690766, "grad_norm": 0.47087252140045166, "learning_rate": 2e-05, "loss": 0.8418, "step": 500 }, { "epoch": 0.023880876568645813, "grad_norm": 0.5223408341407776, "learning_rate": 2e-05, "loss": 0.7874, "step": 510 }, { "epoch": 0.02434912905038397, "grad_norm": 0.5723909735679626, "learning_rate": 2e-05, "loss": 0.8552, "step": 520 }, { "epoch": 0.02481738153212212, "grad_norm": 0.4538605213165283, "learning_rate": 2e-05, "loss": 0.7783, "step": 530 }, { "epoch": 0.025285634013860272, "grad_norm": 0.4878973960876465, "learning_rate": 2e-05, "loss": 0.8085, "step": 540 }, { "epoch": 0.025753886495598427, "grad_norm": 0.5102939605712891, "learning_rate": 2e-05, "loss": 0.799, "step": 550 }, { "epoch": 0.02622213897733658, "grad_norm": 0.5069881081581116, "learning_rate": 2e-05, "loss": 0.8201, "step": 560 }, { "epoch": 0.026690391459074734, "grad_norm": 0.45733290910720825, "learning_rate": 2e-05, "loss": 0.844, "step": 570 }, { "epoch": 0.027158643940812886, "grad_norm": 0.4658640921115875, "learning_rate": 2e-05, "loss": 0.8291, "step": 580 }, { "epoch": 0.02762689642255104, "grad_norm": 0.48104459047317505, "learning_rate": 2e-05, "loss": 0.8432, "step": 590 }, { "epoch": 0.028095148904289192, "grad_norm": 0.46297943592071533, "learning_rate": 2e-05, "loss": 0.8192, "step": 600 }, { "epoch": 0.028563401386027348, "grad_norm": 0.450825959444046, "learning_rate": 2e-05, "loss": 0.7987, "step": 610 }, { "epoch": 0.0290316538677655, "grad_norm": 0.4797734022140503, "learning_rate": 2e-05, "loss": 0.8325, "step": 620 }, { "epoch": 0.02949990634950365, "grad_norm": 0.481893390417099, "learning_rate": 2e-05, "loss": 0.7837, "step": 630 }, { "epoch": 0.029968158831241806, "grad_norm": 0.47477421164512634, "learning_rate": 2e-05, "loss": 0.8278, "step": 640 }, { "epoch": 0.030436411312979958, "grad_norm": 0.5964585542678833, "learning_rate": 2e-05, "loss": 0.7969, "step": 650 }, { "epoch": 0.030904663794718113, "grad_norm": 0.46593981981277466, "learning_rate": 2e-05, "loss": 0.8307, "step": 660 }, { "epoch": 0.03137291627645627, "grad_norm": 0.48121365904808044, "learning_rate": 2e-05, "loss": 0.8174, "step": 670 }, { "epoch": 0.03184116875819442, "grad_norm": 0.5038956999778748, "learning_rate": 2e-05, "loss": 0.8339, "step": 680 }, { "epoch": 0.03230942123993257, "grad_norm": 0.5365706086158752, "learning_rate": 2e-05, "loss": 0.8291, "step": 690 }, { "epoch": 0.03277767372167072, "grad_norm": 0.5319100618362427, "learning_rate": 2e-05, "loss": 0.7953, "step": 700 }, { "epoch": 0.033245926203408875, "grad_norm": 0.4542364776134491, "learning_rate": 2e-05, "loss": 0.8263, "step": 710 }, { "epoch": 0.033714178685147034, "grad_norm": 0.47826236486434937, "learning_rate": 2e-05, "loss": 0.8321, "step": 720 }, { "epoch": 0.034182431166885185, "grad_norm": 0.44108861684799194, "learning_rate": 2e-05, "loss": 0.7989, "step": 730 }, { "epoch": 0.03465068364862334, "grad_norm": 0.4653085172176361, "learning_rate": 2e-05, "loss": 0.7994, "step": 740 }, { "epoch": 0.03511893613036149, "grad_norm": 0.5099039077758789, "learning_rate": 2e-05, "loss": 0.7591, "step": 750 }, { "epoch": 0.03558718861209965, "grad_norm": 0.48215553164482117, "learning_rate": 2e-05, "loss": 0.7921, "step": 760 }, { "epoch": 0.0360554410938378, "grad_norm": 0.46062806248664856, "learning_rate": 2e-05, "loss": 0.8244, "step": 770 }, { "epoch": 0.03652369357557595, "grad_norm": 0.5108964443206787, "learning_rate": 2e-05, "loss": 0.8667, "step": 780 }, { "epoch": 0.0369919460573141, "grad_norm": 0.47737154364585876, "learning_rate": 2e-05, "loss": 0.8246, "step": 790 }, { "epoch": 0.037460198539052254, "grad_norm": 0.5114936828613281, "learning_rate": 2e-05, "loss": 0.8188, "step": 800 }, { "epoch": 0.03792845102079041, "grad_norm": 0.47046583890914917, "learning_rate": 2e-05, "loss": 0.8393, "step": 810 }, { "epoch": 0.038396703502528565, "grad_norm": 0.4314744472503662, "learning_rate": 2e-05, "loss": 0.7953, "step": 820 }, { "epoch": 0.038864955984266716, "grad_norm": 0.4930090308189392, "learning_rate": 2e-05, "loss": 0.8048, "step": 830 }, { "epoch": 0.03933320846600487, "grad_norm": 0.4331071078777313, "learning_rate": 2e-05, "loss": 0.8389, "step": 840 }, { "epoch": 0.03980146094774302, "grad_norm": 0.4713480472564697, "learning_rate": 2e-05, "loss": 0.8165, "step": 850 }, { "epoch": 0.04026971342948118, "grad_norm": 0.4679141938686371, "learning_rate": 2e-05, "loss": 0.8198, "step": 860 }, { "epoch": 0.04073796591121933, "grad_norm": 0.7808457612991333, "learning_rate": 2e-05, "loss": 0.8528, "step": 870 }, { "epoch": 0.04120621839295748, "grad_norm": 0.44788986444473267, "learning_rate": 2e-05, "loss": 0.8225, "step": 880 }, { "epoch": 0.041674470874695634, "grad_norm": 0.480165034532547, "learning_rate": 2e-05, "loss": 0.8185, "step": 890 }, { "epoch": 0.04214272335643379, "grad_norm": 0.46314555406570435, "learning_rate": 2e-05, "loss": 0.8116, "step": 900 }, { "epoch": 0.042610975838171944, "grad_norm": 0.6263248920440674, "learning_rate": 2e-05, "loss": 0.8418, "step": 910 }, { "epoch": 0.043079228319910096, "grad_norm": 0.4619986414909363, "learning_rate": 2e-05, "loss": 0.8378, "step": 920 }, { "epoch": 0.04354748080164825, "grad_norm": 0.4389607906341553, "learning_rate": 2e-05, "loss": 0.8153, "step": 930 }, { "epoch": 0.0440157332833864, "grad_norm": 0.5322599411010742, "learning_rate": 2e-05, "loss": 0.8049, "step": 940 }, { "epoch": 0.04448398576512456, "grad_norm": 0.4362427890300751, "learning_rate": 2e-05, "loss": 0.7895, "step": 950 }, { "epoch": 0.04495223824686271, "grad_norm": 0.560736358165741, "learning_rate": 2e-05, "loss": 0.7834, "step": 960 }, { "epoch": 0.04542049072860086, "grad_norm": 0.49655383825302124, "learning_rate": 2e-05, "loss": 0.8419, "step": 970 }, { "epoch": 0.04588874321033901, "grad_norm": 0.447719931602478, "learning_rate": 2e-05, "loss": 0.8268, "step": 980 }, { "epoch": 0.04635699569207717, "grad_norm": 0.472380131483078, "learning_rate": 2e-05, "loss": 0.797, "step": 990 }, { "epoch": 0.04682524817381532, "grad_norm": 0.4404251277446747, "learning_rate": 2e-05, "loss": 0.8216, "step": 1000 }, { "epoch": 0.047293500655553475, "grad_norm": 0.8469703793525696, "learning_rate": 2e-05, "loss": 0.8061, "step": 1010 }, { "epoch": 0.047761753137291627, "grad_norm": 0.49690261483192444, "learning_rate": 2e-05, "loss": 0.8739, "step": 1020 }, { "epoch": 0.04823000561902978, "grad_norm": 0.4546132981777191, "learning_rate": 2e-05, "loss": 0.8611, "step": 1030 }, { "epoch": 0.04869825810076794, "grad_norm": 0.9852249026298523, "learning_rate": 2e-05, "loss": 0.8151, "step": 1040 }, { "epoch": 0.04916651058250609, "grad_norm": 0.4317361116409302, "learning_rate": 2e-05, "loss": 0.8253, "step": 1050 }, { "epoch": 0.04963476306424424, "grad_norm": 0.48968589305877686, "learning_rate": 2e-05, "loss": 0.8241, "step": 1060 }, { "epoch": 0.05010301554598239, "grad_norm": 0.5702976584434509, "learning_rate": 2e-05, "loss": 0.788, "step": 1070 }, { "epoch": 0.050571268027720544, "grad_norm": 0.4381064474582672, "learning_rate": 2e-05, "loss": 0.7815, "step": 1080 }, { "epoch": 0.0510395205094587, "grad_norm": 0.48637041449546814, "learning_rate": 2e-05, "loss": 0.8424, "step": 1090 }, { "epoch": 0.051507772991196854, "grad_norm": 0.4259801506996155, "learning_rate": 2e-05, "loss": 0.817, "step": 1100 }, { "epoch": 0.051976025472935006, "grad_norm": 0.4507712423801422, "learning_rate": 2e-05, "loss": 0.856, "step": 1110 }, { "epoch": 0.05244427795467316, "grad_norm": 0.4860295057296753, "learning_rate": 2e-05, "loss": 0.8139, "step": 1120 }, { "epoch": 0.052912530436411316, "grad_norm": 0.5244073271751404, "learning_rate": 2e-05, "loss": 0.8165, "step": 1130 }, { "epoch": 0.05338078291814947, "grad_norm": 0.4211806654930115, "learning_rate": 2e-05, "loss": 0.7845, "step": 1140 }, { "epoch": 0.05384903539988762, "grad_norm": 0.4540943205356598, "learning_rate": 2e-05, "loss": 0.7812, "step": 1150 }, { "epoch": 0.05431728788162577, "grad_norm": 0.4845108985900879, "learning_rate": 2e-05, "loss": 0.8138, "step": 1160 }, { "epoch": 0.05478554036336392, "grad_norm": 0.46812689304351807, "learning_rate": 2e-05, "loss": 0.8065, "step": 1170 }, { "epoch": 0.05525379284510208, "grad_norm": 0.42959365248680115, "learning_rate": 2e-05, "loss": 0.8089, "step": 1180 }, { "epoch": 0.05572204532684023, "grad_norm": 0.7998138070106506, "learning_rate": 2e-05, "loss": 0.8137, "step": 1190 }, { "epoch": 0.056190297808578385, "grad_norm": 0.46024176478385925, "learning_rate": 2e-05, "loss": 0.8341, "step": 1200 }, { "epoch": 0.05665855029031654, "grad_norm": 0.4920409023761749, "learning_rate": 2e-05, "loss": 0.8328, "step": 1210 }, { "epoch": 0.057126802772054695, "grad_norm": 0.44345328211784363, "learning_rate": 2e-05, "loss": 0.8242, "step": 1220 }, { "epoch": 0.05759505525379285, "grad_norm": 0.4638558030128479, "learning_rate": 2e-05, "loss": 0.8111, "step": 1230 }, { "epoch": 0.058063307735531, "grad_norm": 0.6508961319923401, "learning_rate": 2e-05, "loss": 0.809, "step": 1240 }, { "epoch": 0.05853156021726915, "grad_norm": 0.4465144872665405, "learning_rate": 2e-05, "loss": 0.8195, "step": 1250 }, { "epoch": 0.0589998126990073, "grad_norm": 0.4405592978000641, "learning_rate": 2e-05, "loss": 0.8352, "step": 1260 }, { "epoch": 0.05946806518074546, "grad_norm": 0.43743807077407837, "learning_rate": 2e-05, "loss": 0.8149, "step": 1270 }, { "epoch": 0.05993631766248361, "grad_norm": 0.5173885226249695, "learning_rate": 2e-05, "loss": 0.8421, "step": 1280 }, { "epoch": 0.060404570144221764, "grad_norm": 0.41101977229118347, "learning_rate": 2e-05, "loss": 0.8493, "step": 1290 }, { "epoch": 0.060872822625959916, "grad_norm": 0.41480135917663574, "learning_rate": 2e-05, "loss": 0.7971, "step": 1300 }, { "epoch": 0.06134107510769807, "grad_norm": 0.5274170637130737, "learning_rate": 2e-05, "loss": 0.8106, "step": 1310 }, { "epoch": 0.061809327589436226, "grad_norm": 0.4326211214065552, "learning_rate": 2e-05, "loss": 0.7927, "step": 1320 }, { "epoch": 0.06227758007117438, "grad_norm": 0.4117155373096466, "learning_rate": 2e-05, "loss": 0.7877, "step": 1330 }, { "epoch": 0.06274583255291254, "grad_norm": 0.4453534483909607, "learning_rate": 2e-05, "loss": 0.8417, "step": 1340 }, { "epoch": 0.06321408503465069, "grad_norm": 0.6158928871154785, "learning_rate": 2e-05, "loss": 0.7797, "step": 1350 }, { "epoch": 0.06368233751638884, "grad_norm": 0.43932247161865234, "learning_rate": 2e-05, "loss": 0.8042, "step": 1360 }, { "epoch": 0.06415058999812699, "grad_norm": 0.5323647856712341, "learning_rate": 2e-05, "loss": 0.798, "step": 1370 }, { "epoch": 0.06461884247986514, "grad_norm": 0.4197414517402649, "learning_rate": 2e-05, "loss": 0.8223, "step": 1380 }, { "epoch": 0.0650870949616033, "grad_norm": 0.48507630825042725, "learning_rate": 2e-05, "loss": 0.8105, "step": 1390 }, { "epoch": 0.06555534744334145, "grad_norm": 0.47112739086151123, "learning_rate": 2e-05, "loss": 0.8249, "step": 1400 }, { "epoch": 0.0660235999250796, "grad_norm": 0.48371198773384094, "learning_rate": 2e-05, "loss": 0.8105, "step": 1410 }, { "epoch": 0.06649185240681775, "grad_norm": 0.43702569603919983, "learning_rate": 2e-05, "loss": 0.7906, "step": 1420 }, { "epoch": 0.06696010488855592, "grad_norm": 0.44430628418922424, "learning_rate": 2e-05, "loss": 0.8313, "step": 1430 }, { "epoch": 0.06742835737029407, "grad_norm": 0.4579251706600189, "learning_rate": 2e-05, "loss": 0.8415, "step": 1440 }, { "epoch": 0.06789660985203222, "grad_norm": 0.48323583602905273, "learning_rate": 2e-05, "loss": 0.8341, "step": 1450 }, { "epoch": 0.06836486233377037, "grad_norm": 0.427022248506546, "learning_rate": 2e-05, "loss": 0.8007, "step": 1460 }, { "epoch": 0.06883311481550852, "grad_norm": 0.4505695104598999, "learning_rate": 2e-05, "loss": 0.8095, "step": 1470 }, { "epoch": 0.06930136729724667, "grad_norm": 0.45807015895843506, "learning_rate": 2e-05, "loss": 0.7785, "step": 1480 }, { "epoch": 0.06976961977898483, "grad_norm": 0.5102551579475403, "learning_rate": 2e-05, "loss": 0.806, "step": 1490 }, { "epoch": 0.07023787226072298, "grad_norm": 0.42989158630371094, "learning_rate": 2e-05, "loss": 0.8295, "step": 1500 }, { "epoch": 0.07070612474246113, "grad_norm": 0.5128605961799622, "learning_rate": 2e-05, "loss": 0.8218, "step": 1510 }, { "epoch": 0.0711743772241993, "grad_norm": 0.4889835715293884, "learning_rate": 2e-05, "loss": 0.7938, "step": 1520 }, { "epoch": 0.07164262970593745, "grad_norm": 0.4175378680229187, "learning_rate": 2e-05, "loss": 0.8033, "step": 1530 }, { "epoch": 0.0721108821876756, "grad_norm": 0.4378540813922882, "learning_rate": 2e-05, "loss": 0.8042, "step": 1540 }, { "epoch": 0.07257913466941375, "grad_norm": 0.4375297427177429, "learning_rate": 2e-05, "loss": 0.8218, "step": 1550 }, { "epoch": 0.0730473871511519, "grad_norm": 0.49845996499061584, "learning_rate": 2e-05, "loss": 0.8044, "step": 1560 }, { "epoch": 0.07351563963289005, "grad_norm": 0.46285390853881836, "learning_rate": 2e-05, "loss": 0.7989, "step": 1570 }, { "epoch": 0.0739838921146282, "grad_norm": 0.46297210454940796, "learning_rate": 2e-05, "loss": 0.8065, "step": 1580 }, { "epoch": 0.07445214459636636, "grad_norm": 0.5150440335273743, "learning_rate": 2e-05, "loss": 0.8284, "step": 1590 }, { "epoch": 0.07492039707810451, "grad_norm": 0.47179800271987915, "learning_rate": 2e-05, "loss": 0.8059, "step": 1600 }, { "epoch": 0.07538864955984266, "grad_norm": 0.4652591347694397, "learning_rate": 2e-05, "loss": 0.8229, "step": 1610 }, { "epoch": 0.07585690204158083, "grad_norm": 0.4540858864784241, "learning_rate": 2e-05, "loss": 0.7697, "step": 1620 }, { "epoch": 0.07632515452331898, "grad_norm": 0.4078024923801422, "learning_rate": 2e-05, "loss": 0.8106, "step": 1630 }, { "epoch": 0.07679340700505713, "grad_norm": 0.44727492332458496, "learning_rate": 2e-05, "loss": 0.8216, "step": 1640 }, { "epoch": 0.07726165948679528, "grad_norm": 0.46308594942092896, "learning_rate": 2e-05, "loss": 0.8184, "step": 1650 }, { "epoch": 0.07772991196853343, "grad_norm": 0.4770665764808655, "learning_rate": 2e-05, "loss": 0.7977, "step": 1660 }, { "epoch": 0.07819816445027158, "grad_norm": 0.4776230752468109, "learning_rate": 2e-05, "loss": 0.7921, "step": 1670 }, { "epoch": 0.07866641693200974, "grad_norm": 0.5174942016601562, "learning_rate": 2e-05, "loss": 0.8066, "step": 1680 }, { "epoch": 0.07913466941374789, "grad_norm": 0.43850815296173096, "learning_rate": 2e-05, "loss": 0.8068, "step": 1690 }, { "epoch": 0.07960292189548604, "grad_norm": 1.0964583158493042, "learning_rate": 2e-05, "loss": 0.7769, "step": 1700 }, { "epoch": 0.0800711743772242, "grad_norm": 0.4482307434082031, "learning_rate": 2e-05, "loss": 0.7822, "step": 1710 }, { "epoch": 0.08053942685896236, "grad_norm": 0.5412369966506958, "learning_rate": 2e-05, "loss": 0.7915, "step": 1720 }, { "epoch": 0.08100767934070051, "grad_norm": 0.4515257179737091, "learning_rate": 2e-05, "loss": 0.8215, "step": 1730 }, { "epoch": 0.08147593182243866, "grad_norm": 0.4404001533985138, "learning_rate": 2e-05, "loss": 0.8162, "step": 1740 }, { "epoch": 0.08194418430417681, "grad_norm": 0.4400689899921417, "learning_rate": 2e-05, "loss": 0.7876, "step": 1750 }, { "epoch": 0.08241243678591496, "grad_norm": 0.4302707314491272, "learning_rate": 2e-05, "loss": 0.8352, "step": 1760 }, { "epoch": 0.08288068926765312, "grad_norm": 0.4659354090690613, "learning_rate": 2e-05, "loss": 0.7758, "step": 1770 }, { "epoch": 0.08334894174939127, "grad_norm": 0.4827459752559662, "learning_rate": 2e-05, "loss": 0.7892, "step": 1780 }, { "epoch": 0.08381719423112942, "grad_norm": 1.0690308809280396, "learning_rate": 2e-05, "loss": 0.8228, "step": 1790 }, { "epoch": 0.08428544671286758, "grad_norm": 0.4485591650009155, "learning_rate": 2e-05, "loss": 0.7583, "step": 1800 }, { "epoch": 0.08475369919460574, "grad_norm": 0.44925209879875183, "learning_rate": 2e-05, "loss": 0.7587, "step": 1810 }, { "epoch": 0.08522195167634389, "grad_norm": 0.4562433063983917, "learning_rate": 2e-05, "loss": 0.7677, "step": 1820 }, { "epoch": 0.08569020415808204, "grad_norm": 0.45940324664115906, "learning_rate": 2e-05, "loss": 0.7985, "step": 1830 }, { "epoch": 0.08615845663982019, "grad_norm": 0.4248304069042206, "learning_rate": 2e-05, "loss": 0.7445, "step": 1840 }, { "epoch": 0.08662670912155834, "grad_norm": 0.48499906063079834, "learning_rate": 2e-05, "loss": 0.8037, "step": 1850 }, { "epoch": 0.0870949616032965, "grad_norm": 0.43459802865982056, "learning_rate": 2e-05, "loss": 0.7893, "step": 1860 }, { "epoch": 0.08756321408503465, "grad_norm": 0.521557629108429, "learning_rate": 2e-05, "loss": 0.79, "step": 1870 }, { "epoch": 0.0880314665667728, "grad_norm": 0.424723744392395, "learning_rate": 2e-05, "loss": 0.7598, "step": 1880 }, { "epoch": 0.08849971904851096, "grad_norm": 0.4430510401725769, "learning_rate": 2e-05, "loss": 0.8156, "step": 1890 }, { "epoch": 0.08896797153024912, "grad_norm": 0.43703287839889526, "learning_rate": 2e-05, "loss": 0.8031, "step": 1900 }, { "epoch": 0.08943622401198727, "grad_norm": 0.46375030279159546, "learning_rate": 2e-05, "loss": 0.7903, "step": 1910 }, { "epoch": 0.08990447649372542, "grad_norm": 0.46522295475006104, "learning_rate": 2e-05, "loss": 0.7418, "step": 1920 }, { "epoch": 0.09037272897546357, "grad_norm": 0.40295276045799255, "learning_rate": 2e-05, "loss": 0.781, "step": 1930 }, { "epoch": 0.09084098145720172, "grad_norm": 0.42140400409698486, "learning_rate": 2e-05, "loss": 0.7899, "step": 1940 }, { "epoch": 0.09130923393893987, "grad_norm": 0.6773248314857483, "learning_rate": 2e-05, "loss": 0.8514, "step": 1950 }, { "epoch": 0.09177748642067803, "grad_norm": 0.46820682287216187, "learning_rate": 2e-05, "loss": 0.8016, "step": 1960 }, { "epoch": 0.09224573890241618, "grad_norm": 0.4235709011554718, "learning_rate": 2e-05, "loss": 0.7933, "step": 1970 }, { "epoch": 0.09271399138415434, "grad_norm": 0.43302154541015625, "learning_rate": 2e-05, "loss": 0.7481, "step": 1980 }, { "epoch": 0.0931822438658925, "grad_norm": 0.4129074215888977, "learning_rate": 2e-05, "loss": 0.7644, "step": 1990 }, { "epoch": 0.09365049634763065, "grad_norm": 0.47755202651023865, "learning_rate": 2e-05, "loss": 0.7979, "step": 2000 }, { "epoch": 0.0941187488293688, "grad_norm": 0.4275096356868744, "learning_rate": 2e-05, "loss": 0.7869, "step": 2010 }, { "epoch": 0.09458700131110695, "grad_norm": 0.41398802399635315, "learning_rate": 2e-05, "loss": 0.7833, "step": 2020 }, { "epoch": 0.0950552537928451, "grad_norm": 0.4200058877468109, "learning_rate": 2e-05, "loss": 0.791, "step": 2030 }, { "epoch": 0.09552350627458325, "grad_norm": 0.4077129364013672, "learning_rate": 2e-05, "loss": 0.7645, "step": 2040 }, { "epoch": 0.0959917587563214, "grad_norm": 0.416229248046875, "learning_rate": 2e-05, "loss": 0.7874, "step": 2050 }, { "epoch": 0.09646001123805956, "grad_norm": 0.4201897382736206, "learning_rate": 2e-05, "loss": 0.7936, "step": 2060 }, { "epoch": 0.09692826371979771, "grad_norm": 0.44387736916542053, "learning_rate": 2e-05, "loss": 0.7972, "step": 2070 }, { "epoch": 0.09739651620153587, "grad_norm": 0.4564218521118164, "learning_rate": 2e-05, "loss": 0.8083, "step": 2080 }, { "epoch": 0.09786476868327403, "grad_norm": 0.4306756854057312, "learning_rate": 2e-05, "loss": 0.7695, "step": 2090 }, { "epoch": 0.09833302116501218, "grad_norm": 0.47157105803489685, "learning_rate": 2e-05, "loss": 0.7916, "step": 2100 }, { "epoch": 0.09880127364675033, "grad_norm": 0.5025231838226318, "learning_rate": 2e-05, "loss": 0.7783, "step": 2110 }, { "epoch": 0.09926952612848848, "grad_norm": 0.49327343702316284, "learning_rate": 2e-05, "loss": 0.7915, "step": 2120 }, { "epoch": 0.09973777861022663, "grad_norm": 0.4390990734100342, "learning_rate": 2e-05, "loss": 0.7971, "step": 2130 }, { "epoch": 0.10020603109196478, "grad_norm": 0.4255847930908203, "learning_rate": 2e-05, "loss": 0.7539, "step": 2140 }, { "epoch": 0.10067428357370294, "grad_norm": 0.4064248502254486, "learning_rate": 2e-05, "loss": 0.8041, "step": 2150 }, { "epoch": 0.10114253605544109, "grad_norm": 0.4446522891521454, "learning_rate": 2e-05, "loss": 0.7974, "step": 2160 }, { "epoch": 0.10161078853717925, "grad_norm": 0.4395385980606079, "learning_rate": 2e-05, "loss": 0.7771, "step": 2170 }, { "epoch": 0.1020790410189174, "grad_norm": 0.4272850751876831, "learning_rate": 2e-05, "loss": 0.8522, "step": 2180 }, { "epoch": 0.10254729350065556, "grad_norm": 0.3931410014629364, "learning_rate": 2e-05, "loss": 0.8056, "step": 2190 }, { "epoch": 0.10301554598239371, "grad_norm": 0.46096065640449524, "learning_rate": 2e-05, "loss": 0.7735, "step": 2200 }, { "epoch": 0.10348379846413186, "grad_norm": 0.458321750164032, "learning_rate": 2e-05, "loss": 0.8037, "step": 2210 }, { "epoch": 0.10395205094587001, "grad_norm": 0.4780912697315216, "learning_rate": 2e-05, "loss": 0.8117, "step": 2220 }, { "epoch": 0.10442030342760816, "grad_norm": 0.4787966012954712, "learning_rate": 2e-05, "loss": 0.7722, "step": 2230 }, { "epoch": 0.10488855590934631, "grad_norm": 0.44335323572158813, "learning_rate": 2e-05, "loss": 0.8006, "step": 2240 }, { "epoch": 0.10535680839108447, "grad_norm": 0.46708425879478455, "learning_rate": 2e-05, "loss": 0.8177, "step": 2250 }, { "epoch": 0.10582506087282263, "grad_norm": 0.41492828726768494, "learning_rate": 2e-05, "loss": 0.8078, "step": 2260 }, { "epoch": 0.10629331335456078, "grad_norm": 0.4242907762527466, "learning_rate": 2e-05, "loss": 0.8162, "step": 2270 }, { "epoch": 0.10676156583629894, "grad_norm": 0.43097883462905884, "learning_rate": 2e-05, "loss": 0.7563, "step": 2280 }, { "epoch": 0.10722981831803709, "grad_norm": 0.3991326689720154, "learning_rate": 2e-05, "loss": 0.7908, "step": 2290 }, { "epoch": 0.10769807079977524, "grad_norm": 0.5473389625549316, "learning_rate": 2e-05, "loss": 0.7945, "step": 2300 }, { "epoch": 0.10816632328151339, "grad_norm": 0.46721047163009644, "learning_rate": 2e-05, "loss": 0.798, "step": 2310 }, { "epoch": 0.10863457576325154, "grad_norm": 0.4458387792110443, "learning_rate": 2e-05, "loss": 0.8095, "step": 2320 }, { "epoch": 0.1091028282449897, "grad_norm": 0.5851238369941711, "learning_rate": 2e-05, "loss": 0.79, "step": 2330 }, { "epoch": 0.10957108072672785, "grad_norm": 0.46909311413764954, "learning_rate": 2e-05, "loss": 0.7908, "step": 2340 }, { "epoch": 0.11003933320846601, "grad_norm": 0.5781607031822205, "learning_rate": 2e-05, "loss": 0.8256, "step": 2350 }, { "epoch": 0.11050758569020416, "grad_norm": 0.4696139693260193, "learning_rate": 2e-05, "loss": 0.8044, "step": 2360 }, { "epoch": 0.11097583817194231, "grad_norm": 0.4228568971157074, "learning_rate": 2e-05, "loss": 0.7684, "step": 2370 }, { "epoch": 0.11144409065368047, "grad_norm": 0.4293256402015686, "learning_rate": 2e-05, "loss": 0.8011, "step": 2380 }, { "epoch": 0.11191234313541862, "grad_norm": 0.4462338984012604, "learning_rate": 2e-05, "loss": 0.7655, "step": 2390 }, { "epoch": 0.11238059561715677, "grad_norm": 0.47912371158599854, "learning_rate": 2e-05, "loss": 0.7984, "step": 2400 }, { "epoch": 0.11284884809889492, "grad_norm": 0.9592866897583008, "learning_rate": 2e-05, "loss": 0.7766, "step": 2410 }, { "epoch": 0.11331710058063307, "grad_norm": 0.39810967445373535, "learning_rate": 2e-05, "loss": 0.7604, "step": 2420 }, { "epoch": 0.11378535306237123, "grad_norm": 0.45152178406715393, "learning_rate": 2e-05, "loss": 0.79, "step": 2430 }, { "epoch": 0.11425360554410939, "grad_norm": 0.44523119926452637, "learning_rate": 2e-05, "loss": 0.8067, "step": 2440 }, { "epoch": 0.11472185802584754, "grad_norm": 0.47627031803131104, "learning_rate": 2e-05, "loss": 0.7797, "step": 2450 }, { "epoch": 0.1151901105075857, "grad_norm": 0.45713964104652405, "learning_rate": 2e-05, "loss": 0.7613, "step": 2460 }, { "epoch": 0.11565836298932385, "grad_norm": 0.4603721499443054, "learning_rate": 2e-05, "loss": 0.7985, "step": 2470 }, { "epoch": 0.116126615471062, "grad_norm": 0.5172587633132935, "learning_rate": 2e-05, "loss": 0.7631, "step": 2480 }, { "epoch": 0.11659486795280015, "grad_norm": 0.4585573971271515, "learning_rate": 2e-05, "loss": 0.7675, "step": 2490 }, { "epoch": 0.1170631204345383, "grad_norm": 0.4653816223144531, "learning_rate": 2e-05, "loss": 0.8136, "step": 2500 }, { "epoch": 0.11753137291627645, "grad_norm": 0.45800113677978516, "learning_rate": 2e-05, "loss": 0.7873, "step": 2510 }, { "epoch": 0.1179996253980146, "grad_norm": 1.0582246780395508, "learning_rate": 2e-05, "loss": 0.7743, "step": 2520 }, { "epoch": 0.11846787787975276, "grad_norm": 0.4848767817020416, "learning_rate": 2e-05, "loss": 0.7817, "step": 2530 }, { "epoch": 0.11893613036149092, "grad_norm": 0.45420584082603455, "learning_rate": 2e-05, "loss": 0.7787, "step": 2540 }, { "epoch": 0.11940438284322907, "grad_norm": 0.446957528591156, "learning_rate": 2e-05, "loss": 0.7691, "step": 2550 }, { "epoch": 0.11987263532496722, "grad_norm": 0.4325239956378937, "learning_rate": 2e-05, "loss": 0.7725, "step": 2560 }, { "epoch": 0.12034088780670538, "grad_norm": 0.3984229266643524, "learning_rate": 2e-05, "loss": 0.7517, "step": 2570 }, { "epoch": 0.12080914028844353, "grad_norm": 0.5047958493232727, "learning_rate": 2e-05, "loss": 0.7832, "step": 2580 }, { "epoch": 0.12127739277018168, "grad_norm": 0.4237649142742157, "learning_rate": 2e-05, "loss": 0.7554, "step": 2590 }, { "epoch": 0.12174564525191983, "grad_norm": 0.5109700560569763, "learning_rate": 2e-05, "loss": 0.791, "step": 2600 }, { "epoch": 0.12221389773365798, "grad_norm": 0.47834986448287964, "learning_rate": 2e-05, "loss": 0.7781, "step": 2610 }, { "epoch": 0.12268215021539614, "grad_norm": 0.43558385968208313, "learning_rate": 2e-05, "loss": 0.7887, "step": 2620 }, { "epoch": 0.1231504026971343, "grad_norm": 0.46023640036582947, "learning_rate": 2e-05, "loss": 0.8184, "step": 2630 }, { "epoch": 0.12361865517887245, "grad_norm": 0.43065863847732544, "learning_rate": 2e-05, "loss": 0.8087, "step": 2640 }, { "epoch": 0.1240869076606106, "grad_norm": 0.46921634674072266, "learning_rate": 2e-05, "loss": 0.8023, "step": 2650 }, { "epoch": 0.12455516014234876, "grad_norm": 0.45447105169296265, "learning_rate": 2e-05, "loss": 0.7865, "step": 2660 }, { "epoch": 0.12502341262408692, "grad_norm": 0.5031870007514954, "learning_rate": 2e-05, "loss": 0.7982, "step": 2670 }, { "epoch": 0.12549166510582507, "grad_norm": 0.4168241024017334, "learning_rate": 2e-05, "loss": 0.7755, "step": 2680 }, { "epoch": 0.12595991758756322, "grad_norm": 0.489377498626709, "learning_rate": 2e-05, "loss": 0.797, "step": 2690 }, { "epoch": 0.12642817006930138, "grad_norm": 0.42968428134918213, "learning_rate": 2e-05, "loss": 0.7752, "step": 2700 }, { "epoch": 0.12689642255103953, "grad_norm": 0.45984914898872375, "learning_rate": 2e-05, "loss": 0.7716, "step": 2710 }, { "epoch": 0.12736467503277768, "grad_norm": 0.47864603996276855, "learning_rate": 2e-05, "loss": 0.7735, "step": 2720 }, { "epoch": 0.12783292751451583, "grad_norm": 0.4695641100406647, "learning_rate": 2e-05, "loss": 0.7924, "step": 2730 }, { "epoch": 0.12830117999625398, "grad_norm": 0.42772170901298523, "learning_rate": 2e-05, "loss": 0.7798, "step": 2740 }, { "epoch": 0.12876943247799214, "grad_norm": 0.526038408279419, "learning_rate": 2e-05, "loss": 0.8099, "step": 2750 }, { "epoch": 0.1292376849597303, "grad_norm": 0.48115813732147217, "learning_rate": 2e-05, "loss": 0.7725, "step": 2760 }, { "epoch": 0.12970593744146844, "grad_norm": 0.8196518421173096, "learning_rate": 2e-05, "loss": 0.7476, "step": 2770 }, { "epoch": 0.1301741899232066, "grad_norm": 0.4384530186653137, "learning_rate": 2e-05, "loss": 0.7528, "step": 2780 }, { "epoch": 0.13064244240494474, "grad_norm": 0.48463067412376404, "learning_rate": 2e-05, "loss": 0.7801, "step": 2790 }, { "epoch": 0.1311106948866829, "grad_norm": 0.431721955537796, "learning_rate": 2e-05, "loss": 0.7843, "step": 2800 }, { "epoch": 0.13157894736842105, "grad_norm": 0.4804224371910095, "learning_rate": 2e-05, "loss": 0.8155, "step": 2810 }, { "epoch": 0.1320471998501592, "grad_norm": 0.4451720118522644, "learning_rate": 2e-05, "loss": 0.7953, "step": 2820 }, { "epoch": 0.13251545233189735, "grad_norm": 0.5056591629981995, "learning_rate": 2e-05, "loss": 0.7696, "step": 2830 }, { "epoch": 0.1329837048136355, "grad_norm": 0.40849485993385315, "learning_rate": 2e-05, "loss": 0.7782, "step": 2840 }, { "epoch": 0.13345195729537365, "grad_norm": 0.4380452036857605, "learning_rate": 2e-05, "loss": 0.7444, "step": 2850 }, { "epoch": 0.13392020977711183, "grad_norm": 0.4316031336784363, "learning_rate": 2e-05, "loss": 0.7728, "step": 2860 }, { "epoch": 0.13438846225884998, "grad_norm": 0.46132344007492065, "learning_rate": 2e-05, "loss": 0.7649, "step": 2870 }, { "epoch": 0.13485671474058814, "grad_norm": 0.4467066526412964, "learning_rate": 2e-05, "loss": 0.7802, "step": 2880 }, { "epoch": 0.1353249672223263, "grad_norm": 0.4437260031700134, "learning_rate": 2e-05, "loss": 0.7728, "step": 2890 }, { "epoch": 0.13579321970406444, "grad_norm": 0.41009271144866943, "learning_rate": 2e-05, "loss": 0.785, "step": 2900 }, { "epoch": 0.1362614721858026, "grad_norm": 0.4567055106163025, "learning_rate": 2e-05, "loss": 0.7977, "step": 2910 }, { "epoch": 0.13672972466754074, "grad_norm": 0.4779447019100189, "learning_rate": 2e-05, "loss": 0.786, "step": 2920 }, { "epoch": 0.1371979771492789, "grad_norm": 0.4813325107097626, "learning_rate": 2e-05, "loss": 0.7602, "step": 2930 }, { "epoch": 0.13766622963101705, "grad_norm": 0.46978309750556946, "learning_rate": 2e-05, "loss": 0.8055, "step": 2940 }, { "epoch": 0.1381344821127552, "grad_norm": 0.436978816986084, "learning_rate": 2e-05, "loss": 0.7712, "step": 2950 }, { "epoch": 0.13860273459449335, "grad_norm": 0.4569421410560608, "learning_rate": 2e-05, "loss": 0.7704, "step": 2960 }, { "epoch": 0.1390709870762315, "grad_norm": 0.4956076443195343, "learning_rate": 2e-05, "loss": 0.7934, "step": 2970 }, { "epoch": 0.13953923955796965, "grad_norm": 0.5110732913017273, "learning_rate": 2e-05, "loss": 0.7768, "step": 2980 }, { "epoch": 0.1400074920397078, "grad_norm": 0.4133819043636322, "learning_rate": 2e-05, "loss": 0.7859, "step": 2990 }, { "epoch": 0.14047574452144596, "grad_norm": 0.5259489417076111, "learning_rate": 2e-05, "loss": 0.7861, "step": 3000 }, { "epoch": 0.1409439970031841, "grad_norm": 0.4838019013404846, "learning_rate": 2e-05, "loss": 0.7816, "step": 3010 }, { "epoch": 0.14141224948492226, "grad_norm": 0.43243408203125, "learning_rate": 2e-05, "loss": 0.7951, "step": 3020 }, { "epoch": 0.1418805019666604, "grad_norm": 0.4447523355484009, "learning_rate": 2e-05, "loss": 0.7745, "step": 3030 }, { "epoch": 0.1423487544483986, "grad_norm": 0.426066130399704, "learning_rate": 2e-05, "loss": 0.7306, "step": 3040 }, { "epoch": 0.14281700693013674, "grad_norm": 0.4635065495967865, "learning_rate": 2e-05, "loss": 0.7769, "step": 3050 }, { "epoch": 0.1432852594118749, "grad_norm": 0.4404882788658142, "learning_rate": 2e-05, "loss": 0.7852, "step": 3060 }, { "epoch": 0.14375351189361305, "grad_norm": 0.4820006489753723, "learning_rate": 2e-05, "loss": 0.7805, "step": 3070 }, { "epoch": 0.1442217643753512, "grad_norm": 1.9450064897537231, "learning_rate": 2e-05, "loss": 0.7459, "step": 3080 }, { "epoch": 0.14469001685708935, "grad_norm": 0.4669210612773895, "learning_rate": 2e-05, "loss": 0.7594, "step": 3090 }, { "epoch": 0.1451582693388275, "grad_norm": 0.4511769711971283, "learning_rate": 2e-05, "loss": 0.7574, "step": 3100 }, { "epoch": 0.14562652182056565, "grad_norm": 0.4666540026664734, "learning_rate": 2e-05, "loss": 0.7624, "step": 3110 }, { "epoch": 0.1460947743023038, "grad_norm": 0.4351053535938263, "learning_rate": 2e-05, "loss": 0.7786, "step": 3120 }, { "epoch": 0.14656302678404196, "grad_norm": 0.48357275128364563, "learning_rate": 2e-05, "loss": 0.7756, "step": 3130 }, { "epoch": 0.1470312792657801, "grad_norm": 0.4528772830963135, "learning_rate": 2e-05, "loss": 0.7812, "step": 3140 }, { "epoch": 0.14749953174751826, "grad_norm": 0.43779534101486206, "learning_rate": 2e-05, "loss": 0.7698, "step": 3150 }, { "epoch": 0.1479677842292564, "grad_norm": 0.4632822275161743, "learning_rate": 2e-05, "loss": 0.7414, "step": 3160 }, { "epoch": 0.14843603671099456, "grad_norm": 0.4203107953071594, "learning_rate": 2e-05, "loss": 0.786, "step": 3170 }, { "epoch": 0.14890428919273271, "grad_norm": 0.4951493740081787, "learning_rate": 2e-05, "loss": 0.7653, "step": 3180 }, { "epoch": 0.14937254167447087, "grad_norm": 0.5392319560050964, "learning_rate": 2e-05, "loss": 0.7691, "step": 3190 }, { "epoch": 0.14984079415620902, "grad_norm": 0.4392766058444977, "learning_rate": 2e-05, "loss": 0.7664, "step": 3200 }, { "epoch": 0.15030904663794717, "grad_norm": 0.5064263939857483, "learning_rate": 2e-05, "loss": 0.7751, "step": 3210 }, { "epoch": 0.15077729911968532, "grad_norm": 0.4974293112754822, "learning_rate": 2e-05, "loss": 0.7846, "step": 3220 }, { "epoch": 0.1512455516014235, "grad_norm": 0.5040820240974426, "learning_rate": 2e-05, "loss": 0.7406, "step": 3230 }, { "epoch": 0.15171380408316165, "grad_norm": 0.4319583475589752, "learning_rate": 2e-05, "loss": 0.7487, "step": 3240 }, { "epoch": 0.1521820565648998, "grad_norm": 0.46588271856307983, "learning_rate": 2e-05, "loss": 0.773, "step": 3250 }, { "epoch": 0.15265030904663796, "grad_norm": 0.41532087326049805, "learning_rate": 2e-05, "loss": 0.7661, "step": 3260 }, { "epoch": 0.1531185615283761, "grad_norm": 0.5403257608413696, "learning_rate": 2e-05, "loss": 0.8033, "step": 3270 }, { "epoch": 0.15358681401011426, "grad_norm": 0.4624592363834381, "learning_rate": 2e-05, "loss": 0.8036, "step": 3280 }, { "epoch": 0.1540550664918524, "grad_norm": 0.4184800088405609, "learning_rate": 2e-05, "loss": 0.8141, "step": 3290 }, { "epoch": 0.15452331897359056, "grad_norm": 0.41161057353019714, "learning_rate": 2e-05, "loss": 0.7622, "step": 3300 }, { "epoch": 0.1549915714553287, "grad_norm": 0.41965046525001526, "learning_rate": 2e-05, "loss": 0.743, "step": 3310 }, { "epoch": 0.15545982393706687, "grad_norm": 0.547100841999054, "learning_rate": 2e-05, "loss": 0.739, "step": 3320 }, { "epoch": 0.15592807641880502, "grad_norm": 0.4471840262413025, "learning_rate": 2e-05, "loss": 0.7939, "step": 3330 }, { "epoch": 0.15639632890054317, "grad_norm": 0.40980273485183716, "learning_rate": 2e-05, "loss": 0.7598, "step": 3340 }, { "epoch": 0.15686458138228132, "grad_norm": 0.5068540573120117, "learning_rate": 2e-05, "loss": 0.7419, "step": 3350 }, { "epoch": 0.15733283386401947, "grad_norm": 0.4310580790042877, "learning_rate": 2e-05, "loss": 0.7807, "step": 3360 }, { "epoch": 0.15780108634575762, "grad_norm": 0.44191500544548035, "learning_rate": 2e-05, "loss": 0.7844, "step": 3370 }, { "epoch": 0.15826933882749578, "grad_norm": 0.492794930934906, "learning_rate": 2e-05, "loss": 0.7829, "step": 3380 }, { "epoch": 0.15873759130923393, "grad_norm": 0.46001243591308594, "learning_rate": 2e-05, "loss": 0.7616, "step": 3390 }, { "epoch": 0.15920584379097208, "grad_norm": 0.452966570854187, "learning_rate": 2e-05, "loss": 0.8051, "step": 3400 }, { "epoch": 0.15967409627271026, "grad_norm": 0.3855198621749878, "learning_rate": 2e-05, "loss": 0.7608, "step": 3410 }, { "epoch": 0.1601423487544484, "grad_norm": 0.4697616398334503, "learning_rate": 2e-05, "loss": 0.7637, "step": 3420 }, { "epoch": 0.16061060123618656, "grad_norm": 0.47525501251220703, "learning_rate": 2e-05, "loss": 0.7569, "step": 3430 }, { "epoch": 0.1610788537179247, "grad_norm": 0.49193453788757324, "learning_rate": 2e-05, "loss": 0.7792, "step": 3440 }, { "epoch": 0.16154710619966287, "grad_norm": 0.5018397569656372, "learning_rate": 2e-05, "loss": 0.8023, "step": 3450 }, { "epoch": 0.16201535868140102, "grad_norm": 0.4693327248096466, "learning_rate": 2e-05, "loss": 0.7602, "step": 3460 }, { "epoch": 0.16248361116313917, "grad_norm": 0.4147368371486664, "learning_rate": 2e-05, "loss": 0.7711, "step": 3470 }, { "epoch": 0.16295186364487732, "grad_norm": 0.48835280537605286, "learning_rate": 2e-05, "loss": 0.8112, "step": 3480 }, { "epoch": 0.16342011612661547, "grad_norm": 0.4873306155204773, "learning_rate": 2e-05, "loss": 0.8052, "step": 3490 }, { "epoch": 0.16388836860835362, "grad_norm": 0.5845130681991577, "learning_rate": 2e-05, "loss": 0.7896, "step": 3500 }, { "epoch": 0.16435662109009178, "grad_norm": 0.5305046439170837, "learning_rate": 2e-05, "loss": 0.7635, "step": 3510 }, { "epoch": 0.16482487357182993, "grad_norm": 0.4971988797187805, "learning_rate": 2e-05, "loss": 0.7448, "step": 3520 }, { "epoch": 0.16529312605356808, "grad_norm": 0.4730629026889801, "learning_rate": 2e-05, "loss": 0.7166, "step": 3530 }, { "epoch": 0.16576137853530623, "grad_norm": 0.4115239381790161, "learning_rate": 2e-05, "loss": 0.7846, "step": 3540 }, { "epoch": 0.16622963101704438, "grad_norm": 0.4584404528141022, "learning_rate": 2e-05, "loss": 0.744, "step": 3550 }, { "epoch": 0.16669788349878253, "grad_norm": 0.4739014208316803, "learning_rate": 2e-05, "loss": 0.8232, "step": 3560 }, { "epoch": 0.16716613598052069, "grad_norm": 0.44108620285987854, "learning_rate": 2e-05, "loss": 0.7595, "step": 3570 }, { "epoch": 0.16763438846225884, "grad_norm": 0.4143202006816864, "learning_rate": 2e-05, "loss": 0.7571, "step": 3580 }, { "epoch": 0.168102640943997, "grad_norm": 0.5289865136146545, "learning_rate": 2e-05, "loss": 0.7487, "step": 3590 }, { "epoch": 0.16857089342573517, "grad_norm": 0.453819215297699, "learning_rate": 2e-05, "loss": 0.7516, "step": 3600 }, { "epoch": 0.16903914590747332, "grad_norm": 0.4348923861980438, "learning_rate": 2e-05, "loss": 0.7767, "step": 3610 }, { "epoch": 0.16950739838921147, "grad_norm": 0.4643234610557556, "learning_rate": 2e-05, "loss": 0.7945, "step": 3620 }, { "epoch": 0.16997565087094962, "grad_norm": 0.47802820801734924, "learning_rate": 2e-05, "loss": 0.7327, "step": 3630 }, { "epoch": 0.17044390335268778, "grad_norm": 0.4367299973964691, "learning_rate": 2e-05, "loss": 0.7923, "step": 3640 }, { "epoch": 0.17091215583442593, "grad_norm": 0.4553154408931732, "learning_rate": 2e-05, "loss": 0.7655, "step": 3650 }, { "epoch": 0.17138040831616408, "grad_norm": 0.4764273464679718, "learning_rate": 2e-05, "loss": 0.7554, "step": 3660 }, { "epoch": 0.17184866079790223, "grad_norm": 0.44732391834259033, "learning_rate": 2e-05, "loss": 0.7692, "step": 3670 }, { "epoch": 0.17231691327964038, "grad_norm": 0.5650924444198608, "learning_rate": 2e-05, "loss": 0.7731, "step": 3680 }, { "epoch": 0.17278516576137853, "grad_norm": 0.6082085371017456, "learning_rate": 2e-05, "loss": 0.7769, "step": 3690 }, { "epoch": 0.17325341824311669, "grad_norm": 0.5217570066452026, "learning_rate": 2e-05, "loss": 0.7568, "step": 3700 }, { "epoch": 0.17372167072485484, "grad_norm": 0.46141839027404785, "learning_rate": 2e-05, "loss": 0.7528, "step": 3710 }, { "epoch": 0.174189923206593, "grad_norm": 0.48429611325263977, "learning_rate": 2e-05, "loss": 0.797, "step": 3720 }, { "epoch": 0.17465817568833114, "grad_norm": 0.5406231880187988, "learning_rate": 2e-05, "loss": 0.7687, "step": 3730 }, { "epoch": 0.1751264281700693, "grad_norm": 0.42686790227890015, "learning_rate": 2e-05, "loss": 0.7706, "step": 3740 }, { "epoch": 0.17559468065180744, "grad_norm": 0.44343850016593933, "learning_rate": 2e-05, "loss": 0.7863, "step": 3750 }, { "epoch": 0.1760629331335456, "grad_norm": 0.4633735716342926, "learning_rate": 2e-05, "loss": 0.7569, "step": 3760 }, { "epoch": 0.17653118561528375, "grad_norm": 0.4800039529800415, "learning_rate": 2e-05, "loss": 0.7502, "step": 3770 }, { "epoch": 0.17699943809702193, "grad_norm": 0.4586217701435089, "learning_rate": 2e-05, "loss": 0.8227, "step": 3780 }, { "epoch": 0.17746769057876008, "grad_norm": 0.4920169413089752, "learning_rate": 2e-05, "loss": 0.7901, "step": 3790 }, { "epoch": 0.17793594306049823, "grad_norm": 0.47960785031318665, "learning_rate": 2e-05, "loss": 0.7633, "step": 3800 }, { "epoch": 0.17840419554223638, "grad_norm": 0.4717206656932831, "learning_rate": 2e-05, "loss": 0.819, "step": 3810 }, { "epoch": 0.17887244802397453, "grad_norm": 0.511841893196106, "learning_rate": 2e-05, "loss": 0.7732, "step": 3820 }, { "epoch": 0.17934070050571269, "grad_norm": 0.47291046380996704, "learning_rate": 2e-05, "loss": 0.7682, "step": 3830 }, { "epoch": 0.17980895298745084, "grad_norm": 0.40757039189338684, "learning_rate": 2e-05, "loss": 0.7546, "step": 3840 }, { "epoch": 0.180277205469189, "grad_norm": 0.5135296583175659, "learning_rate": 2e-05, "loss": 0.7602, "step": 3850 }, { "epoch": 0.18074545795092714, "grad_norm": 0.4503514766693115, "learning_rate": 2e-05, "loss": 0.738, "step": 3860 }, { "epoch": 0.1812137104326653, "grad_norm": 0.49815234541893005, "learning_rate": 2e-05, "loss": 0.7765, "step": 3870 }, { "epoch": 0.18168196291440344, "grad_norm": 0.4232896864414215, "learning_rate": 2e-05, "loss": 0.7836, "step": 3880 }, { "epoch": 0.1821502153961416, "grad_norm": 0.4334942102432251, "learning_rate": 2e-05, "loss": 0.7253, "step": 3890 }, { "epoch": 0.18261846787787975, "grad_norm": 0.43816936016082764, "learning_rate": 2e-05, "loss": 0.7814, "step": 3900 }, { "epoch": 0.1830867203596179, "grad_norm": 0.4376625418663025, "learning_rate": 2e-05, "loss": 0.7547, "step": 3910 }, { "epoch": 0.18355497284135605, "grad_norm": 0.4537307620048523, "learning_rate": 2e-05, "loss": 0.7475, "step": 3920 }, { "epoch": 0.1840232253230942, "grad_norm": 0.4813627302646637, "learning_rate": 2e-05, "loss": 0.7681, "step": 3930 }, { "epoch": 0.18449147780483235, "grad_norm": 0.5152831077575684, "learning_rate": 2e-05, "loss": 0.7151, "step": 3940 }, { "epoch": 0.1849597302865705, "grad_norm": 0.4522545337677002, "learning_rate": 2e-05, "loss": 0.7779, "step": 3950 }, { "epoch": 0.18542798276830869, "grad_norm": 0.6297553777694702, "learning_rate": 2e-05, "loss": 0.7902, "step": 3960 }, { "epoch": 0.18589623525004684, "grad_norm": 0.4071296751499176, "learning_rate": 2e-05, "loss": 0.7563, "step": 3970 }, { "epoch": 0.186364487731785, "grad_norm": 0.4333728849887848, "learning_rate": 2e-05, "loss": 0.7854, "step": 3980 }, { "epoch": 0.18683274021352314, "grad_norm": 0.44967952370643616, "learning_rate": 2e-05, "loss": 0.7522, "step": 3990 }, { "epoch": 0.1873009926952613, "grad_norm": 1.3324648141860962, "learning_rate": 2e-05, "loss": 0.7475, "step": 4000 }, { "epoch": 0.18776924517699944, "grad_norm": 0.42225560545921326, "learning_rate": 2e-05, "loss": 0.7515, "step": 4010 }, { "epoch": 0.1882374976587376, "grad_norm": 0.4295327365398407, "learning_rate": 2e-05, "loss": 0.7989, "step": 4020 }, { "epoch": 0.18870575014047575, "grad_norm": 0.4431644380092621, "learning_rate": 2e-05, "loss": 0.7446, "step": 4030 }, { "epoch": 0.1891740026222139, "grad_norm": 0.4686296880245209, "learning_rate": 2e-05, "loss": 0.7488, "step": 4040 }, { "epoch": 0.18964225510395205, "grad_norm": 0.41146647930145264, "learning_rate": 2e-05, "loss": 0.7627, "step": 4050 }, { "epoch": 0.1901105075856902, "grad_norm": 0.5990108847618103, "learning_rate": 2e-05, "loss": 0.7834, "step": 4060 }, { "epoch": 0.19057876006742835, "grad_norm": 0.4420095682144165, "learning_rate": 2e-05, "loss": 0.7197, "step": 4070 }, { "epoch": 0.1910470125491665, "grad_norm": 0.46126800775527954, "learning_rate": 2e-05, "loss": 0.7522, "step": 4080 }, { "epoch": 0.19151526503090466, "grad_norm": 0.4785154163837433, "learning_rate": 2e-05, "loss": 0.7555, "step": 4090 }, { "epoch": 0.1919835175126428, "grad_norm": 0.5068645477294922, "learning_rate": 2e-05, "loss": 0.7717, "step": 4100 }, { "epoch": 0.19245176999438096, "grad_norm": 0.5095046758651733, "learning_rate": 2e-05, "loss": 0.7928, "step": 4110 }, { "epoch": 0.1929200224761191, "grad_norm": 0.4467774033546448, "learning_rate": 2e-05, "loss": 0.7303, "step": 4120 }, { "epoch": 0.19338827495785726, "grad_norm": 0.4577523469924927, "learning_rate": 2e-05, "loss": 0.733, "step": 4130 }, { "epoch": 0.19385652743959542, "grad_norm": 0.4515482783317566, "learning_rate": 2e-05, "loss": 0.7537, "step": 4140 }, { "epoch": 0.1943247799213336, "grad_norm": 0.5130146741867065, "learning_rate": 2e-05, "loss": 0.761, "step": 4150 }, { "epoch": 0.19479303240307175, "grad_norm": 0.47396641969680786, "learning_rate": 2e-05, "loss": 0.7459, "step": 4160 }, { "epoch": 0.1952612848848099, "grad_norm": 0.4405386447906494, "learning_rate": 2e-05, "loss": 0.7798, "step": 4170 }, { "epoch": 0.19572953736654805, "grad_norm": 0.4735771715641022, "learning_rate": 2e-05, "loss": 0.7695, "step": 4180 }, { "epoch": 0.1961977898482862, "grad_norm": 0.4145168364048004, "learning_rate": 2e-05, "loss": 0.8006, "step": 4190 }, { "epoch": 0.19666604233002435, "grad_norm": 0.5201475024223328, "learning_rate": 2e-05, "loss": 0.7508, "step": 4200 }, { "epoch": 0.1971342948117625, "grad_norm": 0.44904908537864685, "learning_rate": 2e-05, "loss": 0.7819, "step": 4210 }, { "epoch": 0.19760254729350066, "grad_norm": 0.4453062415122986, "learning_rate": 2e-05, "loss": 0.7273, "step": 4220 }, { "epoch": 0.1980707997752388, "grad_norm": 0.4952180087566376, "learning_rate": 2e-05, "loss": 0.7513, "step": 4230 }, { "epoch": 0.19853905225697696, "grad_norm": 0.6102429032325745, "learning_rate": 2e-05, "loss": 0.7505, "step": 4240 }, { "epoch": 0.1990073047387151, "grad_norm": 0.4875331223011017, "learning_rate": 2e-05, "loss": 0.7632, "step": 4250 }, { "epoch": 0.19947555722045326, "grad_norm": 0.5022391676902771, "learning_rate": 2e-05, "loss": 0.7639, "step": 4260 }, { "epoch": 0.19994380970219142, "grad_norm": 0.44564130902290344, "learning_rate": 2e-05, "loss": 0.7377, "step": 4270 }, { "epoch": 0.20041206218392957, "grad_norm": 0.509864091873169, "learning_rate": 2e-05, "loss": 0.7791, "step": 4280 }, { "epoch": 0.20088031466566772, "grad_norm": 0.45319506525993347, "learning_rate": 2e-05, "loss": 0.7693, "step": 4290 }, { "epoch": 0.20134856714740587, "grad_norm": 0.4179646968841553, "learning_rate": 2e-05, "loss": 0.7724, "step": 4300 }, { "epoch": 0.20181681962914402, "grad_norm": 0.44443565607070923, "learning_rate": 2e-05, "loss": 0.7748, "step": 4310 }, { "epoch": 0.20228507211088217, "grad_norm": 0.5083085894584656, "learning_rate": 2e-05, "loss": 0.74, "step": 4320 }, { "epoch": 0.20275332459262035, "grad_norm": 0.43336138129234314, "learning_rate": 2e-05, "loss": 0.7701, "step": 4330 }, { "epoch": 0.2032215770743585, "grad_norm": 0.48234793543815613, "learning_rate": 2e-05, "loss": 0.7723, "step": 4340 }, { "epoch": 0.20368982955609666, "grad_norm": 0.6275402307510376, "learning_rate": 2e-05, "loss": 0.7683, "step": 4350 }, { "epoch": 0.2041580820378348, "grad_norm": 0.4710438847541809, "learning_rate": 2e-05, "loss": 0.7461, "step": 4360 }, { "epoch": 0.20462633451957296, "grad_norm": 0.4537172317504883, "learning_rate": 2e-05, "loss": 0.734, "step": 4370 }, { "epoch": 0.2050945870013111, "grad_norm": 0.4454044699668884, "learning_rate": 2e-05, "loss": 0.7699, "step": 4380 }, { "epoch": 0.20556283948304926, "grad_norm": 0.455642968416214, "learning_rate": 2e-05, "loss": 0.7548, "step": 4390 }, { "epoch": 0.20603109196478742, "grad_norm": 0.45310547947883606, "learning_rate": 2e-05, "loss": 0.7754, "step": 4400 }, { "epoch": 0.20649934444652557, "grad_norm": 0.4452892541885376, "learning_rate": 2e-05, "loss": 0.7774, "step": 4410 }, { "epoch": 0.20696759692826372, "grad_norm": 0.5954875946044922, "learning_rate": 2e-05, "loss": 0.7175, "step": 4420 }, { "epoch": 0.20743584941000187, "grad_norm": 0.43730244040489197, "learning_rate": 2e-05, "loss": 0.7432, "step": 4430 }, { "epoch": 0.20790410189174002, "grad_norm": 0.4403478801250458, "learning_rate": 2e-05, "loss": 0.7893, "step": 4440 }, { "epoch": 0.20837235437347817, "grad_norm": 0.47121667861938477, "learning_rate": 2e-05, "loss": 0.7813, "step": 4450 }, { "epoch": 0.20884060685521633, "grad_norm": 0.442446768283844, "learning_rate": 2e-05, "loss": 0.8086, "step": 4460 }, { "epoch": 0.20930885933695448, "grad_norm": 0.4204050898551941, "learning_rate": 2e-05, "loss": 0.7554, "step": 4470 }, { "epoch": 0.20977711181869263, "grad_norm": 0.47490179538726807, "learning_rate": 2e-05, "loss": 0.7572, "step": 4480 }, { "epoch": 0.21024536430043078, "grad_norm": 0.433151513338089, "learning_rate": 2e-05, "loss": 0.7459, "step": 4490 }, { "epoch": 0.21071361678216893, "grad_norm": 0.47067561745643616, "learning_rate": 2e-05, "loss": 0.7485, "step": 4500 }, { "epoch": 0.21118186926390708, "grad_norm": 0.6863535046577454, "learning_rate": 2e-05, "loss": 0.7935, "step": 4510 }, { "epoch": 0.21165012174564526, "grad_norm": 0.531719446182251, "learning_rate": 2e-05, "loss": 0.7552, "step": 4520 }, { "epoch": 0.21211837422738342, "grad_norm": 0.4008723795413971, "learning_rate": 2e-05, "loss": 0.7481, "step": 4530 }, { "epoch": 0.21258662670912157, "grad_norm": 0.48098883032798767, "learning_rate": 2e-05, "loss": 0.7483, "step": 4540 }, { "epoch": 0.21305487919085972, "grad_norm": 0.4323178231716156, "learning_rate": 2e-05, "loss": 0.7779, "step": 4550 }, { "epoch": 0.21352313167259787, "grad_norm": 0.487679123878479, "learning_rate": 2e-05, "loss": 0.7696, "step": 4560 }, { "epoch": 0.21399138415433602, "grad_norm": 0.705156147480011, "learning_rate": 2e-05, "loss": 0.7455, "step": 4570 }, { "epoch": 0.21445963663607417, "grad_norm": 0.4571705162525177, "learning_rate": 2e-05, "loss": 0.732, "step": 4580 }, { "epoch": 0.21492788911781233, "grad_norm": 0.5622167587280273, "learning_rate": 2e-05, "loss": 0.7546, "step": 4590 }, { "epoch": 0.21539614159955048, "grad_norm": 0.42841002345085144, "learning_rate": 2e-05, "loss": 0.7311, "step": 4600 }, { "epoch": 0.21586439408128863, "grad_norm": 0.4392237365245819, "learning_rate": 2e-05, "loss": 0.7591, "step": 4610 }, { "epoch": 0.21633264656302678, "grad_norm": 0.4754595458507538, "learning_rate": 2e-05, "loss": 0.7412, "step": 4620 }, { "epoch": 0.21680089904476493, "grad_norm": 0.4496627748012543, "learning_rate": 2e-05, "loss": 0.7846, "step": 4630 }, { "epoch": 0.21726915152650308, "grad_norm": 0.4356529414653778, "learning_rate": 2e-05, "loss": 0.7621, "step": 4640 }, { "epoch": 0.21773740400824124, "grad_norm": 0.4718836545944214, "learning_rate": 2e-05, "loss": 0.7044, "step": 4650 }, { "epoch": 0.2182056564899794, "grad_norm": 0.4545374810695648, "learning_rate": 2e-05, "loss": 0.7429, "step": 4660 }, { "epoch": 0.21867390897171754, "grad_norm": 0.4936463534832001, "learning_rate": 2e-05, "loss": 0.7759, "step": 4670 }, { "epoch": 0.2191421614534557, "grad_norm": 0.4476785659790039, "learning_rate": 2e-05, "loss": 0.7955, "step": 4680 }, { "epoch": 0.21961041393519384, "grad_norm": 0.4549963176250458, "learning_rate": 2e-05, "loss": 0.7898, "step": 4690 }, { "epoch": 0.22007866641693202, "grad_norm": 0.5105022192001343, "learning_rate": 2e-05, "loss": 0.7665, "step": 4700 }, { "epoch": 0.22054691889867017, "grad_norm": 0.4230107367038727, "learning_rate": 2e-05, "loss": 0.7159, "step": 4710 }, { "epoch": 0.22101517138040833, "grad_norm": 0.46920329332351685, "learning_rate": 2e-05, "loss": 0.7735, "step": 4720 }, { "epoch": 0.22148342386214648, "grad_norm": 0.5480507612228394, "learning_rate": 2e-05, "loss": 0.7712, "step": 4730 }, { "epoch": 0.22195167634388463, "grad_norm": 0.44134387373924255, "learning_rate": 2e-05, "loss": 0.7407, "step": 4740 }, { "epoch": 0.22241992882562278, "grad_norm": 0.4618501365184784, "learning_rate": 2e-05, "loss": 0.7359, "step": 4750 }, { "epoch": 0.22288818130736093, "grad_norm": 0.46679604053497314, "learning_rate": 2e-05, "loss": 0.7411, "step": 4760 }, { "epoch": 0.22335643378909908, "grad_norm": 0.61300128698349, "learning_rate": 2e-05, "loss": 0.7259, "step": 4770 }, { "epoch": 0.22382468627083724, "grad_norm": 0.5050122141838074, "learning_rate": 2e-05, "loss": 0.7551, "step": 4780 }, { "epoch": 0.2242929387525754, "grad_norm": 0.44730883836746216, "learning_rate": 2e-05, "loss": 0.7244, "step": 4790 }, { "epoch": 0.22476119123431354, "grad_norm": 0.45580169558525085, "learning_rate": 2e-05, "loss": 0.7631, "step": 4800 }, { "epoch": 0.2252294437160517, "grad_norm": 0.4521130621433258, "learning_rate": 2e-05, "loss": 0.7858, "step": 4810 }, { "epoch": 0.22569769619778984, "grad_norm": 0.5105381608009338, "learning_rate": 2e-05, "loss": 0.7518, "step": 4820 }, { "epoch": 0.226165948679528, "grad_norm": 0.4405578374862671, "learning_rate": 2e-05, "loss": 0.7585, "step": 4830 }, { "epoch": 0.22663420116126615, "grad_norm": 0.44144561886787415, "learning_rate": 2e-05, "loss": 0.7283, "step": 4840 }, { "epoch": 0.2271024536430043, "grad_norm": 0.4783679246902466, "learning_rate": 2e-05, "loss": 0.7595, "step": 4850 }, { "epoch": 0.22757070612474245, "grad_norm": 0.4455217123031616, "learning_rate": 2e-05, "loss": 0.7416, "step": 4860 }, { "epoch": 0.2280389586064806, "grad_norm": 0.4736783504486084, "learning_rate": 2e-05, "loss": 0.7295, "step": 4870 }, { "epoch": 0.22850721108821878, "grad_norm": 0.4496026635169983, "learning_rate": 2e-05, "loss": 0.7768, "step": 4880 }, { "epoch": 0.22897546356995693, "grad_norm": 0.4254869520664215, "learning_rate": 2e-05, "loss": 0.7569, "step": 4890 }, { "epoch": 0.22944371605169508, "grad_norm": 0.5083935260772705, "learning_rate": 2e-05, "loss": 0.7119, "step": 4900 }, { "epoch": 0.22991196853343324, "grad_norm": 0.5440414547920227, "learning_rate": 2e-05, "loss": 0.7408, "step": 4910 }, { "epoch": 0.2303802210151714, "grad_norm": 0.4203755259513855, "learning_rate": 2e-05, "loss": 0.7569, "step": 4920 }, { "epoch": 0.23084847349690954, "grad_norm": 0.43250465393066406, "learning_rate": 2e-05, "loss": 0.7208, "step": 4930 }, { "epoch": 0.2313167259786477, "grad_norm": 0.40719085931777954, "learning_rate": 2e-05, "loss": 0.753, "step": 4940 }, { "epoch": 0.23178497846038584, "grad_norm": 0.5324130058288574, "learning_rate": 2e-05, "loss": 0.7013, "step": 4950 }, { "epoch": 0.232253230942124, "grad_norm": 0.4467906057834625, "learning_rate": 2e-05, "loss": 0.7145, "step": 4960 }, { "epoch": 0.23272148342386215, "grad_norm": 0.41979438066482544, "learning_rate": 2e-05, "loss": 0.7139, "step": 4970 }, { "epoch": 0.2331897359056003, "grad_norm": 0.4772839844226837, "learning_rate": 2e-05, "loss": 0.767, "step": 4980 }, { "epoch": 0.23365798838733845, "grad_norm": 0.5461247563362122, "learning_rate": 2e-05, "loss": 0.7394, "step": 4990 }, { "epoch": 0.2341262408690766, "grad_norm": 0.47626641392707825, "learning_rate": 2e-05, "loss": 0.7319, "step": 5000 }, { "epoch": 0.23459449335081475, "grad_norm": 0.53751540184021, "learning_rate": 2e-05, "loss": 0.6977, "step": 5010 }, { "epoch": 0.2350627458325529, "grad_norm": 0.448814332485199, "learning_rate": 2e-05, "loss": 0.767, "step": 5020 }, { "epoch": 0.23553099831429106, "grad_norm": 0.5457051992416382, "learning_rate": 2e-05, "loss": 0.7231, "step": 5030 }, { "epoch": 0.2359992507960292, "grad_norm": 0.5122005343437195, "learning_rate": 2e-05, "loss": 0.7569, "step": 5040 }, { "epoch": 0.23646750327776736, "grad_norm": 0.47288933396339417, "learning_rate": 2e-05, "loss": 0.7804, "step": 5050 }, { "epoch": 0.2369357557595055, "grad_norm": 0.5332443118095398, "learning_rate": 2e-05, "loss": 0.7425, "step": 5060 }, { "epoch": 0.2374040082412437, "grad_norm": 0.47076839208602905, "learning_rate": 2e-05, "loss": 0.7612, "step": 5070 }, { "epoch": 0.23787226072298184, "grad_norm": 0.4321301579475403, "learning_rate": 2e-05, "loss": 0.7663, "step": 5080 }, { "epoch": 0.23834051320472, "grad_norm": 0.5092326998710632, "learning_rate": 2e-05, "loss": 0.733, "step": 5090 }, { "epoch": 0.23880876568645815, "grad_norm": 0.45297569036483765, "learning_rate": 2e-05, "loss": 0.7389, "step": 5100 }, { "epoch": 0.2392770181681963, "grad_norm": 0.44341638684272766, "learning_rate": 2e-05, "loss": 0.7514, "step": 5110 }, { "epoch": 0.23974527064993445, "grad_norm": 0.4600866436958313, "learning_rate": 2e-05, "loss": 0.7186, "step": 5120 }, { "epoch": 0.2402135231316726, "grad_norm": 0.6210048794746399, "learning_rate": 2e-05, "loss": 0.7353, "step": 5130 }, { "epoch": 0.24068177561341075, "grad_norm": 0.4804288148880005, "learning_rate": 2e-05, "loss": 0.7576, "step": 5140 }, { "epoch": 0.2411500280951489, "grad_norm": 0.5150524973869324, "learning_rate": 2e-05, "loss": 0.7246, "step": 5150 }, { "epoch": 0.24161828057688706, "grad_norm": 0.4765327572822571, "learning_rate": 2e-05, "loss": 0.7414, "step": 5160 }, { "epoch": 0.2420865330586252, "grad_norm": 0.4479826092720032, "learning_rate": 2e-05, "loss": 0.7266, "step": 5170 }, { "epoch": 0.24255478554036336, "grad_norm": 0.43373504281044006, "learning_rate": 2e-05, "loss": 0.7458, "step": 5180 }, { "epoch": 0.2430230380221015, "grad_norm": 0.46008190512657166, "learning_rate": 2e-05, "loss": 0.7516, "step": 5190 }, { "epoch": 0.24349129050383966, "grad_norm": 0.4433428943157196, "learning_rate": 2e-05, "loss": 0.7338, "step": 5200 }, { "epoch": 0.24395954298557782, "grad_norm": 0.4364524185657501, "learning_rate": 2e-05, "loss": 0.7555, "step": 5210 }, { "epoch": 0.24442779546731597, "grad_norm": 0.5086431503295898, "learning_rate": 2e-05, "loss": 0.7453, "step": 5220 }, { "epoch": 0.24489604794905412, "grad_norm": 0.5044958591461182, "learning_rate": 2e-05, "loss": 0.7489, "step": 5230 }, { "epoch": 0.24536430043079227, "grad_norm": 0.4961252212524414, "learning_rate": 2e-05, "loss": 0.7634, "step": 5240 }, { "epoch": 0.24583255291253045, "grad_norm": 0.42669373750686646, "learning_rate": 2e-05, "loss": 0.7296, "step": 5250 }, { "epoch": 0.2463008053942686, "grad_norm": 0.4691210985183716, "learning_rate": 2e-05, "loss": 0.7411, "step": 5260 }, { "epoch": 0.24676905787600675, "grad_norm": 0.6449697017669678, "learning_rate": 2e-05, "loss": 0.7307, "step": 5270 }, { "epoch": 0.2472373103577449, "grad_norm": 0.49102461338043213, "learning_rate": 2e-05, "loss": 0.7721, "step": 5280 }, { "epoch": 0.24770556283948306, "grad_norm": 0.41137269139289856, "learning_rate": 2e-05, "loss": 0.761, "step": 5290 }, { "epoch": 0.2481738153212212, "grad_norm": 0.4368797242641449, "learning_rate": 2e-05, "loss": 0.7406, "step": 5300 }, { "epoch": 0.24864206780295936, "grad_norm": 0.5086705088615417, "learning_rate": 2e-05, "loss": 0.7588, "step": 5310 }, { "epoch": 0.2491103202846975, "grad_norm": 0.5293259620666504, "learning_rate": 2e-05, "loss": 0.7583, "step": 5320 }, { "epoch": 0.24957857276643566, "grad_norm": 0.43683844804763794, "learning_rate": 2e-05, "loss": 0.7231, "step": 5330 }, { "epoch": 0.25004682524817384, "grad_norm": 0.45331719517707825, "learning_rate": 2e-05, "loss": 0.6957, "step": 5340 }, { "epoch": 0.250515077729912, "grad_norm": 0.465107798576355, "learning_rate": 1.999194520388485e-05, "loss": 0.7405, "step": 5350 }, { "epoch": 0.25098333021165015, "grad_norm": 0.43206900358200073, "learning_rate": 1.9959247303157763e-05, "loss": 0.7123, "step": 5360 }, { "epoch": 0.2514515826933883, "grad_norm": 0.43132132291793823, "learning_rate": 1.990149424459817e-05, "loss": 0.7311, "step": 5370 }, { "epoch": 0.25191983517512645, "grad_norm": 0.48592984676361084, "learning_rate": 1.9818847538648688e-05, "loss": 0.714, "step": 5380 }, { "epoch": 0.2523880876568646, "grad_norm": 0.6471542716026306, "learning_rate": 1.971153831256721e-05, "loss": 0.7647, "step": 5390 }, { "epoch": 0.25285634013860275, "grad_norm": 0.48665595054626465, "learning_rate": 1.9579866664063435e-05, "loss": 0.7294, "step": 5400 }, { "epoch": 0.2533245926203409, "grad_norm": 0.4819086492061615, "learning_rate": 1.9424200822054782e-05, "loss": 0.7224, "step": 5410 }, { "epoch": 0.25379284510207906, "grad_norm": 0.5288002490997314, "learning_rate": 1.9244976116888626e-05, "loss": 0.7389, "step": 5420 }, { "epoch": 0.2542610975838172, "grad_norm": 0.5115023255348206, "learning_rate": 1.904269376291071e-05, "loss": 0.7439, "step": 5430 }, { "epoch": 0.25472935006555536, "grad_norm": 0.4631025195121765, "learning_rate": 1.88179194567844e-05, "loss": 0.7255, "step": 5440 }, { "epoch": 0.2551976025472935, "grad_norm": 0.7528506517410278, "learning_rate": 1.8571281795480632e-05, "loss": 0.7121, "step": 5450 }, { "epoch": 0.25566585502903166, "grad_norm": 0.4710090756416321, "learning_rate": 1.8303470518362808e-05, "loss": 0.7388, "step": 5460 }, { "epoch": 0.2561341075107698, "grad_norm": 0.4562467634677887, "learning_rate": 1.801523457828271e-05, "loss": 0.7255, "step": 5470 }, { "epoch": 0.25660235999250797, "grad_norm": 0.4709988236427307, "learning_rate": 1.7707380047081796e-05, "loss": 0.7584, "step": 5480 }, { "epoch": 0.2570706124742461, "grad_norm": 0.5111814737319946, "learning_rate": 1.7380767861355252e-05, "loss": 0.7401, "step": 5490 }, { "epoch": 0.25753886495598427, "grad_norm": 0.47118183970451355, "learning_rate": 1.703631141478299e-05, "loss": 0.7427, "step": 5500 }, { "epoch": 0.2580071174377224, "grad_norm": 0.40499457716941833, "learning_rate": 1.6674974003760705e-05, "loss": 0.7324, "step": 5510 }, { "epoch": 0.2584753699194606, "grad_norm": 0.46743279695510864, "learning_rate": 1.6297766133474556e-05, "loss": 0.727, "step": 5520 }, { "epoch": 0.2589436224011987, "grad_norm": 0.44490283727645874, "learning_rate": 1.5905742691953186e-05, "loss": 0.747, "step": 5530 }, { "epoch": 0.2594118748829369, "grad_norm": 0.5094086527824402, "learning_rate": 1.55e-05, "loss": 0.7585, "step": 5540 }, { "epoch": 0.25988012736467503, "grad_norm": 0.6570689678192139, "learning_rate": 1.5081672745255862e-05, "loss": 0.7221, "step": 5550 }, { "epoch": 0.2603483798464132, "grad_norm": 0.4389893114566803, "learning_rate": 1.4651930808966206e-05, "loss": 0.7258, "step": 5560 }, { "epoch": 0.26081663232815133, "grad_norm": 0.6062896251678467, "learning_rate": 1.4211975994326848e-05, "loss": 0.7534, "step": 5570 }, { "epoch": 0.2612848848098895, "grad_norm": 0.4593414068222046, "learning_rate": 1.376303866555779e-05, "loss": 0.6882, "step": 5580 }, { "epoch": 0.26175313729162764, "grad_norm": 0.49872151017189026, "learning_rate": 1.3306374307104164e-05, "loss": 0.7131, "step": 5590 }, { "epoch": 0.2622213897733658, "grad_norm": 0.42910924553871155, "learning_rate": 1.2843260012586718e-05, "loss": 0.7581, "step": 5600 }, { "epoch": 0.26268964225510394, "grad_norm": 0.4514053761959076, "learning_rate": 1.2374990913320726e-05, "loss": 0.7269, "step": 5610 }, { "epoch": 0.2631578947368421, "grad_norm": 0.49845200777053833, "learning_rate": 1.1902876556391247e-05, "loss": 0.742, "step": 5620 }, { "epoch": 0.26362614721858024, "grad_norm": 0.4507065415382385, "learning_rate": 1.1428237242413685e-05, "loss": 0.7294, "step": 5630 }, { "epoch": 0.2640943997003184, "grad_norm": 0.49284324049949646, "learning_rate": 1.095240033322132e-05, "loss": 0.7128, "step": 5640 }, { "epoch": 0.26456265218205655, "grad_norm": 0.46432697772979736, "learning_rate": 1.047669653980572e-05, "loss": 0.7643, "step": 5650 }, { "epoch": 0.2650309046637947, "grad_norm": 0.5275791883468628, "learning_rate": 1.0002456200890902e-05, "loss": 0.7324, "step": 5660 }, { "epoch": 0.26549915714553285, "grad_norm": 0.4414176344871521, "learning_rate": 9.531005562548668e-06, "loss": 0.7486, "step": 5670 }, { "epoch": 0.265967409627271, "grad_norm": 0.4890166223049164, "learning_rate": 9.06366306925925e-06, "loss": 0.7772, "step": 5680 }, { "epoch": 0.26643566210900915, "grad_norm": 0.534798264503479, "learning_rate": 8.601735676789686e-06, "loss": 0.7124, "step": 5690 }, { "epoch": 0.2669039145907473, "grad_norm": 0.514822244644165, "learning_rate": 8.14651519720118e-06, "loss": 0.7197, "step": 5700 }, { "epoch": 0.2673721670724855, "grad_norm": 0.49526098370552063, "learning_rate": 7.699274686206866e-06, "loss": 0.7178, "step": 5710 }, { "epoch": 0.26784041955422366, "grad_norm": 0.4386015832424164, "learning_rate": 7.261264882983024e-06, "loss": 0.6913, "step": 5720 }, { "epoch": 0.2683086720359618, "grad_norm": 0.4785960912704468, "learning_rate": 6.8337107123900386e-06, "loss": 0.751, "step": 5730 }, { "epoch": 0.26877692451769997, "grad_norm": 0.45442572236061096, "learning_rate": 6.417807859384881e-06, "loss": 0.7178, "step": 5740 }, { "epoch": 0.2692451769994381, "grad_norm": 0.7225289940834045, "learning_rate": 6.014719425205009e-06, "loss": 0.7458, "step": 5750 }, { "epoch": 0.26971342948117627, "grad_norm": 0.4711094796657562, "learning_rate": 5.6255726746749275e-06, "loss": 0.7363, "step": 5760 }, { "epoch": 0.2701816819629144, "grad_norm": 0.47222524881362915, "learning_rate": 5.251455883731728e-06, "loss": 0.7541, "step": 5770 }, { "epoch": 0.2706499344446526, "grad_norm": 0.5437127351760864, "learning_rate": 4.893415295985812e-06, "loss": 0.7053, "step": 5780 }, { "epoch": 0.2711181869263907, "grad_norm": 0.45000630617141724, "learning_rate": 4.552452196827885e-06, "loss": 0.7405, "step": 5790 }, { "epoch": 0.2715864394081289, "grad_norm": 0.4622010588645935, "learning_rate": 4.229520113264785e-06, "loss": 0.7319, "step": 5800 }, { "epoch": 0.27205469188986703, "grad_norm": 0.4853818416595459, "learning_rate": 3.925522147314915e-06, "loss": 0.7301, "step": 5810 }, { "epoch": 0.2725229443716052, "grad_norm": 0.5382267832756042, "learning_rate": 3.641308450420675e-06, "loss": 0.7154, "step": 5820 }, { "epoch": 0.27299119685334333, "grad_norm": 0.46594077348709106, "learning_rate": 3.37767384594087e-06, "loss": 0.7075, "step": 5830 }, { "epoch": 0.2734594493350815, "grad_norm": 0.45589321851730347, "learning_rate": 3.1353556063719357e-06, "loss": 0.7255, "step": 5840 }, { "epoch": 0.27392770181681964, "grad_norm": 0.7770072221755981, "learning_rate": 2.9150313915141474e-06, "loss": 0.7316, "step": 5850 }, { "epoch": 0.2743959542985578, "grad_norm": 0.5423017740249634, "learning_rate": 2.717317353348891e-06, "loss": 0.7269, "step": 5860 }, { "epoch": 0.27486420678029594, "grad_norm": 0.4896930158138275, "learning_rate": 2.5427664129268253e-06, "loss": 0.7408, "step": 5870 }, { "epoch": 0.2753324592620341, "grad_norm": 0.5106858015060425, "learning_rate": 2.391866714085717e-06, "loss": 0.7433, "step": 5880 }, { "epoch": 0.27580071174377224, "grad_norm": 0.49272871017456055, "learning_rate": 2.2650402583222753e-06, "loss": 0.7108, "step": 5890 }, { "epoch": 0.2762689642255104, "grad_norm": 0.49198707938194275, "learning_rate": 2.1626417246356398e-06, "loss": 0.7242, "step": 5900 }, { "epoch": 0.27673721670724855, "grad_norm": 0.5110393166542053, "learning_rate": 2.084957477642894e-06, "loss": 0.7276, "step": 5910 }, { "epoch": 0.2772054691889867, "grad_norm": 0.45616614818573, "learning_rate": 2.0322047667405147e-06, "loss": 0.6979, "step": 5920 }, { "epoch": 0.27767372167072485, "grad_norm": 0.4469747841358185, "learning_rate": 2.0045311185513342e-06, "loss": 0.7245, "step": 5930 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.6494000762504348e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }