{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 6.917197452229299, "eval_steps": 500, "global_step": 546, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012738853503184714, "grad_norm": 2.043114423751831, "learning_rate": 0.0, "loss": 2.5378, "mean_token_accuracy": 0.5474915206432343, "num_tokens": 45860.0, "step": 1 }, { "epoch": 0.025477707006369428, "grad_norm": 1.9945865869522095, "learning_rate": 1.1764705882352942e-05, "loss": 2.471, "mean_token_accuracy": 0.5548032820224762, "num_tokens": 91607.0, "step": 2 }, { "epoch": 0.03821656050955414, "grad_norm": 1.7864609956741333, "learning_rate": 2.3529411764705884e-05, "loss": 2.4891, "mean_token_accuracy": 0.554142564535141, "num_tokens": 138803.0, "step": 3 }, { "epoch": 0.050955414012738856, "grad_norm": 1.7019070386886597, "learning_rate": 3.529411764705883e-05, "loss": 2.4532, "mean_token_accuracy": 0.5522601306438446, "num_tokens": 185711.0, "step": 4 }, { "epoch": 0.06369426751592357, "grad_norm": 1.558175802230835, "learning_rate": 4.705882352941177e-05, "loss": 2.3084, "mean_token_accuracy": 0.5643967390060425, "num_tokens": 229326.0, "step": 5 }, { "epoch": 0.07643312101910828, "grad_norm": 1.3139784336090088, "learning_rate": 5.882352941176471e-05, "loss": 2.1893, "mean_token_accuracy": 0.5716671049594879, "num_tokens": 273139.0, "step": 6 }, { "epoch": 0.08917197452229299, "grad_norm": 0.9440768361091614, "learning_rate": 7.058823529411765e-05, "loss": 2.0658, "mean_token_accuracy": 0.5783773064613342, "num_tokens": 320421.0, "step": 7 }, { "epoch": 0.10191082802547771, "grad_norm": 0.575385332107544, "learning_rate": 8.23529411764706e-05, "loss": 1.9971, "mean_token_accuracy": 0.5801331400871277, "num_tokens": 368788.0, "step": 8 }, { "epoch": 0.11464968152866242, "grad_norm": 0.9466742277145386, "learning_rate": 9.411764705882353e-05, "loss": 1.9893, "mean_token_accuracy": 0.5827493369579315, "num_tokens": 415189.0, "step": 9 }, { "epoch": 0.12738853503184713, "grad_norm": 1.1029582023620605, "learning_rate": 0.00010588235294117647, "loss": 1.8928, "mean_token_accuracy": 0.5970898270606995, "num_tokens": 458774.0, "step": 10 }, { "epoch": 0.14012738853503184, "grad_norm": 0.8789502382278442, "learning_rate": 0.00011764705882352942, "loss": 1.9116, "mean_token_accuracy": 0.5919365584850311, "num_tokens": 504300.0, "step": 11 }, { "epoch": 0.15286624203821655, "grad_norm": 0.6089919805526733, "learning_rate": 0.00012941176470588237, "loss": 1.8636, "mean_token_accuracy": 0.5960094928741455, "num_tokens": 550239.0, "step": 12 }, { "epoch": 0.16560509554140126, "grad_norm": 0.567487895488739, "learning_rate": 0.0001411764705882353, "loss": 1.849, "mean_token_accuracy": 0.5990146100521088, "num_tokens": 595311.0, "step": 13 }, { "epoch": 0.17834394904458598, "grad_norm": 0.45083943009376526, "learning_rate": 0.00015294117647058822, "loss": 1.8572, "mean_token_accuracy": 0.5998204350471497, "num_tokens": 643731.0, "step": 14 }, { "epoch": 0.1910828025477707, "grad_norm": 0.3835723102092743, "learning_rate": 0.0001647058823529412, "loss": 1.8459, "mean_token_accuracy": 0.6031338572502136, "num_tokens": 687946.0, "step": 15 }, { "epoch": 0.20382165605095542, "grad_norm": 0.3622026741504669, "learning_rate": 0.00017647058823529413, "loss": 1.8221, "mean_token_accuracy": 0.6063935160636902, "num_tokens": 733740.0, "step": 16 }, { "epoch": 0.21656050955414013, "grad_norm": 0.3480350971221924, "learning_rate": 0.00018823529411764707, "loss": 1.8353, "mean_token_accuracy": 0.6034441590309143, "num_tokens": 780185.0, "step": 17 }, { "epoch": 0.22929936305732485, "grad_norm": 0.4176861047744751, "learning_rate": 0.0002, "loss": 1.8174, "mean_token_accuracy": 0.6044492721557617, "num_tokens": 827533.0, "step": 18 }, { "epoch": 0.24203821656050956, "grad_norm": 0.5879961848258972, "learning_rate": 0.00019999823657444873, "loss": 1.8099, "mean_token_accuracy": 0.6073833703994751, "num_tokens": 873543.0, "step": 19 }, { "epoch": 0.25477707006369427, "grad_norm": 0.5145211815834045, "learning_rate": 0.00019999294635998833, "loss": 1.8359, "mean_token_accuracy": 0.5988730490207672, "num_tokens": 923210.0, "step": 20 }, { "epoch": 0.267515923566879, "grad_norm": 0.4540589153766632, "learning_rate": 0.00019998412954319675, "loss": 1.7355, "mean_token_accuracy": 0.618651270866394, "num_tokens": 969460.0, "step": 21 }, { "epoch": 0.2802547770700637, "grad_norm": 0.3647150993347168, "learning_rate": 0.00019997178643503004, "loss": 1.7658, "mean_token_accuracy": 0.6132998466491699, "num_tokens": 1014215.0, "step": 22 }, { "epoch": 0.2929936305732484, "grad_norm": 0.2961389720439911, "learning_rate": 0.00019995591747081122, "loss": 1.7635, "mean_token_accuracy": 0.6134656071662903, "num_tokens": 1061587.0, "step": 23 }, { "epoch": 0.3057324840764331, "grad_norm": 0.3173348605632782, "learning_rate": 0.000199936523210215, "loss": 1.8054, "mean_token_accuracy": 0.6050374209880829, "num_tokens": 1108746.0, "step": 24 }, { "epoch": 0.3184713375796178, "grad_norm": 0.32570838928222656, "learning_rate": 0.00019991360433724813, "loss": 1.7147, "mean_token_accuracy": 0.623350203037262, "num_tokens": 1150650.0, "step": 25 }, { "epoch": 0.33121019108280253, "grad_norm": 0.31610530614852905, "learning_rate": 0.0001998871616602251, "loss": 1.8334, "mean_token_accuracy": 0.6021896600723267, "num_tokens": 1198478.0, "step": 26 }, { "epoch": 0.34394904458598724, "grad_norm": 0.2649655044078827, "learning_rate": 0.00019985719611173973, "loss": 1.791, "mean_token_accuracy": 0.6080193221569061, "num_tokens": 1248602.0, "step": 27 }, { "epoch": 0.35668789808917195, "grad_norm": 0.27781757712364197, "learning_rate": 0.00019982370874863236, "loss": 1.7948, "mean_token_accuracy": 0.6063768863677979, "num_tokens": 1298225.0, "step": 28 }, { "epoch": 0.36942675159235666, "grad_norm": 0.35199975967407227, "learning_rate": 0.0001997867007519524, "loss": 1.7029, "mean_token_accuracy": 0.6229945421218872, "num_tokens": 1346783.0, "step": 29 }, { "epoch": 0.3821656050955414, "grad_norm": 0.3464992940425873, "learning_rate": 0.00019974617342691678, "loss": 1.7706, "mean_token_accuracy": 0.6096044778823853, "num_tokens": 1394151.0, "step": 30 }, { "epoch": 0.39490445859872614, "grad_norm": 0.3475406765937805, "learning_rate": 0.00019970212820286394, "loss": 1.755, "mean_token_accuracy": 0.6146330833435059, "num_tokens": 1440818.0, "step": 31 }, { "epoch": 0.40764331210191085, "grad_norm": 0.30509206652641296, "learning_rate": 0.00019965456663320329, "loss": 1.7632, "mean_token_accuracy": 0.611842930316925, "num_tokens": 1486970.0, "step": 32 }, { "epoch": 0.42038216560509556, "grad_norm": 0.2553170621395111, "learning_rate": 0.00019960349039536062, "loss": 1.7521, "mean_token_accuracy": 0.6150202453136444, "num_tokens": 1535132.0, "step": 33 }, { "epoch": 0.43312101910828027, "grad_norm": 0.2561066746711731, "learning_rate": 0.00019954890129071876, "loss": 1.7303, "mean_token_accuracy": 0.6202265918254852, "num_tokens": 1581310.0, "step": 34 }, { "epoch": 0.445859872611465, "grad_norm": 0.2694303095340729, "learning_rate": 0.00019949080124455416, "loss": 1.7332, "mean_token_accuracy": 0.6190694272518158, "num_tokens": 1626838.0, "step": 35 }, { "epoch": 0.4585987261146497, "grad_norm": 0.2607475221157074, "learning_rate": 0.00019942919230596896, "loss": 1.7573, "mean_token_accuracy": 0.6160352826118469, "num_tokens": 1674100.0, "step": 36 }, { "epoch": 0.4713375796178344, "grad_norm": 0.2403094321489334, "learning_rate": 0.00019936407664781868, "loss": 1.7641, "mean_token_accuracy": 0.6089144349098206, "num_tokens": 1722819.0, "step": 37 }, { "epoch": 0.4840764331210191, "grad_norm": 0.24304397404193878, "learning_rate": 0.00019929545656663562, "loss": 1.6962, "mean_token_accuracy": 0.6224367320537567, "num_tokens": 1770008.0, "step": 38 }, { "epoch": 0.4968152866242038, "grad_norm": 0.26098185777664185, "learning_rate": 0.00019922333448254786, "loss": 1.7512, "mean_token_accuracy": 0.6127793490886688, "num_tokens": 1815094.0, "step": 39 }, { "epoch": 0.5095541401273885, "grad_norm": 0.24065393209457397, "learning_rate": 0.00019914771293919395, "loss": 1.7413, "mean_token_accuracy": 0.6163510084152222, "num_tokens": 1865027.0, "step": 40 }, { "epoch": 0.5222929936305732, "grad_norm": 0.25826820731163025, "learning_rate": 0.00019906859460363307, "loss": 1.7384, "mean_token_accuracy": 0.6187842190265656, "num_tokens": 1911967.0, "step": 41 }, { "epoch": 0.535031847133758, "grad_norm": 0.23422813415527344, "learning_rate": 0.00019898598226625119, "loss": 1.7723, "mean_token_accuracy": 0.6120906472206116, "num_tokens": 1963100.0, "step": 42 }, { "epoch": 0.5477707006369427, "grad_norm": 0.24756181240081787, "learning_rate": 0.00019889987884066237, "loss": 1.711, "mean_token_accuracy": 0.620893269777298, "num_tokens": 2010768.0, "step": 43 }, { "epoch": 0.5605095541401274, "grad_norm": 0.24499212205410004, "learning_rate": 0.00019881028736360622, "loss": 1.7597, "mean_token_accuracy": 0.6143153309822083, "num_tokens": 2059303.0, "step": 44 }, { "epoch": 0.5732484076433121, "grad_norm": 0.2653355896472931, "learning_rate": 0.0001987172109948408, "loss": 1.7588, "mean_token_accuracy": 0.6123422980308533, "num_tokens": 2103829.0, "step": 45 }, { "epoch": 0.5859872611464968, "grad_norm": 0.24230645596981049, "learning_rate": 0.000198620653017031, "loss": 1.7607, "mean_token_accuracy": 0.6133730709552765, "num_tokens": 2150558.0, "step": 46 }, { "epoch": 0.5987261146496815, "grad_norm": 0.23600345849990845, "learning_rate": 0.00019852061683563296, "loss": 1.7588, "mean_token_accuracy": 0.6099536418914795, "num_tokens": 2201253.0, "step": 47 }, { "epoch": 0.6114649681528662, "grad_norm": 0.25009065866470337, "learning_rate": 0.00019841710597877382, "loss": 1.7485, "mean_token_accuracy": 0.6158089637756348, "num_tokens": 2247382.0, "step": 48 }, { "epoch": 0.6242038216560509, "grad_norm": 0.24068281054496765, "learning_rate": 0.00019831012409712737, "loss": 1.7542, "mean_token_accuracy": 0.6143946349620819, "num_tokens": 2295707.0, "step": 49 }, { "epoch": 0.6369426751592356, "grad_norm": 0.28074583411216736, "learning_rate": 0.0001981996749637853, "loss": 1.7122, "mean_token_accuracy": 0.6212862432003021, "num_tokens": 2340697.0, "step": 50 }, { "epoch": 0.6496815286624203, "grad_norm": 0.27374881505966187, "learning_rate": 0.0001980857624741241, "loss": 1.7265, "mean_token_accuracy": 0.6174845993518829, "num_tokens": 2382717.0, "step": 51 }, { "epoch": 0.6624203821656051, "grad_norm": 0.31332576274871826, "learning_rate": 0.00019796839064566761, "loss": 1.7109, "mean_token_accuracy": 0.6214545965194702, "num_tokens": 2430219.0, "step": 52 }, { "epoch": 0.6751592356687898, "grad_norm": 0.2618464529514313, "learning_rate": 0.00019784756361794555, "loss": 1.6771, "mean_token_accuracy": 0.6261600852012634, "num_tokens": 2473766.0, "step": 53 }, { "epoch": 0.6878980891719745, "grad_norm": 0.25994718074798584, "learning_rate": 0.00019772328565234717, "loss": 1.7405, "mean_token_accuracy": 0.6188207268714905, "num_tokens": 2521674.0, "step": 54 }, { "epoch": 0.7006369426751592, "grad_norm": 0.2400660216808319, "learning_rate": 0.00019759556113197135, "loss": 1.7576, "mean_token_accuracy": 0.6164006292819977, "num_tokens": 2570612.0, "step": 55 }, { "epoch": 0.7133757961783439, "grad_norm": 0.2474898248910904, "learning_rate": 0.00019746439456147172, "loss": 1.6913, "mean_token_accuracy": 0.62461718916893, "num_tokens": 2620095.0, "step": 56 }, { "epoch": 0.7261146496815286, "grad_norm": 0.2517346739768982, "learning_rate": 0.00019732979056689794, "loss": 1.7715, "mean_token_accuracy": 0.6078113615512848, "num_tokens": 2665785.0, "step": 57 }, { "epoch": 0.7388535031847133, "grad_norm": 0.2567152678966522, "learning_rate": 0.00019719175389553242, "loss": 1.7105, "mean_token_accuracy": 0.618989884853363, "num_tokens": 2712064.0, "step": 58 }, { "epoch": 0.7515923566878981, "grad_norm": 0.24779221415519714, "learning_rate": 0.00019705028941572307, "loss": 1.6769, "mean_token_accuracy": 0.6255393028259277, "num_tokens": 2760026.0, "step": 59 }, { "epoch": 0.7643312101910829, "grad_norm": 0.2563987076282501, "learning_rate": 0.00019690540211671144, "loss": 1.7543, "mean_token_accuracy": 0.6144331991672516, "num_tokens": 2806166.0, "step": 60 }, { "epoch": 0.7770700636942676, "grad_norm": 0.2323083132505417, "learning_rate": 0.00019675709710845687, "loss": 1.6956, "mean_token_accuracy": 0.6225294470787048, "num_tokens": 2855572.0, "step": 61 }, { "epoch": 0.7898089171974523, "grad_norm": 0.25542232394218445, "learning_rate": 0.0001966053796214561, "loss": 1.6927, "mean_token_accuracy": 0.6235709488391876, "num_tokens": 2900646.0, "step": 62 }, { "epoch": 0.802547770700637, "grad_norm": 0.24087095260620117, "learning_rate": 0.00019645025500655906, "loss": 1.6741, "mean_token_accuracy": 0.6269287467002869, "num_tokens": 2948656.0, "step": 63 }, { "epoch": 0.8152866242038217, "grad_norm": 0.24608315527439117, "learning_rate": 0.00019629172873477995, "loss": 1.7044, "mean_token_accuracy": 0.6225975453853607, "num_tokens": 2992709.0, "step": 64 }, { "epoch": 0.8280254777070064, "grad_norm": 0.23874063789844513, "learning_rate": 0.00019612980639710428, "loss": 1.6635, "mean_token_accuracy": 0.6289187669754028, "num_tokens": 3038992.0, "step": 65 }, { "epoch": 0.8407643312101911, "grad_norm": 0.24603189527988434, "learning_rate": 0.00019596449370429183, "loss": 1.7611, "mean_token_accuracy": 0.6126619875431061, "num_tokens": 3085558.0, "step": 66 }, { "epoch": 0.8535031847133758, "grad_norm": 0.24913907051086426, "learning_rate": 0.0001957957964866751, "loss": 1.7081, "mean_token_accuracy": 0.6217869222164154, "num_tokens": 3130170.0, "step": 67 }, { "epoch": 0.8662420382165605, "grad_norm": 0.23950885236263275, "learning_rate": 0.00019562372069395384, "loss": 1.6835, "mean_token_accuracy": 0.6236407458782196, "num_tokens": 3176311.0, "step": 68 }, { "epoch": 0.8789808917197452, "grad_norm": 0.2457829862833023, "learning_rate": 0.000195448272394985, "loss": 1.7195, "mean_token_accuracy": 0.6203426420688629, "num_tokens": 3222875.0, "step": 69 }, { "epoch": 0.89171974522293, "grad_norm": 0.25021523237228394, "learning_rate": 0.00019526945777756879, "loss": 1.7121, "mean_token_accuracy": 0.6217123568058014, "num_tokens": 3271109.0, "step": 70 }, { "epoch": 0.9044585987261147, "grad_norm": 0.24255377054214478, "learning_rate": 0.00019508728314823062, "loss": 1.6671, "mean_token_accuracy": 0.6281636953353882, "num_tokens": 3317571.0, "step": 71 }, { "epoch": 0.9171974522292994, "grad_norm": 0.2552671432495117, "learning_rate": 0.00019490175493199833, "loss": 1.6851, "mean_token_accuracy": 0.6248765289783478, "num_tokens": 3362493.0, "step": 72 }, { "epoch": 0.9299363057324841, "grad_norm": 0.24611078202724457, "learning_rate": 0.00019471287967217594, "loss": 1.6799, "mean_token_accuracy": 0.6217860579490662, "num_tokens": 3412450.0, "step": 73 }, { "epoch": 0.9426751592356688, "grad_norm": 0.24427291750907898, "learning_rate": 0.00019452066403011253, "loss": 1.6789, "mean_token_accuracy": 0.6255021095275879, "num_tokens": 3458150.0, "step": 74 }, { "epoch": 0.9554140127388535, "grad_norm": 0.241206556558609, "learning_rate": 0.00019432511478496768, "loss": 1.6791, "mean_token_accuracy": 0.6238900423049927, "num_tokens": 3503285.0, "step": 75 }, { "epoch": 0.9681528662420382, "grad_norm": 0.24642199277877808, "learning_rate": 0.00019412623883347207, "loss": 1.7196, "mean_token_accuracy": 0.6168418824672699, "num_tokens": 3550258.0, "step": 76 }, { "epoch": 0.9808917197452229, "grad_norm": 0.24044229090213776, "learning_rate": 0.0001939240431896844, "loss": 1.693, "mean_token_accuracy": 0.6247681081295013, "num_tokens": 3600054.0, "step": 77 }, { "epoch": 0.9936305732484076, "grad_norm": 0.24420927464962006, "learning_rate": 0.0001937185349847439, "loss": 1.7288, "mean_token_accuracy": 0.6197748780250549, "num_tokens": 3646563.0, "step": 78 }, { "epoch": 1.0, "grad_norm": 0.24420927464962006, "learning_rate": 0.00019350972146661905, "loss": 1.7554, "mean_token_accuracy": 0.613867998123169, "num_tokens": 3670636.0, "step": 79 }, { "epoch": 1.0127388535031847, "grad_norm": 0.40740540623664856, "learning_rate": 0.00019329760999985167, "loss": 1.5665, "mean_token_accuracy": 0.6492078900337219, "num_tokens": 3716041.0, "step": 80 }, { "epoch": 1.0254777070063694, "grad_norm": 0.27306127548217773, "learning_rate": 0.00019308220806529738, "loss": 1.5736, "mean_token_accuracy": 0.6449616551399231, "num_tokens": 3760896.0, "step": 81 }, { "epoch": 1.0382165605095541, "grad_norm": 0.23415158689022064, "learning_rate": 0.00019286352325986164, "loss": 1.5251, "mean_token_accuracy": 0.6536181569099426, "num_tokens": 3807785.0, "step": 82 }, { "epoch": 1.0509554140127388, "grad_norm": 0.2526198923587799, "learning_rate": 0.00019264156329623197, "loss": 1.5906, "mean_token_accuracy": 0.6404092907905579, "num_tokens": 3854182.0, "step": 83 }, { "epoch": 1.0636942675159236, "grad_norm": 0.25573909282684326, "learning_rate": 0.00019241633600260578, "loss": 1.5242, "mean_token_accuracy": 0.6552860736846924, "num_tokens": 3899185.0, "step": 84 }, { "epoch": 1.0764331210191083, "grad_norm": 0.26194682717323303, "learning_rate": 0.00019218784932241434, "loss": 1.6092, "mean_token_accuracy": 0.6397114098072052, "num_tokens": 3945474.0, "step": 85 }, { "epoch": 1.089171974522293, "grad_norm": 0.26084014773368835, "learning_rate": 0.0001919561113140427, "loss": 1.5654, "mean_token_accuracy": 0.6496731340885162, "num_tokens": 3993818.0, "step": 86 }, { "epoch": 1.1019108280254777, "grad_norm": 0.25661009550094604, "learning_rate": 0.00019172113015054532, "loss": 1.5956, "mean_token_accuracy": 0.6394364237785339, "num_tokens": 4043789.0, "step": 87 }, { "epoch": 1.1146496815286624, "grad_norm": 0.26299285888671875, "learning_rate": 0.00019148291411935796, "loss": 1.5534, "mean_token_accuracy": 0.648574948310852, "num_tokens": 4092145.0, "step": 88 }, { "epoch": 1.127388535031847, "grad_norm": 0.2560042440891266, "learning_rate": 0.00019124147162200535, "loss": 1.5341, "mean_token_accuracy": 0.6515755355358124, "num_tokens": 4136793.0, "step": 89 }, { "epoch": 1.1401273885350318, "grad_norm": 0.250197172164917, "learning_rate": 0.00019099681117380486, "loss": 1.5691, "mean_token_accuracy": 0.6437222361564636, "num_tokens": 4186081.0, "step": 90 }, { "epoch": 1.1528662420382165, "grad_norm": 0.2830899655818939, "learning_rate": 0.00019074894140356624, "loss": 1.5533, "mean_token_accuracy": 0.6474398970603943, "num_tokens": 4230818.0, "step": 91 }, { "epoch": 1.1656050955414012, "grad_norm": 0.2672581672668457, "learning_rate": 0.00019049787105328715, "loss": 1.5768, "mean_token_accuracy": 0.6421504616737366, "num_tokens": 4280136.0, "step": 92 }, { "epoch": 1.178343949044586, "grad_norm": 0.27740785479545593, "learning_rate": 0.00019024360897784508, "loss": 1.5441, "mean_token_accuracy": 0.6503708958625793, "num_tokens": 4325269.0, "step": 93 }, { "epoch": 1.1910828025477707, "grad_norm": 0.2790956497192383, "learning_rate": 0.00018998616414468478, "loss": 1.5136, "mean_token_accuracy": 0.6548562347888947, "num_tokens": 4371962.0, "step": 94 }, { "epoch": 1.2038216560509554, "grad_norm": 0.25887349247932434, "learning_rate": 0.0001897255456335022, "loss": 1.5639, "mean_token_accuracy": 0.6482616662979126, "num_tokens": 4420381.0, "step": 95 }, { "epoch": 1.21656050955414, "grad_norm": 0.2554098963737488, "learning_rate": 0.0001894617626359242, "loss": 1.5673, "mean_token_accuracy": 0.6444060206413269, "num_tokens": 4468056.0, "step": 96 }, { "epoch": 1.2292993630573248, "grad_norm": 0.27086755633354187, "learning_rate": 0.00018919482445518436, "loss": 1.554, "mean_token_accuracy": 0.6515795886516571, "num_tokens": 4511736.0, "step": 97 }, { "epoch": 1.2420382165605095, "grad_norm": 0.26914721727371216, "learning_rate": 0.0001889247405057948, "loss": 1.5007, "mean_token_accuracy": 0.6585707366466522, "num_tokens": 4556021.0, "step": 98 }, { "epoch": 1.2547770700636942, "grad_norm": 0.2745961844921112, "learning_rate": 0.00018865152031321427, "loss": 1.4936, "mean_token_accuracy": 0.6575806736946106, "num_tokens": 4601988.0, "step": 99 }, { "epoch": 1.267515923566879, "grad_norm": 0.26875782012939453, "learning_rate": 0.00018837517351351214, "loss": 1.515, "mean_token_accuracy": 0.6536067724227905, "num_tokens": 4649310.0, "step": 100 }, { "epoch": 1.2802547770700636, "grad_norm": 0.28102368116378784, "learning_rate": 0.00018809570985302862, "loss": 1.5216, "mean_token_accuracy": 0.6557919979095459, "num_tokens": 4696205.0, "step": 101 }, { "epoch": 1.2929936305732483, "grad_norm": 0.267914354801178, "learning_rate": 0.00018781313918803086, "loss": 1.571, "mean_token_accuracy": 0.6473680436611176, "num_tokens": 4745047.0, "step": 102 }, { "epoch": 1.305732484076433, "grad_norm": 0.2804099917411804, "learning_rate": 0.00018752747148436543, "loss": 1.6039, "mean_token_accuracy": 0.639825314283371, "num_tokens": 4791232.0, "step": 103 }, { "epoch": 1.3184713375796178, "grad_norm": 0.27488934993743896, "learning_rate": 0.00018723871681710697, "loss": 1.5494, "mean_token_accuracy": 0.6497779786586761, "num_tokens": 4837675.0, "step": 104 }, { "epoch": 1.3312101910828025, "grad_norm": 0.2697705328464508, "learning_rate": 0.0001869468853702026, "loss": 1.4995, "mean_token_accuracy": 0.656253308057785, "num_tokens": 4883626.0, "step": 105 }, { "epoch": 1.3439490445859872, "grad_norm": 0.26725390553474426, "learning_rate": 0.0001866519874361129, "loss": 1.5777, "mean_token_accuracy": 0.6452081203460693, "num_tokens": 4931577.0, "step": 106 }, { "epoch": 1.356687898089172, "grad_norm": 0.2720169425010681, "learning_rate": 0.000186354033415449, "loss": 1.5281, "mean_token_accuracy": 0.6508583128452301, "num_tokens": 4978688.0, "step": 107 }, { "epoch": 1.3694267515923566, "grad_norm": 0.2662588059902191, "learning_rate": 0.00018605303381660543, "loss": 1.53, "mean_token_accuracy": 0.6532346308231354, "num_tokens": 5024797.0, "step": 108 }, { "epoch": 1.3821656050955413, "grad_norm": 0.28359687328338623, "learning_rate": 0.00018574899925538998, "loss": 1.5452, "mean_token_accuracy": 0.6506541073322296, "num_tokens": 5070097.0, "step": 109 }, { "epoch": 1.394904458598726, "grad_norm": 0.2859072983264923, "learning_rate": 0.00018544194045464886, "loss": 1.6259, "mean_token_accuracy": 0.6363864541053772, "num_tokens": 5117390.0, "step": 110 }, { "epoch": 1.4076433121019107, "grad_norm": 0.2912904620170593, "learning_rate": 0.00018513186824388879, "loss": 1.5479, "mean_token_accuracy": 0.6520430743694305, "num_tokens": 5163069.0, "step": 111 }, { "epoch": 1.4203821656050954, "grad_norm": 0.263398140668869, "learning_rate": 0.00018481879355889495, "loss": 1.5585, "mean_token_accuracy": 0.6469611525535583, "num_tokens": 5207392.0, "step": 112 }, { "epoch": 1.4331210191082802, "grad_norm": 0.26866281032562256, "learning_rate": 0.00018450272744134532, "loss": 1.5415, "mean_token_accuracy": 0.6510675251483917, "num_tokens": 5256951.0, "step": 113 }, { "epoch": 1.4458598726114649, "grad_norm": 0.2799576222896576, "learning_rate": 0.00018418368103842125, "loss": 1.5396, "mean_token_accuracy": 0.6497272849082947, "num_tokens": 5304169.0, "step": 114 }, { "epoch": 1.4585987261146496, "grad_norm": 0.27718910574913025, "learning_rate": 0.00018386166560241434, "loss": 1.5567, "mean_token_accuracy": 0.6481947600841522, "num_tokens": 5351483.0, "step": 115 }, { "epoch": 1.4713375796178343, "grad_norm": 0.2619563639163971, "learning_rate": 0.0001835366924903295, "loss": 1.496, "mean_token_accuracy": 0.6585268080234528, "num_tokens": 5398507.0, "step": 116 }, { "epoch": 1.484076433121019, "grad_norm": 0.29501011967658997, "learning_rate": 0.00018320877316348454, "loss": 1.5351, "mean_token_accuracy": 0.6495955288410187, "num_tokens": 5445868.0, "step": 117 }, { "epoch": 1.4968152866242037, "grad_norm": 0.2873230576515198, "learning_rate": 0.00018287791918710587, "loss": 1.5845, "mean_token_accuracy": 0.643306702375412, "num_tokens": 5496468.0, "step": 118 }, { "epoch": 1.5095541401273884, "grad_norm": 0.2742498517036438, "learning_rate": 0.0001825441422299206, "loss": 1.53, "mean_token_accuracy": 0.6520735919475555, "num_tokens": 5543365.0, "step": 119 }, { "epoch": 1.5222929936305731, "grad_norm": 0.28084686398506165, "learning_rate": 0.00018220745406374498, "loss": 1.5315, "mean_token_accuracy": 0.6501257419586182, "num_tokens": 5590745.0, "step": 120 }, { "epoch": 1.5350318471337578, "grad_norm": 0.2685016691684723, "learning_rate": 0.00018186786656306935, "loss": 1.4894, "mean_token_accuracy": 0.6595437228679657, "num_tokens": 5635933.0, "step": 121 }, { "epoch": 1.5477707006369426, "grad_norm": 0.28692150115966797, "learning_rate": 0.00018152539170463925, "loss": 1.5553, "mean_token_accuracy": 0.6456755995750427, "num_tokens": 5685983.0, "step": 122 }, { "epoch": 1.5605095541401273, "grad_norm": 0.2563268542289734, "learning_rate": 0.00018118004156703296, "loss": 1.519, "mean_token_accuracy": 0.652580201625824, "num_tokens": 5734780.0, "step": 123 }, { "epoch": 1.573248407643312, "grad_norm": 0.28583434224128723, "learning_rate": 0.00018083182833023562, "loss": 1.5127, "mean_token_accuracy": 0.6557912826538086, "num_tokens": 5779041.0, "step": 124 }, { "epoch": 1.5859872611464967, "grad_norm": 0.2815837562084198, "learning_rate": 0.0001804807642752096, "loss": 1.5519, "mean_token_accuracy": 0.6499836444854736, "num_tokens": 5825179.0, "step": 125 }, { "epoch": 1.5987261146496814, "grad_norm": 0.27144506573677063, "learning_rate": 0.00018012686178346142, "loss": 1.5583, "mean_token_accuracy": 0.6471421718597412, "num_tokens": 5872958.0, "step": 126 }, { "epoch": 1.611464968152866, "grad_norm": 0.31989362835884094, "learning_rate": 0.000179770133336605, "loss": 1.5479, "mean_token_accuracy": 0.6509740650653839, "num_tokens": 5919853.0, "step": 127 }, { "epoch": 1.6242038216560508, "grad_norm": 0.28704020380973816, "learning_rate": 0.00017941059151592147, "loss": 1.5107, "mean_token_accuracy": 0.6552367806434631, "num_tokens": 5966036.0, "step": 128 }, { "epoch": 1.6369426751592355, "grad_norm": 0.27532413601875305, "learning_rate": 0.00017904824900191556, "loss": 1.5274, "mean_token_accuracy": 0.6521405279636383, "num_tokens": 6013929.0, "step": 129 }, { "epoch": 1.6496815286624202, "grad_norm": 0.2861412465572357, "learning_rate": 0.0001786831185738682, "loss": 1.5653, "mean_token_accuracy": 0.6448757648468018, "num_tokens": 6060218.0, "step": 130 }, { "epoch": 1.662420382165605, "grad_norm": 0.28631675243377686, "learning_rate": 0.0001783152131093859, "loss": 1.5357, "mean_token_accuracy": 0.6499184668064117, "num_tokens": 6105536.0, "step": 131 }, { "epoch": 1.6751592356687897, "grad_norm": 0.2932698726654053, "learning_rate": 0.00017794454558394657, "loss": 1.5251, "mean_token_accuracy": 0.6529253423213959, "num_tokens": 6153129.0, "step": 132 }, { "epoch": 1.6878980891719744, "grad_norm": 0.2933589518070221, "learning_rate": 0.000177571129070442, "loss": 1.5223, "mean_token_accuracy": 0.6531689465045929, "num_tokens": 6199056.0, "step": 133 }, { "epoch": 1.700636942675159, "grad_norm": 0.2958078682422638, "learning_rate": 0.00017719497673871653, "loss": 1.5571, "mean_token_accuracy": 0.6457672417163849, "num_tokens": 6244782.0, "step": 134 }, { "epoch": 1.7133757961783438, "grad_norm": 0.30723750591278076, "learning_rate": 0.00017681610185510285, "loss": 1.5099, "mean_token_accuracy": 0.6570196449756622, "num_tokens": 6287317.0, "step": 135 }, { "epoch": 1.7261146496815285, "grad_norm": 0.28479403257369995, "learning_rate": 0.00017643451778195395, "loss": 1.5438, "mean_token_accuracy": 0.6486569344997406, "num_tokens": 6335678.0, "step": 136 }, { "epoch": 1.7388535031847132, "grad_norm": 0.2733410596847534, "learning_rate": 0.00017605023797717195, "loss": 1.5444, "mean_token_accuracy": 0.6485359966754913, "num_tokens": 6382512.0, "step": 137 }, { "epoch": 1.7515923566878981, "grad_norm": 0.2998912036418915, "learning_rate": 0.00017566327599373338, "loss": 1.4791, "mean_token_accuracy": 0.6596002280712128, "num_tokens": 6427147.0, "step": 138 }, { "epoch": 1.7643312101910829, "grad_norm": 0.28666678071022034, "learning_rate": 0.0001752736454792112, "loss": 1.599, "mean_token_accuracy": 0.6427422761917114, "num_tokens": 6474652.0, "step": 139 }, { "epoch": 1.7770700636942676, "grad_norm": 0.280900776386261, "learning_rate": 0.0001748813601752935, "loss": 1.541, "mean_token_accuracy": 0.6483757197856903, "num_tokens": 6523870.0, "step": 140 }, { "epoch": 1.7898089171974523, "grad_norm": 0.26936545968055725, "learning_rate": 0.00017448643391729888, "loss": 1.5666, "mean_token_accuracy": 0.6445654630661011, "num_tokens": 6570400.0, "step": 141 }, { "epoch": 1.802547770700637, "grad_norm": 0.30444443225860596, "learning_rate": 0.0001740888806336884, "loss": 1.5731, "mean_token_accuracy": 0.6429518759250641, "num_tokens": 6616340.0, "step": 142 }, { "epoch": 1.8152866242038217, "grad_norm": 0.278298944234848, "learning_rate": 0.00017368871434557447, "loss": 1.5337, "mean_token_accuracy": 0.6487603783607483, "num_tokens": 6663529.0, "step": 143 }, { "epoch": 1.8280254777070064, "grad_norm": 0.2908456027507782, "learning_rate": 0.00017328594916622616, "loss": 1.5363, "mean_token_accuracy": 0.650389701128006, "num_tokens": 6708731.0, "step": 144 }, { "epoch": 1.8407643312101911, "grad_norm": 0.2893330454826355, "learning_rate": 0.00017288059930057166, "loss": 1.5415, "mean_token_accuracy": 0.6505038142204285, "num_tokens": 6757212.0, "step": 145 }, { "epoch": 1.8535031847133758, "grad_norm": 0.30690449476242065, "learning_rate": 0.00017247267904469725, "loss": 1.5387, "mean_token_accuracy": 0.6517972648143768, "num_tokens": 6799983.0, "step": 146 }, { "epoch": 1.8662420382165605, "grad_norm": 0.2818317115306854, "learning_rate": 0.00017206220278534286, "loss": 1.5747, "mean_token_accuracy": 0.6467372477054596, "num_tokens": 6848592.0, "step": 147 }, { "epoch": 1.8789808917197452, "grad_norm": 0.2880898118019104, "learning_rate": 0.00017164918499939504, "loss": 1.6025, "mean_token_accuracy": 0.6399553418159485, "num_tokens": 6897858.0, "step": 148 }, { "epoch": 1.89171974522293, "grad_norm": 0.26849091053009033, "learning_rate": 0.0001712336402533761, "loss": 1.5618, "mean_token_accuracy": 0.6450689435005188, "num_tokens": 6945803.0, "step": 149 }, { "epoch": 1.9044585987261147, "grad_norm": 0.28507912158966064, "learning_rate": 0.00017081558320293055, "loss": 1.5794, "mean_token_accuracy": 0.6418361663818359, "num_tokens": 6992743.0, "step": 150 }, { "epoch": 1.9171974522292994, "grad_norm": 0.29636260867118835, "learning_rate": 0.000170395028592308, "loss": 1.5468, "mean_token_accuracy": 0.6484410464763641, "num_tokens": 7039309.0, "step": 151 }, { "epoch": 1.929936305732484, "grad_norm": 0.2758314609527588, "learning_rate": 0.00016997199125384343, "loss": 1.546, "mean_token_accuracy": 0.6494967639446259, "num_tokens": 7084598.0, "step": 152 }, { "epoch": 1.9426751592356688, "grad_norm": 0.2995888590812683, "learning_rate": 0.00016954648610743384, "loss": 1.5199, "mean_token_accuracy": 0.6539457738399506, "num_tokens": 7132905.0, "step": 153 }, { "epoch": 1.9554140127388535, "grad_norm": 0.2744024693965912, "learning_rate": 0.0001691185281600122, "loss": 1.5506, "mean_token_accuracy": 0.6450865864753723, "num_tokens": 7179607.0, "step": 154 }, { "epoch": 1.9681528662420382, "grad_norm": 0.2939317226409912, "learning_rate": 0.0001686881325050181, "loss": 1.5632, "mean_token_accuracy": 0.645559161901474, "num_tokens": 7227433.0, "step": 155 }, { "epoch": 1.980891719745223, "grad_norm": 0.294448584318161, "learning_rate": 0.00016825531432186543, "loss": 1.5284, "mean_token_accuracy": 0.6512192487716675, "num_tokens": 7272804.0, "step": 156 }, { "epoch": 1.9936305732484076, "grad_norm": 0.2998405992984772, "learning_rate": 0.00016782008887540704, "loss": 1.4948, "mean_token_accuracy": 0.65907222032547, "num_tokens": 7318264.0, "step": 157 }, { "epoch": 2.0, "grad_norm": 0.4484761655330658, "learning_rate": 0.00016738247151539643, "loss": 1.4407, "mean_token_accuracy": 0.6714723706245422, "num_tokens": 7341116.0, "step": 158 }, { "epoch": 2.0127388535031847, "grad_norm": 0.3343365788459778, "learning_rate": 0.00016694247767594624, "loss": 1.3322, "mean_token_accuracy": 0.6910092234611511, "num_tokens": 7385765.0, "step": 159 }, { "epoch": 2.0254777070063694, "grad_norm": 0.3265499472618103, "learning_rate": 0.00016650012287498412, "loss": 1.3301, "mean_token_accuracy": 0.6870517134666443, "num_tokens": 7431409.0, "step": 160 }, { "epoch": 2.038216560509554, "grad_norm": 0.2959946393966675, "learning_rate": 0.00016605542271370513, "loss": 1.3674, "mean_token_accuracy": 0.6844088733196259, "num_tokens": 7480191.0, "step": 161 }, { "epoch": 2.050955414012739, "grad_norm": 0.3199387192726135, "learning_rate": 0.00016560839287602192, "loss": 1.2926, "mean_token_accuracy": 0.6962210536003113, "num_tokens": 7528150.0, "step": 162 }, { "epoch": 2.0636942675159236, "grad_norm": 0.36283308267593384, "learning_rate": 0.00016515904912801118, "loss": 1.2666, "mean_token_accuracy": 0.6986918449401855, "num_tokens": 7571869.0, "step": 163 }, { "epoch": 2.0764331210191083, "grad_norm": 0.34669721126556396, "learning_rate": 0.00016470740731735787, "loss": 1.3234, "mean_token_accuracy": 0.6908857524394989, "num_tokens": 7618015.0, "step": 164 }, { "epoch": 2.089171974522293, "grad_norm": 0.34525468945503235, "learning_rate": 0.0001642534833727962, "loss": 1.2866, "mean_token_accuracy": 0.6964756846427917, "num_tokens": 7662549.0, "step": 165 }, { "epoch": 2.1019108280254777, "grad_norm": 0.3327886760234833, "learning_rate": 0.00016379729330354774, "loss": 1.3065, "mean_token_accuracy": 0.6932984590530396, "num_tokens": 7709697.0, "step": 166 }, { "epoch": 2.1146496815286624, "grad_norm": 0.30664750933647156, "learning_rate": 0.00016333885319875702, "loss": 1.2929, "mean_token_accuracy": 0.6956894993782043, "num_tokens": 7758083.0, "step": 167 }, { "epoch": 2.127388535031847, "grad_norm": 0.3107092082500458, "learning_rate": 0.00016287817922692395, "loss": 1.3376, "mean_token_accuracy": 0.6897503137588501, "num_tokens": 7805938.0, "step": 168 }, { "epoch": 2.140127388535032, "grad_norm": 0.31660640239715576, "learning_rate": 0.00016241528763533353, "loss": 1.2791, "mean_token_accuracy": 0.6975639164447784, "num_tokens": 7850498.0, "step": 169 }, { "epoch": 2.1528662420382165, "grad_norm": 0.32096031308174133, "learning_rate": 0.00016195019474948299, "loss": 1.2405, "mean_token_accuracy": 0.7077115774154663, "num_tokens": 7893227.0, "step": 170 }, { "epoch": 2.1656050955414012, "grad_norm": 0.34041303396224976, "learning_rate": 0.00016148291697250594, "loss": 1.331, "mean_token_accuracy": 0.6875595152378082, "num_tokens": 7939866.0, "step": 171 }, { "epoch": 2.178343949044586, "grad_norm": 0.3158988952636719, "learning_rate": 0.00016101347078459373, "loss": 1.3103, "mean_token_accuracy": 0.6904300153255463, "num_tokens": 7989324.0, "step": 172 }, { "epoch": 2.1910828025477707, "grad_norm": 0.31509461998939514, "learning_rate": 0.0001605418727424145, "loss": 1.3244, "mean_token_accuracy": 0.6885357201099396, "num_tokens": 8037303.0, "step": 173 }, { "epoch": 2.2038216560509554, "grad_norm": 0.32755744457244873, "learning_rate": 0.00016006813947852893, "loss": 1.2938, "mean_token_accuracy": 0.6945713758468628, "num_tokens": 8083490.0, "step": 174 }, { "epoch": 2.21656050955414, "grad_norm": 0.326424241065979, "learning_rate": 0.0001595922877008039, "loss": 1.2883, "mean_token_accuracy": 0.6961071789264679, "num_tokens": 8130322.0, "step": 175 }, { "epoch": 2.229299363057325, "grad_norm": 0.33139878511428833, "learning_rate": 0.00015911433419182305, "loss": 1.3053, "mean_token_accuracy": 0.6951516270637512, "num_tokens": 8178618.0, "step": 176 }, { "epoch": 2.2420382165605095, "grad_norm": 0.33605796098709106, "learning_rate": 0.000158634295808295, "loss": 1.3198, "mean_token_accuracy": 0.6912129521369934, "num_tokens": 8227676.0, "step": 177 }, { "epoch": 2.254777070063694, "grad_norm": 0.3550015091896057, "learning_rate": 0.00015815218948045878, "loss": 1.2881, "mean_token_accuracy": 0.6993768513202667, "num_tokens": 8271080.0, "step": 178 }, { "epoch": 2.267515923566879, "grad_norm": 0.34364157915115356, "learning_rate": 0.00015766803221148673, "loss": 1.337, "mean_token_accuracy": 0.6868195235729218, "num_tokens": 8319718.0, "step": 179 }, { "epoch": 2.2802547770700636, "grad_norm": 0.34193143248558044, "learning_rate": 0.0001571818410768848, "loss": 1.3162, "mean_token_accuracy": 0.6915777623653412, "num_tokens": 8365783.0, "step": 180 }, { "epoch": 2.2929936305732483, "grad_norm": 0.32836443185806274, "learning_rate": 0.0001566936332238904, "loss": 1.3102, "mean_token_accuracy": 0.6936459541320801, "num_tokens": 8414953.0, "step": 181 }, { "epoch": 2.305732484076433, "grad_norm": 0.3303191065788269, "learning_rate": 0.0001562034258708676, "loss": 1.302, "mean_token_accuracy": 0.6961067020893097, "num_tokens": 8461084.0, "step": 182 }, { "epoch": 2.3184713375796178, "grad_norm": 0.3395134508609772, "learning_rate": 0.0001557112363066998, "loss": 1.2847, "mean_token_accuracy": 0.6985503137111664, "num_tokens": 8503630.0, "step": 183 }, { "epoch": 2.3312101910828025, "grad_norm": 0.34719496965408325, "learning_rate": 0.00015521708189018005, "loss": 1.3131, "mean_token_accuracy": 0.6886778473854065, "num_tokens": 8549241.0, "step": 184 }, { "epoch": 2.343949044585987, "grad_norm": 0.342877060174942, "learning_rate": 0.00015472098004939888, "loss": 1.3407, "mean_token_accuracy": 0.6869197189807892, "num_tokens": 8596933.0, "step": 185 }, { "epoch": 2.356687898089172, "grad_norm": 0.32749322056770325, "learning_rate": 0.00015422294828112954, "loss": 1.286, "mean_token_accuracy": 0.6954855024814606, "num_tokens": 8645281.0, "step": 186 }, { "epoch": 2.3694267515923566, "grad_norm": 0.35311228036880493, "learning_rate": 0.00015372300415021091, "loss": 1.2954, "mean_token_accuracy": 0.6963195204734802, "num_tokens": 8691586.0, "step": 187 }, { "epoch": 2.3821656050955413, "grad_norm": 0.3434406518936157, "learning_rate": 0.00015322116528892807, "loss": 1.2902, "mean_token_accuracy": 0.6954045593738556, "num_tokens": 8738642.0, "step": 188 }, { "epoch": 2.394904458598726, "grad_norm": 0.34454143047332764, "learning_rate": 0.0001527174493963905, "loss": 1.329, "mean_token_accuracy": 0.6872740387916565, "num_tokens": 8785494.0, "step": 189 }, { "epoch": 2.4076433121019107, "grad_norm": 0.3454861640930176, "learning_rate": 0.0001522118742379076, "loss": 1.3279, "mean_token_accuracy": 0.687510758638382, "num_tokens": 8833002.0, "step": 190 }, { "epoch": 2.4203821656050954, "grad_norm": 0.342602401971817, "learning_rate": 0.00015170445764436252, "loss": 1.3414, "mean_token_accuracy": 0.6878556907176971, "num_tokens": 8881670.0, "step": 191 }, { "epoch": 2.43312101910828, "grad_norm": 0.3364247977733612, "learning_rate": 0.00015119521751158296, "loss": 1.2873, "mean_token_accuracy": 0.6955643892288208, "num_tokens": 8928589.0, "step": 192 }, { "epoch": 2.445859872611465, "grad_norm": 0.3498151898384094, "learning_rate": 0.00015068417179971014, "loss": 1.3165, "mean_token_accuracy": 0.6920604407787323, "num_tokens": 8972786.0, "step": 193 }, { "epoch": 2.4585987261146496, "grad_norm": 0.3346851170063019, "learning_rate": 0.00015017133853256537, "loss": 1.3256, "mean_token_accuracy": 0.692162960767746, "num_tokens": 9023468.0, "step": 194 }, { "epoch": 2.4713375796178343, "grad_norm": 0.35006558895111084, "learning_rate": 0.00014965673579701445, "loss": 1.2724, "mean_token_accuracy": 0.7002449333667755, "num_tokens": 9068145.0, "step": 195 }, { "epoch": 2.484076433121019, "grad_norm": 0.34246891736984253, "learning_rate": 0.00014914038174232956, "loss": 1.3404, "mean_token_accuracy": 0.6872991621494293, "num_tokens": 9118948.0, "step": 196 }, { "epoch": 2.4968152866242037, "grad_norm": 0.3341098129749298, "learning_rate": 0.0001486222945795494, "loss": 1.3156, "mean_token_accuracy": 0.6871801018714905, "num_tokens": 9166164.0, "step": 197 }, { "epoch": 2.5095541401273884, "grad_norm": 0.34007757902145386, "learning_rate": 0.00014810249258083677, "loss": 1.3102, "mean_token_accuracy": 0.6924366652965546, "num_tokens": 9214691.0, "step": 198 }, { "epoch": 2.522292993630573, "grad_norm": 0.3317483365535736, "learning_rate": 0.00014758099407883422, "loss": 1.3083, "mean_token_accuracy": 0.6904500126838684, "num_tokens": 9264180.0, "step": 199 }, { "epoch": 2.535031847133758, "grad_norm": 0.3468264043331146, "learning_rate": 0.0001470578174660174, "loss": 1.3293, "mean_token_accuracy": 0.6916395723819733, "num_tokens": 9311651.0, "step": 200 }, { "epoch": 2.5477707006369426, "grad_norm": 0.3456972539424896, "learning_rate": 0.00014653298119404645, "loss": 1.3268, "mean_token_accuracy": 0.6869567632675171, "num_tokens": 9360999.0, "step": 201 }, { "epoch": 2.5605095541401273, "grad_norm": 0.35997506976127625, "learning_rate": 0.00014600650377311522, "loss": 1.3105, "mean_token_accuracy": 0.6917800903320312, "num_tokens": 9405644.0, "step": 202 }, { "epoch": 2.573248407643312, "grad_norm": 0.3483164310455322, "learning_rate": 0.00014547840377129842, "loss": 1.3148, "mean_token_accuracy": 0.6925802230834961, "num_tokens": 9451607.0, "step": 203 }, { "epoch": 2.5859872611464967, "grad_norm": 0.3380853235721588, "learning_rate": 0.0001449486998138968, "loss": 1.304, "mean_token_accuracy": 0.6935497522354126, "num_tokens": 9498424.0, "step": 204 }, { "epoch": 2.5987261146496814, "grad_norm": 0.36971330642700195, "learning_rate": 0.00014441741058278024, "loss": 1.2874, "mean_token_accuracy": 0.6996894776821136, "num_tokens": 9540724.0, "step": 205 }, { "epoch": 2.611464968152866, "grad_norm": 0.3429723381996155, "learning_rate": 0.0001438845548157288, "loss": 1.309, "mean_token_accuracy": 0.692668229341507, "num_tokens": 9588689.0, "step": 206 }, { "epoch": 2.624203821656051, "grad_norm": 0.3566606342792511, "learning_rate": 0.000143350151305772, "loss": 1.3495, "mean_token_accuracy": 0.684135228395462, "num_tokens": 9636532.0, "step": 207 }, { "epoch": 2.6369426751592355, "grad_norm": 0.3401079773902893, "learning_rate": 0.0001428142189005259, "loss": 1.3193, "mean_token_accuracy": 0.6945083439350128, "num_tokens": 9685613.0, "step": 208 }, { "epoch": 2.6496815286624202, "grad_norm": 0.3454475998878479, "learning_rate": 0.0001422767765015285, "loss": 1.3007, "mean_token_accuracy": 0.6913789212703705, "num_tokens": 9733242.0, "step": 209 }, { "epoch": 2.662420382165605, "grad_norm": 0.36231961846351624, "learning_rate": 0.0001417378430635729, "loss": 1.253, "mean_token_accuracy": 0.7031304240226746, "num_tokens": 9776947.0, "step": 210 }, { "epoch": 2.6751592356687897, "grad_norm": 0.3470020890235901, "learning_rate": 0.00014119743759403907, "loss": 1.341, "mean_token_accuracy": 0.6853951811790466, "num_tokens": 9824542.0, "step": 211 }, { "epoch": 2.6878980891719744, "grad_norm": 0.35202592611312866, "learning_rate": 0.00014065557915222322, "loss": 1.3058, "mean_token_accuracy": 0.691655308008194, "num_tokens": 9871224.0, "step": 212 }, { "epoch": 2.700636942675159, "grad_norm": 0.3493707478046417, "learning_rate": 0.00014011228684866582, "loss": 1.3376, "mean_token_accuracy": 0.6874703168869019, "num_tokens": 9920118.0, "step": 213 }, { "epoch": 2.713375796178344, "grad_norm": 0.35377079248428345, "learning_rate": 0.00013956757984447745, "loss": 1.2805, "mean_token_accuracy": 0.6971912980079651, "num_tokens": 9963918.0, "step": 214 }, { "epoch": 2.7261146496815285, "grad_norm": 0.3466252386569977, "learning_rate": 0.00013902147735066306, "loss": 1.2664, "mean_token_accuracy": 0.6998610198497772, "num_tokens": 10010058.0, "step": 215 }, { "epoch": 2.738853503184713, "grad_norm": 0.3474418520927429, "learning_rate": 0.0001384739986274445, "loss": 1.2961, "mean_token_accuracy": 0.6941092908382416, "num_tokens": 10058468.0, "step": 216 }, { "epoch": 2.7515923566878984, "grad_norm": 0.36090087890625, "learning_rate": 0.00013792516298358114, "loss": 1.3642, "mean_token_accuracy": 0.6834468245506287, "num_tokens": 10106765.0, "step": 217 }, { "epoch": 2.7643312101910826, "grad_norm": 0.3633421063423157, "learning_rate": 0.000137374989775689, "loss": 1.3233, "mean_token_accuracy": 0.6901079416275024, "num_tokens": 10152807.0, "step": 218 }, { "epoch": 2.777070063694268, "grad_norm": 0.34589487314224243, "learning_rate": 0.00013682349840755785, "loss": 1.2613, "mean_token_accuracy": 0.7022227048873901, "num_tokens": 10198115.0, "step": 219 }, { "epoch": 2.789808917197452, "grad_norm": 0.34732723236083984, "learning_rate": 0.00013627070832946718, "loss": 1.3236, "mean_token_accuracy": 0.6895630061626434, "num_tokens": 10244677.0, "step": 220 }, { "epoch": 2.802547770700637, "grad_norm": 0.35598820447921753, "learning_rate": 0.00013571663903749984, "loss": 1.2993, "mean_token_accuracy": 0.6935286521911621, "num_tokens": 10289391.0, "step": 221 }, { "epoch": 2.8152866242038215, "grad_norm": 0.3413410186767578, "learning_rate": 0.00013516131007285483, "loss": 1.3134, "mean_token_accuracy": 0.6913627684116364, "num_tokens": 10336052.0, "step": 222 }, { "epoch": 2.8280254777070066, "grad_norm": 0.3477303981781006, "learning_rate": 0.00013460474102115785, "loss": 1.2962, "mean_token_accuracy": 0.6957099437713623, "num_tokens": 10381705.0, "step": 223 }, { "epoch": 2.840764331210191, "grad_norm": 0.3488887548446655, "learning_rate": 0.0001340469515117706, "loss": 1.3512, "mean_token_accuracy": 0.6867388784885406, "num_tokens": 10430510.0, "step": 224 }, { "epoch": 2.853503184713376, "grad_norm": 0.38249075412750244, "learning_rate": 0.00013348796121709862, "loss": 1.3002, "mean_token_accuracy": 0.693688690662384, "num_tokens": 10475799.0, "step": 225 }, { "epoch": 2.8662420382165603, "grad_norm": 0.3548857867717743, "learning_rate": 0.00013292778985189724, "loss": 1.3455, "mean_token_accuracy": 0.683870941400528, "num_tokens": 10523519.0, "step": 226 }, { "epoch": 2.8789808917197455, "grad_norm": 0.3587774336338043, "learning_rate": 0.0001323664571725764, "loss": 1.3114, "mean_token_accuracy": 0.6917595863342285, "num_tokens": 10569542.0, "step": 227 }, { "epoch": 2.8917197452229297, "grad_norm": 0.356501042842865, "learning_rate": 0.00013180398297650393, "loss": 1.2964, "mean_token_accuracy": 0.6952946484088898, "num_tokens": 10614027.0, "step": 228 }, { "epoch": 2.904458598726115, "grad_norm": 0.35891181230545044, "learning_rate": 0.00013124038710130722, "loss": 1.3163, "mean_token_accuracy": 0.6918761730194092, "num_tokens": 10658379.0, "step": 229 }, { "epoch": 2.917197452229299, "grad_norm": 0.3601120412349701, "learning_rate": 0.00013067568942417356, "loss": 1.3088, "mean_token_accuracy": 0.6909421980381012, "num_tokens": 10704697.0, "step": 230 }, { "epoch": 2.9299363057324843, "grad_norm": 0.3705814778804779, "learning_rate": 0.00013010990986114926, "loss": 1.3429, "mean_token_accuracy": 0.686343640089035, "num_tokens": 10749941.0, "step": 231 }, { "epoch": 2.9426751592356686, "grad_norm": 0.3506789207458496, "learning_rate": 0.00012954306836643703, "loss": 1.3814, "mean_token_accuracy": 0.681389331817627, "num_tokens": 10799643.0, "step": 232 }, { "epoch": 2.9554140127388537, "grad_norm": 0.35677486658096313, "learning_rate": 0.0001289751849316924, "loss": 1.3094, "mean_token_accuracy": 0.6908452808856964, "num_tokens": 10846595.0, "step": 233 }, { "epoch": 2.968152866242038, "grad_norm": 0.35693496465682983, "learning_rate": 0.0001284062795853185, "loss": 1.3572, "mean_token_accuracy": 0.6837401986122131, "num_tokens": 10892579.0, "step": 234 }, { "epoch": 2.980891719745223, "grad_norm": 0.3480221927165985, "learning_rate": 0.00012783637239175994, "loss": 1.3716, "mean_token_accuracy": 0.6815778911113739, "num_tokens": 10941192.0, "step": 235 }, { "epoch": 2.9936305732484074, "grad_norm": 0.35607731342315674, "learning_rate": 0.00012726548345079475, "loss": 1.2997, "mean_token_accuracy": 0.6946380734443665, "num_tokens": 10988163.0, "step": 236 }, { "epoch": 3.0, "grad_norm": 0.35607731342315674, "learning_rate": 0.00012669363289682584, "loss": 1.1714, "mean_token_accuracy": 0.7204415202140808, "num_tokens": 11011750.0, "step": 237 }, { "epoch": 3.0127388535031847, "grad_norm": 0.575162947177887, "learning_rate": 0.0001261208408981708, "loss": 1.0975, "mean_token_accuracy": 0.7386822700500488, "num_tokens": 11059787.0, "step": 238 }, { "epoch": 3.0254777070063694, "grad_norm": 0.4076228737831116, "learning_rate": 0.00012554712765635057, "loss": 1.0699, "mean_token_accuracy": 0.7432563006877899, "num_tokens": 11104750.0, "step": 239 }, { "epoch": 3.038216560509554, "grad_norm": 0.3734162747859955, "learning_rate": 0.0001249725134053769, "loss": 1.0605, "mean_token_accuracy": 0.7436703443527222, "num_tokens": 11150757.0, "step": 240 }, { "epoch": 3.050955414012739, "grad_norm": 0.40389564633369446, "learning_rate": 0.00012439701841103888, "loss": 1.0362, "mean_token_accuracy": 0.7471202611923218, "num_tokens": 11200823.0, "step": 241 }, { "epoch": 3.0636942675159236, "grad_norm": 0.5040764212608337, "learning_rate": 0.00012382066297018804, "loss": 1.0947, "mean_token_accuracy": 0.7376525700092316, "num_tokens": 11247910.0, "step": 242 }, { "epoch": 3.0764331210191083, "grad_norm": 0.5463912487030029, "learning_rate": 0.0001232434674100226, "loss": 1.0766, "mean_token_accuracy": 0.739810049533844, "num_tokens": 11294764.0, "step": 243 }, { "epoch": 3.089171974522293, "grad_norm": 0.47988808155059814, "learning_rate": 0.00012266545208737054, "loss": 1.0322, "mean_token_accuracy": 0.7498438358306885, "num_tokens": 11341044.0, "step": 244 }, { "epoch": 3.1019108280254777, "grad_norm": 0.4334051311016083, "learning_rate": 0.00012208663738797165, "loss": 1.0363, "mean_token_accuracy": 0.7506378591060638, "num_tokens": 11387746.0, "step": 245 }, { "epoch": 3.1146496815286624, "grad_norm": 0.39998453855514526, "learning_rate": 0.00012150704372575854, "loss": 1.06, "mean_token_accuracy": 0.7452342510223389, "num_tokens": 11436154.0, "step": 246 }, { "epoch": 3.127388535031847, "grad_norm": 0.3928165137767792, "learning_rate": 0.00012092669154213665, "loss": 0.9898, "mean_token_accuracy": 0.7584972083568573, "num_tokens": 11481728.0, "step": 247 }, { "epoch": 3.140127388535032, "grad_norm": 0.40028896927833557, "learning_rate": 0.0001203456013052634, "loss": 1.0131, "mean_token_accuracy": 0.7529804110527039, "num_tokens": 11527633.0, "step": 248 }, { "epoch": 3.1528662420382165, "grad_norm": 0.410742849111557, "learning_rate": 0.00011976379350932618, "loss": 1.0296, "mean_token_accuracy": 0.7526900470256805, "num_tokens": 11571058.0, "step": 249 }, { "epoch": 3.1656050955414012, "grad_norm": 0.46235859394073486, "learning_rate": 0.00011918128867381965, "loss": 1.0359, "mean_token_accuracy": 0.7495845854282379, "num_tokens": 11616706.0, "step": 250 }, { "epoch": 3.178343949044586, "grad_norm": 0.4445168673992157, "learning_rate": 0.00011859810734282208, "loss": 1.0576, "mean_token_accuracy": 0.7440116107463837, "num_tokens": 11663486.0, "step": 251 }, { "epoch": 3.1910828025477707, "grad_norm": 0.4728211462497711, "learning_rate": 0.00011801427008427063, "loss": 1.0368, "mean_token_accuracy": 0.7495954632759094, "num_tokens": 11708088.0, "step": 252 }, { "epoch": 3.2038216560509554, "grad_norm": 0.4592626690864563, "learning_rate": 0.00011742979748923611, "loss": 1.0344, "mean_token_accuracy": 0.7493532598018646, "num_tokens": 11753940.0, "step": 253 }, { "epoch": 3.21656050955414, "grad_norm": 0.46383729577064514, "learning_rate": 0.00011684471017119667, "loss": 1.0031, "mean_token_accuracy": 0.7553220391273499, "num_tokens": 11800640.0, "step": 254 }, { "epoch": 3.229299363057325, "grad_norm": 0.44475027918815613, "learning_rate": 0.00011625902876531082, "loss": 1.0085, "mean_token_accuracy": 0.7538060247898102, "num_tokens": 11847227.0, "step": 255 }, { "epoch": 3.2420382165605095, "grad_norm": 0.4252687990665436, "learning_rate": 0.00011567277392768972, "loss": 1.1065, "mean_token_accuracy": 0.7358538806438446, "num_tokens": 11897270.0, "step": 256 }, { "epoch": 3.254777070063694, "grad_norm": 0.4112376272678375, "learning_rate": 0.00011508596633466852, "loss": 1.0294, "mean_token_accuracy": 0.7512390911579132, "num_tokens": 11943975.0, "step": 257 }, { "epoch": 3.267515923566879, "grad_norm": 0.42077869176864624, "learning_rate": 0.00011449862668207734, "loss": 1.0362, "mean_token_accuracy": 0.7497402131557465, "num_tokens": 11990344.0, "step": 258 }, { "epoch": 3.2802547770700636, "grad_norm": 0.4334986209869385, "learning_rate": 0.00011391077568451116, "loss": 1.0238, "mean_token_accuracy": 0.7498055994510651, "num_tokens": 12036618.0, "step": 259 }, { "epoch": 3.2929936305732483, "grad_norm": 0.42075401544570923, "learning_rate": 0.0001133224340745994, "loss": 1.0022, "mean_token_accuracy": 0.754104495048523, "num_tokens": 12081719.0, "step": 260 }, { "epoch": 3.305732484076433, "grad_norm": 0.4563131034374237, "learning_rate": 0.00011273362260227458, "loss": 1.0512, "mean_token_accuracy": 0.7474367916584015, "num_tokens": 12128789.0, "step": 261 }, { "epoch": 3.3184713375796178, "grad_norm": 0.4512925446033478, "learning_rate": 0.00011214436203404062, "loss": 1.0496, "mean_token_accuracy": 0.7442962825298309, "num_tokens": 12177227.0, "step": 262 }, { "epoch": 3.3312101910828025, "grad_norm": 0.4189808964729309, "learning_rate": 0.00011155467315224038, "loss": 1.0589, "mean_token_accuracy": 0.7440447509288788, "num_tokens": 12226380.0, "step": 263 }, { "epoch": 3.343949044585987, "grad_norm": 0.42184701561927795, "learning_rate": 0.00011096457675432266, "loss": 1.0399, "mean_token_accuracy": 0.7482756078243256, "num_tokens": 12275760.0, "step": 264 }, { "epoch": 3.356687898089172, "grad_norm": 0.4403589963912964, "learning_rate": 0.0001103740936521088, "loss": 1.0571, "mean_token_accuracy": 0.7462457716464996, "num_tokens": 12324908.0, "step": 265 }, { "epoch": 3.3694267515923566, "grad_norm": 0.4608840346336365, "learning_rate": 0.00010978324467105858, "loss": 1.0259, "mean_token_accuracy": 0.7492176592350006, "num_tokens": 12369407.0, "step": 266 }, { "epoch": 3.3821656050955413, "grad_norm": 0.443196177482605, "learning_rate": 0.00010919205064953582, "loss": 1.0489, "mean_token_accuracy": 0.7451373040676117, "num_tokens": 12416757.0, "step": 267 }, { "epoch": 3.394904458598726, "grad_norm": 0.41043445467948914, "learning_rate": 0.00010860053243807338, "loss": 1.0468, "mean_token_accuracy": 0.7448963224887848, "num_tokens": 12467082.0, "step": 268 }, { "epoch": 3.4076433121019107, "grad_norm": 0.439742773771286, "learning_rate": 0.00010800871089863785, "loss": 1.0377, "mean_token_accuracy": 0.7474401891231537, "num_tokens": 12512084.0, "step": 269 }, { "epoch": 3.4203821656050954, "grad_norm": 0.4662080407142639, "learning_rate": 0.00010741660690389365, "loss": 1.0456, "mean_token_accuracy": 0.7488239109516144, "num_tokens": 12557743.0, "step": 270 }, { "epoch": 3.43312101910828, "grad_norm": 0.45201772451400757, "learning_rate": 0.0001068242413364671, "loss": 1.0273, "mean_token_accuracy": 0.7499560117721558, "num_tokens": 12603687.0, "step": 271 }, { "epoch": 3.445859872611465, "grad_norm": 0.424855500459671, "learning_rate": 0.00010623163508820977, "loss": 1.0008, "mean_token_accuracy": 0.7553302347660065, "num_tokens": 12648954.0, "step": 272 }, { "epoch": 3.4585987261146496, "grad_norm": 0.4551679790019989, "learning_rate": 0.00010563880905946159, "loss": 1.0301, "mean_token_accuracy": 0.7494941651821136, "num_tokens": 12692342.0, "step": 273 }, { "epoch": 3.4713375796178343, "grad_norm": 0.46419814229011536, "learning_rate": 0.00010504578415831395, "loss": 1.0583, "mean_token_accuracy": 0.7461420893669128, "num_tokens": 12737321.0, "step": 274 }, { "epoch": 3.484076433121019, "grad_norm": 0.4456294775009155, "learning_rate": 0.00010445258129987206, "loss": 1.0406, "mean_token_accuracy": 0.7484328746795654, "num_tokens": 12784140.0, "step": 275 }, { "epoch": 3.4968152866242037, "grad_norm": 0.4584999978542328, "learning_rate": 0.00010385922140551752, "loss": 1.0348, "mean_token_accuracy": 0.7499430775642395, "num_tokens": 12830314.0, "step": 276 }, { "epoch": 3.5095541401273884, "grad_norm": 0.44610586762428284, "learning_rate": 0.00010326572540217028, "loss": 1.0534, "mean_token_accuracy": 0.747410923242569, "num_tokens": 12877459.0, "step": 277 }, { "epoch": 3.522292993630573, "grad_norm": 0.48907381296157837, "learning_rate": 0.00010267211422155072, "loss": 1.0698, "mean_token_accuracy": 0.7433335781097412, "num_tokens": 12923562.0, "step": 278 }, { "epoch": 3.535031847133758, "grad_norm": 0.4395643174648285, "learning_rate": 0.00010207840879944123, "loss": 1.0296, "mean_token_accuracy": 0.7491806745529175, "num_tokens": 12971195.0, "step": 279 }, { "epoch": 3.5477707006369426, "grad_norm": 0.445525586605072, "learning_rate": 0.0001014846300749481, "loss": 1.0634, "mean_token_accuracy": 0.7422992885112762, "num_tokens": 13018111.0, "step": 280 }, { "epoch": 3.5605095541401273, "grad_norm": 0.44029030203819275, "learning_rate": 0.00010089079898976284, "loss": 1.0845, "mean_token_accuracy": 0.7385657727718353, "num_tokens": 13065801.0, "step": 281 }, { "epoch": 3.573248407643312, "grad_norm": 0.4442991614341736, "learning_rate": 0.00010029693648742355, "loss": 1.0247, "mean_token_accuracy": 0.7507951855659485, "num_tokens": 13110544.0, "step": 282 }, { "epoch": 3.5859872611464967, "grad_norm": 0.4595116972923279, "learning_rate": 9.970306351257647e-05, "loss": 1.0714, "mean_token_accuracy": 0.7425291538238525, "num_tokens": 13159700.0, "step": 283 }, { "epoch": 3.5987261146496814, "grad_norm": 0.42567887902259827, "learning_rate": 9.910920101023717e-05, "loss": 1.0511, "mean_token_accuracy": 0.7453266978263855, "num_tokens": 13208331.0, "step": 284 }, { "epoch": 3.611464968152866, "grad_norm": 0.43944114446640015, "learning_rate": 9.851536992505188e-05, "loss": 1.0418, "mean_token_accuracy": 0.7464134097099304, "num_tokens": 13255087.0, "step": 285 }, { "epoch": 3.624203821656051, "grad_norm": 0.44316551089286804, "learning_rate": 9.79215912005588e-05, "loss": 1.0306, "mean_token_accuracy": 0.7519051730632782, "num_tokens": 13301979.0, "step": 286 }, { "epoch": 3.6369426751592355, "grad_norm": 0.46782058477401733, "learning_rate": 9.732788577844934e-05, "loss": 1.0267, "mean_token_accuracy": 0.7499517202377319, "num_tokens": 13346264.0, "step": 287 }, { "epoch": 3.6496815286624202, "grad_norm": 0.4449765682220459, "learning_rate": 9.673427459782974e-05, "loss": 1.0627, "mean_token_accuracy": 0.7452774345874786, "num_tokens": 13395122.0, "step": 288 }, { "epoch": 3.662420382165605, "grad_norm": 0.44802337884902954, "learning_rate": 9.61407785944825e-05, "loss": 1.0381, "mean_token_accuracy": 0.7449367344379425, "num_tokens": 13441560.0, "step": 289 }, { "epoch": 3.6751592356687897, "grad_norm": 0.47226378321647644, "learning_rate": 9.554741870012797e-05, "loss": 1.061, "mean_token_accuracy": 0.7463669776916504, "num_tokens": 13485397.0, "step": 290 }, { "epoch": 3.6878980891719744, "grad_norm": 0.4418249726295471, "learning_rate": 9.495421584168609e-05, "loss": 1.0429, "mean_token_accuracy": 0.7469217479228973, "num_tokens": 13533561.0, "step": 291 }, { "epoch": 3.700636942675159, "grad_norm": 0.43316134810447693, "learning_rate": 9.436119094053846e-05, "loss": 1.0496, "mean_token_accuracy": 0.7461331188678741, "num_tokens": 13579401.0, "step": 292 }, { "epoch": 3.713375796178344, "grad_norm": 0.4408023953437805, "learning_rate": 9.376836491179028e-05, "loss": 1.0554, "mean_token_accuracy": 0.7451147735118866, "num_tokens": 13626917.0, "step": 293 }, { "epoch": 3.7261146496815285, "grad_norm": 0.47314339876174927, "learning_rate": 9.317575866353292e-05, "loss": 1.0349, "mean_token_accuracy": 0.7479163408279419, "num_tokens": 13669796.0, "step": 294 }, { "epoch": 3.738853503184713, "grad_norm": 0.45513227581977844, "learning_rate": 9.258339309610637e-05, "loss": 1.063, "mean_token_accuracy": 0.7429400384426117, "num_tokens": 13717064.0, "step": 295 }, { "epoch": 3.7515923566878984, "grad_norm": 0.44753924012184143, "learning_rate": 9.199128910136219e-05, "loss": 1.014, "mean_token_accuracy": 0.7514563202857971, "num_tokens": 13763993.0, "step": 296 }, { "epoch": 3.7643312101910826, "grad_norm": 0.4445459246635437, "learning_rate": 9.139946756192663e-05, "loss": 1.0219, "mean_token_accuracy": 0.7516200542449951, "num_tokens": 13810226.0, "step": 297 }, { "epoch": 3.777070063694268, "grad_norm": 0.4555498957633972, "learning_rate": 9.080794935046421e-05, "loss": 1.0846, "mean_token_accuracy": 0.737242728471756, "num_tokens": 13859627.0, "step": 298 }, { "epoch": 3.789808917197452, "grad_norm": 0.4423632323741913, "learning_rate": 9.021675532894145e-05, "loss": 1.0149, "mean_token_accuracy": 0.7535317242145538, "num_tokens": 13904621.0, "step": 299 }, { "epoch": 3.802547770700637, "grad_norm": 0.4562549293041229, "learning_rate": 8.962590634789123e-05, "loss": 1.0274, "mean_token_accuracy": 0.7515223622322083, "num_tokens": 13951418.0, "step": 300 }, { "epoch": 3.8152866242038215, "grad_norm": 0.4509284198284149, "learning_rate": 8.903542324567736e-05, "loss": 1.0512, "mean_token_accuracy": 0.7477030754089355, "num_tokens": 13996941.0, "step": 301 }, { "epoch": 3.8280254777070066, "grad_norm": 0.4827808737754822, "learning_rate": 8.844532684775963e-05, "loss": 0.9791, "mean_token_accuracy": 0.7602791786193848, "num_tokens": 14041820.0, "step": 302 }, { "epoch": 3.840764331210191, "grad_norm": 0.46509167551994324, "learning_rate": 8.785563796595938e-05, "loss": 1.0442, "mean_token_accuracy": 0.7479641735553741, "num_tokens": 14089905.0, "step": 303 }, { "epoch": 3.853503184713376, "grad_norm": 0.4547942876815796, "learning_rate": 8.726637739772542e-05, "loss": 1.0554, "mean_token_accuracy": 0.7465295493602753, "num_tokens": 14135065.0, "step": 304 }, { "epoch": 3.8662420382165603, "grad_norm": 0.4469335675239563, "learning_rate": 8.667756592540064e-05, "loss": 1.0383, "mean_token_accuracy": 0.7464892268180847, "num_tokens": 14179255.0, "step": 305 }, { "epoch": 3.8789808917197455, "grad_norm": 0.45058006048202515, "learning_rate": 8.608922431548887e-05, "loss": 1.0453, "mean_token_accuracy": 0.7463506460189819, "num_tokens": 14228844.0, "step": 306 }, { "epoch": 3.8917197452229297, "grad_norm": 0.44601333141326904, "learning_rate": 8.55013733179227e-05, "loss": 1.0407, "mean_token_accuracy": 0.7497325539588928, "num_tokens": 14274709.0, "step": 307 }, { "epoch": 3.904458598726115, "grad_norm": 0.44497182965278625, "learning_rate": 8.49140336653315e-05, "loss": 1.0158, "mean_token_accuracy": 0.7533020973205566, "num_tokens": 14321597.0, "step": 308 }, { "epoch": 3.917197452229299, "grad_norm": 0.43743929266929626, "learning_rate": 8.43272260723103e-05, "loss": 1.0137, "mean_token_accuracy": 0.7568092048168182, "num_tokens": 14369925.0, "step": 309 }, { "epoch": 3.9299363057324843, "grad_norm": 0.44671833515167236, "learning_rate": 8.374097123468918e-05, "loss": 1.0583, "mean_token_accuracy": 0.7409914433956146, "num_tokens": 14417628.0, "step": 310 }, { "epoch": 3.9426751592356686, "grad_norm": 0.44011715054512024, "learning_rate": 8.315528982880337e-05, "loss": 1.0307, "mean_token_accuracy": 0.7483357191085815, "num_tokens": 14466473.0, "step": 311 }, { "epoch": 3.9554140127388537, "grad_norm": 0.45142441987991333, "learning_rate": 8.257020251076393e-05, "loss": 1.0565, "mean_token_accuracy": 0.7446093857288361, "num_tokens": 14512510.0, "step": 312 }, { "epoch": 3.968152866242038, "grad_norm": 0.48025238513946533, "learning_rate": 8.198572991572939e-05, "loss": 1.0597, "mean_token_accuracy": 0.7435389757156372, "num_tokens": 14561087.0, "step": 313 }, { "epoch": 3.980891719745223, "grad_norm": 0.45641523599624634, "learning_rate": 8.140189265717794e-05, "loss": 1.0903, "mean_token_accuracy": 0.739763617515564, "num_tokens": 14610134.0, "step": 314 }, { "epoch": 3.9936305732484074, "grad_norm": 0.4491109848022461, "learning_rate": 8.081871132618036e-05, "loss": 1.0839, "mean_token_accuracy": 0.7389968633651733, "num_tokens": 14659750.0, "step": 315 }, { "epoch": 4.0, "grad_norm": 0.6807467937469482, "learning_rate": 8.023620649067384e-05, "loss": 0.9348, "mean_token_accuracy": 0.7736132740974426, "num_tokens": 14683741.0, "step": 316 }, { "epoch": 4.012738853503185, "grad_norm": 0.46182575821876526, "learning_rate": 7.965439869473664e-05, "loss": 0.8458, "mean_token_accuracy": 0.7974231243133545, "num_tokens": 14731484.0, "step": 317 }, { "epoch": 4.025477707006369, "grad_norm": 0.4779008626937866, "learning_rate": 7.907330845786337e-05, "loss": 0.82, "mean_token_accuracy": 0.8037229180335999, "num_tokens": 14776906.0, "step": 318 }, { "epoch": 4.038216560509555, "grad_norm": 0.47625744342803955, "learning_rate": 7.849295627424148e-05, "loss": 0.791, "mean_token_accuracy": 0.8079457581043243, "num_tokens": 14822669.0, "step": 319 }, { "epoch": 4.050955414012739, "grad_norm": 0.5156582593917847, "learning_rate": 7.791336261202835e-05, "loss": 0.7787, "mean_token_accuracy": 0.8072306513786316, "num_tokens": 14869201.0, "step": 320 }, { "epoch": 4.063694267515924, "grad_norm": 0.6505507826805115, "learning_rate": 7.733454791262947e-05, "loss": 0.774, "mean_token_accuracy": 0.8075048327445984, "num_tokens": 14916197.0, "step": 321 }, { "epoch": 4.076433121019108, "grad_norm": 0.7211319208145142, "learning_rate": 7.67565325899774e-05, "loss": 0.7775, "mean_token_accuracy": 0.8053169548511505, "num_tokens": 14962850.0, "step": 322 }, { "epoch": 4.089171974522293, "grad_norm": 0.6594023108482361, "learning_rate": 7.617933702981198e-05, "loss": 0.7764, "mean_token_accuracy": 0.8061047494411469, "num_tokens": 15011258.0, "step": 323 }, { "epoch": 4.101910828025478, "grad_norm": 0.6146224737167358, "learning_rate": 7.560298158896114e-05, "loss": 0.7769, "mean_token_accuracy": 0.8081805408000946, "num_tokens": 15056644.0, "step": 324 }, { "epoch": 4.114649681528663, "grad_norm": 0.5424087047576904, "learning_rate": 7.502748659462311e-05, "loss": 0.7706, "mean_token_accuracy": 0.8129306137561798, "num_tokens": 15102628.0, "step": 325 }, { "epoch": 4.127388535031847, "grad_norm": 0.5145137310028076, "learning_rate": 7.445287234364946e-05, "loss": 0.7846, "mean_token_accuracy": 0.8085419535636902, "num_tokens": 15147902.0, "step": 326 }, { "epoch": 4.140127388535032, "grad_norm": 0.5234518051147461, "learning_rate": 7.38791591018292e-05, "loss": 0.765, "mean_token_accuracy": 0.8127568960189819, "num_tokens": 15191402.0, "step": 327 }, { "epoch": 4.1528662420382165, "grad_norm": 0.5007306933403015, "learning_rate": 7.330636710317417e-05, "loss": 0.8103, "mean_token_accuracy": 0.8035311698913574, "num_tokens": 15237737.0, "step": 328 }, { "epoch": 4.165605095541402, "grad_norm": 0.517250120639801, "learning_rate": 7.273451654920532e-05, "loss": 0.7801, "mean_token_accuracy": 0.8110656440258026, "num_tokens": 15284311.0, "step": 329 }, { "epoch": 4.178343949044586, "grad_norm": 0.5196605920791626, "learning_rate": 7.21636276082401e-05, "loss": 0.7937, "mean_token_accuracy": 0.8047934472560883, "num_tokens": 15330798.0, "step": 330 }, { "epoch": 4.191082802547771, "grad_norm": 0.5460777878761292, "learning_rate": 7.15937204146815e-05, "loss": 0.8176, "mean_token_accuracy": 0.8022070527076721, "num_tokens": 15378878.0, "step": 331 }, { "epoch": 4.203821656050955, "grad_norm": 0.5694323778152466, "learning_rate": 7.102481506830764e-05, "loss": 0.8123, "mean_token_accuracy": 0.8015323579311371, "num_tokens": 15425749.0, "step": 332 }, { "epoch": 4.2165605095541405, "grad_norm": 0.55637127161026, "learning_rate": 7.0456931633563e-05, "loss": 0.7753, "mean_token_accuracy": 0.8087098598480225, "num_tokens": 15472222.0, "step": 333 }, { "epoch": 4.229299363057325, "grad_norm": 0.5772049427032471, "learning_rate": 6.989009013885077e-05, "loss": 0.7884, "mean_token_accuracy": 0.8073362112045288, "num_tokens": 15521012.0, "step": 334 }, { "epoch": 4.24203821656051, "grad_norm": 0.5783923268318176, "learning_rate": 6.932431057582647e-05, "loss": 0.7451, "mean_token_accuracy": 0.8135620653629303, "num_tokens": 15566485.0, "step": 335 }, { "epoch": 4.254777070063694, "grad_norm": 0.5757331252098083, "learning_rate": 6.875961289869283e-05, "loss": 0.7487, "mean_token_accuracy": 0.8147032558917999, "num_tokens": 15612600.0, "step": 336 }, { "epoch": 4.267515923566879, "grad_norm": 0.5666617751121521, "learning_rate": 6.819601702349609e-05, "loss": 0.7653, "mean_token_accuracy": 0.810498058795929, "num_tokens": 15658443.0, "step": 337 }, { "epoch": 4.280254777070064, "grad_norm": 0.54319828748703, "learning_rate": 6.763354282742363e-05, "loss": 0.7754, "mean_token_accuracy": 0.8075751662254333, "num_tokens": 15706012.0, "step": 338 }, { "epoch": 4.292993630573249, "grad_norm": 0.5346329212188721, "learning_rate": 6.707221014810279e-05, "loss": 0.7588, "mean_token_accuracy": 0.812885046005249, "num_tokens": 15752588.0, "step": 339 }, { "epoch": 4.305732484076433, "grad_norm": 0.5441272258758545, "learning_rate": 6.651203878290139e-05, "loss": 0.7827, "mean_token_accuracy": 0.8059158623218536, "num_tokens": 15798766.0, "step": 340 }, { "epoch": 4.318471337579618, "grad_norm": 0.5370075106620789, "learning_rate": 6.59530484882294e-05, "loss": 0.8123, "mean_token_accuracy": 0.8005849421024323, "num_tokens": 15845861.0, "step": 341 }, { "epoch": 4.3312101910828025, "grad_norm": 0.5364204049110413, "learning_rate": 6.539525897884219e-05, "loss": 0.7945, "mean_token_accuracy": 0.8061460852622986, "num_tokens": 15891605.0, "step": 342 }, { "epoch": 4.343949044585988, "grad_norm": 0.5339395403862, "learning_rate": 6.48386899271452e-05, "loss": 0.8008, "mean_token_accuracy": 0.8012154996395111, "num_tokens": 15940667.0, "step": 343 }, { "epoch": 4.356687898089172, "grad_norm": 0.5205627083778381, "learning_rate": 6.428336096250019e-05, "loss": 0.7537, "mean_token_accuracy": 0.8153076469898224, "num_tokens": 15987561.0, "step": 344 }, { "epoch": 4.369426751592357, "grad_norm": 0.5304903388023376, "learning_rate": 6.372929167053286e-05, "loss": 0.7702, "mean_token_accuracy": 0.809718132019043, "num_tokens": 16034176.0, "step": 345 }, { "epoch": 4.382165605095541, "grad_norm": 0.5487926602363586, "learning_rate": 6.317650159244212e-05, "loss": 0.7613, "mean_token_accuracy": 0.8127056956291199, "num_tokens": 16082008.0, "step": 346 }, { "epoch": 4.3949044585987265, "grad_norm": 0.5397400856018066, "learning_rate": 6.2625010224311e-05, "loss": 0.767, "mean_token_accuracy": 0.8101482689380646, "num_tokens": 16127461.0, "step": 347 }, { "epoch": 4.407643312101911, "grad_norm": 0.5537377595901489, "learning_rate": 6.207483701641888e-05, "loss": 0.7713, "mean_token_accuracy": 0.8083570003509521, "num_tokens": 16173594.0, "step": 348 }, { "epoch": 4.420382165605096, "grad_norm": 0.5595129728317261, "learning_rate": 6.15260013725555e-05, "loss": 0.7617, "mean_token_accuracy": 0.8116026222705841, "num_tokens": 16218042.0, "step": 349 }, { "epoch": 4.43312101910828, "grad_norm": 0.5709227323532104, "learning_rate": 6.097852264933697e-05, "loss": 0.7986, "mean_token_accuracy": 0.8036070764064789, "num_tokens": 16264765.0, "step": 350 }, { "epoch": 4.445859872611465, "grad_norm": 0.5528348684310913, "learning_rate": 6.043242015552258e-05, "loss": 0.7754, "mean_token_accuracy": 0.8096699416637421, "num_tokens": 16311474.0, "step": 351 }, { "epoch": 4.45859872611465, "grad_norm": 0.5509300827980042, "learning_rate": 5.988771315133418e-05, "loss": 0.7629, "mean_token_accuracy": 0.812688410282135, "num_tokens": 16359002.0, "step": 352 }, { "epoch": 4.471337579617835, "grad_norm": 0.5490424633026123, "learning_rate": 5.934442084777676e-05, "loss": 0.7771, "mean_token_accuracy": 0.8061512410640717, "num_tokens": 16407048.0, "step": 353 }, { "epoch": 4.484076433121019, "grad_norm": 0.5424743294715881, "learning_rate": 5.880256240596096e-05, "loss": 0.7625, "mean_token_accuracy": 0.811147153377533, "num_tokens": 16453863.0, "step": 354 }, { "epoch": 4.496815286624204, "grad_norm": 0.5359919667243958, "learning_rate": 5.8262156936427096e-05, "loss": 0.7985, "mean_token_accuracy": 0.8056308627128601, "num_tokens": 16502333.0, "step": 355 }, { "epoch": 4.509554140127388, "grad_norm": 0.5353891253471375, "learning_rate": 5.772322349847154e-05, "loss": 0.7774, "mean_token_accuracy": 0.8094648122787476, "num_tokens": 16549278.0, "step": 356 }, { "epoch": 4.522292993630574, "grad_norm": 0.5505733489990234, "learning_rate": 5.71857810994741e-05, "loss": 0.7633, "mean_token_accuracy": 0.8114041388034821, "num_tokens": 16595007.0, "step": 357 }, { "epoch": 4.535031847133758, "grad_norm": 0.5385571122169495, "learning_rate": 5.6649848694228026e-05, "loss": 0.7829, "mean_token_accuracy": 0.8066455721855164, "num_tokens": 16642899.0, "step": 358 }, { "epoch": 4.547770700636943, "grad_norm": 0.5487037301063538, "learning_rate": 5.611544518427121e-05, "loss": 0.7427, "mean_token_accuracy": 0.8148898184299469, "num_tokens": 16687593.0, "step": 359 }, { "epoch": 4.560509554140127, "grad_norm": 0.5425994396209717, "learning_rate": 5.558258941721982e-05, "loss": 0.7872, "mean_token_accuracy": 0.8057865798473358, "num_tokens": 16737104.0, "step": 360 }, { "epoch": 4.573248407643312, "grad_norm": 0.5299367904663086, "learning_rate": 5.5051300186103214e-05, "loss": 0.7353, "mean_token_accuracy": 0.8165575265884399, "num_tokens": 16782471.0, "step": 361 }, { "epoch": 4.585987261146497, "grad_norm": 0.5561987161636353, "learning_rate": 5.452159622870158e-05, "loss": 0.7256, "mean_token_accuracy": 0.8211332857608795, "num_tokens": 16824795.0, "step": 362 }, { "epoch": 4.598726114649682, "grad_norm": 0.5320610404014587, "learning_rate": 5.399349622688479e-05, "loss": 0.7847, "mean_token_accuracy": 0.806152880191803, "num_tokens": 16873618.0, "step": 363 }, { "epoch": 4.611464968152866, "grad_norm": 0.5142655968666077, "learning_rate": 5.346701880595354e-05, "loss": 0.768, "mean_token_accuracy": 0.8106401562690735, "num_tokens": 16921852.0, "step": 364 }, { "epoch": 4.624203821656051, "grad_norm": 0.5498877763748169, "learning_rate": 5.29421825339826e-05, "loss": 0.7585, "mean_token_accuracy": 0.8139531016349792, "num_tokens": 16968343.0, "step": 365 }, { "epoch": 4.6369426751592355, "grad_norm": 0.5473263263702393, "learning_rate": 5.24190059211658e-05, "loss": 0.7421, "mean_token_accuracy": 0.8171448707580566, "num_tokens": 17012314.0, "step": 366 }, { "epoch": 4.649681528662421, "grad_norm": 0.545117199420929, "learning_rate": 5.189750741916326e-05, "loss": 0.7712, "mean_token_accuracy": 0.8083784878253937, "num_tokens": 17059162.0, "step": 367 }, { "epoch": 4.662420382165605, "grad_norm": 0.5788088440895081, "learning_rate": 5.137770542045063e-05, "loss": 0.7568, "mean_token_accuracy": 0.8137945234775543, "num_tokens": 17103266.0, "step": 368 }, { "epoch": 4.67515923566879, "grad_norm": 0.5412328243255615, "learning_rate": 5.085961825767049e-05, "loss": 0.7962, "mean_token_accuracy": 0.80179163813591, "num_tokens": 17153007.0, "step": 369 }, { "epoch": 4.687898089171974, "grad_norm": 0.5531262159347534, "learning_rate": 5.0343264202985575e-05, "loss": 0.7539, "mean_token_accuracy": 0.8140422999858856, "num_tokens": 17197748.0, "step": 370 }, { "epoch": 4.7006369426751595, "grad_norm": 0.554670512676239, "learning_rate": 4.9828661467434644e-05, "loss": 0.7965, "mean_token_accuracy": 0.8047409653663635, "num_tokens": 17245560.0, "step": 371 }, { "epoch": 4.713375796178344, "grad_norm": 0.5575906038284302, "learning_rate": 4.93158282002899e-05, "loss": 0.7646, "mean_token_accuracy": 0.8107549250125885, "num_tokens": 17291952.0, "step": 372 }, { "epoch": 4.726114649681529, "grad_norm": 0.5389590263366699, "learning_rate": 4.8804782488417054e-05, "loss": 0.8151, "mean_token_accuracy": 0.8011313676834106, "num_tokens": 17342344.0, "step": 373 }, { "epoch": 4.738853503184713, "grad_norm": 0.5552359819412231, "learning_rate": 4.82955423556375e-05, "loss": 0.7789, "mean_token_accuracy": 0.8068567216396332, "num_tokens": 17389806.0, "step": 374 }, { "epoch": 4.751592356687898, "grad_norm": 0.5424468517303467, "learning_rate": 4.778812576209241e-05, "loss": 0.7622, "mean_token_accuracy": 0.8100213408470154, "num_tokens": 17438195.0, "step": 375 }, { "epoch": 4.764331210191083, "grad_norm": 0.5468940138816833, "learning_rate": 4.728255060360955e-05, "loss": 0.7555, "mean_token_accuracy": 0.8137983977794647, "num_tokens": 17482935.0, "step": 376 }, { "epoch": 4.777070063694268, "grad_norm": 0.54682457447052, "learning_rate": 4.677883471107193e-05, "loss": 0.7665, "mean_token_accuracy": 0.8110204339027405, "num_tokens": 17529731.0, "step": 377 }, { "epoch": 4.789808917197452, "grad_norm": 0.5494992136955261, "learning_rate": 4.6276995849789115e-05, "loss": 0.7748, "mean_token_accuracy": 0.8063468039035797, "num_tokens": 17575732.0, "step": 378 }, { "epoch": 4.802547770700637, "grad_norm": 0.5323486328125, "learning_rate": 4.57770517188705e-05, "loss": 0.7762, "mean_token_accuracy": 0.8069157600402832, "num_tokens": 17625739.0, "step": 379 }, { "epoch": 4.8152866242038215, "grad_norm": 0.5506855249404907, "learning_rate": 4.527901995060113e-05, "loss": 0.7642, "mean_token_accuracy": 0.8129552602767944, "num_tokens": 17672179.0, "step": 380 }, { "epoch": 4.828025477707007, "grad_norm": 0.5435847043991089, "learning_rate": 4.478291810981998e-05, "loss": 0.7856, "mean_token_accuracy": 0.8080207407474518, "num_tokens": 17718571.0, "step": 381 }, { "epoch": 4.840764331210191, "grad_norm": 0.5513826012611389, "learning_rate": 4.428876369330023e-05, "loss": 0.7519, "mean_token_accuracy": 0.8144398927688599, "num_tokens": 17764089.0, "step": 382 }, { "epoch": 4.853503184713376, "grad_norm": 0.5551168918609619, "learning_rate": 4.379657412913243e-05, "loss": 0.8151, "mean_token_accuracy": 0.8006792664527893, "num_tokens": 17811590.0, "step": 383 }, { "epoch": 4.86624203821656, "grad_norm": 0.5645202994346619, "learning_rate": 4.330636677610962e-05, "loss": 0.7522, "mean_token_accuracy": 0.8127522766590118, "num_tokens": 17858948.0, "step": 384 }, { "epoch": 4.8789808917197455, "grad_norm": 0.5622471570968628, "learning_rate": 4.281815892311525e-05, "loss": 0.8062, "mean_token_accuracy": 0.8032259941101074, "num_tokens": 17908157.0, "step": 385 }, { "epoch": 4.89171974522293, "grad_norm": 0.542911946773529, "learning_rate": 4.2331967788513295e-05, "loss": 0.7682, "mean_token_accuracy": 0.8091734647750854, "num_tokens": 17954806.0, "step": 386 }, { "epoch": 4.904458598726115, "grad_norm": 0.5518525838851929, "learning_rate": 4.1847810519541255e-05, "loss": 0.7999, "mean_token_accuracy": 0.801593542098999, "num_tokens": 18004377.0, "step": 387 }, { "epoch": 4.917197452229299, "grad_norm": 0.5533684492111206, "learning_rate": 4.136570419170501e-05, "loss": 0.7968, "mean_token_accuracy": 0.8025395572185516, "num_tokens": 18052401.0, "step": 388 }, { "epoch": 4.929936305732484, "grad_norm": 0.55246502161026, "learning_rate": 4.088566580817694e-05, "loss": 0.7978, "mean_token_accuracy": 0.8031694889068604, "num_tokens": 18100024.0, "step": 389 }, { "epoch": 4.942675159235669, "grad_norm": 0.5535824298858643, "learning_rate": 4.040771229919612e-05, "loss": 0.7482, "mean_token_accuracy": 0.8140803873538971, "num_tokens": 18147924.0, "step": 390 }, { "epoch": 4.955414012738854, "grad_norm": 0.5558858513832092, "learning_rate": 3.99318605214711e-05, "loss": 0.7681, "mean_token_accuracy": 0.8126172721385956, "num_tokens": 18192564.0, "step": 391 }, { "epoch": 4.968152866242038, "grad_norm": 0.5758087038993835, "learning_rate": 3.945812725758554e-05, "loss": 0.7549, "mean_token_accuracy": 0.8129025399684906, "num_tokens": 18235174.0, "step": 392 }, { "epoch": 4.980891719745223, "grad_norm": 0.5681016445159912, "learning_rate": 3.8986529215406275e-05, "loss": 0.7903, "mean_token_accuracy": 0.803301215171814, "num_tokens": 18282949.0, "step": 393 }, { "epoch": 4.993630573248407, "grad_norm": 0.5532224178314209, "learning_rate": 3.851708302749409e-05, "loss": 0.8045, "mean_token_accuracy": 0.801055371761322, "num_tokens": 18331817.0, "step": 394 }, { "epoch": 5.0, "grad_norm": 0.5532224178314209, "learning_rate": 3.8049805250517004e-05, "loss": 0.6807, "mean_token_accuracy": 0.8316032886505127, "num_tokens": 18355644.0, "step": 395 }, { "epoch": 5.012738853503185, "grad_norm": 0.803767204284668, "learning_rate": 3.7584712364666494e-05, "loss": 0.6007, "mean_token_accuracy": 0.8561270534992218, "num_tokens": 18401098.0, "step": 396 }, { "epoch": 5.025477707006369, "grad_norm": 0.5155036449432373, "learning_rate": 3.71218207730761e-05, "loss": 0.5801, "mean_token_accuracy": 0.8610466420650482, "num_tokens": 18447934.0, "step": 397 }, { "epoch": 5.038216560509555, "grad_norm": 0.5219685435295105, "learning_rate": 3.666114680124298e-05, "loss": 0.5532, "mean_token_accuracy": 0.8671682178974152, "num_tokens": 18494377.0, "step": 398 }, { "epoch": 5.050955414012739, "grad_norm": 0.5384805798530579, "learning_rate": 3.620270669645228e-05, "loss": 0.5539, "mean_token_accuracy": 0.8648174703121185, "num_tokens": 18537068.0, "step": 399 }, { "epoch": 5.063694267515924, "grad_norm": 0.5684152841567993, "learning_rate": 3.574651662720382e-05, "loss": 0.5738, "mean_token_accuracy": 0.8580814898014069, "num_tokens": 18581071.0, "step": 400 }, { "epoch": 5.076433121019108, "grad_norm": 0.6354894638061523, "learning_rate": 3.5292592682642134e-05, "loss": 0.5662, "mean_token_accuracy": 0.8605021834373474, "num_tokens": 18629826.0, "step": 401 }, { "epoch": 5.089171974522293, "grad_norm": 0.6762036681175232, "learning_rate": 3.484095087198881e-05, "loss": 0.5567, "mean_token_accuracy": 0.8611220121383667, "num_tokens": 18679551.0, "step": 402 }, { "epoch": 5.101910828025478, "grad_norm": 0.7970669865608215, "learning_rate": 3.4391607123978095e-05, "loss": 0.5898, "mean_token_accuracy": 0.853861540555954, "num_tokens": 18726481.0, "step": 403 }, { "epoch": 5.114649681528663, "grad_norm": 0.7165261507034302, "learning_rate": 3.394457728629489e-05, "loss": 0.5543, "mean_token_accuracy": 0.8633293807506561, "num_tokens": 18774675.0, "step": 404 }, { "epoch": 5.127388535031847, "grad_norm": 0.6630553007125854, "learning_rate": 3.349987712501591e-05, "loss": 0.5794, "mean_token_accuracy": 0.8572741746902466, "num_tokens": 18819968.0, "step": 405 }, { "epoch": 5.140127388535032, "grad_norm": 0.6473745703697205, "learning_rate": 3.305752232405377e-05, "loss": 0.5514, "mean_token_accuracy": 0.8612950146198273, "num_tokens": 18867168.0, "step": 406 }, { "epoch": 5.1528662420382165, "grad_norm": 0.6203842163085938, "learning_rate": 3.2617528484603576e-05, "loss": 0.5792, "mean_token_accuracy": 0.8582462072372437, "num_tokens": 18915270.0, "step": 407 }, { "epoch": 5.165605095541402, "grad_norm": 0.632040798664093, "learning_rate": 3.2179911124592966e-05, "loss": 0.5655, "mean_token_accuracy": 0.864041805267334, "num_tokens": 18961168.0, "step": 408 }, { "epoch": 5.178343949044586, "grad_norm": 0.5363501906394958, "learning_rate": 3.174468567813461e-05, "loss": 0.5529, "mean_token_accuracy": 0.865607500076294, "num_tokens": 19009217.0, "step": 409 }, { "epoch": 5.191082802547771, "grad_norm": 0.5809481739997864, "learning_rate": 3.131186749498195e-05, "loss": 0.5753, "mean_token_accuracy": 0.8589119017124176, "num_tokens": 19058035.0, "step": 410 }, { "epoch": 5.203821656050955, "grad_norm": 0.533413290977478, "learning_rate": 3.088147183998782e-05, "loss": 0.5756, "mean_token_accuracy": 0.8603843152523041, "num_tokens": 19105942.0, "step": 411 }, { "epoch": 5.2165605095541405, "grad_norm": 0.5912073850631714, "learning_rate": 3.0453513892566197e-05, "loss": 0.5713, "mean_token_accuracy": 0.8610886931419373, "num_tokens": 19149032.0, "step": 412 }, { "epoch": 5.229299363057325, "grad_norm": 0.5597264170646667, "learning_rate": 3.0028008746156588e-05, "loss": 0.5593, "mean_token_accuracy": 0.8630417883396149, "num_tokens": 19193905.0, "step": 413 }, { "epoch": 5.24203821656051, "grad_norm": 0.5707894563674927, "learning_rate": 2.9604971407692027e-05, "loss": 0.5656, "mean_token_accuracy": 0.8626342117786407, "num_tokens": 19241798.0, "step": 414 }, { "epoch": 5.254777070063694, "grad_norm": 0.5729110240936279, "learning_rate": 2.918441679706949e-05, "loss": 0.5593, "mean_token_accuracy": 0.8617399036884308, "num_tokens": 19287116.0, "step": 415 }, { "epoch": 5.267515923566879, "grad_norm": 0.6001513600349426, "learning_rate": 2.8766359746623894e-05, "loss": 0.5541, "mean_token_accuracy": 0.8645914494991302, "num_tokens": 19333494.0, "step": 416 }, { "epoch": 5.280254777070064, "grad_norm": 0.620059609413147, "learning_rate": 2.835081500060498e-05, "loss": 0.5485, "mean_token_accuracy": 0.8663501143455505, "num_tokens": 19380078.0, "step": 417 }, { "epoch": 5.292993630573249, "grad_norm": 0.6021698117256165, "learning_rate": 2.7937797214657147e-05, "loss": 0.5778, "mean_token_accuracy": 0.8575234711170197, "num_tokens": 19429142.0, "step": 418 }, { "epoch": 5.305732484076433, "grad_norm": 0.6448414325714111, "learning_rate": 2.7527320955302794e-05, "loss": 0.5887, "mean_token_accuracy": 0.8552671074867249, "num_tokens": 19477251.0, "step": 419 }, { "epoch": 5.318471337579618, "grad_norm": 0.6018058657646179, "learning_rate": 2.7119400699428332e-05, "loss": 0.5486, "mean_token_accuracy": 0.8661691546440125, "num_tokens": 19523462.0, "step": 420 }, { "epoch": 5.3312101910828025, "grad_norm": 0.598821222782135, "learning_rate": 2.671405083377386e-05, "loss": 0.5559, "mean_token_accuracy": 0.8639799356460571, "num_tokens": 19570087.0, "step": 421 }, { "epoch": 5.343949044585988, "grad_norm": 0.6228508949279785, "learning_rate": 2.6311285654425575e-05, "loss": 0.5626, "mean_token_accuracy": 0.8616799116134644, "num_tokens": 19618251.0, "step": 422 }, { "epoch": 5.356687898089172, "grad_norm": 0.591503381729126, "learning_rate": 2.5911119366311597e-05, "loss": 0.5654, "mean_token_accuracy": 0.8612537682056427, "num_tokens": 19666992.0, "step": 423 }, { "epoch": 5.369426751592357, "grad_norm": 0.5860921144485474, "learning_rate": 2.5513566082701135e-05, "loss": 0.5671, "mean_token_accuracy": 0.8606434762477875, "num_tokens": 19714972.0, "step": 424 }, { "epoch": 5.382165605095541, "grad_norm": 0.5802496671676636, "learning_rate": 2.51186398247065e-05, "loss": 0.5646, "mean_token_accuracy": 0.8609052002429962, "num_tokens": 19762246.0, "step": 425 }, { "epoch": 5.3949044585987265, "grad_norm": 0.5896458625793457, "learning_rate": 2.472635452078883e-05, "loss": 0.5398, "mean_token_accuracy": 0.8695516288280487, "num_tokens": 19805820.0, "step": 426 }, { "epoch": 5.407643312101911, "grad_norm": 0.6189890503883362, "learning_rate": 2.433672400626663e-05, "loss": 0.56, "mean_token_accuracy": 0.8619295656681061, "num_tokens": 19850138.0, "step": 427 }, { "epoch": 5.420382165605096, "grad_norm": 0.5819289088249207, "learning_rate": 2.3949762022828092e-05, "loss": 0.5778, "mean_token_accuracy": 0.8582758605480194, "num_tokens": 19897704.0, "step": 428 }, { "epoch": 5.43312101910828, "grad_norm": 0.5880019664764404, "learning_rate": 2.3565482218046075e-05, "loss": 0.5617, "mean_token_accuracy": 0.8624799251556396, "num_tokens": 19945551.0, "step": 429 }, { "epoch": 5.445859872611465, "grad_norm": 0.5863910913467407, "learning_rate": 2.3183898144897177e-05, "loss": 0.5669, "mean_token_accuracy": 0.8587363660335541, "num_tokens": 19992591.0, "step": 430 }, { "epoch": 5.45859872611465, "grad_norm": 0.5961703062057495, "learning_rate": 2.2805023261283497e-05, "loss": 0.5723, "mean_token_accuracy": 0.8603742122650146, "num_tokens": 20040108.0, "step": 431 }, { "epoch": 5.471337579617835, "grad_norm": 0.5917873382568359, "learning_rate": 2.242887092955801e-05, "loss": 0.5632, "mean_token_accuracy": 0.8612915873527527, "num_tokens": 20084175.0, "step": 432 }, { "epoch": 5.484076433121019, "grad_norm": 0.5897845029830933, "learning_rate": 2.2055454416053422e-05, "loss": 0.5538, "mean_token_accuracy": 0.8653071224689484, "num_tokens": 20128240.0, "step": 433 }, { "epoch": 5.496815286624204, "grad_norm": 0.6288106441497803, "learning_rate": 2.168478689061413e-05, "loss": 0.5509, "mean_token_accuracy": 0.8656776249408722, "num_tokens": 20174729.0, "step": 434 }, { "epoch": 5.509554140127388, "grad_norm": 0.5910764932632446, "learning_rate": 2.131688142613183e-05, "loss": 0.5725, "mean_token_accuracy": 0.8601183593273163, "num_tokens": 20224313.0, "step": 435 }, { "epoch": 5.522292993630574, "grad_norm": 0.5756183862686157, "learning_rate": 2.095175099808444e-05, "loss": 0.5465, "mean_token_accuracy": 0.8652230203151703, "num_tokens": 20271807.0, "step": 436 }, { "epoch": 5.535031847133758, "grad_norm": 0.6019288301467896, "learning_rate": 2.058940848407854e-05, "loss": 0.5743, "mean_token_accuracy": 0.8625396490097046, "num_tokens": 20319175.0, "step": 437 }, { "epoch": 5.547770700636943, "grad_norm": 0.593775749206543, "learning_rate": 2.0229866663395026e-05, "loss": 0.547, "mean_token_accuracy": 0.8664292097091675, "num_tokens": 20363325.0, "step": 438 }, { "epoch": 5.560509554140127, "grad_norm": 0.602142870426178, "learning_rate": 1.987313821653861e-05, "loss": 0.5731, "mean_token_accuracy": 0.8586575984954834, "num_tokens": 20411205.0, "step": 439 }, { "epoch": 5.573248407643312, "grad_norm": 0.591356098651886, "learning_rate": 1.951923572479044e-05, "loss": 0.5506, "mean_token_accuracy": 0.8643897771835327, "num_tokens": 20454798.0, "step": 440 }, { "epoch": 5.585987261146497, "grad_norm": 0.6110073924064636, "learning_rate": 1.9168171669764413e-05, "loss": 0.5401, "mean_token_accuracy": 0.8683696687221527, "num_tokens": 20500406.0, "step": 441 }, { "epoch": 5.598726114649682, "grad_norm": 0.5945736765861511, "learning_rate": 1.881995843296708e-05, "loss": 0.5523, "mean_token_accuracy": 0.8627299666404724, "num_tokens": 20545603.0, "step": 442 }, { "epoch": 5.611464968152866, "grad_norm": 0.6136711239814758, "learning_rate": 1.847460829536075e-05, "loss": 0.5806, "mean_token_accuracy": 0.8575672209262848, "num_tokens": 20590976.0, "step": 443 }, { "epoch": 5.624203821656051, "grad_norm": 0.5992861390113831, "learning_rate": 1.8132133436930642e-05, "loss": 0.5705, "mean_token_accuracy": 0.8608649969100952, "num_tokens": 20639201.0, "step": 444 }, { "epoch": 5.6369426751592355, "grad_norm": 0.5806087255477905, "learning_rate": 1.7792545936255013e-05, "loss": 0.5845, "mean_token_accuracy": 0.8575698733329773, "num_tokens": 20691761.0, "step": 445 }, { "epoch": 5.649681528662421, "grad_norm": 0.5738813877105713, "learning_rate": 1.745585777007943e-05, "loss": 0.5557, "mean_token_accuracy": 0.8638261556625366, "num_tokens": 20736217.0, "step": 446 }, { "epoch": 5.662420382165605, "grad_norm": 0.6299033761024475, "learning_rate": 1.7122080812894147e-05, "loss": 0.5859, "mean_token_accuracy": 0.8571733236312866, "num_tokens": 20783324.0, "step": 447 }, { "epoch": 5.67515923566879, "grad_norm": 0.5905052423477173, "learning_rate": 1.679122683651546e-05, "loss": 0.5646, "mean_token_accuracy": 0.8605034649372101, "num_tokens": 20829442.0, "step": 448 }, { "epoch": 5.687898089171974, "grad_norm": 0.6001847982406616, "learning_rate": 1.6463307509670524e-05, "loss": 0.5715, "mean_token_accuracy": 0.8600328266620636, "num_tokens": 20876617.0, "step": 449 }, { "epoch": 5.7006369426751595, "grad_norm": 0.615409791469574, "learning_rate": 1.6138334397585675e-05, "loss": 0.5581, "mean_token_accuracy": 0.8639148473739624, "num_tokens": 20923904.0, "step": 450 }, { "epoch": 5.713375796178344, "grad_norm": 0.6029254794120789, "learning_rate": 1.5816318961578757e-05, "loss": 0.5588, "mean_token_accuracy": 0.8626428246498108, "num_tokens": 20968829.0, "step": 451 }, { "epoch": 5.726114649681529, "grad_norm": 0.6081089973449707, "learning_rate": 1.5497272558654697e-05, "loss": 0.5754, "mean_token_accuracy": 0.8593170344829559, "num_tokens": 21013343.0, "step": 452 }, { "epoch": 5.738853503184713, "grad_norm": 0.6028342843055725, "learning_rate": 1.5181206441105078e-05, "loss": 0.5784, "mean_token_accuracy": 0.8598412871360779, "num_tokens": 21063652.0, "step": 453 }, { "epoch": 5.751592356687898, "grad_norm": 0.5935065746307373, "learning_rate": 1.4868131756111225e-05, "loss": 0.5785, "mean_token_accuracy": 0.858275294303894, "num_tokens": 21110656.0, "step": 454 }, { "epoch": 5.764331210191083, "grad_norm": 0.5879067182540894, "learning_rate": 1.4558059545351143e-05, "loss": 0.5793, "mean_token_accuracy": 0.855660617351532, "num_tokens": 21159702.0, "step": 455 }, { "epoch": 5.777070063694268, "grad_norm": 0.6150187849998474, "learning_rate": 1.4251000744610033e-05, "loss": 0.5673, "mean_token_accuracy": 0.8586822152137756, "num_tokens": 21204767.0, "step": 456 }, { "epoch": 5.789808917197452, "grad_norm": 0.5964578986167908, "learning_rate": 1.394696618339456e-05, "loss": 0.5565, "mean_token_accuracy": 0.8625064194202423, "num_tokens": 21253400.0, "step": 457 }, { "epoch": 5.802547770700637, "grad_norm": 0.5985179543495178, "learning_rate": 1.364596658455105e-05, "loss": 0.5715, "mean_token_accuracy": 0.859099268913269, "num_tokens": 21302541.0, "step": 458 }, { "epoch": 5.8152866242038215, "grad_norm": 0.6097904443740845, "learning_rate": 1.3348012563887102e-05, "loss": 0.527, "mean_token_accuracy": 0.8690455555915833, "num_tokens": 21348200.0, "step": 459 }, { "epoch": 5.828025477707007, "grad_norm": 0.6043243408203125, "learning_rate": 1.3053114629797437e-05, "loss": 0.5621, "mean_token_accuracy": 0.8595924079418182, "num_tokens": 21393364.0, "step": 460 }, { "epoch": 5.840764331210191, "grad_norm": 0.6127822399139404, "learning_rate": 1.2761283182893047e-05, "loss": 0.5672, "mean_token_accuracy": 0.8621090352535248, "num_tokens": 21438173.0, "step": 461 }, { "epoch": 5.853503184713376, "grad_norm": 0.5967704653739929, "learning_rate": 1.2472528515634584e-05, "loss": 0.5442, "mean_token_accuracy": 0.8661996722221375, "num_tokens": 21484340.0, "step": 462 }, { "epoch": 5.86624203821656, "grad_norm": 0.5981035232543945, "learning_rate": 1.218686081196917e-05, "loss": 0.5573, "mean_token_accuracy": 0.8626265227794647, "num_tokens": 21531558.0, "step": 463 }, { "epoch": 5.8789808917197455, "grad_norm": 0.5868001580238342, "learning_rate": 1.1904290146971397e-05, "loss": 0.5759, "mean_token_accuracy": 0.8578618168830872, "num_tokens": 21581138.0, "step": 464 }, { "epoch": 5.89171974522293, "grad_norm": 0.5864095687866211, "learning_rate": 1.1624826486487871e-05, "loss": 0.5718, "mean_token_accuracy": 0.8594149053096771, "num_tokens": 21632418.0, "step": 465 }, { "epoch": 5.904458598726115, "grad_norm": 0.602932870388031, "learning_rate": 1.1348479686785751e-05, "loss": 0.5519, "mean_token_accuracy": 0.8616421222686768, "num_tokens": 21677037.0, "step": 466 }, { "epoch": 5.917197452229299, "grad_norm": 0.6247318983078003, "learning_rate": 1.1075259494205225e-05, "loss": 0.5868, "mean_token_accuracy": 0.8568370342254639, "num_tokens": 21723655.0, "step": 467 }, { "epoch": 5.929936305732484, "grad_norm": 0.6046456098556519, "learning_rate": 1.0805175544815648e-05, "loss": 0.5888, "mean_token_accuracy": 0.8549422025680542, "num_tokens": 21771636.0, "step": 468 }, { "epoch": 5.942675159235669, "grad_norm": 0.599376916885376, "learning_rate": 1.0538237364075787e-05, "loss": 0.5746, "mean_token_accuracy": 0.8595117330551147, "num_tokens": 21818294.0, "step": 469 }, { "epoch": 5.955414012738854, "grad_norm": 0.5762757658958435, "learning_rate": 1.0274454366497787e-05, "loss": 0.5758, "mean_token_accuracy": 0.8589733839035034, "num_tokens": 21865302.0, "step": 470 }, { "epoch": 5.968152866242038, "grad_norm": 0.6216184496879578, "learning_rate": 1.0013835855315235e-05, "loss": 0.5862, "mean_token_accuracy": 0.857296347618103, "num_tokens": 21912717.0, "step": 471 }, { "epoch": 5.980891719745223, "grad_norm": 0.6174598932266235, "learning_rate": 9.756391022154954e-06, "loss": 0.5497, "mean_token_accuracy": 0.8617016673088074, "num_tokens": 21956909.0, "step": 472 }, { "epoch": 5.993630573248407, "grad_norm": 0.5991003513336182, "learning_rate": 9.502128946712862e-06, "loss": 0.5824, "mean_token_accuracy": 0.8596709668636322, "num_tokens": 22004284.0, "step": 473 }, { "epoch": 6.0, "grad_norm": 0.874085545539856, "learning_rate": 9.251058596433793e-06, "loss": 0.4975, "mean_token_accuracy": 0.880401074886322, "num_tokens": 22026256.0, "step": 474 }, { "epoch": 6.012738853503185, "grad_norm": 0.5285953283309937, "learning_rate": 9.003188826195142e-06, "loss": 0.5064, "mean_token_accuracy": 0.8789235949516296, "num_tokens": 22073817.0, "step": 475 }, { "epoch": 6.025477707006369, "grad_norm": 0.5319235324859619, "learning_rate": 8.758528377994667e-06, "loss": 0.4917, "mean_token_accuracy": 0.883221447467804, "num_tokens": 22120864.0, "step": 476 }, { "epoch": 6.038216560509555, "grad_norm": 0.5413665771484375, "learning_rate": 8.517085880642062e-06, "loss": 0.4614, "mean_token_accuracy": 0.8908380270004272, "num_tokens": 22165690.0, "step": 477 }, { "epoch": 6.050955414012739, "grad_norm": 0.5396758913993835, "learning_rate": 8.278869849454718e-06, "loss": 0.4728, "mean_token_accuracy": 0.8866445422172546, "num_tokens": 22211467.0, "step": 478 }, { "epoch": 6.063694267515924, "grad_norm": 0.5413012504577637, "learning_rate": 8.043888685957313e-06, "loss": 0.4671, "mean_token_accuracy": 0.8871977031230927, "num_tokens": 22256869.0, "step": 479 }, { "epoch": 6.076433121019108, "grad_norm": 0.5447385907173157, "learning_rate": 7.812150677585673e-06, "loss": 0.4709, "mean_token_accuracy": 0.8885963261127472, "num_tokens": 22304712.0, "step": 480 }, { "epoch": 6.089171974522293, "grad_norm": 0.5395948886871338, "learning_rate": 7.583663997394241e-06, "loss": 0.4656, "mean_token_accuracy": 0.8892465233802795, "num_tokens": 22353292.0, "step": 481 }, { "epoch": 6.101910828025478, "grad_norm": 0.5652547478675842, "learning_rate": 7.358436703768035e-06, "loss": 0.4539, "mean_token_accuracy": 0.8909508585929871, "num_tokens": 22401089.0, "step": 482 }, { "epoch": 6.114649681528663, "grad_norm": 0.5841154456138611, "learning_rate": 7.136476740138387e-06, "loss": 0.4564, "mean_token_accuracy": 0.8898600935935974, "num_tokens": 22447040.0, "step": 483 }, { "epoch": 6.127388535031847, "grad_norm": 0.5878347754478455, "learning_rate": 6.917791934702655e-06, "loss": 0.4596, "mean_token_accuracy": 0.8882217407226562, "num_tokens": 22494482.0, "step": 484 }, { "epoch": 6.140127388535032, "grad_norm": 0.5902244448661804, "learning_rate": 6.702390000148351e-06, "loss": 0.4571, "mean_token_accuracy": 0.8898824751377106, "num_tokens": 22539295.0, "step": 485 }, { "epoch": 6.1528662420382165, "grad_norm": 0.6030483245849609, "learning_rate": 6.490278533380956e-06, "loss": 0.4868, "mean_token_accuracy": 0.8809216916561127, "num_tokens": 22588300.0, "step": 486 }, { "epoch": 6.165605095541402, "grad_norm": 0.5984454154968262, "learning_rate": 6.281465015256094e-06, "loss": 0.4656, "mean_token_accuracy": 0.8885324001312256, "num_tokens": 22636028.0, "step": 487 }, { "epoch": 6.178343949044586, "grad_norm": 0.6295449137687683, "learning_rate": 6.0759568103156195e-06, "loss": 0.4845, "mean_token_accuracy": 0.8819713294506073, "num_tokens": 22684018.0, "step": 488 }, { "epoch": 6.191082802547771, "grad_norm": 0.6019818186759949, "learning_rate": 5.873761166527936e-06, "loss": 0.4505, "mean_token_accuracy": 0.8912405371665955, "num_tokens": 22730357.0, "step": 489 }, { "epoch": 6.203821656050955, "grad_norm": 0.6028389930725098, "learning_rate": 5.674885215032322e-06, "loss": 0.461, "mean_token_accuracy": 0.8886306285858154, "num_tokens": 22778899.0, "step": 490 }, { "epoch": 6.2165605095541405, "grad_norm": 0.6356772184371948, "learning_rate": 5.479335969887467e-06, "loss": 0.4548, "mean_token_accuracy": 0.8894259035587311, "num_tokens": 22824833.0, "step": 491 }, { "epoch": 6.229299363057325, "grad_norm": 0.6403616070747375, "learning_rate": 5.287120327824091e-06, "loss": 0.474, "mean_token_accuracy": 0.8855110108852386, "num_tokens": 22871101.0, "step": 492 }, { "epoch": 6.24203821656051, "grad_norm": 0.5932328701019287, "learning_rate": 5.098245068001661e-06, "loss": 0.4678, "mean_token_accuracy": 0.8874426782131195, "num_tokens": 22920768.0, "step": 493 }, { "epoch": 6.254777070063694, "grad_norm": 0.612916111946106, "learning_rate": 4.9127168517693946e-06, "loss": 0.4428, "mean_token_accuracy": 0.8922592103481293, "num_tokens": 22964967.0, "step": 494 }, { "epoch": 6.267515923566879, "grad_norm": 0.6020427346229553, "learning_rate": 4.730542222431223e-06, "loss": 0.4383, "mean_token_accuracy": 0.8952569663524628, "num_tokens": 23009889.0, "step": 495 }, { "epoch": 6.280254777070064, "grad_norm": 0.596607506275177, "learning_rate": 4.551727605015032e-06, "loss": 0.4449, "mean_token_accuracy": 0.8933581709861755, "num_tokens": 23056164.0, "step": 496 }, { "epoch": 6.292993630573249, "grad_norm": 0.61225825548172, "learning_rate": 4.376279306046183e-06, "loss": 0.4782, "mean_token_accuracy": 0.8831726312637329, "num_tokens": 23101966.0, "step": 497 }, { "epoch": 6.305732484076433, "grad_norm": 0.6055213809013367, "learning_rate": 4.2042035133248895e-06, "loss": 0.465, "mean_token_accuracy": 0.88702791929245, "num_tokens": 23150516.0, "step": 498 }, { "epoch": 6.318471337579618, "grad_norm": 0.5911315083503723, "learning_rate": 4.035506295708191e-06, "loss": 0.4496, "mean_token_accuracy": 0.8899335861206055, "num_tokens": 23197593.0, "step": 499 }, { "epoch": 6.3312101910828025, "grad_norm": 0.6018553972244263, "learning_rate": 3.870193602895733e-06, "loss": 0.4539, "mean_token_accuracy": 0.8879165351390839, "num_tokens": 23242618.0, "step": 500 }, { "epoch": 6.343949044585988, "grad_norm": 0.5925772190093994, "learning_rate": 3.7082712652200867e-06, "loss": 0.4408, "mean_token_accuracy": 0.8935061991214752, "num_tokens": 23286589.0, "step": 501 }, { "epoch": 6.356687898089172, "grad_norm": 0.5770175457000732, "learning_rate": 3.54974499344094e-06, "loss": 0.4548, "mean_token_accuracy": 0.8910494446754456, "num_tokens": 23333149.0, "step": 502 }, { "epoch": 6.369426751592357, "grad_norm": 0.5860756039619446, "learning_rate": 3.3946203785439113e-06, "loss": 0.4697, "mean_token_accuracy": 0.8873529136180878, "num_tokens": 23380362.0, "step": 503 }, { "epoch": 6.382165605095541, "grad_norm": 0.5788154006004333, "learning_rate": 3.2429028915431534e-06, "loss": 0.4474, "mean_token_accuracy": 0.8910690546035767, "num_tokens": 23427020.0, "step": 504 }, { "epoch": 6.3949044585987265, "grad_norm": 0.575828492641449, "learning_rate": 3.094597883288575e-06, "loss": 0.4873, "mean_token_accuracy": 0.8848420679569244, "num_tokens": 23476005.0, "step": 505 }, { "epoch": 6.407643312101911, "grad_norm": 0.5773833394050598, "learning_rate": 2.9497105842769435e-06, "loss": 0.4369, "mean_token_accuracy": 0.8952364027500153, "num_tokens": 23522481.0, "step": 506 }, { "epoch": 6.420382165605096, "grad_norm": 0.591640055179596, "learning_rate": 2.808246104467582e-06, "loss": 0.4667, "mean_token_accuracy": 0.8868449926376343, "num_tokens": 23568307.0, "step": 507 }, { "epoch": 6.43312101910828, "grad_norm": 0.586330771446228, "learning_rate": 2.6702094331020887e-06, "loss": 0.4723, "mean_token_accuracy": 0.8849689066410065, "num_tokens": 23616018.0, "step": 508 }, { "epoch": 6.445859872611465, "grad_norm": 0.5872050523757935, "learning_rate": 2.5356054385282766e-06, "loss": 0.4767, "mean_token_accuracy": 0.8855108022689819, "num_tokens": 23662705.0, "step": 509 }, { "epoch": 6.45859872611465, "grad_norm": 0.5915942192077637, "learning_rate": 2.404438868028658e-06, "loss": 0.443, "mean_token_accuracy": 0.8939434885978699, "num_tokens": 23708614.0, "step": 510 }, { "epoch": 6.471337579617835, "grad_norm": 0.5772258639335632, "learning_rate": 2.276714347652831e-06, "loss": 0.4535, "mean_token_accuracy": 0.8918261229991913, "num_tokens": 23755220.0, "step": 511 }, { "epoch": 6.484076433121019, "grad_norm": 0.602470874786377, "learning_rate": 2.152436382054479e-06, "loss": 0.4976, "mean_token_accuracy": 0.8814437389373779, "num_tokens": 23801965.0, "step": 512 }, { "epoch": 6.496815286624204, "grad_norm": 0.5672124624252319, "learning_rate": 2.0316093543323757e-06, "loss": 0.4792, "mean_token_accuracy": 0.8845764100551605, "num_tokens": 23850903.0, "step": 513 }, { "epoch": 6.509554140127388, "grad_norm": 0.570857584476471, "learning_rate": 1.914237525875917e-06, "loss": 0.4576, "mean_token_accuracy": 0.8894221186637878, "num_tokens": 23898377.0, "step": 514 }, { "epoch": 6.522292993630574, "grad_norm": 0.5888267755508423, "learning_rate": 1.8003250362147005e-06, "loss": 0.462, "mean_token_accuracy": 0.8884663283824921, "num_tokens": 23945604.0, "step": 515 }, { "epoch": 6.535031847133758, "grad_norm": 0.593219518661499, "learning_rate": 1.6898759028726285e-06, "loss": 0.5017, "mean_token_accuracy": 0.8780794739723206, "num_tokens": 23993458.0, "step": 516 }, { "epoch": 6.547770700636943, "grad_norm": 0.5750519037246704, "learning_rate": 1.5828940212261889e-06, "loss": 0.472, "mean_token_accuracy": 0.8875796794891357, "num_tokens": 24040106.0, "step": 517 }, { "epoch": 6.560509554140127, "grad_norm": 0.5601825714111328, "learning_rate": 1.479383164367043e-06, "loss": 0.4602, "mean_token_accuracy": 0.8908886611461639, "num_tokens": 24087994.0, "step": 518 }, { "epoch": 6.573248407643312, "grad_norm": 0.5909698009490967, "learning_rate": 1.3793469829689987e-06, "loss": 0.4625, "mean_token_accuracy": 0.8879349529743195, "num_tokens": 24134642.0, "step": 519 }, { "epoch": 6.585987261146497, "grad_norm": 0.5777092576026917, "learning_rate": 1.2827890051592128e-06, "loss": 0.46, "mean_token_accuracy": 0.8871607184410095, "num_tokens": 24182448.0, "step": 520 }, { "epoch": 6.598726114649682, "grad_norm": 0.6093650460243225, "learning_rate": 1.1897126363937804e-06, "loss": 0.4713, "mean_token_accuracy": 0.8866488337516785, "num_tokens": 24226243.0, "step": 521 }, { "epoch": 6.611464968152866, "grad_norm": 0.5591498613357544, "learning_rate": 1.1001211593376526e-06, "loss": 0.4614, "mean_token_accuracy": 0.8907770216464996, "num_tokens": 24275531.0, "step": 522 }, { "epoch": 6.624203821656051, "grad_norm": 0.5817198753356934, "learning_rate": 1.0140177337488288e-06, "loss": 0.4749, "mean_token_accuracy": 0.8850551843643188, "num_tokens": 24323213.0, "step": 523 }, { "epoch": 6.6369426751592355, "grad_norm": 0.5963823199272156, "learning_rate": 9.314053963669245e-07, "loss": 0.4544, "mean_token_accuracy": 0.8898647129535675, "num_tokens": 24369413.0, "step": 524 }, { "epoch": 6.649681528662421, "grad_norm": 0.6051519513130188, "learning_rate": 8.522870608060563e-07, "loss": 0.4643, "mean_token_accuracy": 0.8886588215827942, "num_tokens": 24413967.0, "step": 525 }, { "epoch": 6.662420382165605, "grad_norm": 0.5751470923423767, "learning_rate": 7.766655174521465e-07, "loss": 0.4711, "mean_token_accuracy": 0.8882945775985718, "num_tokens": 24462445.0, "step": 526 }, { "epoch": 6.67515923566879, "grad_norm": 0.5853144526481628, "learning_rate": 7.045434333643797e-07, "loss": 0.4558, "mean_token_accuracy": 0.8899858295917511, "num_tokens": 24509589.0, "step": 527 }, { "epoch": 6.687898089171974, "grad_norm": 0.5752429366111755, "learning_rate": 6.359233521813224e-07, "loss": 0.4638, "mean_token_accuracy": 0.8884373903274536, "num_tokens": 24556095.0, "step": 528 }, { "epoch": 6.7006369426751595, "grad_norm": 0.5856727957725525, "learning_rate": 5.70807694031028e-07, "loss": 0.4818, "mean_token_accuracy": 0.8827240765094757, "num_tokens": 24604994.0, "step": 529 }, { "epoch": 6.713375796178344, "grad_norm": 0.588467001914978, "learning_rate": 5.091987554458388e-07, "loss": 0.4655, "mean_token_accuracy": 0.8869950175285339, "num_tokens": 24651020.0, "step": 530 }, { "epoch": 6.726114649681529, "grad_norm": 0.5824346542358398, "learning_rate": 4.510987092812502e-07, "loss": 0.4726, "mean_token_accuracy": 0.8863205313682556, "num_tokens": 24697824.0, "step": 531 }, { "epoch": 6.738853503184713, "grad_norm": 0.5869485139846802, "learning_rate": 3.965096046394057e-07, "loss": 0.4656, "mean_token_accuracy": 0.8880146145820618, "num_tokens": 24745058.0, "step": 532 }, { "epoch": 6.751592356687898, "grad_norm": 0.5894216299057007, "learning_rate": 3.4543336679673245e-07, "loss": 0.473, "mean_token_accuracy": 0.8840719163417816, "num_tokens": 24792886.0, "step": 533 }, { "epoch": 6.764331210191083, "grad_norm": 0.5966050624847412, "learning_rate": 2.978717971360956e-07, "loss": 0.467, "mean_token_accuracy": 0.8892892599105835, "num_tokens": 24839223.0, "step": 534 }, { "epoch": 6.777070063694268, "grad_norm": 0.5877535343170166, "learning_rate": 2.5382657308322676e-07, "loss": 0.4686, "mean_token_accuracy": 0.8878327012062073, "num_tokens": 24886155.0, "step": 535 }, { "epoch": 6.789808917197452, "grad_norm": 0.5607234239578247, "learning_rate": 2.1329924804760482e-07, "loss": 0.462, "mean_token_accuracy": 0.8899067938327789, "num_tokens": 24935615.0, "step": 536 }, { "epoch": 6.802547770700637, "grad_norm": 0.5836446285247803, "learning_rate": 1.7629125136764402e-07, "loss": 0.4877, "mean_token_accuracy": 0.8824087679386139, "num_tokens": 24982352.0, "step": 537 }, { "epoch": 6.8152866242038215, "grad_norm": 0.5934491157531738, "learning_rate": 1.4280388826026782e-07, "loss": 0.4424, "mean_token_accuracy": 0.8934253454208374, "num_tokens": 25026903.0, "step": 538 }, { "epoch": 6.828025477707007, "grad_norm": 0.5779575109481812, "learning_rate": 1.128383397749233e-07, "loss": 0.4827, "mean_token_accuracy": 0.8874645829200745, "num_tokens": 25074252.0, "step": 539 }, { "epoch": 6.840764331210191, "grad_norm": 0.5870651006698608, "learning_rate": 8.639566275189248e-08, "loss": 0.4493, "mean_token_accuracy": 0.8932221829891205, "num_tokens": 25119706.0, "step": 540 }, { "epoch": 6.853503184713376, "grad_norm": 0.5863420367240906, "learning_rate": 6.347678978501082e-08, "loss": 0.4654, "mean_token_accuracy": 0.8872964382171631, "num_tokens": 25165377.0, "step": 541 }, { "epoch": 6.86624203821656, "grad_norm": 0.5763266086578369, "learning_rate": 4.408252918880473e-08, "loss": 0.4521, "mean_token_accuracy": 0.8921694755554199, "num_tokens": 25211636.0, "step": 542 }, { "epoch": 6.8789808917197455, "grad_norm": 0.5784059166908264, "learning_rate": 2.8213564969969963e-08, "loss": 0.4738, "mean_token_accuracy": 0.8872754871845245, "num_tokens": 25258903.0, "step": 543 }, { "epoch": 6.89171974522293, "grad_norm": 0.5755369067192078, "learning_rate": 1.5870456803246392e-08, "loss": 0.4225, "mean_token_accuracy": 0.8984050452709198, "num_tokens": 25302553.0, "step": 544 }, { "epoch": 6.904458598726115, "grad_norm": 0.5839601159095764, "learning_rate": 7.053640011678297e-09, "loss": 0.445, "mean_token_accuracy": 0.8928711414337158, "num_tokens": 25348281.0, "step": 545 }, { "epoch": 6.917197452229299, "grad_norm": 0.6116732954978943, "learning_rate": 1.7634255512710695e-09, "loss": 0.4755, "mean_token_accuracy": 0.8853686451911926, "num_tokens": 25393401.0, "step": 546 }, { "epoch": 6.917197452229299, "step": 546, "total_flos": 1.6111370622520525e+18, "train_loss": 1.0811113911124812, "train_runtime": 3374.9045, "train_samples_per_second": 10.371, "train_steps_per_second": 0.162 } ], "logging_steps": 1.0, "max_steps": 546, "num_input_tokens_seen": 0, "num_train_epochs": 7, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.6111370622520525e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }