| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 6.917197452229299, |
| "eval_steps": 500, |
| "global_step": 546, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 2.043114423751831, |
| "learning_rate": 0.0, |
| "loss": 2.5378, |
| "mean_token_accuracy": 0.5474915206432343, |
| "num_tokens": 45860.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 1.9945865869522095, |
| "learning_rate": 1.1764705882352942e-05, |
| "loss": 2.471, |
| "mean_token_accuracy": 0.5548032820224762, |
| "num_tokens": 91607.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 1.7864609956741333, |
| "learning_rate": 2.3529411764705884e-05, |
| "loss": 2.4891, |
| "mean_token_accuracy": 0.554142564535141, |
| "num_tokens": 138803.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 1.7019070386886597, |
| "learning_rate": 3.529411764705883e-05, |
| "loss": 2.4532, |
| "mean_token_accuracy": 0.5522601306438446, |
| "num_tokens": 185711.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 1.558175802230835, |
| "learning_rate": 4.705882352941177e-05, |
| "loss": 2.3084, |
| "mean_token_accuracy": 0.5643967390060425, |
| "num_tokens": 229326.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 1.3139784336090088, |
| "learning_rate": 5.882352941176471e-05, |
| "loss": 2.1893, |
| "mean_token_accuracy": 0.5716671049594879, |
| "num_tokens": 273139.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 0.9440768361091614, |
| "learning_rate": 7.058823529411765e-05, |
| "loss": 2.0658, |
| "mean_token_accuracy": 0.5783773064613342, |
| "num_tokens": 320421.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 0.575385332107544, |
| "learning_rate": 8.23529411764706e-05, |
| "loss": 1.9971, |
| "mean_token_accuracy": 0.5801331400871277, |
| "num_tokens": 368788.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 0.9466742277145386, |
| "learning_rate": 9.411764705882353e-05, |
| "loss": 1.9893, |
| "mean_token_accuracy": 0.5827493369579315, |
| "num_tokens": 415189.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 1.1029582023620605, |
| "learning_rate": 0.00010588235294117647, |
| "loss": 1.8928, |
| "mean_token_accuracy": 0.5970898270606995, |
| "num_tokens": 458774.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 0.8789502382278442, |
| "learning_rate": 0.00011764705882352942, |
| "loss": 1.9116, |
| "mean_token_accuracy": 0.5919365584850311, |
| "num_tokens": 504300.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 0.6089919805526733, |
| "learning_rate": 0.00012941176470588237, |
| "loss": 1.8636, |
| "mean_token_accuracy": 0.5960094928741455, |
| "num_tokens": 550239.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 0.567487895488739, |
| "learning_rate": 0.0001411764705882353, |
| "loss": 1.849, |
| "mean_token_accuracy": 0.5990146100521088, |
| "num_tokens": 595311.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 0.45083943009376526, |
| "learning_rate": 0.00015294117647058822, |
| "loss": 1.8572, |
| "mean_token_accuracy": 0.5998204350471497, |
| "num_tokens": 643731.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.3835723102092743, |
| "learning_rate": 0.0001647058823529412, |
| "loss": 1.8459, |
| "mean_token_accuracy": 0.6031338572502136, |
| "num_tokens": 687946.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.3622026741504669, |
| "learning_rate": 0.00017647058823529413, |
| "loss": 1.8221, |
| "mean_token_accuracy": 0.6063935160636902, |
| "num_tokens": 733740.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 0.3480350971221924, |
| "learning_rate": 0.00018823529411764707, |
| "loss": 1.8353, |
| "mean_token_accuracy": 0.6034441590309143, |
| "num_tokens": 780185.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.4176861047744751, |
| "learning_rate": 0.0002, |
| "loss": 1.8174, |
| "mean_token_accuracy": 0.6044492721557617, |
| "num_tokens": 827533.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 0.5879961848258972, |
| "learning_rate": 0.00019999823657444873, |
| "loss": 1.8099, |
| "mean_token_accuracy": 0.6073833703994751, |
| "num_tokens": 873543.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.5145211815834045, |
| "learning_rate": 0.00019999294635998833, |
| "loss": 1.8359, |
| "mean_token_accuracy": 0.5988730490207672, |
| "num_tokens": 923210.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.4540589153766632, |
| "learning_rate": 0.00019998412954319675, |
| "loss": 1.7355, |
| "mean_token_accuracy": 0.618651270866394, |
| "num_tokens": 969460.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.3647150993347168, |
| "learning_rate": 0.00019997178643503004, |
| "loss": 1.7658, |
| "mean_token_accuracy": 0.6132998466491699, |
| "num_tokens": 1014215.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.2961389720439911, |
| "learning_rate": 0.00019995591747081122, |
| "loss": 1.7635, |
| "mean_token_accuracy": 0.6134656071662903, |
| "num_tokens": 1061587.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.3173348605632782, |
| "learning_rate": 0.000199936523210215, |
| "loss": 1.8054, |
| "mean_token_accuracy": 0.6050374209880829, |
| "num_tokens": 1108746.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.32570838928222656, |
| "learning_rate": 0.00019991360433724813, |
| "loss": 1.7147, |
| "mean_token_accuracy": 0.623350203037262, |
| "num_tokens": 1150650.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.31610530614852905, |
| "learning_rate": 0.0001998871616602251, |
| "loss": 1.8334, |
| "mean_token_accuracy": 0.6021896600723267, |
| "num_tokens": 1198478.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.2649655044078827, |
| "learning_rate": 0.00019985719611173973, |
| "loss": 1.791, |
| "mean_token_accuracy": 0.6080193221569061, |
| "num_tokens": 1248602.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.27781757712364197, |
| "learning_rate": 0.00019982370874863236, |
| "loss": 1.7948, |
| "mean_token_accuracy": 0.6063768863677979, |
| "num_tokens": 1298225.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.35199975967407227, |
| "learning_rate": 0.0001997867007519524, |
| "loss": 1.7029, |
| "mean_token_accuracy": 0.6229945421218872, |
| "num_tokens": 1346783.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.3464992940425873, |
| "learning_rate": 0.00019974617342691678, |
| "loss": 1.7706, |
| "mean_token_accuracy": 0.6096044778823853, |
| "num_tokens": 1394151.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.3475406765937805, |
| "learning_rate": 0.00019970212820286394, |
| "loss": 1.755, |
| "mean_token_accuracy": 0.6146330833435059, |
| "num_tokens": 1440818.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.30509206652641296, |
| "learning_rate": 0.00019965456663320329, |
| "loss": 1.7632, |
| "mean_token_accuracy": 0.611842930316925, |
| "num_tokens": 1486970.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.2553170621395111, |
| "learning_rate": 0.00019960349039536062, |
| "loss": 1.7521, |
| "mean_token_accuracy": 0.6150202453136444, |
| "num_tokens": 1535132.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.2561066746711731, |
| "learning_rate": 0.00019954890129071876, |
| "loss": 1.7303, |
| "mean_token_accuracy": 0.6202265918254852, |
| "num_tokens": 1581310.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.2694303095340729, |
| "learning_rate": 0.00019949080124455416, |
| "loss": 1.7332, |
| "mean_token_accuracy": 0.6190694272518158, |
| "num_tokens": 1626838.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.2607475221157074, |
| "learning_rate": 0.00019942919230596896, |
| "loss": 1.7573, |
| "mean_token_accuracy": 0.6160352826118469, |
| "num_tokens": 1674100.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.2403094321489334, |
| "learning_rate": 0.00019936407664781868, |
| "loss": 1.7641, |
| "mean_token_accuracy": 0.6089144349098206, |
| "num_tokens": 1722819.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.24304397404193878, |
| "learning_rate": 0.00019929545656663562, |
| "loss": 1.6962, |
| "mean_token_accuracy": 0.6224367320537567, |
| "num_tokens": 1770008.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.26098185777664185, |
| "learning_rate": 0.00019922333448254786, |
| "loss": 1.7512, |
| "mean_token_accuracy": 0.6127793490886688, |
| "num_tokens": 1815094.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.24065393209457397, |
| "learning_rate": 0.00019914771293919395, |
| "loss": 1.7413, |
| "mean_token_accuracy": 0.6163510084152222, |
| "num_tokens": 1865027.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.25826820731163025, |
| "learning_rate": 0.00019906859460363307, |
| "loss": 1.7384, |
| "mean_token_accuracy": 0.6187842190265656, |
| "num_tokens": 1911967.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.23422813415527344, |
| "learning_rate": 0.00019898598226625119, |
| "loss": 1.7723, |
| "mean_token_accuracy": 0.6120906472206116, |
| "num_tokens": 1963100.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.24756181240081787, |
| "learning_rate": 0.00019889987884066237, |
| "loss": 1.711, |
| "mean_token_accuracy": 0.620893269777298, |
| "num_tokens": 2010768.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.24499212205410004, |
| "learning_rate": 0.00019881028736360622, |
| "loss": 1.7597, |
| "mean_token_accuracy": 0.6143153309822083, |
| "num_tokens": 2059303.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.2653355896472931, |
| "learning_rate": 0.0001987172109948408, |
| "loss": 1.7588, |
| "mean_token_accuracy": 0.6123422980308533, |
| "num_tokens": 2103829.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.24230645596981049, |
| "learning_rate": 0.000198620653017031, |
| "loss": 1.7607, |
| "mean_token_accuracy": 0.6133730709552765, |
| "num_tokens": 2150558.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.23600345849990845, |
| "learning_rate": 0.00019852061683563296, |
| "loss": 1.7588, |
| "mean_token_accuracy": 0.6099536418914795, |
| "num_tokens": 2201253.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.25009065866470337, |
| "learning_rate": 0.00019841710597877382, |
| "loss": 1.7485, |
| "mean_token_accuracy": 0.6158089637756348, |
| "num_tokens": 2247382.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.24068281054496765, |
| "learning_rate": 0.00019831012409712737, |
| "loss": 1.7542, |
| "mean_token_accuracy": 0.6143946349620819, |
| "num_tokens": 2295707.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.28074583411216736, |
| "learning_rate": 0.0001981996749637853, |
| "loss": 1.7122, |
| "mean_token_accuracy": 0.6212862432003021, |
| "num_tokens": 2340697.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.27374881505966187, |
| "learning_rate": 0.0001980857624741241, |
| "loss": 1.7265, |
| "mean_token_accuracy": 0.6174845993518829, |
| "num_tokens": 2382717.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.31332576274871826, |
| "learning_rate": 0.00019796839064566761, |
| "loss": 1.7109, |
| "mean_token_accuracy": 0.6214545965194702, |
| "num_tokens": 2430219.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.2618464529514313, |
| "learning_rate": 0.00019784756361794555, |
| "loss": 1.6771, |
| "mean_token_accuracy": 0.6261600852012634, |
| "num_tokens": 2473766.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.25994718074798584, |
| "learning_rate": 0.00019772328565234717, |
| "loss": 1.7405, |
| "mean_token_accuracy": 0.6188207268714905, |
| "num_tokens": 2521674.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.2400660216808319, |
| "learning_rate": 0.00019759556113197135, |
| "loss": 1.7576, |
| "mean_token_accuracy": 0.6164006292819977, |
| "num_tokens": 2570612.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.2474898248910904, |
| "learning_rate": 0.00019746439456147172, |
| "loss": 1.6913, |
| "mean_token_accuracy": 0.62461718916893, |
| "num_tokens": 2620095.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.2517346739768982, |
| "learning_rate": 0.00019732979056689794, |
| "loss": 1.7715, |
| "mean_token_accuracy": 0.6078113615512848, |
| "num_tokens": 2665785.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.2567152678966522, |
| "learning_rate": 0.00019719175389553242, |
| "loss": 1.7105, |
| "mean_token_accuracy": 0.618989884853363, |
| "num_tokens": 2712064.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.24779221415519714, |
| "learning_rate": 0.00019705028941572307, |
| "loss": 1.6769, |
| "mean_token_accuracy": 0.6255393028259277, |
| "num_tokens": 2760026.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.2563987076282501, |
| "learning_rate": 0.00019690540211671144, |
| "loss": 1.7543, |
| "mean_token_accuracy": 0.6144331991672516, |
| "num_tokens": 2806166.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.2323083132505417, |
| "learning_rate": 0.00019675709710845687, |
| "loss": 1.6956, |
| "mean_token_accuracy": 0.6225294470787048, |
| "num_tokens": 2855572.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.25542232394218445, |
| "learning_rate": 0.0001966053796214561, |
| "loss": 1.6927, |
| "mean_token_accuracy": 0.6235709488391876, |
| "num_tokens": 2900646.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.24087095260620117, |
| "learning_rate": 0.00019645025500655906, |
| "loss": 1.6741, |
| "mean_token_accuracy": 0.6269287467002869, |
| "num_tokens": 2948656.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.24608315527439117, |
| "learning_rate": 0.00019629172873477995, |
| "loss": 1.7044, |
| "mean_token_accuracy": 0.6225975453853607, |
| "num_tokens": 2992709.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.23874063789844513, |
| "learning_rate": 0.00019612980639710428, |
| "loss": 1.6635, |
| "mean_token_accuracy": 0.6289187669754028, |
| "num_tokens": 3038992.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.24603189527988434, |
| "learning_rate": 0.00019596449370429183, |
| "loss": 1.7611, |
| "mean_token_accuracy": 0.6126619875431061, |
| "num_tokens": 3085558.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.24913907051086426, |
| "learning_rate": 0.0001957957964866751, |
| "loss": 1.7081, |
| "mean_token_accuracy": 0.6217869222164154, |
| "num_tokens": 3130170.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.23950885236263275, |
| "learning_rate": 0.00019562372069395384, |
| "loss": 1.6835, |
| "mean_token_accuracy": 0.6236407458782196, |
| "num_tokens": 3176311.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.2457829862833023, |
| "learning_rate": 0.000195448272394985, |
| "loss": 1.7195, |
| "mean_token_accuracy": 0.6203426420688629, |
| "num_tokens": 3222875.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.25021523237228394, |
| "learning_rate": 0.00019526945777756879, |
| "loss": 1.7121, |
| "mean_token_accuracy": 0.6217123568058014, |
| "num_tokens": 3271109.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.24255377054214478, |
| "learning_rate": 0.00019508728314823062, |
| "loss": 1.6671, |
| "mean_token_accuracy": 0.6281636953353882, |
| "num_tokens": 3317571.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.2552671432495117, |
| "learning_rate": 0.00019490175493199833, |
| "loss": 1.6851, |
| "mean_token_accuracy": 0.6248765289783478, |
| "num_tokens": 3362493.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.24611078202724457, |
| "learning_rate": 0.00019471287967217594, |
| "loss": 1.6799, |
| "mean_token_accuracy": 0.6217860579490662, |
| "num_tokens": 3412450.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.24427291750907898, |
| "learning_rate": 0.00019452066403011253, |
| "loss": 1.6789, |
| "mean_token_accuracy": 0.6255021095275879, |
| "num_tokens": 3458150.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.241206556558609, |
| "learning_rate": 0.00019432511478496768, |
| "loss": 1.6791, |
| "mean_token_accuracy": 0.6238900423049927, |
| "num_tokens": 3503285.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.24642199277877808, |
| "learning_rate": 0.00019412623883347207, |
| "loss": 1.7196, |
| "mean_token_accuracy": 0.6168418824672699, |
| "num_tokens": 3550258.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.24044229090213776, |
| "learning_rate": 0.0001939240431896844, |
| "loss": 1.693, |
| "mean_token_accuracy": 0.6247681081295013, |
| "num_tokens": 3600054.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.24420927464962006, |
| "learning_rate": 0.0001937185349847439, |
| "loss": 1.7288, |
| "mean_token_accuracy": 0.6197748780250549, |
| "num_tokens": 3646563.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.24420927464962006, |
| "learning_rate": 0.00019350972146661905, |
| "loss": 1.7554, |
| "mean_token_accuracy": 0.613867998123169, |
| "num_tokens": 3670636.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.40740540623664856, |
| "learning_rate": 0.00019329760999985167, |
| "loss": 1.5665, |
| "mean_token_accuracy": 0.6492078900337219, |
| "num_tokens": 3716041.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.27306127548217773, |
| "learning_rate": 0.00019308220806529738, |
| "loss": 1.5736, |
| "mean_token_accuracy": 0.6449616551399231, |
| "num_tokens": 3760896.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.23415158689022064, |
| "learning_rate": 0.00019286352325986164, |
| "loss": 1.5251, |
| "mean_token_accuracy": 0.6536181569099426, |
| "num_tokens": 3807785.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.2526198923587799, |
| "learning_rate": 0.00019264156329623197, |
| "loss": 1.5906, |
| "mean_token_accuracy": 0.6404092907905579, |
| "num_tokens": 3854182.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.25573909282684326, |
| "learning_rate": 0.00019241633600260578, |
| "loss": 1.5242, |
| "mean_token_accuracy": 0.6552860736846924, |
| "num_tokens": 3899185.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.26194682717323303, |
| "learning_rate": 0.00019218784932241434, |
| "loss": 1.6092, |
| "mean_token_accuracy": 0.6397114098072052, |
| "num_tokens": 3945474.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.26084014773368835, |
| "learning_rate": 0.0001919561113140427, |
| "loss": 1.5654, |
| "mean_token_accuracy": 0.6496731340885162, |
| "num_tokens": 3993818.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.25661009550094604, |
| "learning_rate": 0.00019172113015054532, |
| "loss": 1.5956, |
| "mean_token_accuracy": 0.6394364237785339, |
| "num_tokens": 4043789.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.26299285888671875, |
| "learning_rate": 0.00019148291411935796, |
| "loss": 1.5534, |
| "mean_token_accuracy": 0.648574948310852, |
| "num_tokens": 4092145.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.2560042440891266, |
| "learning_rate": 0.00019124147162200535, |
| "loss": 1.5341, |
| "mean_token_accuracy": 0.6515755355358124, |
| "num_tokens": 4136793.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.250197172164917, |
| "learning_rate": 0.00019099681117380486, |
| "loss": 1.5691, |
| "mean_token_accuracy": 0.6437222361564636, |
| "num_tokens": 4186081.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.2830899655818939, |
| "learning_rate": 0.00019074894140356624, |
| "loss": 1.5533, |
| "mean_token_accuracy": 0.6474398970603943, |
| "num_tokens": 4230818.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.2672581672668457, |
| "learning_rate": 0.00019049787105328715, |
| "loss": 1.5768, |
| "mean_token_accuracy": 0.6421504616737366, |
| "num_tokens": 4280136.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.27740785479545593, |
| "learning_rate": 0.00019024360897784508, |
| "loss": 1.5441, |
| "mean_token_accuracy": 0.6503708958625793, |
| "num_tokens": 4325269.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.2790956497192383, |
| "learning_rate": 0.00018998616414468478, |
| "loss": 1.5136, |
| "mean_token_accuracy": 0.6548562347888947, |
| "num_tokens": 4371962.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.25887349247932434, |
| "learning_rate": 0.0001897255456335022, |
| "loss": 1.5639, |
| "mean_token_accuracy": 0.6482616662979126, |
| "num_tokens": 4420381.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.2554098963737488, |
| "learning_rate": 0.0001894617626359242, |
| "loss": 1.5673, |
| "mean_token_accuracy": 0.6444060206413269, |
| "num_tokens": 4468056.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.27086755633354187, |
| "learning_rate": 0.00018919482445518436, |
| "loss": 1.554, |
| "mean_token_accuracy": 0.6515795886516571, |
| "num_tokens": 4511736.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.26914721727371216, |
| "learning_rate": 0.0001889247405057948, |
| "loss": 1.5007, |
| "mean_token_accuracy": 0.6585707366466522, |
| "num_tokens": 4556021.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.2745961844921112, |
| "learning_rate": 0.00018865152031321427, |
| "loss": 1.4936, |
| "mean_token_accuracy": 0.6575806736946106, |
| "num_tokens": 4601988.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.26875782012939453, |
| "learning_rate": 0.00018837517351351214, |
| "loss": 1.515, |
| "mean_token_accuracy": 0.6536067724227905, |
| "num_tokens": 4649310.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.28102368116378784, |
| "learning_rate": 0.00018809570985302862, |
| "loss": 1.5216, |
| "mean_token_accuracy": 0.6557919979095459, |
| "num_tokens": 4696205.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.267914354801178, |
| "learning_rate": 0.00018781313918803086, |
| "loss": 1.571, |
| "mean_token_accuracy": 0.6473680436611176, |
| "num_tokens": 4745047.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.2804099917411804, |
| "learning_rate": 0.00018752747148436543, |
| "loss": 1.6039, |
| "mean_token_accuracy": 0.639825314283371, |
| "num_tokens": 4791232.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.27488934993743896, |
| "learning_rate": 0.00018723871681710697, |
| "loss": 1.5494, |
| "mean_token_accuracy": 0.6497779786586761, |
| "num_tokens": 4837675.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.2697705328464508, |
| "learning_rate": 0.0001869468853702026, |
| "loss": 1.4995, |
| "mean_token_accuracy": 0.656253308057785, |
| "num_tokens": 4883626.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.26725390553474426, |
| "learning_rate": 0.0001866519874361129, |
| "loss": 1.5777, |
| "mean_token_accuracy": 0.6452081203460693, |
| "num_tokens": 4931577.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.2720169425010681, |
| "learning_rate": 0.000186354033415449, |
| "loss": 1.5281, |
| "mean_token_accuracy": 0.6508583128452301, |
| "num_tokens": 4978688.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.2662588059902191, |
| "learning_rate": 0.00018605303381660543, |
| "loss": 1.53, |
| "mean_token_accuracy": 0.6532346308231354, |
| "num_tokens": 5024797.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.28359687328338623, |
| "learning_rate": 0.00018574899925538998, |
| "loss": 1.5452, |
| "mean_token_accuracy": 0.6506541073322296, |
| "num_tokens": 5070097.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.2859072983264923, |
| "learning_rate": 0.00018544194045464886, |
| "loss": 1.6259, |
| "mean_token_accuracy": 0.6363864541053772, |
| "num_tokens": 5117390.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.2912904620170593, |
| "learning_rate": 0.00018513186824388879, |
| "loss": 1.5479, |
| "mean_token_accuracy": 0.6520430743694305, |
| "num_tokens": 5163069.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.263398140668869, |
| "learning_rate": 0.00018481879355889495, |
| "loss": 1.5585, |
| "mean_token_accuracy": 0.6469611525535583, |
| "num_tokens": 5207392.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.26866281032562256, |
| "learning_rate": 0.00018450272744134532, |
| "loss": 1.5415, |
| "mean_token_accuracy": 0.6510675251483917, |
| "num_tokens": 5256951.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.2799576222896576, |
| "learning_rate": 0.00018418368103842125, |
| "loss": 1.5396, |
| "mean_token_accuracy": 0.6497272849082947, |
| "num_tokens": 5304169.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.27718910574913025, |
| "learning_rate": 0.00018386166560241434, |
| "loss": 1.5567, |
| "mean_token_accuracy": 0.6481947600841522, |
| "num_tokens": 5351483.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.2619563639163971, |
| "learning_rate": 0.0001835366924903295, |
| "loss": 1.496, |
| "mean_token_accuracy": 0.6585268080234528, |
| "num_tokens": 5398507.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.29501011967658997, |
| "learning_rate": 0.00018320877316348454, |
| "loss": 1.5351, |
| "mean_token_accuracy": 0.6495955288410187, |
| "num_tokens": 5445868.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.2873230576515198, |
| "learning_rate": 0.00018287791918710587, |
| "loss": 1.5845, |
| "mean_token_accuracy": 0.643306702375412, |
| "num_tokens": 5496468.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.2742498517036438, |
| "learning_rate": 0.0001825441422299206, |
| "loss": 1.53, |
| "mean_token_accuracy": 0.6520735919475555, |
| "num_tokens": 5543365.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.28084686398506165, |
| "learning_rate": 0.00018220745406374498, |
| "loss": 1.5315, |
| "mean_token_accuracy": 0.6501257419586182, |
| "num_tokens": 5590745.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.2685016691684723, |
| "learning_rate": 0.00018186786656306935, |
| "loss": 1.4894, |
| "mean_token_accuracy": 0.6595437228679657, |
| "num_tokens": 5635933.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.28692150115966797, |
| "learning_rate": 0.00018152539170463925, |
| "loss": 1.5553, |
| "mean_token_accuracy": 0.6456755995750427, |
| "num_tokens": 5685983.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.2563268542289734, |
| "learning_rate": 0.00018118004156703296, |
| "loss": 1.519, |
| "mean_token_accuracy": 0.652580201625824, |
| "num_tokens": 5734780.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.28583434224128723, |
| "learning_rate": 0.00018083182833023562, |
| "loss": 1.5127, |
| "mean_token_accuracy": 0.6557912826538086, |
| "num_tokens": 5779041.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.2815837562084198, |
| "learning_rate": 0.0001804807642752096, |
| "loss": 1.5519, |
| "mean_token_accuracy": 0.6499836444854736, |
| "num_tokens": 5825179.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.27144506573677063, |
| "learning_rate": 0.00018012686178346142, |
| "loss": 1.5583, |
| "mean_token_accuracy": 0.6471421718597412, |
| "num_tokens": 5872958.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.31989362835884094, |
| "learning_rate": 0.000179770133336605, |
| "loss": 1.5479, |
| "mean_token_accuracy": 0.6509740650653839, |
| "num_tokens": 5919853.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.28704020380973816, |
| "learning_rate": 0.00017941059151592147, |
| "loss": 1.5107, |
| "mean_token_accuracy": 0.6552367806434631, |
| "num_tokens": 5966036.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.27532413601875305, |
| "learning_rate": 0.00017904824900191556, |
| "loss": 1.5274, |
| "mean_token_accuracy": 0.6521405279636383, |
| "num_tokens": 6013929.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.2861412465572357, |
| "learning_rate": 0.0001786831185738682, |
| "loss": 1.5653, |
| "mean_token_accuracy": 0.6448757648468018, |
| "num_tokens": 6060218.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.28631675243377686, |
| "learning_rate": 0.0001783152131093859, |
| "loss": 1.5357, |
| "mean_token_accuracy": 0.6499184668064117, |
| "num_tokens": 6105536.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.2932698726654053, |
| "learning_rate": 0.00017794454558394657, |
| "loss": 1.5251, |
| "mean_token_accuracy": 0.6529253423213959, |
| "num_tokens": 6153129.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.2933589518070221, |
| "learning_rate": 0.000177571129070442, |
| "loss": 1.5223, |
| "mean_token_accuracy": 0.6531689465045929, |
| "num_tokens": 6199056.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.2958078682422638, |
| "learning_rate": 0.00017719497673871653, |
| "loss": 1.5571, |
| "mean_token_accuracy": 0.6457672417163849, |
| "num_tokens": 6244782.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.30723750591278076, |
| "learning_rate": 0.00017681610185510285, |
| "loss": 1.5099, |
| "mean_token_accuracy": 0.6570196449756622, |
| "num_tokens": 6287317.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.28479403257369995, |
| "learning_rate": 0.00017643451778195395, |
| "loss": 1.5438, |
| "mean_token_accuracy": 0.6486569344997406, |
| "num_tokens": 6335678.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.2733410596847534, |
| "learning_rate": 0.00017605023797717195, |
| "loss": 1.5444, |
| "mean_token_accuracy": 0.6485359966754913, |
| "num_tokens": 6382512.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.2998912036418915, |
| "learning_rate": 0.00017566327599373338, |
| "loss": 1.4791, |
| "mean_token_accuracy": 0.6596002280712128, |
| "num_tokens": 6427147.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.28666678071022034, |
| "learning_rate": 0.0001752736454792112, |
| "loss": 1.599, |
| "mean_token_accuracy": 0.6427422761917114, |
| "num_tokens": 6474652.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.280900776386261, |
| "learning_rate": 0.0001748813601752935, |
| "loss": 1.541, |
| "mean_token_accuracy": 0.6483757197856903, |
| "num_tokens": 6523870.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.26936545968055725, |
| "learning_rate": 0.00017448643391729888, |
| "loss": 1.5666, |
| "mean_token_accuracy": 0.6445654630661011, |
| "num_tokens": 6570400.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.30444443225860596, |
| "learning_rate": 0.0001740888806336884, |
| "loss": 1.5731, |
| "mean_token_accuracy": 0.6429518759250641, |
| "num_tokens": 6616340.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.278298944234848, |
| "learning_rate": 0.00017368871434557447, |
| "loss": 1.5337, |
| "mean_token_accuracy": 0.6487603783607483, |
| "num_tokens": 6663529.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.2908456027507782, |
| "learning_rate": 0.00017328594916622616, |
| "loss": 1.5363, |
| "mean_token_accuracy": 0.650389701128006, |
| "num_tokens": 6708731.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.2893330454826355, |
| "learning_rate": 0.00017288059930057166, |
| "loss": 1.5415, |
| "mean_token_accuracy": 0.6505038142204285, |
| "num_tokens": 6757212.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.30690449476242065, |
| "learning_rate": 0.00017247267904469725, |
| "loss": 1.5387, |
| "mean_token_accuracy": 0.6517972648143768, |
| "num_tokens": 6799983.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.2818317115306854, |
| "learning_rate": 0.00017206220278534286, |
| "loss": 1.5747, |
| "mean_token_accuracy": 0.6467372477054596, |
| "num_tokens": 6848592.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.2880898118019104, |
| "learning_rate": 0.00017164918499939504, |
| "loss": 1.6025, |
| "mean_token_accuracy": 0.6399553418159485, |
| "num_tokens": 6897858.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.26849091053009033, |
| "learning_rate": 0.0001712336402533761, |
| "loss": 1.5618, |
| "mean_token_accuracy": 0.6450689435005188, |
| "num_tokens": 6945803.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.28507912158966064, |
| "learning_rate": 0.00017081558320293055, |
| "loss": 1.5794, |
| "mean_token_accuracy": 0.6418361663818359, |
| "num_tokens": 6992743.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.29636260867118835, |
| "learning_rate": 0.000170395028592308, |
| "loss": 1.5468, |
| "mean_token_accuracy": 0.6484410464763641, |
| "num_tokens": 7039309.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.2758314609527588, |
| "learning_rate": 0.00016997199125384343, |
| "loss": 1.546, |
| "mean_token_accuracy": 0.6494967639446259, |
| "num_tokens": 7084598.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.2995888590812683, |
| "learning_rate": 0.00016954648610743384, |
| "loss": 1.5199, |
| "mean_token_accuracy": 0.6539457738399506, |
| "num_tokens": 7132905.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.2744024693965912, |
| "learning_rate": 0.0001691185281600122, |
| "loss": 1.5506, |
| "mean_token_accuracy": 0.6450865864753723, |
| "num_tokens": 7179607.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.2939317226409912, |
| "learning_rate": 0.0001686881325050181, |
| "loss": 1.5632, |
| "mean_token_accuracy": 0.645559161901474, |
| "num_tokens": 7227433.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.294448584318161, |
| "learning_rate": 0.00016825531432186543, |
| "loss": 1.5284, |
| "mean_token_accuracy": 0.6512192487716675, |
| "num_tokens": 7272804.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.2998405992984772, |
| "learning_rate": 0.00016782008887540704, |
| "loss": 1.4948, |
| "mean_token_accuracy": 0.65907222032547, |
| "num_tokens": 7318264.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.4484761655330658, |
| "learning_rate": 0.00016738247151539643, |
| "loss": 1.4407, |
| "mean_token_accuracy": 0.6714723706245422, |
| "num_tokens": 7341116.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.3343365788459778, |
| "learning_rate": 0.00016694247767594624, |
| "loss": 1.3322, |
| "mean_token_accuracy": 0.6910092234611511, |
| "num_tokens": 7385765.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 0.3265499472618103, |
| "learning_rate": 0.00016650012287498412, |
| "loss": 1.3301, |
| "mean_token_accuracy": 0.6870517134666443, |
| "num_tokens": 7431409.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.2959946393966675, |
| "learning_rate": 0.00016605542271370513, |
| "loss": 1.3674, |
| "mean_token_accuracy": 0.6844088733196259, |
| "num_tokens": 7480191.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.3199387192726135, |
| "learning_rate": 0.00016560839287602192, |
| "loss": 1.2926, |
| "mean_token_accuracy": 0.6962210536003113, |
| "num_tokens": 7528150.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.36283308267593384, |
| "learning_rate": 0.00016515904912801118, |
| "loss": 1.2666, |
| "mean_token_accuracy": 0.6986918449401855, |
| "num_tokens": 7571869.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.34669721126556396, |
| "learning_rate": 0.00016470740731735787, |
| "loss": 1.3234, |
| "mean_token_accuracy": 0.6908857524394989, |
| "num_tokens": 7618015.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.34525468945503235, |
| "learning_rate": 0.0001642534833727962, |
| "loss": 1.2866, |
| "mean_token_accuracy": 0.6964756846427917, |
| "num_tokens": 7662549.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.3327886760234833, |
| "learning_rate": 0.00016379729330354774, |
| "loss": 1.3065, |
| "mean_token_accuracy": 0.6932984590530396, |
| "num_tokens": 7709697.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.30664750933647156, |
| "learning_rate": 0.00016333885319875702, |
| "loss": 1.2929, |
| "mean_token_accuracy": 0.6956894993782043, |
| "num_tokens": 7758083.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.3107092082500458, |
| "learning_rate": 0.00016287817922692395, |
| "loss": 1.3376, |
| "mean_token_accuracy": 0.6897503137588501, |
| "num_tokens": 7805938.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.31660640239715576, |
| "learning_rate": 0.00016241528763533353, |
| "loss": 1.2791, |
| "mean_token_accuracy": 0.6975639164447784, |
| "num_tokens": 7850498.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.32096031308174133, |
| "learning_rate": 0.00016195019474948299, |
| "loss": 1.2405, |
| "mean_token_accuracy": 0.7077115774154663, |
| "num_tokens": 7893227.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.34041303396224976, |
| "learning_rate": 0.00016148291697250594, |
| "loss": 1.331, |
| "mean_token_accuracy": 0.6875595152378082, |
| "num_tokens": 7939866.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.3158988952636719, |
| "learning_rate": 0.00016101347078459373, |
| "loss": 1.3103, |
| "mean_token_accuracy": 0.6904300153255463, |
| "num_tokens": 7989324.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.31509461998939514, |
| "learning_rate": 0.0001605418727424145, |
| "loss": 1.3244, |
| "mean_token_accuracy": 0.6885357201099396, |
| "num_tokens": 8037303.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.32755744457244873, |
| "learning_rate": 0.00016006813947852893, |
| "loss": 1.2938, |
| "mean_token_accuracy": 0.6945713758468628, |
| "num_tokens": 8083490.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.326424241065979, |
| "learning_rate": 0.0001595922877008039, |
| "loss": 1.2883, |
| "mean_token_accuracy": 0.6961071789264679, |
| "num_tokens": 8130322.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.33139878511428833, |
| "learning_rate": 0.00015911433419182305, |
| "loss": 1.3053, |
| "mean_token_accuracy": 0.6951516270637512, |
| "num_tokens": 8178618.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.33605796098709106, |
| "learning_rate": 0.000158634295808295, |
| "loss": 1.3198, |
| "mean_token_accuracy": 0.6912129521369934, |
| "num_tokens": 8227676.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.3550015091896057, |
| "learning_rate": 0.00015815218948045878, |
| "loss": 1.2881, |
| "mean_token_accuracy": 0.6993768513202667, |
| "num_tokens": 8271080.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.34364157915115356, |
| "learning_rate": 0.00015766803221148673, |
| "loss": 1.337, |
| "mean_token_accuracy": 0.6868195235729218, |
| "num_tokens": 8319718.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.34193143248558044, |
| "learning_rate": 0.0001571818410768848, |
| "loss": 1.3162, |
| "mean_token_accuracy": 0.6915777623653412, |
| "num_tokens": 8365783.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.32836443185806274, |
| "learning_rate": 0.0001566936332238904, |
| "loss": 1.3102, |
| "mean_token_accuracy": 0.6936459541320801, |
| "num_tokens": 8414953.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.3303191065788269, |
| "learning_rate": 0.0001562034258708676, |
| "loss": 1.302, |
| "mean_token_accuracy": 0.6961067020893097, |
| "num_tokens": 8461084.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.3395134508609772, |
| "learning_rate": 0.0001557112363066998, |
| "loss": 1.2847, |
| "mean_token_accuracy": 0.6985503137111664, |
| "num_tokens": 8503630.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.34719496965408325, |
| "learning_rate": 0.00015521708189018005, |
| "loss": 1.3131, |
| "mean_token_accuracy": 0.6886778473854065, |
| "num_tokens": 8549241.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.342877060174942, |
| "learning_rate": 0.00015472098004939888, |
| "loss": 1.3407, |
| "mean_token_accuracy": 0.6869197189807892, |
| "num_tokens": 8596933.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.32749322056770325, |
| "learning_rate": 0.00015422294828112954, |
| "loss": 1.286, |
| "mean_token_accuracy": 0.6954855024814606, |
| "num_tokens": 8645281.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.35311228036880493, |
| "learning_rate": 0.00015372300415021091, |
| "loss": 1.2954, |
| "mean_token_accuracy": 0.6963195204734802, |
| "num_tokens": 8691586.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.3434406518936157, |
| "learning_rate": 0.00015322116528892807, |
| "loss": 1.2902, |
| "mean_token_accuracy": 0.6954045593738556, |
| "num_tokens": 8738642.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.34454143047332764, |
| "learning_rate": 0.0001527174493963905, |
| "loss": 1.329, |
| "mean_token_accuracy": 0.6872740387916565, |
| "num_tokens": 8785494.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.3454861640930176, |
| "learning_rate": 0.0001522118742379076, |
| "loss": 1.3279, |
| "mean_token_accuracy": 0.687510758638382, |
| "num_tokens": 8833002.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.342602401971817, |
| "learning_rate": 0.00015170445764436252, |
| "loss": 1.3414, |
| "mean_token_accuracy": 0.6878556907176971, |
| "num_tokens": 8881670.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.3364247977733612, |
| "learning_rate": 0.00015119521751158296, |
| "loss": 1.2873, |
| "mean_token_accuracy": 0.6955643892288208, |
| "num_tokens": 8928589.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.3498151898384094, |
| "learning_rate": 0.00015068417179971014, |
| "loss": 1.3165, |
| "mean_token_accuracy": 0.6920604407787323, |
| "num_tokens": 8972786.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.3346851170063019, |
| "learning_rate": 0.00015017133853256537, |
| "loss": 1.3256, |
| "mean_token_accuracy": 0.692162960767746, |
| "num_tokens": 9023468.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.35006558895111084, |
| "learning_rate": 0.00014965673579701445, |
| "loss": 1.2724, |
| "mean_token_accuracy": 0.7002449333667755, |
| "num_tokens": 9068145.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.34246891736984253, |
| "learning_rate": 0.00014914038174232956, |
| "loss": 1.3404, |
| "mean_token_accuracy": 0.6872991621494293, |
| "num_tokens": 9118948.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.3341098129749298, |
| "learning_rate": 0.0001486222945795494, |
| "loss": 1.3156, |
| "mean_token_accuracy": 0.6871801018714905, |
| "num_tokens": 9166164.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.34007757902145386, |
| "learning_rate": 0.00014810249258083677, |
| "loss": 1.3102, |
| "mean_token_accuracy": 0.6924366652965546, |
| "num_tokens": 9214691.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.3317483365535736, |
| "learning_rate": 0.00014758099407883422, |
| "loss": 1.3083, |
| "mean_token_accuracy": 0.6904500126838684, |
| "num_tokens": 9264180.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.3468264043331146, |
| "learning_rate": 0.0001470578174660174, |
| "loss": 1.3293, |
| "mean_token_accuracy": 0.6916395723819733, |
| "num_tokens": 9311651.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.3456972539424896, |
| "learning_rate": 0.00014653298119404645, |
| "loss": 1.3268, |
| "mean_token_accuracy": 0.6869567632675171, |
| "num_tokens": 9360999.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.35997506976127625, |
| "learning_rate": 0.00014600650377311522, |
| "loss": 1.3105, |
| "mean_token_accuracy": 0.6917800903320312, |
| "num_tokens": 9405644.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.3483164310455322, |
| "learning_rate": 0.00014547840377129842, |
| "loss": 1.3148, |
| "mean_token_accuracy": 0.6925802230834961, |
| "num_tokens": 9451607.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.3380853235721588, |
| "learning_rate": 0.0001449486998138968, |
| "loss": 1.304, |
| "mean_token_accuracy": 0.6935497522354126, |
| "num_tokens": 9498424.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.36971330642700195, |
| "learning_rate": 0.00014441741058278024, |
| "loss": 1.2874, |
| "mean_token_accuracy": 0.6996894776821136, |
| "num_tokens": 9540724.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.3429723381996155, |
| "learning_rate": 0.0001438845548157288, |
| "loss": 1.309, |
| "mean_token_accuracy": 0.692668229341507, |
| "num_tokens": 9588689.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.3566606342792511, |
| "learning_rate": 0.000143350151305772, |
| "loss": 1.3495, |
| "mean_token_accuracy": 0.684135228395462, |
| "num_tokens": 9636532.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.3401079773902893, |
| "learning_rate": 0.0001428142189005259, |
| "loss": 1.3193, |
| "mean_token_accuracy": 0.6945083439350128, |
| "num_tokens": 9685613.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.3454475998878479, |
| "learning_rate": 0.0001422767765015285, |
| "loss": 1.3007, |
| "mean_token_accuracy": 0.6913789212703705, |
| "num_tokens": 9733242.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.36231961846351624, |
| "learning_rate": 0.0001417378430635729, |
| "loss": 1.253, |
| "mean_token_accuracy": 0.7031304240226746, |
| "num_tokens": 9776947.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.3470020890235901, |
| "learning_rate": 0.00014119743759403907, |
| "loss": 1.341, |
| "mean_token_accuracy": 0.6853951811790466, |
| "num_tokens": 9824542.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.35202592611312866, |
| "learning_rate": 0.00014065557915222322, |
| "loss": 1.3058, |
| "mean_token_accuracy": 0.691655308008194, |
| "num_tokens": 9871224.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.3493707478046417, |
| "learning_rate": 0.00014011228684866582, |
| "loss": 1.3376, |
| "mean_token_accuracy": 0.6874703168869019, |
| "num_tokens": 9920118.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.35377079248428345, |
| "learning_rate": 0.00013956757984447745, |
| "loss": 1.2805, |
| "mean_token_accuracy": 0.6971912980079651, |
| "num_tokens": 9963918.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.3466252386569977, |
| "learning_rate": 0.00013902147735066306, |
| "loss": 1.2664, |
| "mean_token_accuracy": 0.6998610198497772, |
| "num_tokens": 10010058.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.3474418520927429, |
| "learning_rate": 0.0001384739986274445, |
| "loss": 1.2961, |
| "mean_token_accuracy": 0.6941092908382416, |
| "num_tokens": 10058468.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.36090087890625, |
| "learning_rate": 0.00013792516298358114, |
| "loss": 1.3642, |
| "mean_token_accuracy": 0.6834468245506287, |
| "num_tokens": 10106765.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.3633421063423157, |
| "learning_rate": 0.000137374989775689, |
| "loss": 1.3233, |
| "mean_token_accuracy": 0.6901079416275024, |
| "num_tokens": 10152807.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.34589487314224243, |
| "learning_rate": 0.00013682349840755785, |
| "loss": 1.2613, |
| "mean_token_accuracy": 0.7022227048873901, |
| "num_tokens": 10198115.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.34732723236083984, |
| "learning_rate": 0.00013627070832946718, |
| "loss": 1.3236, |
| "mean_token_accuracy": 0.6895630061626434, |
| "num_tokens": 10244677.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.35598820447921753, |
| "learning_rate": 0.00013571663903749984, |
| "loss": 1.2993, |
| "mean_token_accuracy": 0.6935286521911621, |
| "num_tokens": 10289391.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.3413410186767578, |
| "learning_rate": 0.00013516131007285483, |
| "loss": 1.3134, |
| "mean_token_accuracy": 0.6913627684116364, |
| "num_tokens": 10336052.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.3477303981781006, |
| "learning_rate": 0.00013460474102115785, |
| "loss": 1.2962, |
| "mean_token_accuracy": 0.6957099437713623, |
| "num_tokens": 10381705.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.3488887548446655, |
| "learning_rate": 0.0001340469515117706, |
| "loss": 1.3512, |
| "mean_token_accuracy": 0.6867388784885406, |
| "num_tokens": 10430510.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.38249075412750244, |
| "learning_rate": 0.00013348796121709862, |
| "loss": 1.3002, |
| "mean_token_accuracy": 0.693688690662384, |
| "num_tokens": 10475799.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.3548857867717743, |
| "learning_rate": 0.00013292778985189724, |
| "loss": 1.3455, |
| "mean_token_accuracy": 0.683870941400528, |
| "num_tokens": 10523519.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.3587774336338043, |
| "learning_rate": 0.0001323664571725764, |
| "loss": 1.3114, |
| "mean_token_accuracy": 0.6917595863342285, |
| "num_tokens": 10569542.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.356501042842865, |
| "learning_rate": 0.00013180398297650393, |
| "loss": 1.2964, |
| "mean_token_accuracy": 0.6952946484088898, |
| "num_tokens": 10614027.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.35891181230545044, |
| "learning_rate": 0.00013124038710130722, |
| "loss": 1.3163, |
| "mean_token_accuracy": 0.6918761730194092, |
| "num_tokens": 10658379.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.3601120412349701, |
| "learning_rate": 0.00013067568942417356, |
| "loss": 1.3088, |
| "mean_token_accuracy": 0.6909421980381012, |
| "num_tokens": 10704697.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.3705814778804779, |
| "learning_rate": 0.00013010990986114926, |
| "loss": 1.3429, |
| "mean_token_accuracy": 0.686343640089035, |
| "num_tokens": 10749941.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.3506789207458496, |
| "learning_rate": 0.00012954306836643703, |
| "loss": 1.3814, |
| "mean_token_accuracy": 0.681389331817627, |
| "num_tokens": 10799643.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.35677486658096313, |
| "learning_rate": 0.0001289751849316924, |
| "loss": 1.3094, |
| "mean_token_accuracy": 0.6908452808856964, |
| "num_tokens": 10846595.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.35693496465682983, |
| "learning_rate": 0.0001284062795853185, |
| "loss": 1.3572, |
| "mean_token_accuracy": 0.6837401986122131, |
| "num_tokens": 10892579.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.980891719745223, |
| "grad_norm": 0.3480221927165985, |
| "learning_rate": 0.00012783637239175994, |
| "loss": 1.3716, |
| "mean_token_accuracy": 0.6815778911113739, |
| "num_tokens": 10941192.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9936305732484074, |
| "grad_norm": 0.35607731342315674, |
| "learning_rate": 0.00012726548345079475, |
| "loss": 1.2997, |
| "mean_token_accuracy": 0.6946380734443665, |
| "num_tokens": 10988163.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.35607731342315674, |
| "learning_rate": 0.00012669363289682584, |
| "loss": 1.1714, |
| "mean_token_accuracy": 0.7204415202140808, |
| "num_tokens": 11011750.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0127388535031847, |
| "grad_norm": 0.575162947177887, |
| "learning_rate": 0.0001261208408981708, |
| "loss": 1.0975, |
| "mean_token_accuracy": 0.7386822700500488, |
| "num_tokens": 11059787.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0254777070063694, |
| "grad_norm": 0.4076228737831116, |
| "learning_rate": 0.00012554712765635057, |
| "loss": 1.0699, |
| "mean_token_accuracy": 0.7432563006877899, |
| "num_tokens": 11104750.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.038216560509554, |
| "grad_norm": 0.3734162747859955, |
| "learning_rate": 0.0001249725134053769, |
| "loss": 1.0605, |
| "mean_token_accuracy": 0.7436703443527222, |
| "num_tokens": 11150757.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050955414012739, |
| "grad_norm": 0.40389564633369446, |
| "learning_rate": 0.00012439701841103888, |
| "loss": 1.0362, |
| "mean_token_accuracy": 0.7471202611923218, |
| "num_tokens": 11200823.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0636942675159236, |
| "grad_norm": 0.5040764212608337, |
| "learning_rate": 0.00012382066297018804, |
| "loss": 1.0947, |
| "mean_token_accuracy": 0.7376525700092316, |
| "num_tokens": 11247910.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0764331210191083, |
| "grad_norm": 0.5463912487030029, |
| "learning_rate": 0.0001232434674100226, |
| "loss": 1.0766, |
| "mean_token_accuracy": 0.739810049533844, |
| "num_tokens": 11294764.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.089171974522293, |
| "grad_norm": 0.47988808155059814, |
| "learning_rate": 0.00012266545208737054, |
| "loss": 1.0322, |
| "mean_token_accuracy": 0.7498438358306885, |
| "num_tokens": 11341044.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1019108280254777, |
| "grad_norm": 0.4334051311016083, |
| "learning_rate": 0.00012208663738797165, |
| "loss": 1.0363, |
| "mean_token_accuracy": 0.7506378591060638, |
| "num_tokens": 11387746.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1146496815286624, |
| "grad_norm": 0.39998453855514526, |
| "learning_rate": 0.00012150704372575854, |
| "loss": 1.06, |
| "mean_token_accuracy": 0.7452342510223389, |
| "num_tokens": 11436154.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.127388535031847, |
| "grad_norm": 0.3928165137767792, |
| "learning_rate": 0.00012092669154213665, |
| "loss": 0.9898, |
| "mean_token_accuracy": 0.7584972083568573, |
| "num_tokens": 11481728.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.140127388535032, |
| "grad_norm": 0.40028896927833557, |
| "learning_rate": 0.0001203456013052634, |
| "loss": 1.0131, |
| "mean_token_accuracy": 0.7529804110527039, |
| "num_tokens": 11527633.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.1528662420382165, |
| "grad_norm": 0.410742849111557, |
| "learning_rate": 0.00011976379350932618, |
| "loss": 1.0296, |
| "mean_token_accuracy": 0.7526900470256805, |
| "num_tokens": 11571058.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1656050955414012, |
| "grad_norm": 0.46235859394073486, |
| "learning_rate": 0.00011918128867381965, |
| "loss": 1.0359, |
| "mean_token_accuracy": 0.7495845854282379, |
| "num_tokens": 11616706.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.178343949044586, |
| "grad_norm": 0.4445168673992157, |
| "learning_rate": 0.00011859810734282208, |
| "loss": 1.0576, |
| "mean_token_accuracy": 0.7440116107463837, |
| "num_tokens": 11663486.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.1910828025477707, |
| "grad_norm": 0.4728211462497711, |
| "learning_rate": 0.00011801427008427063, |
| "loss": 1.0368, |
| "mean_token_accuracy": 0.7495954632759094, |
| "num_tokens": 11708088.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2038216560509554, |
| "grad_norm": 0.4592626690864563, |
| "learning_rate": 0.00011742979748923611, |
| "loss": 1.0344, |
| "mean_token_accuracy": 0.7493532598018646, |
| "num_tokens": 11753940.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.21656050955414, |
| "grad_norm": 0.46383729577064514, |
| "learning_rate": 0.00011684471017119667, |
| "loss": 1.0031, |
| "mean_token_accuracy": 0.7553220391273499, |
| "num_tokens": 11800640.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.229299363057325, |
| "grad_norm": 0.44475027918815613, |
| "learning_rate": 0.00011625902876531082, |
| "loss": 1.0085, |
| "mean_token_accuracy": 0.7538060247898102, |
| "num_tokens": 11847227.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.2420382165605095, |
| "grad_norm": 0.4252687990665436, |
| "learning_rate": 0.00011567277392768972, |
| "loss": 1.1065, |
| "mean_token_accuracy": 0.7358538806438446, |
| "num_tokens": 11897270.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.254777070063694, |
| "grad_norm": 0.4112376272678375, |
| "learning_rate": 0.00011508596633466852, |
| "loss": 1.0294, |
| "mean_token_accuracy": 0.7512390911579132, |
| "num_tokens": 11943975.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.267515923566879, |
| "grad_norm": 0.42077869176864624, |
| "learning_rate": 0.00011449862668207734, |
| "loss": 1.0362, |
| "mean_token_accuracy": 0.7497402131557465, |
| "num_tokens": 11990344.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.2802547770700636, |
| "grad_norm": 0.4334986209869385, |
| "learning_rate": 0.00011391077568451116, |
| "loss": 1.0238, |
| "mean_token_accuracy": 0.7498055994510651, |
| "num_tokens": 12036618.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.2929936305732483, |
| "grad_norm": 0.42075401544570923, |
| "learning_rate": 0.0001133224340745994, |
| "loss": 1.0022, |
| "mean_token_accuracy": 0.754104495048523, |
| "num_tokens": 12081719.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.305732484076433, |
| "grad_norm": 0.4563131034374237, |
| "learning_rate": 0.00011273362260227458, |
| "loss": 1.0512, |
| "mean_token_accuracy": 0.7474367916584015, |
| "num_tokens": 12128789.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3184713375796178, |
| "grad_norm": 0.4512925446033478, |
| "learning_rate": 0.00011214436203404062, |
| "loss": 1.0496, |
| "mean_token_accuracy": 0.7442962825298309, |
| "num_tokens": 12177227.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.3312101910828025, |
| "grad_norm": 0.4189808964729309, |
| "learning_rate": 0.00011155467315224038, |
| "loss": 1.0589, |
| "mean_token_accuracy": 0.7440447509288788, |
| "num_tokens": 12226380.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.343949044585987, |
| "grad_norm": 0.42184701561927795, |
| "learning_rate": 0.00011096457675432266, |
| "loss": 1.0399, |
| "mean_token_accuracy": 0.7482756078243256, |
| "num_tokens": 12275760.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.356687898089172, |
| "grad_norm": 0.4403589963912964, |
| "learning_rate": 0.0001103740936521088, |
| "loss": 1.0571, |
| "mean_token_accuracy": 0.7462457716464996, |
| "num_tokens": 12324908.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.3694267515923566, |
| "grad_norm": 0.4608840346336365, |
| "learning_rate": 0.00010978324467105858, |
| "loss": 1.0259, |
| "mean_token_accuracy": 0.7492176592350006, |
| "num_tokens": 12369407.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.3821656050955413, |
| "grad_norm": 0.443196177482605, |
| "learning_rate": 0.00010919205064953582, |
| "loss": 1.0489, |
| "mean_token_accuracy": 0.7451373040676117, |
| "num_tokens": 12416757.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.394904458598726, |
| "grad_norm": 0.41043445467948914, |
| "learning_rate": 0.00010860053243807338, |
| "loss": 1.0468, |
| "mean_token_accuracy": 0.7448963224887848, |
| "num_tokens": 12467082.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4076433121019107, |
| "grad_norm": 0.439742773771286, |
| "learning_rate": 0.00010800871089863785, |
| "loss": 1.0377, |
| "mean_token_accuracy": 0.7474401891231537, |
| "num_tokens": 12512084.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4203821656050954, |
| "grad_norm": 0.4662080407142639, |
| "learning_rate": 0.00010741660690389365, |
| "loss": 1.0456, |
| "mean_token_accuracy": 0.7488239109516144, |
| "num_tokens": 12557743.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.43312101910828, |
| "grad_norm": 0.45201772451400757, |
| "learning_rate": 0.0001068242413364671, |
| "loss": 1.0273, |
| "mean_token_accuracy": 0.7499560117721558, |
| "num_tokens": 12603687.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.445859872611465, |
| "grad_norm": 0.424855500459671, |
| "learning_rate": 0.00010623163508820977, |
| "loss": 1.0008, |
| "mean_token_accuracy": 0.7553302347660065, |
| "num_tokens": 12648954.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4585987261146496, |
| "grad_norm": 0.4551679790019989, |
| "learning_rate": 0.00010563880905946159, |
| "loss": 1.0301, |
| "mean_token_accuracy": 0.7494941651821136, |
| "num_tokens": 12692342.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4713375796178343, |
| "grad_norm": 0.46419814229011536, |
| "learning_rate": 0.00010504578415831395, |
| "loss": 1.0583, |
| "mean_token_accuracy": 0.7461420893669128, |
| "num_tokens": 12737321.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.484076433121019, |
| "grad_norm": 0.4456294775009155, |
| "learning_rate": 0.00010445258129987206, |
| "loss": 1.0406, |
| "mean_token_accuracy": 0.7484328746795654, |
| "num_tokens": 12784140.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4968152866242037, |
| "grad_norm": 0.4584999978542328, |
| "learning_rate": 0.00010385922140551752, |
| "loss": 1.0348, |
| "mean_token_accuracy": 0.7499430775642395, |
| "num_tokens": 12830314.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5095541401273884, |
| "grad_norm": 0.44610586762428284, |
| "learning_rate": 0.00010326572540217028, |
| "loss": 1.0534, |
| "mean_token_accuracy": 0.747410923242569, |
| "num_tokens": 12877459.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.522292993630573, |
| "grad_norm": 0.48907381296157837, |
| "learning_rate": 0.00010267211422155072, |
| "loss": 1.0698, |
| "mean_token_accuracy": 0.7433335781097412, |
| "num_tokens": 12923562.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.535031847133758, |
| "grad_norm": 0.4395643174648285, |
| "learning_rate": 0.00010207840879944123, |
| "loss": 1.0296, |
| "mean_token_accuracy": 0.7491806745529175, |
| "num_tokens": 12971195.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5477707006369426, |
| "grad_norm": 0.445525586605072, |
| "learning_rate": 0.0001014846300749481, |
| "loss": 1.0634, |
| "mean_token_accuracy": 0.7422992885112762, |
| "num_tokens": 13018111.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5605095541401273, |
| "grad_norm": 0.44029030203819275, |
| "learning_rate": 0.00010089079898976284, |
| "loss": 1.0845, |
| "mean_token_accuracy": 0.7385657727718353, |
| "num_tokens": 13065801.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.573248407643312, |
| "grad_norm": 0.4442991614341736, |
| "learning_rate": 0.00010029693648742355, |
| "loss": 1.0247, |
| "mean_token_accuracy": 0.7507951855659485, |
| "num_tokens": 13110544.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5859872611464967, |
| "grad_norm": 0.4595116972923279, |
| "learning_rate": 9.970306351257647e-05, |
| "loss": 1.0714, |
| "mean_token_accuracy": 0.7425291538238525, |
| "num_tokens": 13159700.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5987261146496814, |
| "grad_norm": 0.42567887902259827, |
| "learning_rate": 9.910920101023717e-05, |
| "loss": 1.0511, |
| "mean_token_accuracy": 0.7453266978263855, |
| "num_tokens": 13208331.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.611464968152866, |
| "grad_norm": 0.43944114446640015, |
| "learning_rate": 9.851536992505188e-05, |
| "loss": 1.0418, |
| "mean_token_accuracy": 0.7464134097099304, |
| "num_tokens": 13255087.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.624203821656051, |
| "grad_norm": 0.44316551089286804, |
| "learning_rate": 9.79215912005588e-05, |
| "loss": 1.0306, |
| "mean_token_accuracy": 0.7519051730632782, |
| "num_tokens": 13301979.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.6369426751592355, |
| "grad_norm": 0.46782058477401733, |
| "learning_rate": 9.732788577844934e-05, |
| "loss": 1.0267, |
| "mean_token_accuracy": 0.7499517202377319, |
| "num_tokens": 13346264.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6496815286624202, |
| "grad_norm": 0.4449765682220459, |
| "learning_rate": 9.673427459782974e-05, |
| "loss": 1.0627, |
| "mean_token_accuracy": 0.7452774345874786, |
| "num_tokens": 13395122.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.662420382165605, |
| "grad_norm": 0.44802337884902954, |
| "learning_rate": 9.61407785944825e-05, |
| "loss": 1.0381, |
| "mean_token_accuracy": 0.7449367344379425, |
| "num_tokens": 13441560.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.6751592356687897, |
| "grad_norm": 0.47226378321647644, |
| "learning_rate": 9.554741870012797e-05, |
| "loss": 1.061, |
| "mean_token_accuracy": 0.7463669776916504, |
| "num_tokens": 13485397.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6878980891719744, |
| "grad_norm": 0.4418249726295471, |
| "learning_rate": 9.495421584168609e-05, |
| "loss": 1.0429, |
| "mean_token_accuracy": 0.7469217479228973, |
| "num_tokens": 13533561.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.700636942675159, |
| "grad_norm": 0.43316134810447693, |
| "learning_rate": 9.436119094053846e-05, |
| "loss": 1.0496, |
| "mean_token_accuracy": 0.7461331188678741, |
| "num_tokens": 13579401.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.713375796178344, |
| "grad_norm": 0.4408023953437805, |
| "learning_rate": 9.376836491179028e-05, |
| "loss": 1.0554, |
| "mean_token_accuracy": 0.7451147735118866, |
| "num_tokens": 13626917.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.7261146496815285, |
| "grad_norm": 0.47314339876174927, |
| "learning_rate": 9.317575866353292e-05, |
| "loss": 1.0349, |
| "mean_token_accuracy": 0.7479163408279419, |
| "num_tokens": 13669796.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.738853503184713, |
| "grad_norm": 0.45513227581977844, |
| "learning_rate": 9.258339309610637e-05, |
| "loss": 1.063, |
| "mean_token_accuracy": 0.7429400384426117, |
| "num_tokens": 13717064.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7515923566878984, |
| "grad_norm": 0.44753924012184143, |
| "learning_rate": 9.199128910136219e-05, |
| "loss": 1.014, |
| "mean_token_accuracy": 0.7514563202857971, |
| "num_tokens": 13763993.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.7643312101910826, |
| "grad_norm": 0.4445459246635437, |
| "learning_rate": 9.139946756192663e-05, |
| "loss": 1.0219, |
| "mean_token_accuracy": 0.7516200542449951, |
| "num_tokens": 13810226.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.777070063694268, |
| "grad_norm": 0.4555498957633972, |
| "learning_rate": 9.080794935046421e-05, |
| "loss": 1.0846, |
| "mean_token_accuracy": 0.737242728471756, |
| "num_tokens": 13859627.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.789808917197452, |
| "grad_norm": 0.4423632323741913, |
| "learning_rate": 9.021675532894145e-05, |
| "loss": 1.0149, |
| "mean_token_accuracy": 0.7535317242145538, |
| "num_tokens": 13904621.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.802547770700637, |
| "grad_norm": 0.4562549293041229, |
| "learning_rate": 8.962590634789123e-05, |
| "loss": 1.0274, |
| "mean_token_accuracy": 0.7515223622322083, |
| "num_tokens": 13951418.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.8152866242038215, |
| "grad_norm": 0.4509284198284149, |
| "learning_rate": 8.903542324567736e-05, |
| "loss": 1.0512, |
| "mean_token_accuracy": 0.7477030754089355, |
| "num_tokens": 13996941.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8280254777070066, |
| "grad_norm": 0.4827808737754822, |
| "learning_rate": 8.844532684775963e-05, |
| "loss": 0.9791, |
| "mean_token_accuracy": 0.7602791786193848, |
| "num_tokens": 14041820.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.840764331210191, |
| "grad_norm": 0.46509167551994324, |
| "learning_rate": 8.785563796595938e-05, |
| "loss": 1.0442, |
| "mean_token_accuracy": 0.7479641735553741, |
| "num_tokens": 14089905.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.853503184713376, |
| "grad_norm": 0.4547942876815796, |
| "learning_rate": 8.726637739772542e-05, |
| "loss": 1.0554, |
| "mean_token_accuracy": 0.7465295493602753, |
| "num_tokens": 14135065.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8662420382165603, |
| "grad_norm": 0.4469335675239563, |
| "learning_rate": 8.667756592540064e-05, |
| "loss": 1.0383, |
| "mean_token_accuracy": 0.7464892268180847, |
| "num_tokens": 14179255.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8789808917197455, |
| "grad_norm": 0.45058006048202515, |
| "learning_rate": 8.608922431548887e-05, |
| "loss": 1.0453, |
| "mean_token_accuracy": 0.7463506460189819, |
| "num_tokens": 14228844.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8917197452229297, |
| "grad_norm": 0.44601333141326904, |
| "learning_rate": 8.55013733179227e-05, |
| "loss": 1.0407, |
| "mean_token_accuracy": 0.7497325539588928, |
| "num_tokens": 14274709.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.904458598726115, |
| "grad_norm": 0.44497182965278625, |
| "learning_rate": 8.49140336653315e-05, |
| "loss": 1.0158, |
| "mean_token_accuracy": 0.7533020973205566, |
| "num_tokens": 14321597.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.917197452229299, |
| "grad_norm": 0.43743929266929626, |
| "learning_rate": 8.43272260723103e-05, |
| "loss": 1.0137, |
| "mean_token_accuracy": 0.7568092048168182, |
| "num_tokens": 14369925.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9299363057324843, |
| "grad_norm": 0.44671833515167236, |
| "learning_rate": 8.374097123468918e-05, |
| "loss": 1.0583, |
| "mean_token_accuracy": 0.7409914433956146, |
| "num_tokens": 14417628.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9426751592356686, |
| "grad_norm": 0.44011715054512024, |
| "learning_rate": 8.315528982880337e-05, |
| "loss": 1.0307, |
| "mean_token_accuracy": 0.7483357191085815, |
| "num_tokens": 14466473.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9554140127388537, |
| "grad_norm": 0.45142441987991333, |
| "learning_rate": 8.257020251076393e-05, |
| "loss": 1.0565, |
| "mean_token_accuracy": 0.7446093857288361, |
| "num_tokens": 14512510.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.968152866242038, |
| "grad_norm": 0.48025238513946533, |
| "learning_rate": 8.198572991572939e-05, |
| "loss": 1.0597, |
| "mean_token_accuracy": 0.7435389757156372, |
| "num_tokens": 14561087.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.980891719745223, |
| "grad_norm": 0.45641523599624634, |
| "learning_rate": 8.140189265717794e-05, |
| "loss": 1.0903, |
| "mean_token_accuracy": 0.739763617515564, |
| "num_tokens": 14610134.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9936305732484074, |
| "grad_norm": 0.4491109848022461, |
| "learning_rate": 8.081871132618036e-05, |
| "loss": 1.0839, |
| "mean_token_accuracy": 0.7389968633651733, |
| "num_tokens": 14659750.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.6807467937469482, |
| "learning_rate": 8.023620649067384e-05, |
| "loss": 0.9348, |
| "mean_token_accuracy": 0.7736132740974426, |
| "num_tokens": 14683741.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012738853503185, |
| "grad_norm": 0.46182575821876526, |
| "learning_rate": 7.965439869473664e-05, |
| "loss": 0.8458, |
| "mean_token_accuracy": 0.7974231243133545, |
| "num_tokens": 14731484.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025477707006369, |
| "grad_norm": 0.4779008626937866, |
| "learning_rate": 7.907330845786337e-05, |
| "loss": 0.82, |
| "mean_token_accuracy": 0.8037229180335999, |
| "num_tokens": 14776906.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.038216560509555, |
| "grad_norm": 0.47625744342803955, |
| "learning_rate": 7.849295627424148e-05, |
| "loss": 0.791, |
| "mean_token_accuracy": 0.8079457581043243, |
| "num_tokens": 14822669.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050955414012739, |
| "grad_norm": 0.5156582593917847, |
| "learning_rate": 7.791336261202835e-05, |
| "loss": 0.7787, |
| "mean_token_accuracy": 0.8072306513786316, |
| "num_tokens": 14869201.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063694267515924, |
| "grad_norm": 0.6505507826805115, |
| "learning_rate": 7.733454791262947e-05, |
| "loss": 0.774, |
| "mean_token_accuracy": 0.8075048327445984, |
| "num_tokens": 14916197.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.076433121019108, |
| "grad_norm": 0.7211319208145142, |
| "learning_rate": 7.67565325899774e-05, |
| "loss": 0.7775, |
| "mean_token_accuracy": 0.8053169548511505, |
| "num_tokens": 14962850.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.089171974522293, |
| "grad_norm": 0.6594023108482361, |
| "learning_rate": 7.617933702981198e-05, |
| "loss": 0.7764, |
| "mean_token_accuracy": 0.8061047494411469, |
| "num_tokens": 15011258.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.101910828025478, |
| "grad_norm": 0.6146224737167358, |
| "learning_rate": 7.560298158896114e-05, |
| "loss": 0.7769, |
| "mean_token_accuracy": 0.8081805408000946, |
| "num_tokens": 15056644.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.114649681528663, |
| "grad_norm": 0.5424087047576904, |
| "learning_rate": 7.502748659462311e-05, |
| "loss": 0.7706, |
| "mean_token_accuracy": 0.8129306137561798, |
| "num_tokens": 15102628.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.127388535031847, |
| "grad_norm": 0.5145137310028076, |
| "learning_rate": 7.445287234364946e-05, |
| "loss": 0.7846, |
| "mean_token_accuracy": 0.8085419535636902, |
| "num_tokens": 15147902.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.140127388535032, |
| "grad_norm": 0.5234518051147461, |
| "learning_rate": 7.38791591018292e-05, |
| "loss": 0.765, |
| "mean_token_accuracy": 0.8127568960189819, |
| "num_tokens": 15191402.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.1528662420382165, |
| "grad_norm": 0.5007306933403015, |
| "learning_rate": 7.330636710317417e-05, |
| "loss": 0.8103, |
| "mean_token_accuracy": 0.8035311698913574, |
| "num_tokens": 15237737.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.165605095541402, |
| "grad_norm": 0.517250120639801, |
| "learning_rate": 7.273451654920532e-05, |
| "loss": 0.7801, |
| "mean_token_accuracy": 0.8110656440258026, |
| "num_tokens": 15284311.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.178343949044586, |
| "grad_norm": 0.5196605920791626, |
| "learning_rate": 7.21636276082401e-05, |
| "loss": 0.7937, |
| "mean_token_accuracy": 0.8047934472560883, |
| "num_tokens": 15330798.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.191082802547771, |
| "grad_norm": 0.5460777878761292, |
| "learning_rate": 7.15937204146815e-05, |
| "loss": 0.8176, |
| "mean_token_accuracy": 0.8022070527076721, |
| "num_tokens": 15378878.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.203821656050955, |
| "grad_norm": 0.5694323778152466, |
| "learning_rate": 7.102481506830764e-05, |
| "loss": 0.8123, |
| "mean_token_accuracy": 0.8015323579311371, |
| "num_tokens": 15425749.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.2165605095541405, |
| "grad_norm": 0.55637127161026, |
| "learning_rate": 7.0456931633563e-05, |
| "loss": 0.7753, |
| "mean_token_accuracy": 0.8087098598480225, |
| "num_tokens": 15472222.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.229299363057325, |
| "grad_norm": 0.5772049427032471, |
| "learning_rate": 6.989009013885077e-05, |
| "loss": 0.7884, |
| "mean_token_accuracy": 0.8073362112045288, |
| "num_tokens": 15521012.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.24203821656051, |
| "grad_norm": 0.5783923268318176, |
| "learning_rate": 6.932431057582647e-05, |
| "loss": 0.7451, |
| "mean_token_accuracy": 0.8135620653629303, |
| "num_tokens": 15566485.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.254777070063694, |
| "grad_norm": 0.5757331252098083, |
| "learning_rate": 6.875961289869283e-05, |
| "loss": 0.7487, |
| "mean_token_accuracy": 0.8147032558917999, |
| "num_tokens": 15612600.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.267515923566879, |
| "grad_norm": 0.5666617751121521, |
| "learning_rate": 6.819601702349609e-05, |
| "loss": 0.7653, |
| "mean_token_accuracy": 0.810498058795929, |
| "num_tokens": 15658443.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.280254777070064, |
| "grad_norm": 0.54319828748703, |
| "learning_rate": 6.763354282742363e-05, |
| "loss": 0.7754, |
| "mean_token_accuracy": 0.8075751662254333, |
| "num_tokens": 15706012.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.292993630573249, |
| "grad_norm": 0.5346329212188721, |
| "learning_rate": 6.707221014810279e-05, |
| "loss": 0.7588, |
| "mean_token_accuracy": 0.812885046005249, |
| "num_tokens": 15752588.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.305732484076433, |
| "grad_norm": 0.5441272258758545, |
| "learning_rate": 6.651203878290139e-05, |
| "loss": 0.7827, |
| "mean_token_accuracy": 0.8059158623218536, |
| "num_tokens": 15798766.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.318471337579618, |
| "grad_norm": 0.5370075106620789, |
| "learning_rate": 6.59530484882294e-05, |
| "loss": 0.8123, |
| "mean_token_accuracy": 0.8005849421024323, |
| "num_tokens": 15845861.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.3312101910828025, |
| "grad_norm": 0.5364204049110413, |
| "learning_rate": 6.539525897884219e-05, |
| "loss": 0.7945, |
| "mean_token_accuracy": 0.8061460852622986, |
| "num_tokens": 15891605.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.343949044585988, |
| "grad_norm": 0.5339395403862, |
| "learning_rate": 6.48386899271452e-05, |
| "loss": 0.8008, |
| "mean_token_accuracy": 0.8012154996395111, |
| "num_tokens": 15940667.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.356687898089172, |
| "grad_norm": 0.5205627083778381, |
| "learning_rate": 6.428336096250019e-05, |
| "loss": 0.7537, |
| "mean_token_accuracy": 0.8153076469898224, |
| "num_tokens": 15987561.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.369426751592357, |
| "grad_norm": 0.5304903388023376, |
| "learning_rate": 6.372929167053286e-05, |
| "loss": 0.7702, |
| "mean_token_accuracy": 0.809718132019043, |
| "num_tokens": 16034176.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.382165605095541, |
| "grad_norm": 0.5487926602363586, |
| "learning_rate": 6.317650159244212e-05, |
| "loss": 0.7613, |
| "mean_token_accuracy": 0.8127056956291199, |
| "num_tokens": 16082008.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3949044585987265, |
| "grad_norm": 0.5397400856018066, |
| "learning_rate": 6.2625010224311e-05, |
| "loss": 0.767, |
| "mean_token_accuracy": 0.8101482689380646, |
| "num_tokens": 16127461.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.407643312101911, |
| "grad_norm": 0.5537377595901489, |
| "learning_rate": 6.207483701641888e-05, |
| "loss": 0.7713, |
| "mean_token_accuracy": 0.8083570003509521, |
| "num_tokens": 16173594.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.420382165605096, |
| "grad_norm": 0.5595129728317261, |
| "learning_rate": 6.15260013725555e-05, |
| "loss": 0.7617, |
| "mean_token_accuracy": 0.8116026222705841, |
| "num_tokens": 16218042.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.43312101910828, |
| "grad_norm": 0.5709227323532104, |
| "learning_rate": 6.097852264933697e-05, |
| "loss": 0.7986, |
| "mean_token_accuracy": 0.8036070764064789, |
| "num_tokens": 16264765.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.445859872611465, |
| "grad_norm": 0.5528348684310913, |
| "learning_rate": 6.043242015552258e-05, |
| "loss": 0.7754, |
| "mean_token_accuracy": 0.8096699416637421, |
| "num_tokens": 16311474.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.45859872611465, |
| "grad_norm": 0.5509300827980042, |
| "learning_rate": 5.988771315133418e-05, |
| "loss": 0.7629, |
| "mean_token_accuracy": 0.812688410282135, |
| "num_tokens": 16359002.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.471337579617835, |
| "grad_norm": 0.5490424633026123, |
| "learning_rate": 5.934442084777676e-05, |
| "loss": 0.7771, |
| "mean_token_accuracy": 0.8061512410640717, |
| "num_tokens": 16407048.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.484076433121019, |
| "grad_norm": 0.5424743294715881, |
| "learning_rate": 5.880256240596096e-05, |
| "loss": 0.7625, |
| "mean_token_accuracy": 0.811147153377533, |
| "num_tokens": 16453863.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.496815286624204, |
| "grad_norm": 0.5359919667243958, |
| "learning_rate": 5.8262156936427096e-05, |
| "loss": 0.7985, |
| "mean_token_accuracy": 0.8056308627128601, |
| "num_tokens": 16502333.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.509554140127388, |
| "grad_norm": 0.5353891253471375, |
| "learning_rate": 5.772322349847154e-05, |
| "loss": 0.7774, |
| "mean_token_accuracy": 0.8094648122787476, |
| "num_tokens": 16549278.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.522292993630574, |
| "grad_norm": 0.5505733489990234, |
| "learning_rate": 5.71857810994741e-05, |
| "loss": 0.7633, |
| "mean_token_accuracy": 0.8114041388034821, |
| "num_tokens": 16595007.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.535031847133758, |
| "grad_norm": 0.5385571122169495, |
| "learning_rate": 5.6649848694228026e-05, |
| "loss": 0.7829, |
| "mean_token_accuracy": 0.8066455721855164, |
| "num_tokens": 16642899.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.547770700636943, |
| "grad_norm": 0.5487037301063538, |
| "learning_rate": 5.611544518427121e-05, |
| "loss": 0.7427, |
| "mean_token_accuracy": 0.8148898184299469, |
| "num_tokens": 16687593.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.560509554140127, |
| "grad_norm": 0.5425994396209717, |
| "learning_rate": 5.558258941721982e-05, |
| "loss": 0.7872, |
| "mean_token_accuracy": 0.8057865798473358, |
| "num_tokens": 16737104.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.573248407643312, |
| "grad_norm": 0.5299367904663086, |
| "learning_rate": 5.5051300186103214e-05, |
| "loss": 0.7353, |
| "mean_token_accuracy": 0.8165575265884399, |
| "num_tokens": 16782471.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.585987261146497, |
| "grad_norm": 0.5561987161636353, |
| "learning_rate": 5.452159622870158e-05, |
| "loss": 0.7256, |
| "mean_token_accuracy": 0.8211332857608795, |
| "num_tokens": 16824795.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.598726114649682, |
| "grad_norm": 0.5320610404014587, |
| "learning_rate": 5.399349622688479e-05, |
| "loss": 0.7847, |
| "mean_token_accuracy": 0.806152880191803, |
| "num_tokens": 16873618.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.611464968152866, |
| "grad_norm": 0.5142655968666077, |
| "learning_rate": 5.346701880595354e-05, |
| "loss": 0.768, |
| "mean_token_accuracy": 0.8106401562690735, |
| "num_tokens": 16921852.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.624203821656051, |
| "grad_norm": 0.5498877763748169, |
| "learning_rate": 5.29421825339826e-05, |
| "loss": 0.7585, |
| "mean_token_accuracy": 0.8139531016349792, |
| "num_tokens": 16968343.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.6369426751592355, |
| "grad_norm": 0.5473263263702393, |
| "learning_rate": 5.24190059211658e-05, |
| "loss": 0.7421, |
| "mean_token_accuracy": 0.8171448707580566, |
| "num_tokens": 17012314.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.649681528662421, |
| "grad_norm": 0.545117199420929, |
| "learning_rate": 5.189750741916326e-05, |
| "loss": 0.7712, |
| "mean_token_accuracy": 0.8083784878253937, |
| "num_tokens": 17059162.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.662420382165605, |
| "grad_norm": 0.5788088440895081, |
| "learning_rate": 5.137770542045063e-05, |
| "loss": 0.7568, |
| "mean_token_accuracy": 0.8137945234775543, |
| "num_tokens": 17103266.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.67515923566879, |
| "grad_norm": 0.5412328243255615, |
| "learning_rate": 5.085961825767049e-05, |
| "loss": 0.7962, |
| "mean_token_accuracy": 0.80179163813591, |
| "num_tokens": 17153007.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.687898089171974, |
| "grad_norm": 0.5531262159347534, |
| "learning_rate": 5.0343264202985575e-05, |
| "loss": 0.7539, |
| "mean_token_accuracy": 0.8140422999858856, |
| "num_tokens": 17197748.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.7006369426751595, |
| "grad_norm": 0.554670512676239, |
| "learning_rate": 4.9828661467434644e-05, |
| "loss": 0.7965, |
| "mean_token_accuracy": 0.8047409653663635, |
| "num_tokens": 17245560.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.713375796178344, |
| "grad_norm": 0.5575906038284302, |
| "learning_rate": 4.93158282002899e-05, |
| "loss": 0.7646, |
| "mean_token_accuracy": 0.8107549250125885, |
| "num_tokens": 17291952.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.726114649681529, |
| "grad_norm": 0.5389590263366699, |
| "learning_rate": 4.8804782488417054e-05, |
| "loss": 0.8151, |
| "mean_token_accuracy": 0.8011313676834106, |
| "num_tokens": 17342344.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.738853503184713, |
| "grad_norm": 0.5552359819412231, |
| "learning_rate": 4.82955423556375e-05, |
| "loss": 0.7789, |
| "mean_token_accuracy": 0.8068567216396332, |
| "num_tokens": 17389806.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.751592356687898, |
| "grad_norm": 0.5424468517303467, |
| "learning_rate": 4.778812576209241e-05, |
| "loss": 0.7622, |
| "mean_token_accuracy": 0.8100213408470154, |
| "num_tokens": 17438195.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.764331210191083, |
| "grad_norm": 0.5468940138816833, |
| "learning_rate": 4.728255060360955e-05, |
| "loss": 0.7555, |
| "mean_token_accuracy": 0.8137983977794647, |
| "num_tokens": 17482935.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.777070063694268, |
| "grad_norm": 0.54682457447052, |
| "learning_rate": 4.677883471107193e-05, |
| "loss": 0.7665, |
| "mean_token_accuracy": 0.8110204339027405, |
| "num_tokens": 17529731.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.789808917197452, |
| "grad_norm": 0.5494992136955261, |
| "learning_rate": 4.6276995849789115e-05, |
| "loss": 0.7748, |
| "mean_token_accuracy": 0.8063468039035797, |
| "num_tokens": 17575732.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.802547770700637, |
| "grad_norm": 0.5323486328125, |
| "learning_rate": 4.57770517188705e-05, |
| "loss": 0.7762, |
| "mean_token_accuracy": 0.8069157600402832, |
| "num_tokens": 17625739.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.8152866242038215, |
| "grad_norm": 0.5506855249404907, |
| "learning_rate": 4.527901995060113e-05, |
| "loss": 0.7642, |
| "mean_token_accuracy": 0.8129552602767944, |
| "num_tokens": 17672179.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.828025477707007, |
| "grad_norm": 0.5435847043991089, |
| "learning_rate": 4.478291810981998e-05, |
| "loss": 0.7856, |
| "mean_token_accuracy": 0.8080207407474518, |
| "num_tokens": 17718571.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.840764331210191, |
| "grad_norm": 0.5513826012611389, |
| "learning_rate": 4.428876369330023e-05, |
| "loss": 0.7519, |
| "mean_token_accuracy": 0.8144398927688599, |
| "num_tokens": 17764089.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.853503184713376, |
| "grad_norm": 0.5551168918609619, |
| "learning_rate": 4.379657412913243e-05, |
| "loss": 0.8151, |
| "mean_token_accuracy": 0.8006792664527893, |
| "num_tokens": 17811590.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.86624203821656, |
| "grad_norm": 0.5645202994346619, |
| "learning_rate": 4.330636677610962e-05, |
| "loss": 0.7522, |
| "mean_token_accuracy": 0.8127522766590118, |
| "num_tokens": 17858948.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8789808917197455, |
| "grad_norm": 0.5622471570968628, |
| "learning_rate": 4.281815892311525e-05, |
| "loss": 0.8062, |
| "mean_token_accuracy": 0.8032259941101074, |
| "num_tokens": 17908157.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.89171974522293, |
| "grad_norm": 0.542911946773529, |
| "learning_rate": 4.2331967788513295e-05, |
| "loss": 0.7682, |
| "mean_token_accuracy": 0.8091734647750854, |
| "num_tokens": 17954806.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.904458598726115, |
| "grad_norm": 0.5518525838851929, |
| "learning_rate": 4.1847810519541255e-05, |
| "loss": 0.7999, |
| "mean_token_accuracy": 0.801593542098999, |
| "num_tokens": 18004377.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.917197452229299, |
| "grad_norm": 0.5533684492111206, |
| "learning_rate": 4.136570419170501e-05, |
| "loss": 0.7968, |
| "mean_token_accuracy": 0.8025395572185516, |
| "num_tokens": 18052401.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.929936305732484, |
| "grad_norm": 0.55246502161026, |
| "learning_rate": 4.088566580817694e-05, |
| "loss": 0.7978, |
| "mean_token_accuracy": 0.8031694889068604, |
| "num_tokens": 18100024.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "grad_norm": 0.5535824298858643, |
| "learning_rate": 4.040771229919612e-05, |
| "loss": 0.7482, |
| "mean_token_accuracy": 0.8140803873538971, |
| "num_tokens": 18147924.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.955414012738854, |
| "grad_norm": 0.5558858513832092, |
| "learning_rate": 3.99318605214711e-05, |
| "loss": 0.7681, |
| "mean_token_accuracy": 0.8126172721385956, |
| "num_tokens": 18192564.0, |
| "step": 391 |
| }, |
| { |
| "epoch": 4.968152866242038, |
| "grad_norm": 0.5758087038993835, |
| "learning_rate": 3.945812725758554e-05, |
| "loss": 0.7549, |
| "mean_token_accuracy": 0.8129025399684906, |
| "num_tokens": 18235174.0, |
| "step": 392 |
| }, |
| { |
| "epoch": 4.980891719745223, |
| "grad_norm": 0.5681016445159912, |
| "learning_rate": 3.8986529215406275e-05, |
| "loss": 0.7903, |
| "mean_token_accuracy": 0.803301215171814, |
| "num_tokens": 18282949.0, |
| "step": 393 |
| }, |
| { |
| "epoch": 4.993630573248407, |
| "grad_norm": 0.5532224178314209, |
| "learning_rate": 3.851708302749409e-05, |
| "loss": 0.8045, |
| "mean_token_accuracy": 0.801055371761322, |
| "num_tokens": 18331817.0, |
| "step": 394 |
| }, |
| { |
| "epoch": 5.0, |
| "grad_norm": 0.5532224178314209, |
| "learning_rate": 3.8049805250517004e-05, |
| "loss": 0.6807, |
| "mean_token_accuracy": 0.8316032886505127, |
| "num_tokens": 18355644.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 5.012738853503185, |
| "grad_norm": 0.803767204284668, |
| "learning_rate": 3.7584712364666494e-05, |
| "loss": 0.6007, |
| "mean_token_accuracy": 0.8561270534992218, |
| "num_tokens": 18401098.0, |
| "step": 396 |
| }, |
| { |
| "epoch": 5.025477707006369, |
| "grad_norm": 0.5155036449432373, |
| "learning_rate": 3.71218207730761e-05, |
| "loss": 0.5801, |
| "mean_token_accuracy": 0.8610466420650482, |
| "num_tokens": 18447934.0, |
| "step": 397 |
| }, |
| { |
| "epoch": 5.038216560509555, |
| "grad_norm": 0.5219685435295105, |
| "learning_rate": 3.666114680124298e-05, |
| "loss": 0.5532, |
| "mean_token_accuracy": 0.8671682178974152, |
| "num_tokens": 18494377.0, |
| "step": 398 |
| }, |
| { |
| "epoch": 5.050955414012739, |
| "grad_norm": 0.5384805798530579, |
| "learning_rate": 3.620270669645228e-05, |
| "loss": 0.5539, |
| "mean_token_accuracy": 0.8648174703121185, |
| "num_tokens": 18537068.0, |
| "step": 399 |
| }, |
| { |
| "epoch": 5.063694267515924, |
| "grad_norm": 0.5684152841567993, |
| "learning_rate": 3.574651662720382e-05, |
| "loss": 0.5738, |
| "mean_token_accuracy": 0.8580814898014069, |
| "num_tokens": 18581071.0, |
| "step": 400 |
| }, |
| { |
| "epoch": 5.076433121019108, |
| "grad_norm": 0.6354894638061523, |
| "learning_rate": 3.5292592682642134e-05, |
| "loss": 0.5662, |
| "mean_token_accuracy": 0.8605021834373474, |
| "num_tokens": 18629826.0, |
| "step": 401 |
| }, |
| { |
| "epoch": 5.089171974522293, |
| "grad_norm": 0.6762036681175232, |
| "learning_rate": 3.484095087198881e-05, |
| "loss": 0.5567, |
| "mean_token_accuracy": 0.8611220121383667, |
| "num_tokens": 18679551.0, |
| "step": 402 |
| }, |
| { |
| "epoch": 5.101910828025478, |
| "grad_norm": 0.7970669865608215, |
| "learning_rate": 3.4391607123978095e-05, |
| "loss": 0.5898, |
| "mean_token_accuracy": 0.853861540555954, |
| "num_tokens": 18726481.0, |
| "step": 403 |
| }, |
| { |
| "epoch": 5.114649681528663, |
| "grad_norm": 0.7165261507034302, |
| "learning_rate": 3.394457728629489e-05, |
| "loss": 0.5543, |
| "mean_token_accuracy": 0.8633293807506561, |
| "num_tokens": 18774675.0, |
| "step": 404 |
| }, |
| { |
| "epoch": 5.127388535031847, |
| "grad_norm": 0.6630553007125854, |
| "learning_rate": 3.349987712501591e-05, |
| "loss": 0.5794, |
| "mean_token_accuracy": 0.8572741746902466, |
| "num_tokens": 18819968.0, |
| "step": 405 |
| }, |
| { |
| "epoch": 5.140127388535032, |
| "grad_norm": 0.6473745703697205, |
| "learning_rate": 3.305752232405377e-05, |
| "loss": 0.5514, |
| "mean_token_accuracy": 0.8612950146198273, |
| "num_tokens": 18867168.0, |
| "step": 406 |
| }, |
| { |
| "epoch": 5.1528662420382165, |
| "grad_norm": 0.6203842163085938, |
| "learning_rate": 3.2617528484603576e-05, |
| "loss": 0.5792, |
| "mean_token_accuracy": 0.8582462072372437, |
| "num_tokens": 18915270.0, |
| "step": 407 |
| }, |
| { |
| "epoch": 5.165605095541402, |
| "grad_norm": 0.632040798664093, |
| "learning_rate": 3.2179911124592966e-05, |
| "loss": 0.5655, |
| "mean_token_accuracy": 0.864041805267334, |
| "num_tokens": 18961168.0, |
| "step": 408 |
| }, |
| { |
| "epoch": 5.178343949044586, |
| "grad_norm": 0.5363501906394958, |
| "learning_rate": 3.174468567813461e-05, |
| "loss": 0.5529, |
| "mean_token_accuracy": 0.865607500076294, |
| "num_tokens": 19009217.0, |
| "step": 409 |
| }, |
| { |
| "epoch": 5.191082802547771, |
| "grad_norm": 0.5809481739997864, |
| "learning_rate": 3.131186749498195e-05, |
| "loss": 0.5753, |
| "mean_token_accuracy": 0.8589119017124176, |
| "num_tokens": 19058035.0, |
| "step": 410 |
| }, |
| { |
| "epoch": 5.203821656050955, |
| "grad_norm": 0.533413290977478, |
| "learning_rate": 3.088147183998782e-05, |
| "loss": 0.5756, |
| "mean_token_accuracy": 0.8603843152523041, |
| "num_tokens": 19105942.0, |
| "step": 411 |
| }, |
| { |
| "epoch": 5.2165605095541405, |
| "grad_norm": 0.5912073850631714, |
| "learning_rate": 3.0453513892566197e-05, |
| "loss": 0.5713, |
| "mean_token_accuracy": 0.8610886931419373, |
| "num_tokens": 19149032.0, |
| "step": 412 |
| }, |
| { |
| "epoch": 5.229299363057325, |
| "grad_norm": 0.5597264170646667, |
| "learning_rate": 3.0028008746156588e-05, |
| "loss": 0.5593, |
| "mean_token_accuracy": 0.8630417883396149, |
| "num_tokens": 19193905.0, |
| "step": 413 |
| }, |
| { |
| "epoch": 5.24203821656051, |
| "grad_norm": 0.5707894563674927, |
| "learning_rate": 2.9604971407692027e-05, |
| "loss": 0.5656, |
| "mean_token_accuracy": 0.8626342117786407, |
| "num_tokens": 19241798.0, |
| "step": 414 |
| }, |
| { |
| "epoch": 5.254777070063694, |
| "grad_norm": 0.5729110240936279, |
| "learning_rate": 2.918441679706949e-05, |
| "loss": 0.5593, |
| "mean_token_accuracy": 0.8617399036884308, |
| "num_tokens": 19287116.0, |
| "step": 415 |
| }, |
| { |
| "epoch": 5.267515923566879, |
| "grad_norm": 0.6001513600349426, |
| "learning_rate": 2.8766359746623894e-05, |
| "loss": 0.5541, |
| "mean_token_accuracy": 0.8645914494991302, |
| "num_tokens": 19333494.0, |
| "step": 416 |
| }, |
| { |
| "epoch": 5.280254777070064, |
| "grad_norm": 0.620059609413147, |
| "learning_rate": 2.835081500060498e-05, |
| "loss": 0.5485, |
| "mean_token_accuracy": 0.8663501143455505, |
| "num_tokens": 19380078.0, |
| "step": 417 |
| }, |
| { |
| "epoch": 5.292993630573249, |
| "grad_norm": 0.6021698117256165, |
| "learning_rate": 2.7937797214657147e-05, |
| "loss": 0.5778, |
| "mean_token_accuracy": 0.8575234711170197, |
| "num_tokens": 19429142.0, |
| "step": 418 |
| }, |
| { |
| "epoch": 5.305732484076433, |
| "grad_norm": 0.6448414325714111, |
| "learning_rate": 2.7527320955302794e-05, |
| "loss": 0.5887, |
| "mean_token_accuracy": 0.8552671074867249, |
| "num_tokens": 19477251.0, |
| "step": 419 |
| }, |
| { |
| "epoch": 5.318471337579618, |
| "grad_norm": 0.6018058657646179, |
| "learning_rate": 2.7119400699428332e-05, |
| "loss": 0.5486, |
| "mean_token_accuracy": 0.8661691546440125, |
| "num_tokens": 19523462.0, |
| "step": 420 |
| }, |
| { |
| "epoch": 5.3312101910828025, |
| "grad_norm": 0.598821222782135, |
| "learning_rate": 2.671405083377386e-05, |
| "loss": 0.5559, |
| "mean_token_accuracy": 0.8639799356460571, |
| "num_tokens": 19570087.0, |
| "step": 421 |
| }, |
| { |
| "epoch": 5.343949044585988, |
| "grad_norm": 0.6228508949279785, |
| "learning_rate": 2.6311285654425575e-05, |
| "loss": 0.5626, |
| "mean_token_accuracy": 0.8616799116134644, |
| "num_tokens": 19618251.0, |
| "step": 422 |
| }, |
| { |
| "epoch": 5.356687898089172, |
| "grad_norm": 0.591503381729126, |
| "learning_rate": 2.5911119366311597e-05, |
| "loss": 0.5654, |
| "mean_token_accuracy": 0.8612537682056427, |
| "num_tokens": 19666992.0, |
| "step": 423 |
| }, |
| { |
| "epoch": 5.369426751592357, |
| "grad_norm": 0.5860921144485474, |
| "learning_rate": 2.5513566082701135e-05, |
| "loss": 0.5671, |
| "mean_token_accuracy": 0.8606434762477875, |
| "num_tokens": 19714972.0, |
| "step": 424 |
| }, |
| { |
| "epoch": 5.382165605095541, |
| "grad_norm": 0.5802496671676636, |
| "learning_rate": 2.51186398247065e-05, |
| "loss": 0.5646, |
| "mean_token_accuracy": 0.8609052002429962, |
| "num_tokens": 19762246.0, |
| "step": 425 |
| }, |
| { |
| "epoch": 5.3949044585987265, |
| "grad_norm": 0.5896458625793457, |
| "learning_rate": 2.472635452078883e-05, |
| "loss": 0.5398, |
| "mean_token_accuracy": 0.8695516288280487, |
| "num_tokens": 19805820.0, |
| "step": 426 |
| }, |
| { |
| "epoch": 5.407643312101911, |
| "grad_norm": 0.6189890503883362, |
| "learning_rate": 2.433672400626663e-05, |
| "loss": 0.56, |
| "mean_token_accuracy": 0.8619295656681061, |
| "num_tokens": 19850138.0, |
| "step": 427 |
| }, |
| { |
| "epoch": 5.420382165605096, |
| "grad_norm": 0.5819289088249207, |
| "learning_rate": 2.3949762022828092e-05, |
| "loss": 0.5778, |
| "mean_token_accuracy": 0.8582758605480194, |
| "num_tokens": 19897704.0, |
| "step": 428 |
| }, |
| { |
| "epoch": 5.43312101910828, |
| "grad_norm": 0.5880019664764404, |
| "learning_rate": 2.3565482218046075e-05, |
| "loss": 0.5617, |
| "mean_token_accuracy": 0.8624799251556396, |
| "num_tokens": 19945551.0, |
| "step": 429 |
| }, |
| { |
| "epoch": 5.445859872611465, |
| "grad_norm": 0.5863910913467407, |
| "learning_rate": 2.3183898144897177e-05, |
| "loss": 0.5669, |
| "mean_token_accuracy": 0.8587363660335541, |
| "num_tokens": 19992591.0, |
| "step": 430 |
| }, |
| { |
| "epoch": 5.45859872611465, |
| "grad_norm": 0.5961703062057495, |
| "learning_rate": 2.2805023261283497e-05, |
| "loss": 0.5723, |
| "mean_token_accuracy": 0.8603742122650146, |
| "num_tokens": 20040108.0, |
| "step": 431 |
| }, |
| { |
| "epoch": 5.471337579617835, |
| "grad_norm": 0.5917873382568359, |
| "learning_rate": 2.242887092955801e-05, |
| "loss": 0.5632, |
| "mean_token_accuracy": 0.8612915873527527, |
| "num_tokens": 20084175.0, |
| "step": 432 |
| }, |
| { |
| "epoch": 5.484076433121019, |
| "grad_norm": 0.5897845029830933, |
| "learning_rate": 2.2055454416053422e-05, |
| "loss": 0.5538, |
| "mean_token_accuracy": 0.8653071224689484, |
| "num_tokens": 20128240.0, |
| "step": 433 |
| }, |
| { |
| "epoch": 5.496815286624204, |
| "grad_norm": 0.6288106441497803, |
| "learning_rate": 2.168478689061413e-05, |
| "loss": 0.5509, |
| "mean_token_accuracy": 0.8656776249408722, |
| "num_tokens": 20174729.0, |
| "step": 434 |
| }, |
| { |
| "epoch": 5.509554140127388, |
| "grad_norm": 0.5910764932632446, |
| "learning_rate": 2.131688142613183e-05, |
| "loss": 0.5725, |
| "mean_token_accuracy": 0.8601183593273163, |
| "num_tokens": 20224313.0, |
| "step": 435 |
| }, |
| { |
| "epoch": 5.522292993630574, |
| "grad_norm": 0.5756183862686157, |
| "learning_rate": 2.095175099808444e-05, |
| "loss": 0.5465, |
| "mean_token_accuracy": 0.8652230203151703, |
| "num_tokens": 20271807.0, |
| "step": 436 |
| }, |
| { |
| "epoch": 5.535031847133758, |
| "grad_norm": 0.6019288301467896, |
| "learning_rate": 2.058940848407854e-05, |
| "loss": 0.5743, |
| "mean_token_accuracy": 0.8625396490097046, |
| "num_tokens": 20319175.0, |
| "step": 437 |
| }, |
| { |
| "epoch": 5.547770700636943, |
| "grad_norm": 0.593775749206543, |
| "learning_rate": 2.0229866663395026e-05, |
| "loss": 0.547, |
| "mean_token_accuracy": 0.8664292097091675, |
| "num_tokens": 20363325.0, |
| "step": 438 |
| }, |
| { |
| "epoch": 5.560509554140127, |
| "grad_norm": 0.602142870426178, |
| "learning_rate": 1.987313821653861e-05, |
| "loss": 0.5731, |
| "mean_token_accuracy": 0.8586575984954834, |
| "num_tokens": 20411205.0, |
| "step": 439 |
| }, |
| { |
| "epoch": 5.573248407643312, |
| "grad_norm": 0.591356098651886, |
| "learning_rate": 1.951923572479044e-05, |
| "loss": 0.5506, |
| "mean_token_accuracy": 0.8643897771835327, |
| "num_tokens": 20454798.0, |
| "step": 440 |
| }, |
| { |
| "epoch": 5.585987261146497, |
| "grad_norm": 0.6110073924064636, |
| "learning_rate": 1.9168171669764413e-05, |
| "loss": 0.5401, |
| "mean_token_accuracy": 0.8683696687221527, |
| "num_tokens": 20500406.0, |
| "step": 441 |
| }, |
| { |
| "epoch": 5.598726114649682, |
| "grad_norm": 0.5945736765861511, |
| "learning_rate": 1.881995843296708e-05, |
| "loss": 0.5523, |
| "mean_token_accuracy": 0.8627299666404724, |
| "num_tokens": 20545603.0, |
| "step": 442 |
| }, |
| { |
| "epoch": 5.611464968152866, |
| "grad_norm": 0.6136711239814758, |
| "learning_rate": 1.847460829536075e-05, |
| "loss": 0.5806, |
| "mean_token_accuracy": 0.8575672209262848, |
| "num_tokens": 20590976.0, |
| "step": 443 |
| }, |
| { |
| "epoch": 5.624203821656051, |
| "grad_norm": 0.5992861390113831, |
| "learning_rate": 1.8132133436930642e-05, |
| "loss": 0.5705, |
| "mean_token_accuracy": 0.8608649969100952, |
| "num_tokens": 20639201.0, |
| "step": 444 |
| }, |
| { |
| "epoch": 5.6369426751592355, |
| "grad_norm": 0.5806087255477905, |
| "learning_rate": 1.7792545936255013e-05, |
| "loss": 0.5845, |
| "mean_token_accuracy": 0.8575698733329773, |
| "num_tokens": 20691761.0, |
| "step": 445 |
| }, |
| { |
| "epoch": 5.649681528662421, |
| "grad_norm": 0.5738813877105713, |
| "learning_rate": 1.745585777007943e-05, |
| "loss": 0.5557, |
| "mean_token_accuracy": 0.8638261556625366, |
| "num_tokens": 20736217.0, |
| "step": 446 |
| }, |
| { |
| "epoch": 5.662420382165605, |
| "grad_norm": 0.6299033761024475, |
| "learning_rate": 1.7122080812894147e-05, |
| "loss": 0.5859, |
| "mean_token_accuracy": 0.8571733236312866, |
| "num_tokens": 20783324.0, |
| "step": 447 |
| }, |
| { |
| "epoch": 5.67515923566879, |
| "grad_norm": 0.5905052423477173, |
| "learning_rate": 1.679122683651546e-05, |
| "loss": 0.5646, |
| "mean_token_accuracy": 0.8605034649372101, |
| "num_tokens": 20829442.0, |
| "step": 448 |
| }, |
| { |
| "epoch": 5.687898089171974, |
| "grad_norm": 0.6001847982406616, |
| "learning_rate": 1.6463307509670524e-05, |
| "loss": 0.5715, |
| "mean_token_accuracy": 0.8600328266620636, |
| "num_tokens": 20876617.0, |
| "step": 449 |
| }, |
| { |
| "epoch": 5.7006369426751595, |
| "grad_norm": 0.615409791469574, |
| "learning_rate": 1.6138334397585675e-05, |
| "loss": 0.5581, |
| "mean_token_accuracy": 0.8639148473739624, |
| "num_tokens": 20923904.0, |
| "step": 450 |
| }, |
| { |
| "epoch": 5.713375796178344, |
| "grad_norm": 0.6029254794120789, |
| "learning_rate": 1.5816318961578757e-05, |
| "loss": 0.5588, |
| "mean_token_accuracy": 0.8626428246498108, |
| "num_tokens": 20968829.0, |
| "step": 451 |
| }, |
| { |
| "epoch": 5.726114649681529, |
| "grad_norm": 0.6081089973449707, |
| "learning_rate": 1.5497272558654697e-05, |
| "loss": 0.5754, |
| "mean_token_accuracy": 0.8593170344829559, |
| "num_tokens": 21013343.0, |
| "step": 452 |
| }, |
| { |
| "epoch": 5.738853503184713, |
| "grad_norm": 0.6028342843055725, |
| "learning_rate": 1.5181206441105078e-05, |
| "loss": 0.5784, |
| "mean_token_accuracy": 0.8598412871360779, |
| "num_tokens": 21063652.0, |
| "step": 453 |
| }, |
| { |
| "epoch": 5.751592356687898, |
| "grad_norm": 0.5935065746307373, |
| "learning_rate": 1.4868131756111225e-05, |
| "loss": 0.5785, |
| "mean_token_accuracy": 0.858275294303894, |
| "num_tokens": 21110656.0, |
| "step": 454 |
| }, |
| { |
| "epoch": 5.764331210191083, |
| "grad_norm": 0.5879067182540894, |
| "learning_rate": 1.4558059545351143e-05, |
| "loss": 0.5793, |
| "mean_token_accuracy": 0.855660617351532, |
| "num_tokens": 21159702.0, |
| "step": 455 |
| }, |
| { |
| "epoch": 5.777070063694268, |
| "grad_norm": 0.6150187849998474, |
| "learning_rate": 1.4251000744610033e-05, |
| "loss": 0.5673, |
| "mean_token_accuracy": 0.8586822152137756, |
| "num_tokens": 21204767.0, |
| "step": 456 |
| }, |
| { |
| "epoch": 5.789808917197452, |
| "grad_norm": 0.5964578986167908, |
| "learning_rate": 1.394696618339456e-05, |
| "loss": 0.5565, |
| "mean_token_accuracy": 0.8625064194202423, |
| "num_tokens": 21253400.0, |
| "step": 457 |
| }, |
| { |
| "epoch": 5.802547770700637, |
| "grad_norm": 0.5985179543495178, |
| "learning_rate": 1.364596658455105e-05, |
| "loss": 0.5715, |
| "mean_token_accuracy": 0.859099268913269, |
| "num_tokens": 21302541.0, |
| "step": 458 |
| }, |
| { |
| "epoch": 5.8152866242038215, |
| "grad_norm": 0.6097904443740845, |
| "learning_rate": 1.3348012563887102e-05, |
| "loss": 0.527, |
| "mean_token_accuracy": 0.8690455555915833, |
| "num_tokens": 21348200.0, |
| "step": 459 |
| }, |
| { |
| "epoch": 5.828025477707007, |
| "grad_norm": 0.6043243408203125, |
| "learning_rate": 1.3053114629797437e-05, |
| "loss": 0.5621, |
| "mean_token_accuracy": 0.8595924079418182, |
| "num_tokens": 21393364.0, |
| "step": 460 |
| }, |
| { |
| "epoch": 5.840764331210191, |
| "grad_norm": 0.6127822399139404, |
| "learning_rate": 1.2761283182893047e-05, |
| "loss": 0.5672, |
| "mean_token_accuracy": 0.8621090352535248, |
| "num_tokens": 21438173.0, |
| "step": 461 |
| }, |
| { |
| "epoch": 5.853503184713376, |
| "grad_norm": 0.5967704653739929, |
| "learning_rate": 1.2472528515634584e-05, |
| "loss": 0.5442, |
| "mean_token_accuracy": 0.8661996722221375, |
| "num_tokens": 21484340.0, |
| "step": 462 |
| }, |
| { |
| "epoch": 5.86624203821656, |
| "grad_norm": 0.5981035232543945, |
| "learning_rate": 1.218686081196917e-05, |
| "loss": 0.5573, |
| "mean_token_accuracy": 0.8626265227794647, |
| "num_tokens": 21531558.0, |
| "step": 463 |
| }, |
| { |
| "epoch": 5.8789808917197455, |
| "grad_norm": 0.5868001580238342, |
| "learning_rate": 1.1904290146971397e-05, |
| "loss": 0.5759, |
| "mean_token_accuracy": 0.8578618168830872, |
| "num_tokens": 21581138.0, |
| "step": 464 |
| }, |
| { |
| "epoch": 5.89171974522293, |
| "grad_norm": 0.5864095687866211, |
| "learning_rate": 1.1624826486487871e-05, |
| "loss": 0.5718, |
| "mean_token_accuracy": 0.8594149053096771, |
| "num_tokens": 21632418.0, |
| "step": 465 |
| }, |
| { |
| "epoch": 5.904458598726115, |
| "grad_norm": 0.602932870388031, |
| "learning_rate": 1.1348479686785751e-05, |
| "loss": 0.5519, |
| "mean_token_accuracy": 0.8616421222686768, |
| "num_tokens": 21677037.0, |
| "step": 466 |
| }, |
| { |
| "epoch": 5.917197452229299, |
| "grad_norm": 0.6247318983078003, |
| "learning_rate": 1.1075259494205225e-05, |
| "loss": 0.5868, |
| "mean_token_accuracy": 0.8568370342254639, |
| "num_tokens": 21723655.0, |
| "step": 467 |
| }, |
| { |
| "epoch": 5.929936305732484, |
| "grad_norm": 0.6046456098556519, |
| "learning_rate": 1.0805175544815648e-05, |
| "loss": 0.5888, |
| "mean_token_accuracy": 0.8549422025680542, |
| "num_tokens": 21771636.0, |
| "step": 468 |
| }, |
| { |
| "epoch": 5.942675159235669, |
| "grad_norm": 0.599376916885376, |
| "learning_rate": 1.0538237364075787e-05, |
| "loss": 0.5746, |
| "mean_token_accuracy": 0.8595117330551147, |
| "num_tokens": 21818294.0, |
| "step": 469 |
| }, |
| { |
| "epoch": 5.955414012738854, |
| "grad_norm": 0.5762757658958435, |
| "learning_rate": 1.0274454366497787e-05, |
| "loss": 0.5758, |
| "mean_token_accuracy": 0.8589733839035034, |
| "num_tokens": 21865302.0, |
| "step": 470 |
| }, |
| { |
| "epoch": 5.968152866242038, |
| "grad_norm": 0.6216184496879578, |
| "learning_rate": 1.0013835855315235e-05, |
| "loss": 0.5862, |
| "mean_token_accuracy": 0.857296347618103, |
| "num_tokens": 21912717.0, |
| "step": 471 |
| }, |
| { |
| "epoch": 5.980891719745223, |
| "grad_norm": 0.6174598932266235, |
| "learning_rate": 9.756391022154954e-06, |
| "loss": 0.5497, |
| "mean_token_accuracy": 0.8617016673088074, |
| "num_tokens": 21956909.0, |
| "step": 472 |
| }, |
| { |
| "epoch": 5.993630573248407, |
| "grad_norm": 0.5991003513336182, |
| "learning_rate": 9.502128946712862e-06, |
| "loss": 0.5824, |
| "mean_token_accuracy": 0.8596709668636322, |
| "num_tokens": 22004284.0, |
| "step": 473 |
| }, |
| { |
| "epoch": 6.0, |
| "grad_norm": 0.874085545539856, |
| "learning_rate": 9.251058596433793e-06, |
| "loss": 0.4975, |
| "mean_token_accuracy": 0.880401074886322, |
| "num_tokens": 22026256.0, |
| "step": 474 |
| }, |
| { |
| "epoch": 6.012738853503185, |
| "grad_norm": 0.5285953283309937, |
| "learning_rate": 9.003188826195142e-06, |
| "loss": 0.5064, |
| "mean_token_accuracy": 0.8789235949516296, |
| "num_tokens": 22073817.0, |
| "step": 475 |
| }, |
| { |
| "epoch": 6.025477707006369, |
| "grad_norm": 0.5319235324859619, |
| "learning_rate": 8.758528377994667e-06, |
| "loss": 0.4917, |
| "mean_token_accuracy": 0.883221447467804, |
| "num_tokens": 22120864.0, |
| "step": 476 |
| }, |
| { |
| "epoch": 6.038216560509555, |
| "grad_norm": 0.5413665771484375, |
| "learning_rate": 8.517085880642062e-06, |
| "loss": 0.4614, |
| "mean_token_accuracy": 0.8908380270004272, |
| "num_tokens": 22165690.0, |
| "step": 477 |
| }, |
| { |
| "epoch": 6.050955414012739, |
| "grad_norm": 0.5396758913993835, |
| "learning_rate": 8.278869849454718e-06, |
| "loss": 0.4728, |
| "mean_token_accuracy": 0.8866445422172546, |
| "num_tokens": 22211467.0, |
| "step": 478 |
| }, |
| { |
| "epoch": 6.063694267515924, |
| "grad_norm": 0.5413012504577637, |
| "learning_rate": 8.043888685957313e-06, |
| "loss": 0.4671, |
| "mean_token_accuracy": 0.8871977031230927, |
| "num_tokens": 22256869.0, |
| "step": 479 |
| }, |
| { |
| "epoch": 6.076433121019108, |
| "grad_norm": 0.5447385907173157, |
| "learning_rate": 7.812150677585673e-06, |
| "loss": 0.4709, |
| "mean_token_accuracy": 0.8885963261127472, |
| "num_tokens": 22304712.0, |
| "step": 480 |
| }, |
| { |
| "epoch": 6.089171974522293, |
| "grad_norm": 0.5395948886871338, |
| "learning_rate": 7.583663997394241e-06, |
| "loss": 0.4656, |
| "mean_token_accuracy": 0.8892465233802795, |
| "num_tokens": 22353292.0, |
| "step": 481 |
| }, |
| { |
| "epoch": 6.101910828025478, |
| "grad_norm": 0.5652547478675842, |
| "learning_rate": 7.358436703768035e-06, |
| "loss": 0.4539, |
| "mean_token_accuracy": 0.8909508585929871, |
| "num_tokens": 22401089.0, |
| "step": 482 |
| }, |
| { |
| "epoch": 6.114649681528663, |
| "grad_norm": 0.5841154456138611, |
| "learning_rate": 7.136476740138387e-06, |
| "loss": 0.4564, |
| "mean_token_accuracy": 0.8898600935935974, |
| "num_tokens": 22447040.0, |
| "step": 483 |
| }, |
| { |
| "epoch": 6.127388535031847, |
| "grad_norm": 0.5878347754478455, |
| "learning_rate": 6.917791934702655e-06, |
| "loss": 0.4596, |
| "mean_token_accuracy": 0.8882217407226562, |
| "num_tokens": 22494482.0, |
| "step": 484 |
| }, |
| { |
| "epoch": 6.140127388535032, |
| "grad_norm": 0.5902244448661804, |
| "learning_rate": 6.702390000148351e-06, |
| "loss": 0.4571, |
| "mean_token_accuracy": 0.8898824751377106, |
| "num_tokens": 22539295.0, |
| "step": 485 |
| }, |
| { |
| "epoch": 6.1528662420382165, |
| "grad_norm": 0.6030483245849609, |
| "learning_rate": 6.490278533380956e-06, |
| "loss": 0.4868, |
| "mean_token_accuracy": 0.8809216916561127, |
| "num_tokens": 22588300.0, |
| "step": 486 |
| }, |
| { |
| "epoch": 6.165605095541402, |
| "grad_norm": 0.5984454154968262, |
| "learning_rate": 6.281465015256094e-06, |
| "loss": 0.4656, |
| "mean_token_accuracy": 0.8885324001312256, |
| "num_tokens": 22636028.0, |
| "step": 487 |
| }, |
| { |
| "epoch": 6.178343949044586, |
| "grad_norm": 0.6295449137687683, |
| "learning_rate": 6.0759568103156195e-06, |
| "loss": 0.4845, |
| "mean_token_accuracy": 0.8819713294506073, |
| "num_tokens": 22684018.0, |
| "step": 488 |
| }, |
| { |
| "epoch": 6.191082802547771, |
| "grad_norm": 0.6019818186759949, |
| "learning_rate": 5.873761166527936e-06, |
| "loss": 0.4505, |
| "mean_token_accuracy": 0.8912405371665955, |
| "num_tokens": 22730357.0, |
| "step": 489 |
| }, |
| { |
| "epoch": 6.203821656050955, |
| "grad_norm": 0.6028389930725098, |
| "learning_rate": 5.674885215032322e-06, |
| "loss": 0.461, |
| "mean_token_accuracy": 0.8886306285858154, |
| "num_tokens": 22778899.0, |
| "step": 490 |
| }, |
| { |
| "epoch": 6.2165605095541405, |
| "grad_norm": 0.6356772184371948, |
| "learning_rate": 5.479335969887467e-06, |
| "loss": 0.4548, |
| "mean_token_accuracy": 0.8894259035587311, |
| "num_tokens": 22824833.0, |
| "step": 491 |
| }, |
| { |
| "epoch": 6.229299363057325, |
| "grad_norm": 0.6403616070747375, |
| "learning_rate": 5.287120327824091e-06, |
| "loss": 0.474, |
| "mean_token_accuracy": 0.8855110108852386, |
| "num_tokens": 22871101.0, |
| "step": 492 |
| }, |
| { |
| "epoch": 6.24203821656051, |
| "grad_norm": 0.5932328701019287, |
| "learning_rate": 5.098245068001661e-06, |
| "loss": 0.4678, |
| "mean_token_accuracy": 0.8874426782131195, |
| "num_tokens": 22920768.0, |
| "step": 493 |
| }, |
| { |
| "epoch": 6.254777070063694, |
| "grad_norm": 0.612916111946106, |
| "learning_rate": 4.9127168517693946e-06, |
| "loss": 0.4428, |
| "mean_token_accuracy": 0.8922592103481293, |
| "num_tokens": 22964967.0, |
| "step": 494 |
| }, |
| { |
| "epoch": 6.267515923566879, |
| "grad_norm": 0.6020427346229553, |
| "learning_rate": 4.730542222431223e-06, |
| "loss": 0.4383, |
| "mean_token_accuracy": 0.8952569663524628, |
| "num_tokens": 23009889.0, |
| "step": 495 |
| }, |
| { |
| "epoch": 6.280254777070064, |
| "grad_norm": 0.596607506275177, |
| "learning_rate": 4.551727605015032e-06, |
| "loss": 0.4449, |
| "mean_token_accuracy": 0.8933581709861755, |
| "num_tokens": 23056164.0, |
| "step": 496 |
| }, |
| { |
| "epoch": 6.292993630573249, |
| "grad_norm": 0.61225825548172, |
| "learning_rate": 4.376279306046183e-06, |
| "loss": 0.4782, |
| "mean_token_accuracy": 0.8831726312637329, |
| "num_tokens": 23101966.0, |
| "step": 497 |
| }, |
| { |
| "epoch": 6.305732484076433, |
| "grad_norm": 0.6055213809013367, |
| "learning_rate": 4.2042035133248895e-06, |
| "loss": 0.465, |
| "mean_token_accuracy": 0.88702791929245, |
| "num_tokens": 23150516.0, |
| "step": 498 |
| }, |
| { |
| "epoch": 6.318471337579618, |
| "grad_norm": 0.5911315083503723, |
| "learning_rate": 4.035506295708191e-06, |
| "loss": 0.4496, |
| "mean_token_accuracy": 0.8899335861206055, |
| "num_tokens": 23197593.0, |
| "step": 499 |
| }, |
| { |
| "epoch": 6.3312101910828025, |
| "grad_norm": 0.6018553972244263, |
| "learning_rate": 3.870193602895733e-06, |
| "loss": 0.4539, |
| "mean_token_accuracy": 0.8879165351390839, |
| "num_tokens": 23242618.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 6.343949044585988, |
| "grad_norm": 0.5925772190093994, |
| "learning_rate": 3.7082712652200867e-06, |
| "loss": 0.4408, |
| "mean_token_accuracy": 0.8935061991214752, |
| "num_tokens": 23286589.0, |
| "step": 501 |
| }, |
| { |
| "epoch": 6.356687898089172, |
| "grad_norm": 0.5770175457000732, |
| "learning_rate": 3.54974499344094e-06, |
| "loss": 0.4548, |
| "mean_token_accuracy": 0.8910494446754456, |
| "num_tokens": 23333149.0, |
| "step": 502 |
| }, |
| { |
| "epoch": 6.369426751592357, |
| "grad_norm": 0.5860756039619446, |
| "learning_rate": 3.3946203785439113e-06, |
| "loss": 0.4697, |
| "mean_token_accuracy": 0.8873529136180878, |
| "num_tokens": 23380362.0, |
| "step": 503 |
| }, |
| { |
| "epoch": 6.382165605095541, |
| "grad_norm": 0.5788154006004333, |
| "learning_rate": 3.2429028915431534e-06, |
| "loss": 0.4474, |
| "mean_token_accuracy": 0.8910690546035767, |
| "num_tokens": 23427020.0, |
| "step": 504 |
| }, |
| { |
| "epoch": 6.3949044585987265, |
| "grad_norm": 0.575828492641449, |
| "learning_rate": 3.094597883288575e-06, |
| "loss": 0.4873, |
| "mean_token_accuracy": 0.8848420679569244, |
| "num_tokens": 23476005.0, |
| "step": 505 |
| }, |
| { |
| "epoch": 6.407643312101911, |
| "grad_norm": 0.5773833394050598, |
| "learning_rate": 2.9497105842769435e-06, |
| "loss": 0.4369, |
| "mean_token_accuracy": 0.8952364027500153, |
| "num_tokens": 23522481.0, |
| "step": 506 |
| }, |
| { |
| "epoch": 6.420382165605096, |
| "grad_norm": 0.591640055179596, |
| "learning_rate": 2.808246104467582e-06, |
| "loss": 0.4667, |
| "mean_token_accuracy": 0.8868449926376343, |
| "num_tokens": 23568307.0, |
| "step": 507 |
| }, |
| { |
| "epoch": 6.43312101910828, |
| "grad_norm": 0.586330771446228, |
| "learning_rate": 2.6702094331020887e-06, |
| "loss": 0.4723, |
| "mean_token_accuracy": 0.8849689066410065, |
| "num_tokens": 23616018.0, |
| "step": 508 |
| }, |
| { |
| "epoch": 6.445859872611465, |
| "grad_norm": 0.5872050523757935, |
| "learning_rate": 2.5356054385282766e-06, |
| "loss": 0.4767, |
| "mean_token_accuracy": 0.8855108022689819, |
| "num_tokens": 23662705.0, |
| "step": 509 |
| }, |
| { |
| "epoch": 6.45859872611465, |
| "grad_norm": 0.5915942192077637, |
| "learning_rate": 2.404438868028658e-06, |
| "loss": 0.443, |
| "mean_token_accuracy": 0.8939434885978699, |
| "num_tokens": 23708614.0, |
| "step": 510 |
| }, |
| { |
| "epoch": 6.471337579617835, |
| "grad_norm": 0.5772258639335632, |
| "learning_rate": 2.276714347652831e-06, |
| "loss": 0.4535, |
| "mean_token_accuracy": 0.8918261229991913, |
| "num_tokens": 23755220.0, |
| "step": 511 |
| }, |
| { |
| "epoch": 6.484076433121019, |
| "grad_norm": 0.602470874786377, |
| "learning_rate": 2.152436382054479e-06, |
| "loss": 0.4976, |
| "mean_token_accuracy": 0.8814437389373779, |
| "num_tokens": 23801965.0, |
| "step": 512 |
| }, |
| { |
| "epoch": 6.496815286624204, |
| "grad_norm": 0.5672124624252319, |
| "learning_rate": 2.0316093543323757e-06, |
| "loss": 0.4792, |
| "mean_token_accuracy": 0.8845764100551605, |
| "num_tokens": 23850903.0, |
| "step": 513 |
| }, |
| { |
| "epoch": 6.509554140127388, |
| "grad_norm": 0.570857584476471, |
| "learning_rate": 1.914237525875917e-06, |
| "loss": 0.4576, |
| "mean_token_accuracy": 0.8894221186637878, |
| "num_tokens": 23898377.0, |
| "step": 514 |
| }, |
| { |
| "epoch": 6.522292993630574, |
| "grad_norm": 0.5888267755508423, |
| "learning_rate": 1.8003250362147005e-06, |
| "loss": 0.462, |
| "mean_token_accuracy": 0.8884663283824921, |
| "num_tokens": 23945604.0, |
| "step": 515 |
| }, |
| { |
| "epoch": 6.535031847133758, |
| "grad_norm": 0.593219518661499, |
| "learning_rate": 1.6898759028726285e-06, |
| "loss": 0.5017, |
| "mean_token_accuracy": 0.8780794739723206, |
| "num_tokens": 23993458.0, |
| "step": 516 |
| }, |
| { |
| "epoch": 6.547770700636943, |
| "grad_norm": 0.5750519037246704, |
| "learning_rate": 1.5828940212261889e-06, |
| "loss": 0.472, |
| "mean_token_accuracy": 0.8875796794891357, |
| "num_tokens": 24040106.0, |
| "step": 517 |
| }, |
| { |
| "epoch": 6.560509554140127, |
| "grad_norm": 0.5601825714111328, |
| "learning_rate": 1.479383164367043e-06, |
| "loss": 0.4602, |
| "mean_token_accuracy": 0.8908886611461639, |
| "num_tokens": 24087994.0, |
| "step": 518 |
| }, |
| { |
| "epoch": 6.573248407643312, |
| "grad_norm": 0.5909698009490967, |
| "learning_rate": 1.3793469829689987e-06, |
| "loss": 0.4625, |
| "mean_token_accuracy": 0.8879349529743195, |
| "num_tokens": 24134642.0, |
| "step": 519 |
| }, |
| { |
| "epoch": 6.585987261146497, |
| "grad_norm": 0.5777092576026917, |
| "learning_rate": 1.2827890051592128e-06, |
| "loss": 0.46, |
| "mean_token_accuracy": 0.8871607184410095, |
| "num_tokens": 24182448.0, |
| "step": 520 |
| }, |
| { |
| "epoch": 6.598726114649682, |
| "grad_norm": 0.6093650460243225, |
| "learning_rate": 1.1897126363937804e-06, |
| "loss": 0.4713, |
| "mean_token_accuracy": 0.8866488337516785, |
| "num_tokens": 24226243.0, |
| "step": 521 |
| }, |
| { |
| "epoch": 6.611464968152866, |
| "grad_norm": 0.5591498613357544, |
| "learning_rate": 1.1001211593376526e-06, |
| "loss": 0.4614, |
| "mean_token_accuracy": 0.8907770216464996, |
| "num_tokens": 24275531.0, |
| "step": 522 |
| }, |
| { |
| "epoch": 6.624203821656051, |
| "grad_norm": 0.5817198753356934, |
| "learning_rate": 1.0140177337488288e-06, |
| "loss": 0.4749, |
| "mean_token_accuracy": 0.8850551843643188, |
| "num_tokens": 24323213.0, |
| "step": 523 |
| }, |
| { |
| "epoch": 6.6369426751592355, |
| "grad_norm": 0.5963823199272156, |
| "learning_rate": 9.314053963669245e-07, |
| "loss": 0.4544, |
| "mean_token_accuracy": 0.8898647129535675, |
| "num_tokens": 24369413.0, |
| "step": 524 |
| }, |
| { |
| "epoch": 6.649681528662421, |
| "grad_norm": 0.6051519513130188, |
| "learning_rate": 8.522870608060563e-07, |
| "loss": 0.4643, |
| "mean_token_accuracy": 0.8886588215827942, |
| "num_tokens": 24413967.0, |
| "step": 525 |
| }, |
| { |
| "epoch": 6.662420382165605, |
| "grad_norm": 0.5751470923423767, |
| "learning_rate": 7.766655174521465e-07, |
| "loss": 0.4711, |
| "mean_token_accuracy": 0.8882945775985718, |
| "num_tokens": 24462445.0, |
| "step": 526 |
| }, |
| { |
| "epoch": 6.67515923566879, |
| "grad_norm": 0.5853144526481628, |
| "learning_rate": 7.045434333643797e-07, |
| "loss": 0.4558, |
| "mean_token_accuracy": 0.8899858295917511, |
| "num_tokens": 24509589.0, |
| "step": 527 |
| }, |
| { |
| "epoch": 6.687898089171974, |
| "grad_norm": 0.5752429366111755, |
| "learning_rate": 6.359233521813224e-07, |
| "loss": 0.4638, |
| "mean_token_accuracy": 0.8884373903274536, |
| "num_tokens": 24556095.0, |
| "step": 528 |
| }, |
| { |
| "epoch": 6.7006369426751595, |
| "grad_norm": 0.5856727957725525, |
| "learning_rate": 5.70807694031028e-07, |
| "loss": 0.4818, |
| "mean_token_accuracy": 0.8827240765094757, |
| "num_tokens": 24604994.0, |
| "step": 529 |
| }, |
| { |
| "epoch": 6.713375796178344, |
| "grad_norm": 0.588467001914978, |
| "learning_rate": 5.091987554458388e-07, |
| "loss": 0.4655, |
| "mean_token_accuracy": 0.8869950175285339, |
| "num_tokens": 24651020.0, |
| "step": 530 |
| }, |
| { |
| "epoch": 6.726114649681529, |
| "grad_norm": 0.5824346542358398, |
| "learning_rate": 4.510987092812502e-07, |
| "loss": 0.4726, |
| "mean_token_accuracy": 0.8863205313682556, |
| "num_tokens": 24697824.0, |
| "step": 531 |
| }, |
| { |
| "epoch": 6.738853503184713, |
| "grad_norm": 0.5869485139846802, |
| "learning_rate": 3.965096046394057e-07, |
| "loss": 0.4656, |
| "mean_token_accuracy": 0.8880146145820618, |
| "num_tokens": 24745058.0, |
| "step": 532 |
| }, |
| { |
| "epoch": 6.751592356687898, |
| "grad_norm": 0.5894216299057007, |
| "learning_rate": 3.4543336679673245e-07, |
| "loss": 0.473, |
| "mean_token_accuracy": 0.8840719163417816, |
| "num_tokens": 24792886.0, |
| "step": 533 |
| }, |
| { |
| "epoch": 6.764331210191083, |
| "grad_norm": 0.5966050624847412, |
| "learning_rate": 2.978717971360956e-07, |
| "loss": 0.467, |
| "mean_token_accuracy": 0.8892892599105835, |
| "num_tokens": 24839223.0, |
| "step": 534 |
| }, |
| { |
| "epoch": 6.777070063694268, |
| "grad_norm": 0.5877535343170166, |
| "learning_rate": 2.5382657308322676e-07, |
| "loss": 0.4686, |
| "mean_token_accuracy": 0.8878327012062073, |
| "num_tokens": 24886155.0, |
| "step": 535 |
| }, |
| { |
| "epoch": 6.789808917197452, |
| "grad_norm": 0.5607234239578247, |
| "learning_rate": 2.1329924804760482e-07, |
| "loss": 0.462, |
| "mean_token_accuracy": 0.8899067938327789, |
| "num_tokens": 24935615.0, |
| "step": 536 |
| }, |
| { |
| "epoch": 6.802547770700637, |
| "grad_norm": 0.5836446285247803, |
| "learning_rate": 1.7629125136764402e-07, |
| "loss": 0.4877, |
| "mean_token_accuracy": 0.8824087679386139, |
| "num_tokens": 24982352.0, |
| "step": 537 |
| }, |
| { |
| "epoch": 6.8152866242038215, |
| "grad_norm": 0.5934491157531738, |
| "learning_rate": 1.4280388826026782e-07, |
| "loss": 0.4424, |
| "mean_token_accuracy": 0.8934253454208374, |
| "num_tokens": 25026903.0, |
| "step": 538 |
| }, |
| { |
| "epoch": 6.828025477707007, |
| "grad_norm": 0.5779575109481812, |
| "learning_rate": 1.128383397749233e-07, |
| "loss": 0.4827, |
| "mean_token_accuracy": 0.8874645829200745, |
| "num_tokens": 25074252.0, |
| "step": 539 |
| }, |
| { |
| "epoch": 6.840764331210191, |
| "grad_norm": 0.5870651006698608, |
| "learning_rate": 8.639566275189248e-08, |
| "loss": 0.4493, |
| "mean_token_accuracy": 0.8932221829891205, |
| "num_tokens": 25119706.0, |
| "step": 540 |
| }, |
| { |
| "epoch": 6.853503184713376, |
| "grad_norm": 0.5863420367240906, |
| "learning_rate": 6.347678978501082e-08, |
| "loss": 0.4654, |
| "mean_token_accuracy": 0.8872964382171631, |
| "num_tokens": 25165377.0, |
| "step": 541 |
| }, |
| { |
| "epoch": 6.86624203821656, |
| "grad_norm": 0.5763266086578369, |
| "learning_rate": 4.408252918880473e-08, |
| "loss": 0.4521, |
| "mean_token_accuracy": 0.8921694755554199, |
| "num_tokens": 25211636.0, |
| "step": 542 |
| }, |
| { |
| "epoch": 6.8789808917197455, |
| "grad_norm": 0.5784059166908264, |
| "learning_rate": 2.8213564969969963e-08, |
| "loss": 0.4738, |
| "mean_token_accuracy": 0.8872754871845245, |
| "num_tokens": 25258903.0, |
| "step": 543 |
| }, |
| { |
| "epoch": 6.89171974522293, |
| "grad_norm": 0.5755369067192078, |
| "learning_rate": 1.5870456803246392e-08, |
| "loss": 0.4225, |
| "mean_token_accuracy": 0.8984050452709198, |
| "num_tokens": 25302553.0, |
| "step": 544 |
| }, |
| { |
| "epoch": 6.904458598726115, |
| "grad_norm": 0.5839601159095764, |
| "learning_rate": 7.053640011678297e-09, |
| "loss": 0.445, |
| "mean_token_accuracy": 0.8928711414337158, |
| "num_tokens": 25348281.0, |
| "step": 545 |
| }, |
| { |
| "epoch": 6.917197452229299, |
| "grad_norm": 0.6116732954978943, |
| "learning_rate": 1.7634255512710695e-09, |
| "loss": 0.4755, |
| "mean_token_accuracy": 0.8853686451911926, |
| "num_tokens": 25393401.0, |
| "step": 546 |
| }, |
| { |
| "epoch": 6.917197452229299, |
| "step": 546, |
| "total_flos": 1.6111370622520525e+18, |
| "train_loss": 1.0811113911124812, |
| "train_runtime": 3374.9045, |
| "train_samples_per_second": 10.371, |
| "train_steps_per_second": 0.162 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 546, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 7, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.6111370622520525e+18, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|