Instructions to use Famali/qwen7b-abap-sql-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Famali/qwen7b-abap-sql-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("models/Qwen2.5-Coder-7B-Instruct") model = PeftModel.from_pretrained(base_model, "Famali/qwen7b-abap-sql-lora") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.866260246234475, | |
| "eval_steps": 0, | |
| "global_step": 5000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.810929330997169, | |
| "epoch": 0.00173252049246895, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 1.0344827586206897e-05, | |
| "loss": 1.254616641998291, | |
| "mean_token_accuracy": 0.7005728678777814, | |
| "num_tokens": 55845.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.8157925633713603, | |
| "epoch": 0.0034650409849379, | |
| "grad_norm": 0.2197265625, | |
| "learning_rate": 2.183908045977012e-05, | |
| "loss": 1.2245146751403808, | |
| "mean_token_accuracy": 0.708231895044446, | |
| "num_tokens": 113111.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.8832647049799561, | |
| "epoch": 0.00519756147740685, | |
| "grad_norm": 0.25, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.1657934188842773, | |
| "mean_token_accuracy": 0.7022482370957732, | |
| "num_tokens": 164227.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.9586381811648608, | |
| "epoch": 0.0069300819698758, | |
| "grad_norm": 0.298828125, | |
| "learning_rate": 4.482758620689655e-05, | |
| "loss": 1.0330963134765625, | |
| "mean_token_accuracy": 0.7396623624488712, | |
| "num_tokens": 217441.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.9550106849521398, | |
| "epoch": 0.00866260246234475, | |
| "grad_norm": 0.3828125, | |
| "learning_rate": 5.632183908045977e-05, | |
| "loss": 0.8959432601928711, | |
| "mean_token_accuracy": 0.7642454300075769, | |
| "num_tokens": 268289.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.7945327928289772, | |
| "epoch": 0.0103951229548137, | |
| "grad_norm": 0.173828125, | |
| "learning_rate": 6.781609195402298e-05, | |
| "loss": 0.7625956058502197, | |
| "mean_token_accuracy": 0.8002910505980253, | |
| "num_tokens": 324346.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.7771458545699715, | |
| "epoch": 0.01212764344728265, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 7.931034482758621e-05, | |
| "loss": 0.7818475723266601, | |
| "mean_token_accuracy": 0.8028205497190356, | |
| "num_tokens": 377817.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.7179010029882192, | |
| "epoch": 0.0138601639397516, | |
| "grad_norm": 0.14453125, | |
| "learning_rate": 9.080459770114943e-05, | |
| "loss": 0.7082338809967041, | |
| "mean_token_accuracy": 0.8104276180267334, | |
| "num_tokens": 430404.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.6860609723255038, | |
| "epoch": 0.01559268443222055, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 0.00010229885057471265, | |
| "loss": 0.7078627109527588, | |
| "mean_token_accuracy": 0.8185620239004493, | |
| "num_tokens": 485403.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.7082041744142771, | |
| "epoch": 0.0173252049246895, | |
| "grad_norm": 0.224609375, | |
| "learning_rate": 0.00011379310344827588, | |
| "loss": 0.6847227573394775, | |
| "mean_token_accuracy": 0.813801309466362, | |
| "num_tokens": 540316.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.7132678747177124, | |
| "epoch": 0.01905772541715845, | |
| "grad_norm": 0.150390625, | |
| "learning_rate": 0.00012528735632183908, | |
| "loss": 0.7346933841705322, | |
| "mean_token_accuracy": 0.8136965841054916, | |
| "num_tokens": 596090.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.6739615526981652, | |
| "epoch": 0.0207902459096274, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 0.0001367816091954023, | |
| "loss": 0.7035027980804444, | |
| "mean_token_accuracy": 0.8202918566763401, | |
| "num_tokens": 652251.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.7046921165660024, | |
| "epoch": 0.02252276640209635, | |
| "grad_norm": 0.2216796875, | |
| "learning_rate": 0.00014827586206896554, | |
| "loss": 0.7162999153137207, | |
| "mean_token_accuracy": 0.8211559295654297, | |
| "num_tokens": 705549.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.653735039010644, | |
| "epoch": 0.0242552868945653, | |
| "grad_norm": 0.2001953125, | |
| "learning_rate": 0.00015977011494252874, | |
| "loss": 0.6981287002563477, | |
| "mean_token_accuracy": 0.82376406211406, | |
| "num_tokens": 761437.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.6913811397738755, | |
| "epoch": 0.02598780738703425, | |
| "grad_norm": 0.2138671875, | |
| "learning_rate": 0.00017126436781609197, | |
| "loss": 0.6812327861785888, | |
| "mean_token_accuracy": 0.8214046888053417, | |
| "num_tokens": 815757.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.6818532709032297, | |
| "epoch": 0.0277203278795032, | |
| "grad_norm": 0.14453125, | |
| "learning_rate": 0.00018275862068965518, | |
| "loss": 0.6739168643951416, | |
| "mean_token_accuracy": 0.8230750940740108, | |
| "num_tokens": 870566.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.6293836037628353, | |
| "epoch": 0.02945284837197215, | |
| "grad_norm": 0.1962890625, | |
| "learning_rate": 0.0001942528735632184, | |
| "loss": 0.6438039302825928, | |
| "mean_token_accuracy": 0.8250031888484954, | |
| "num_tokens": 919572.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.7395828457549214, | |
| "epoch": 0.0311853688644411, | |
| "grad_norm": 0.236328125, | |
| "learning_rate": 0.000199999606319698, | |
| "loss": 0.7348537921905518, | |
| "mean_token_accuracy": 0.8079655442386866, | |
| "num_tokens": 976518.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.6470751653891057, | |
| "epoch": 0.03291788935691005, | |
| "grad_norm": 0.1923828125, | |
| "learning_rate": 0.0001999964568958801, | |
| "loss": 0.6475263118743897, | |
| "mean_token_accuracy": 0.8273555610328913, | |
| "num_tokens": 1029982.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.6638997793197632, | |
| "epoch": 0.034650409849379, | |
| "grad_norm": 0.1787109375, | |
| "learning_rate": 0.00019999015814743337, | |
| "loss": 0.6720759868621826, | |
| "mean_token_accuracy": 0.8212123598903418, | |
| "num_tokens": 1083520.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.6658276095055043, | |
| "epoch": 0.03638293034184795, | |
| "grad_norm": 0.1796875, | |
| "learning_rate": 0.00019998071027273287, | |
| "loss": 0.6466164588928223, | |
| "mean_token_accuracy": 0.824113554507494, | |
| "num_tokens": 1140398.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.6653693447820842, | |
| "epoch": 0.0381154508343169, | |
| "grad_norm": 0.1796875, | |
| "learning_rate": 0.00019996811356933346, | |
| "loss": 0.7165875911712647, | |
| "mean_token_accuracy": 0.8195627685636282, | |
| "num_tokens": 1199606.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.6407551797106862, | |
| "epoch": 0.03984797132678585, | |
| "grad_norm": 0.1767578125, | |
| "learning_rate": 0.00019995236843396017, | |
| "loss": 0.6214494228363037, | |
| "mean_token_accuracy": 0.8284068278968334, | |
| "num_tokens": 1255643.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.6598921860568225, | |
| "epoch": 0.0415804918192548, | |
| "grad_norm": 0.1875, | |
| "learning_rate": 0.00019993347536249607, | |
| "loss": 0.6686903476715088, | |
| "mean_token_accuracy": 0.825398787111044, | |
| "num_tokens": 1307549.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.6621891765855252, | |
| "epoch": 0.04331301231172375, | |
| "grad_norm": 0.162109375, | |
| "learning_rate": 0.0001999114349499664, | |
| "loss": 0.6639114379882812, | |
| "mean_token_accuracy": 0.8296613309532404, | |
| "num_tokens": 1357737.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.6813261322677135, | |
| "epoch": 0.0450455328041927, | |
| "grad_norm": 0.2275390625, | |
| "learning_rate": 0.00019988624789051983, | |
| "loss": 0.6541904926300048, | |
| "mean_token_accuracy": 0.8254248831421137, | |
| "num_tokens": 1408003.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.6344376143068076, | |
| "epoch": 0.04677805329666165, | |
| "grad_norm": 0.1396484375, | |
| "learning_rate": 0.00019985791497740678, | |
| "loss": 0.6409160137176514, | |
| "mean_token_accuracy": 0.8295672092586756, | |
| "num_tokens": 1468512.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.6638527356088162, | |
| "epoch": 0.0485105737891306, | |
| "grad_norm": 0.146484375, | |
| "learning_rate": 0.00019982643710295426, | |
| "loss": 0.6663234233856201, | |
| "mean_token_accuracy": 0.828643910959363, | |
| "num_tokens": 1523479.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.6975623445119709, | |
| "epoch": 0.05024309428159955, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 0.0001997918152585379, | |
| "loss": 0.7597866058349609, | |
| "mean_token_accuracy": 0.8158255266025662, | |
| "num_tokens": 1576432.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.6049194569699466, | |
| "epoch": 0.0519756147740685, | |
| "grad_norm": 0.203125, | |
| "learning_rate": 0.00019975405053455051, | |
| "loss": 0.5933527946472168, | |
| "mean_token_accuracy": 0.8358733810484409, | |
| "num_tokens": 1629231.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.620193119905889, | |
| "epoch": 0.05370813526653745, | |
| "grad_norm": 0.173828125, | |
| "learning_rate": 0.00019971314412036808, | |
| "loss": 0.6208887100219727, | |
| "mean_token_accuracy": 0.8321478370577097, | |
| "num_tokens": 1679414.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.6657766723074019, | |
| "epoch": 0.0554406557590064, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.00019966909730431196, | |
| "loss": 0.6897091865539551, | |
| "mean_token_accuracy": 0.8228034034371376, | |
| "num_tokens": 1737775.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.644062434695661, | |
| "epoch": 0.05717317625147535, | |
| "grad_norm": 0.21875, | |
| "learning_rate": 0.00019962191147360856, | |
| "loss": 0.6630971908569336, | |
| "mean_token_accuracy": 0.8295374032109976, | |
| "num_tokens": 1792525.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.6073618672788144, | |
| "epoch": 0.0589056967439443, | |
| "grad_norm": 0.234375, | |
| "learning_rate": 0.00019957158811434553, | |
| "loss": 0.624071455001831, | |
| "mean_token_accuracy": 0.8320268541574478, | |
| "num_tokens": 1842155.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.6616941560059786, | |
| "epoch": 0.06063821723641325, | |
| "grad_norm": 0.181640625, | |
| "learning_rate": 0.00019951812881142497, | |
| "loss": 0.6492743015289306, | |
| "mean_token_accuracy": 0.8291781645268201, | |
| "num_tokens": 1899018.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.6520219750702381, | |
| "epoch": 0.0623707377288822, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 0.00019946153524851351, | |
| "loss": 0.6957698822021484, | |
| "mean_token_accuracy": 0.8234761968255043, | |
| "num_tokens": 1951764.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.6280029808636755, | |
| "epoch": 0.06410325822135116, | |
| "grad_norm": 0.2158203125, | |
| "learning_rate": 0.0001994018092079893, | |
| "loss": 0.6160636901855469, | |
| "mean_token_accuracy": 0.8326598234474659, | |
| "num_tokens": 2003098.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.6201984202489257, | |
| "epoch": 0.0658357787138201, | |
| "grad_norm": 0.1298828125, | |
| "learning_rate": 0.00019933895257088596, | |
| "loss": 0.6358787059783936, | |
| "mean_token_accuracy": 0.831251024082303, | |
| "num_tokens": 2057015.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.650082749966532, | |
| "epoch": 0.06756829920628905, | |
| "grad_norm": 0.1181640625, | |
| "learning_rate": 0.00019927296731683315, | |
| "loss": 0.6564774990081788, | |
| "mean_token_accuracy": 0.8291048884391785, | |
| "num_tokens": 2112697.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.6485576028004288, | |
| "epoch": 0.069300819698758, | |
| "grad_norm": 0.1552734375, | |
| "learning_rate": 0.00019920385552399432, | |
| "loss": 0.6576817035675049, | |
| "mean_token_accuracy": 0.8271005995571613, | |
| "num_tokens": 2163939.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.5890314053744078, | |
| "epoch": 0.07103334019122695, | |
| "grad_norm": 0.1328125, | |
| "learning_rate": 0.00019913161936900133, | |
| "loss": 0.5919264316558838, | |
| "mean_token_accuracy": 0.8378766164183616, | |
| "num_tokens": 2216098.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.6104229719843716, | |
| "epoch": 0.0727658606836959, | |
| "grad_norm": 0.16796875, | |
| "learning_rate": 0.00019905626112688582, | |
| "loss": 0.609614372253418, | |
| "mean_token_accuracy": 0.8336421933025122, | |
| "num_tokens": 2267710.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.6408540541771799, | |
| "epoch": 0.07449838117616485, | |
| "grad_norm": 0.169921875, | |
| "learning_rate": 0.00019897778317100754, | |
| "loss": 0.6390007495880127, | |
| "mean_token_accuracy": 0.8281146749854088, | |
| "num_tokens": 2316219.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.6305070512928068, | |
| "epoch": 0.0762309016686338, | |
| "grad_norm": 0.2890625, | |
| "learning_rate": 0.00019889618797297968, | |
| "loss": 0.631248950958252, | |
| "mean_token_accuracy": 0.8325294002890586, | |
| "num_tokens": 2371925.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.6037532315589488, | |
| "epoch": 0.07796342216110275, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 0.00019881147810259093, | |
| "loss": 0.6101105213165283, | |
| "mean_token_accuracy": 0.8346767805516719, | |
| "num_tokens": 2426625.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.6217060944065451, | |
| "epoch": 0.0796959426535717, | |
| "grad_norm": 0.162109375, | |
| "learning_rate": 0.00019872365622772465, | |
| "loss": 0.6300463199615478, | |
| "mean_token_accuracy": 0.8344658222049475, | |
| "num_tokens": 2478515.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.6248600482009351, | |
| "epoch": 0.08142846314604064, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.00019863272511427474, | |
| "loss": 0.6302617073059082, | |
| "mean_token_accuracy": 0.8273205358535052, | |
| "num_tokens": 2532071.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.6396009525284171, | |
| "epoch": 0.0831609836385096, | |
| "grad_norm": 0.224609375, | |
| "learning_rate": 0.00019853868762605866, | |
| "loss": 0.6199671268463135, | |
| "mean_token_accuracy": 0.8307142000645399, | |
| "num_tokens": 2589201.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.6030260891653597, | |
| "epoch": 0.08489350413097856, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.00019844154672472706, | |
| "loss": 0.6208174705505372, | |
| "mean_token_accuracy": 0.8347844246774911, | |
| "num_tokens": 2645142.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.6636065155267715, | |
| "epoch": 0.0866260246234475, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 0.00019834130546967073, | |
| "loss": 0.6683245182037354, | |
| "mean_token_accuracy": 0.8294202674180269, | |
| "num_tokens": 2699971.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.6588667241856456, | |
| "epoch": 0.08835854511591645, | |
| "grad_norm": 0.232421875, | |
| "learning_rate": 0.00019823796701792405, | |
| "loss": 0.6521318435668946, | |
| "mean_token_accuracy": 0.8271396320313216, | |
| "num_tokens": 2755726.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.6405920119024813, | |
| "epoch": 0.0900910656083854, | |
| "grad_norm": 0.1630859375, | |
| "learning_rate": 0.00019813153462406566, | |
| "loss": 0.6348390579223633, | |
| "mean_token_accuracy": 0.8277827233076096, | |
| "num_tokens": 2809331.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.6443098559975624, | |
| "epoch": 0.09182358610085435, | |
| "grad_norm": 0.279296875, | |
| "learning_rate": 0.00019802201164011586, | |
| "loss": 0.6198469161987304, | |
| "mean_token_accuracy": 0.8291943591088057, | |
| "num_tokens": 2858441.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.6293792264536023, | |
| "epoch": 0.0935561065933233, | |
| "grad_norm": 0.1533203125, | |
| "learning_rate": 0.0001979094015154312, | |
| "loss": 0.6151269912719727, | |
| "mean_token_accuracy": 0.8302976503968239, | |
| "num_tokens": 2912293.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.6466425215825439, | |
| "epoch": 0.09528862708579225, | |
| "grad_norm": 0.1435546875, | |
| "learning_rate": 0.00019779370779659576, | |
| "loss": 0.6462889671325683, | |
| "mean_token_accuracy": 0.8293194837868214, | |
| "num_tokens": 2969052.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.6073407874442637, | |
| "epoch": 0.0970211475782612, | |
| "grad_norm": 0.1533203125, | |
| "learning_rate": 0.00019767493412730936, | |
| "loss": 0.6346017360687256, | |
| "mean_token_accuracy": 0.8343164108693599, | |
| "num_tokens": 3025367.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.5817480836063623, | |
| "epoch": 0.09875366807073015, | |
| "grad_norm": 0.193359375, | |
| "learning_rate": 0.00019755308424827304, | |
| "loss": 0.5833946228027344, | |
| "mean_token_accuracy": 0.8394967459142209, | |
| "num_tokens": 3074360.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.6115848210640251, | |
| "epoch": 0.1004861885631991, | |
| "grad_norm": 0.1416015625, | |
| "learning_rate": 0.00019742816199707096, | |
| "loss": 0.5977429389953614, | |
| "mean_token_accuracy": 0.8364680297672749, | |
| "num_tokens": 3125265.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.6274468263611197, | |
| "epoch": 0.10221870905566804, | |
| "grad_norm": 0.2255859375, | |
| "learning_rate": 0.00019730017130804975, | |
| "loss": 0.6550042152404785, | |
| "mean_token_accuracy": 0.8297880813479424, | |
| "num_tokens": 3173631.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.6123087177053094, | |
| "epoch": 0.103951229548137, | |
| "grad_norm": 0.146484375, | |
| "learning_rate": 0.0001971691162121945, | |
| "loss": 0.6123240947723388, | |
| "mean_token_accuracy": 0.8380243465304374, | |
| "num_tokens": 3221993.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.6288255278021098, | |
| "epoch": 0.10568375004060594, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 0.00019703500083700194, | |
| "loss": 0.6531140327453613, | |
| "mean_token_accuracy": 0.8308754049241542, | |
| "num_tokens": 3270001.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.6463912200182677, | |
| "epoch": 0.1074162705330749, | |
| "grad_norm": 0.23046875, | |
| "learning_rate": 0.0001968978294063502, | |
| "loss": 0.6550347805023193, | |
| "mean_token_accuracy": 0.8286161825060845, | |
| "num_tokens": 3319189.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.6228113821707666, | |
| "epoch": 0.10914879102554385, | |
| "grad_norm": 0.15234375, | |
| "learning_rate": 0.00019675760624036603, | |
| "loss": 0.6403580665588379, | |
| "mean_token_accuracy": 0.8286291882395744, | |
| "num_tokens": 3375662.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.615918574295938, | |
| "epoch": 0.1108813115180128, | |
| "grad_norm": 0.1708984375, | |
| "learning_rate": 0.00019661433575528857, | |
| "loss": 0.612631368637085, | |
| "mean_token_accuracy": 0.8331956438720226, | |
| "num_tokens": 3424137.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.6141920768655836, | |
| "epoch": 0.11261383201048175, | |
| "grad_norm": 0.1494140625, | |
| "learning_rate": 0.0001964680224633304, | |
| "loss": 0.6380485534667969, | |
| "mean_token_accuracy": 0.8324795596301555, | |
| "num_tokens": 3475797.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.6042345489375294, | |
| "epoch": 0.1143463525029507, | |
| "grad_norm": 0.1533203125, | |
| "learning_rate": 0.00019631867097253528, | |
| "loss": 0.6176069736480713, | |
| "mean_token_accuracy": 0.8363753166049719, | |
| "num_tokens": 3529500.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.6391982820816338, | |
| "epoch": 0.11607887299541965, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 0.00019616628598663322, | |
| "loss": 0.6678025245666503, | |
| "mean_token_accuracy": 0.8258381471037864, | |
| "num_tokens": 3581994.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.6329770868644118, | |
| "epoch": 0.1178113934878886, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 0.0001960108723048921, | |
| "loss": 0.6337652206420898, | |
| "mean_token_accuracy": 0.8345998499542475, | |
| "num_tokens": 3638782.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.6326605278067291, | |
| "epoch": 0.11954391398035755, | |
| "grad_norm": 0.14453125, | |
| "learning_rate": 0.0001958524348219667, | |
| "loss": 0.6063634872436523, | |
| "mean_token_accuracy": 0.832572503387928, | |
| "num_tokens": 3691273.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.5810540007427335, | |
| "epoch": 0.1212764344728265, | |
| "grad_norm": 0.19140625, | |
| "learning_rate": 0.00019569097852774453, | |
| "loss": 0.594770860671997, | |
| "mean_token_accuracy": 0.8386940393596888, | |
| "num_tokens": 3745624.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.588012866396457, | |
| "epoch": 0.12300895496529544, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.0001955265085071886, | |
| "loss": 0.6192033767700196, | |
| "mean_token_accuracy": 0.8409584548324347, | |
| "num_tokens": 3795503.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.6364398309960961, | |
| "epoch": 0.1247414754577644, | |
| "grad_norm": 0.1328125, | |
| "learning_rate": 0.00019535902994017722, | |
| "loss": 0.6561676979064941, | |
| "mean_token_accuracy": 0.8255573306232691, | |
| "num_tokens": 3851187.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.619802868552506, | |
| "epoch": 0.12647399595023334, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 0.0001951885481013411, | |
| "loss": 0.6344377994537354, | |
| "mean_token_accuracy": 0.8339987032115459, | |
| "num_tokens": 3899124.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.6206785554066301, | |
| "epoch": 0.1282065164427023, | |
| "grad_norm": 0.1455078125, | |
| "learning_rate": 0.00019501506835989697, | |
| "loss": 0.631008529663086, | |
| "mean_token_accuracy": 0.8334441259503365, | |
| "num_tokens": 3959861.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.5827660778537392, | |
| "epoch": 0.12993903693517125, | |
| "grad_norm": 0.1630859375, | |
| "learning_rate": 0.00019483859617947872, | |
| "loss": 0.5870482444763183, | |
| "mean_token_accuracy": 0.8423280280083418, | |
| "num_tokens": 4011262.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.5850820791441947, | |
| "epoch": 0.1316715574276402, | |
| "grad_norm": 0.158203125, | |
| "learning_rate": 0.000194659137117965, | |
| "loss": 0.5706618785858154, | |
| "mean_token_accuracy": 0.835949943959713, | |
| "num_tokens": 4066973.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.5861118984874338, | |
| "epoch": 0.13340407792010914, | |
| "grad_norm": 0.14453125, | |
| "learning_rate": 0.00019447669682730458, | |
| "loss": 0.5910950183868409, | |
| "mean_token_accuracy": 0.8391546167433261, | |
| "num_tokens": 4122334.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.6104440504685045, | |
| "epoch": 0.1351365984125781, | |
| "grad_norm": 0.1552734375, | |
| "learning_rate": 0.00019429128105333802, | |
| "loss": 0.6063616752624512, | |
| "mean_token_accuracy": 0.8353819210082293, | |
| "num_tokens": 4169982.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.5728639733977616, | |
| "epoch": 0.13686911890504705, | |
| "grad_norm": 0.15625, | |
| "learning_rate": 0.00019410289563561684, | |
| "loss": 0.5704578399658203, | |
| "mean_token_accuracy": 0.8447943590581417, | |
| "num_tokens": 4224171.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.629005889594555, | |
| "epoch": 0.138601639397516, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 0.0001939115465072196, | |
| "loss": 0.6602046966552735, | |
| "mean_token_accuracy": 0.8233518835157156, | |
| "num_tokens": 4277323.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.656224881671369, | |
| "epoch": 0.14033415988998496, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 0.0001937172396945651, | |
| "loss": 0.6153887271881103, | |
| "mean_token_accuracy": 0.8298857126384973, | |
| "num_tokens": 4335646.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.5757689834572375, | |
| "epoch": 0.1420666803824539, | |
| "grad_norm": 0.1923828125, | |
| "learning_rate": 0.00019351998131722243, | |
| "loss": 0.5900076866149903, | |
| "mean_token_accuracy": 0.8418699573725462, | |
| "num_tokens": 4388682.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 0.6217615368776024, | |
| "epoch": 0.14379920087492284, | |
| "grad_norm": 0.2197265625, | |
| "learning_rate": 0.0001933197775877184, | |
| "loss": 0.6482601642608643, | |
| "mean_token_accuracy": 0.8346694391220808, | |
| "num_tokens": 4442000.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 0.6114513349719346, | |
| "epoch": 0.1455317213673918, | |
| "grad_norm": 0.2060546875, | |
| "learning_rate": 0.00019311663481134174, | |
| "loss": 0.582618522644043, | |
| "mean_token_accuracy": 0.8370612319558859, | |
| "num_tokens": 4498203.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 0.6372988875955343, | |
| "epoch": 0.14726424185986076, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.00019291055938594462, | |
| "loss": 0.6404173374176025, | |
| "mean_token_accuracy": 0.8303977962583303, | |
| "num_tokens": 4552204.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.6316783194430172, | |
| "epoch": 0.1489967623523297, | |
| "grad_norm": 0.2158203125, | |
| "learning_rate": 0.00019270155780174114, | |
| "loss": 0.656841516494751, | |
| "mean_token_accuracy": 0.829747848957777, | |
| "num_tokens": 4604813.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 0.641633422859013, | |
| "epoch": 0.15072928284479864, | |
| "grad_norm": 0.1943359375, | |
| "learning_rate": 0.00019248963664110288, | |
| "loss": 0.6612475395202637, | |
| "mean_token_accuracy": 0.8291548546403646, | |
| "num_tokens": 4661699.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 0.5630314766429365, | |
| "epoch": 0.1524618033372676, | |
| "grad_norm": 0.126953125, | |
| "learning_rate": 0.00019227480257835163, | |
| "loss": 0.5817951679229736, | |
| "mean_token_accuracy": 0.8393433384597302, | |
| "num_tokens": 4718774.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 0.5991185949184, | |
| "epoch": 0.15419432382973655, | |
| "grad_norm": 0.126953125, | |
| "learning_rate": 0.00019205706237954915, | |
| "loss": 0.5823598861694336, | |
| "mean_token_accuracy": 0.8372795689851046, | |
| "num_tokens": 4772837.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 0.6217554544098676, | |
| "epoch": 0.1559268443222055, | |
| "grad_norm": 0.1650390625, | |
| "learning_rate": 0.00019183642290228415, | |
| "loss": 0.6203337669372558, | |
| "mean_token_accuracy": 0.8345170859247446, | |
| "num_tokens": 4826993.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.6516272252425551, | |
| "epoch": 0.15765936481467444, | |
| "grad_norm": 0.150390625, | |
| "learning_rate": 0.00019161289109545618, | |
| "loss": 0.6951152801513671, | |
| "mean_token_accuracy": 0.8220154713839293, | |
| "num_tokens": 4879529.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 0.6168920679949224, | |
| "epoch": 0.1593918853071434, | |
| "grad_norm": 0.16796875, | |
| "learning_rate": 0.000191386473999057, | |
| "loss": 0.6254449844360351, | |
| "mean_token_accuracy": 0.8336785022169352, | |
| "num_tokens": 4936217.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 0.6057372880168259, | |
| "epoch": 0.16112440579961235, | |
| "grad_norm": 0.2021484375, | |
| "learning_rate": 0.00019115717874394856, | |
| "loss": 0.5920339584350586, | |
| "mean_token_accuracy": 0.8377459555864334, | |
| "num_tokens": 4991428.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 0.596577781997621, | |
| "epoch": 0.1628569262920813, | |
| "grad_norm": 0.1875, | |
| "learning_rate": 0.00019092501255163873, | |
| "loss": 0.6038323879241944, | |
| "mean_token_accuracy": 0.8356593985110521, | |
| "num_tokens": 5042620.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 0.628834813600406, | |
| "epoch": 0.16458944678455026, | |
| "grad_norm": 0.140625, | |
| "learning_rate": 0.00019068998273405363, | |
| "loss": 0.611536693572998, | |
| "mean_token_accuracy": 0.8292743604630232, | |
| "num_tokens": 5095899.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.6090147131122648, | |
| "epoch": 0.1663219672770192, | |
| "grad_norm": 0.216796875, | |
| "learning_rate": 0.00019045209669330747, | |
| "loss": 0.6397492408752441, | |
| "mean_token_accuracy": 0.8378318089991807, | |
| "num_tokens": 5145143.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 0.6188279316294938, | |
| "epoch": 0.16805448776948814, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 0.00019021136192146933, | |
| "loss": 0.6236711502075195, | |
| "mean_token_accuracy": 0.8312609314918518, | |
| "num_tokens": 5194365.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 0.6223139866255224, | |
| "epoch": 0.1697870082619571, | |
| "grad_norm": 0.1533203125, | |
| "learning_rate": 0.00018996778600032733, | |
| "loss": 0.5912320137023925, | |
| "mean_token_accuracy": 0.8325776852667331, | |
| "num_tokens": 5249204.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 0.6108009752351791, | |
| "epoch": 0.17151952875442605, | |
| "grad_norm": 0.2275390625, | |
| "learning_rate": 0.00018972137660114977, | |
| "loss": 0.6407642841339112, | |
| "mean_token_accuracy": 0.8345553431659937, | |
| "num_tokens": 5300027.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 0.6413511738181115, | |
| "epoch": 0.173252049246895, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 0.00018947214148444346, | |
| "loss": 0.6601122856140137, | |
| "mean_token_accuracy": 0.8267729926854372, | |
| "num_tokens": 5351314.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.6124841270968318, | |
| "epoch": 0.17498456973936394, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 0.00018922008849970947, | |
| "loss": 0.6234911918640137, | |
| "mean_token_accuracy": 0.8351690549403429, | |
| "num_tokens": 5403143.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 0.5752321697305888, | |
| "epoch": 0.1767170902318329, | |
| "grad_norm": 0.1640625, | |
| "learning_rate": 0.00018896522558519574, | |
| "loss": 0.5731208801269532, | |
| "mean_token_accuracy": 0.8450708810240031, | |
| "num_tokens": 5452416.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 0.616970372479409, | |
| "epoch": 0.17844961072430185, | |
| "grad_norm": 0.158203125, | |
| "learning_rate": 0.00018870756076764725, | |
| "loss": 0.6389582633972168, | |
| "mean_token_accuracy": 0.8294888816773891, | |
| "num_tokens": 5507850.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 0.6209618886932731, | |
| "epoch": 0.1801821312167708, | |
| "grad_norm": 0.220703125, | |
| "learning_rate": 0.00018844710216205305, | |
| "loss": 0.5994563102722168, | |
| "mean_token_accuracy": 0.8357018873095512, | |
| "num_tokens": 5563755.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 0.5663943574763834, | |
| "epoch": 0.18191465170923976, | |
| "grad_norm": 0.173828125, | |
| "learning_rate": 0.00018818385797139082, | |
| "loss": 0.5874752044677735, | |
| "mean_token_accuracy": 0.8382753696292639, | |
| "num_tokens": 5615163.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.5496276264078915, | |
| "epoch": 0.1836471722017087, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 0.00018791783648636844, | |
| "loss": 0.552100658416748, | |
| "mean_token_accuracy": 0.847124283015728, | |
| "num_tokens": 5666023.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 0.5882025823928416, | |
| "epoch": 0.18537969269417764, | |
| "grad_norm": 0.154296875, | |
| "learning_rate": 0.00018764904608516286, | |
| "loss": 0.5891311168670654, | |
| "mean_token_accuracy": 0.8424473576247692, | |
| "num_tokens": 5718586.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 0.5900297143496573, | |
| "epoch": 0.1871122131866466, | |
| "grad_norm": 0.193359375, | |
| "learning_rate": 0.00018737749523315634, | |
| "loss": 0.5772682189941406, | |
| "mean_token_accuracy": 0.8354586530476809, | |
| "num_tokens": 5773519.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 0.6208466733340174, | |
| "epoch": 0.18884473367911556, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.0001871031924826698, | |
| "loss": 0.6123514652252198, | |
| "mean_token_accuracy": 0.8369224779307842, | |
| "num_tokens": 5826864.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 0.6265057612210512, | |
| "epoch": 0.1905772541715845, | |
| "grad_norm": 0.2216796875, | |
| "learning_rate": 0.00018682614647269337, | |
| "loss": 0.6527121067047119, | |
| "mean_token_accuracy": 0.8279910124838352, | |
| "num_tokens": 5883460.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.6124740152154118, | |
| "epoch": 0.19230977466405344, | |
| "grad_norm": 0.1865234375, | |
| "learning_rate": 0.00018654636592861442, | |
| "loss": 0.601304292678833, | |
| "mean_token_accuracy": 0.837521544471383, | |
| "num_tokens": 5935188.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 0.6669362563639879, | |
| "epoch": 0.1940422951565224, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 0.00018626385966194275, | |
| "loss": 0.6994386196136475, | |
| "mean_token_accuracy": 0.8204180236905814, | |
| "num_tokens": 5990812.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 0.5861103215254844, | |
| "epoch": 0.19577481564899135, | |
| "grad_norm": 0.1455078125, | |
| "learning_rate": 0.00018597863657003301, | |
| "loss": 0.596555233001709, | |
| "mean_token_accuracy": 0.8415500700473786, | |
| "num_tokens": 6046076.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 0.574791920511052, | |
| "epoch": 0.1975073361414603, | |
| "grad_norm": 0.2392578125, | |
| "learning_rate": 0.00018569070563580464, | |
| "loss": 0.5656003952026367, | |
| "mean_token_accuracy": 0.84433070756495, | |
| "num_tokens": 6096184.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 0.5880047191400081, | |
| "epoch": 0.19923985663392924, | |
| "grad_norm": 0.1826171875, | |
| "learning_rate": 0.00018540007592745864, | |
| "loss": 0.6296281337738037, | |
| "mean_token_accuracy": 0.8372744925320148, | |
| "num_tokens": 6150146.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.6163527581840753, | |
| "epoch": 0.2009723771263982, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 0.0001851067565981924, | |
| "loss": 0.6186246395111084, | |
| "mean_token_accuracy": 0.8372070085257292, | |
| "num_tokens": 6204194.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 0.6072378985583782, | |
| "epoch": 0.20270489761886715, | |
| "grad_norm": 0.2109375, | |
| "learning_rate": 0.00018481075688591103, | |
| "loss": 0.6095839023590088, | |
| "mean_token_accuracy": 0.838889866694808, | |
| "num_tokens": 6258705.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 0.6074762488715351, | |
| "epoch": 0.2044374181113361, | |
| "grad_norm": 0.193359375, | |
| "learning_rate": 0.0001845120861129367, | |
| "loss": 0.5899257659912109, | |
| "mean_token_accuracy": 0.8360508769750595, | |
| "num_tokens": 6307059.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 0.641719778161496, | |
| "epoch": 0.20616993860380506, | |
| "grad_norm": 0.1865234375, | |
| "learning_rate": 0.00018421075368571494, | |
| "loss": 0.6559735298156738, | |
| "mean_token_accuracy": 0.8301095329225063, | |
| "num_tokens": 6358072.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 0.5920701253227889, | |
| "epoch": 0.207902459096274, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 0.0001839067690945183, | |
| "loss": 0.6020590782165527, | |
| "mean_token_accuracy": 0.8376339256763459, | |
| "num_tokens": 6410083.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.6142618627287447, | |
| "epoch": 0.20963497958874294, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 0.0001836001419131476, | |
| "loss": 0.6106932640075684, | |
| "mean_token_accuracy": 0.8338899418711663, | |
| "num_tokens": 6463508.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 0.6488701615482568, | |
| "epoch": 0.21136750008121188, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 0.00018329088179863033, | |
| "loss": 0.6356019973754883, | |
| "mean_token_accuracy": 0.8337765200063586, | |
| "num_tokens": 6523476.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 0.6172928042709828, | |
| "epoch": 0.21310002057368085, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 0.00018297899849091656, | |
| "loss": 0.6405450344085694, | |
| "mean_token_accuracy": 0.8321660306304693, | |
| "num_tokens": 6573355.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 0.621446970757097, | |
| "epoch": 0.2148325410661498, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 0.0001826645018125721, | |
| "loss": 0.6622963428497315, | |
| "mean_token_accuracy": 0.8254197046160698, | |
| "num_tokens": 6622895.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 0.6129778816364706, | |
| "epoch": 0.21656506155861874, | |
| "grad_norm": 0.16015625, | |
| "learning_rate": 0.00018234740166846929, | |
| "loss": 0.5634833335876465, | |
| "mean_token_accuracy": 0.8355090744793415, | |
| "num_tokens": 6679834.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.6156612957827747, | |
| "epoch": 0.2182975820510877, | |
| "grad_norm": 0.1640625, | |
| "learning_rate": 0.00018202770804547492, | |
| "loss": 0.6147466659545898, | |
| "mean_token_accuracy": 0.8310359807685017, | |
| "num_tokens": 6731484.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 0.5810929948464036, | |
| "epoch": 0.22003010254355665, | |
| "grad_norm": 0.189453125, | |
| "learning_rate": 0.00018170543101213565, | |
| "loss": 0.5630557537078857, | |
| "mean_token_accuracy": 0.8407821863889694, | |
| "num_tokens": 6787191.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 0.6104231233242899, | |
| "epoch": 0.2217626230360256, | |
| "grad_norm": 0.1943359375, | |
| "learning_rate": 0.00018138058071836115, | |
| "loss": 0.621036958694458, | |
| "mean_token_accuracy": 0.8329197008162736, | |
| "num_tokens": 6840606.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 0.6128938837908209, | |
| "epoch": 0.22349514352849456, | |
| "grad_norm": 0.21484375, | |
| "learning_rate": 0.00018105316739510424, | |
| "loss": 0.5915724754333496, | |
| "mean_token_accuracy": 0.8370759826153517, | |
| "num_tokens": 6887163.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 0.5851812950335443, | |
| "epoch": 0.2252276640209635, | |
| "grad_norm": 0.2236328125, | |
| "learning_rate": 0.00018072320135403862, | |
| "loss": 0.5940948963165283, | |
| "mean_token_accuracy": 0.8384971469640732, | |
| "num_tokens": 6940242.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.5889422579668462, | |
| "epoch": 0.22696018451343244, | |
| "grad_norm": 0.21875, | |
| "learning_rate": 0.00018039069298723435, | |
| "loss": 0.5769166946411133, | |
| "mean_token_accuracy": 0.8388250943273305, | |
| "num_tokens": 6996198.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 0.606858121138066, | |
| "epoch": 0.2286927050059014, | |
| "grad_norm": 0.1552734375, | |
| "learning_rate": 0.00018005565276683037, | |
| "loss": 0.6112150192260742, | |
| "mean_token_accuracy": 0.8364918135106564, | |
| "num_tokens": 7048115.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 0.5949655521195382, | |
| "epoch": 0.23042522549837036, | |
| "grad_norm": 0.2470703125, | |
| "learning_rate": 0.00017971809124470468, | |
| "loss": 0.6120047569274902, | |
| "mean_token_accuracy": 0.8407701279968023, | |
| "num_tokens": 7108085.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 0.6079389780759812, | |
| "epoch": 0.2321577459908393, | |
| "grad_norm": 0.16015625, | |
| "learning_rate": 0.00017937801905214214, | |
| "loss": 0.6000718593597412, | |
| "mean_token_accuracy": 0.8364381536841392, | |
| "num_tokens": 7162152.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 0.6189309723675251, | |
| "epoch": 0.23389026648330824, | |
| "grad_norm": 0.2275390625, | |
| "learning_rate": 0.00017903544689949953, | |
| "loss": 0.6147403240203857, | |
| "mean_token_accuracy": 0.8258390601724386, | |
| "num_tokens": 7213480.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.5935845918487758, | |
| "epoch": 0.2356227869757772, | |
| "grad_norm": 0.244140625, | |
| "learning_rate": 0.00017869038557586834, | |
| "loss": 0.594597339630127, | |
| "mean_token_accuracy": 0.8422905754297971, | |
| "num_tokens": 7268365.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 0.5886939469724893, | |
| "epoch": 0.23735530746824615, | |
| "grad_norm": 0.1796875, | |
| "learning_rate": 0.00017834284594873476, | |
| "loss": 0.5968518257141113, | |
| "mean_token_accuracy": 0.839365403354168, | |
| "num_tokens": 7322788.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 0.5890856982208789, | |
| "epoch": 0.2390878279607151, | |
| "grad_norm": 0.20703125, | |
| "learning_rate": 0.00017799283896363776, | |
| "loss": 0.5831431388854981, | |
| "mean_token_accuracy": 0.8419708486646413, | |
| "num_tokens": 7378087.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 0.6064389856532216, | |
| "epoch": 0.24082034845318404, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 0.00017764037564382408, | |
| "loss": 0.6195587635040283, | |
| "mean_token_accuracy": 0.8357837244868278, | |
| "num_tokens": 7432262.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 0.5797448608092963, | |
| "epoch": 0.242552868945653, | |
| "grad_norm": 0.1826171875, | |
| "learning_rate": 0.00017728546708990113, | |
| "loss": 0.6022681713104248, | |
| "mean_token_accuracy": 0.8418242033571005, | |
| "num_tokens": 7489537.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.585219320608303, | |
| "epoch": 0.24428538943812195, | |
| "grad_norm": 0.1494140625, | |
| "learning_rate": 0.0001769281244794875, | |
| "loss": 0.601930570602417, | |
| "mean_token_accuracy": 0.8405182551592588, | |
| "num_tokens": 7545283.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 0.6301440540701151, | |
| "epoch": 0.2460179099305909, | |
| "grad_norm": 0.16796875, | |
| "learning_rate": 0.0001765683590668607, | |
| "loss": 0.617746639251709, | |
| "mean_token_accuracy": 0.8311772037297487, | |
| "num_tokens": 7599954.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 0.5862551515456289, | |
| "epoch": 0.24775043042305986, | |
| "grad_norm": 0.1494140625, | |
| "learning_rate": 0.000176206182182603, | |
| "loss": 0.5854514122009278, | |
| "mean_token_accuracy": 0.8412911489605903, | |
| "num_tokens": 7651135.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 0.6006224121898412, | |
| "epoch": 0.2494829509155288, | |
| "grad_norm": 0.2451171875, | |
| "learning_rate": 0.00017584160523324437, | |
| "loss": 0.626686954498291, | |
| "mean_token_accuracy": 0.8344044268131257, | |
| "num_tokens": 7701714.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 0.6094549149740487, | |
| "epoch": 0.25121547140799777, | |
| "grad_norm": 0.220703125, | |
| "learning_rate": 0.00017547463970090323, | |
| "loss": 0.5837365627288819, | |
| "mean_token_accuracy": 0.8370290040969849, | |
| "num_tokens": 7755256.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.5964161755517126, | |
| "epoch": 0.2529479919004667, | |
| "grad_norm": 0.158203125, | |
| "learning_rate": 0.00017510529714292496, | |
| "loss": 0.5807624340057373, | |
| "mean_token_accuracy": 0.8389873761683703, | |
| "num_tokens": 7805875.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 0.5798287321813405, | |
| "epoch": 0.25468051239293565, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 0.0001747335891915179, | |
| "loss": 0.6037708759307862, | |
| "mean_token_accuracy": 0.8360363617539406, | |
| "num_tokens": 7857904.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 0.6185758833307773, | |
| "epoch": 0.2564130328854046, | |
| "grad_norm": 0.203125, | |
| "learning_rate": 0.00017435952755338684, | |
| "loss": 0.6310105323791504, | |
| "mean_token_accuracy": 0.8346008766442538, | |
| "num_tokens": 7911115.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 0.5521081209182739, | |
| "epoch": 0.25814555337787354, | |
| "grad_norm": 0.158203125, | |
| "learning_rate": 0.00017398312400936452, | |
| "loss": 0.5405902862548828, | |
| "mean_token_accuracy": 0.8503412056714297, | |
| "num_tokens": 7961113.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 0.6125838646665216, | |
| "epoch": 0.2598780738703425, | |
| "grad_norm": 0.224609375, | |
| "learning_rate": 0.00017360439041404045, | |
| "loss": 0.6419179439544678, | |
| "mean_token_accuracy": 0.831499756872654, | |
| "num_tokens": 8016836.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 0.6090016840025783, | |
| "epoch": 0.2616105943628114, | |
| "grad_norm": 0.16796875, | |
| "learning_rate": 0.0001732233386953877, | |
| "loss": 0.6156506061553955, | |
| "mean_token_accuracy": 0.8323286134749651, | |
| "num_tokens": 8069126.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 0.5781607817858457, | |
| "epoch": 0.2633431148552804, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.000172839980854387, | |
| "loss": 0.5711768627166748, | |
| "mean_token_accuracy": 0.8443056184798479, | |
| "num_tokens": 8121984.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 0.6185290202964098, | |
| "epoch": 0.26507563534774936, | |
| "grad_norm": 0.2177734375, | |
| "learning_rate": 0.0001724543289646491, | |
| "loss": 0.6232064247131348, | |
| "mean_token_accuracy": 0.8340055584907532, | |
| "num_tokens": 8174853.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 0.5681716504506766, | |
| "epoch": 0.2668081558402183, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 0.0001720663951720343, | |
| "loss": 0.5704017162322998, | |
| "mean_token_accuracy": 0.8463324144482612, | |
| "num_tokens": 8230103.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 0.6060013690497726, | |
| "epoch": 0.26854067633268724, | |
| "grad_norm": 0.203125, | |
| "learning_rate": 0.00017167619169426997, | |
| "loss": 0.6261486053466797, | |
| "mean_token_accuracy": 0.8349693570286035, | |
| "num_tokens": 8285159.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 0.5899374564178288, | |
| "epoch": 0.2702731968251562, | |
| "grad_norm": 0.1748046875, | |
| "learning_rate": 0.00017128373082056565, | |
| "loss": 0.5784136772155761, | |
| "mean_token_accuracy": 0.834688114002347, | |
| "num_tokens": 8339683.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 0.600262654479593, | |
| "epoch": 0.27200571731762513, | |
| "grad_norm": 0.232421875, | |
| "learning_rate": 0.00017088902491122637, | |
| "loss": 0.6100976943969727, | |
| "mean_token_accuracy": 0.8409205380827188, | |
| "num_tokens": 8392860.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 0.6050844821147621, | |
| "epoch": 0.2737382378100941, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 0.0001704920863972629, | |
| "loss": 0.6370552539825439, | |
| "mean_token_accuracy": 0.833171795681119, | |
| "num_tokens": 8444381.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 0.622040162421763, | |
| "epoch": 0.27547075830256307, | |
| "grad_norm": 0.1572265625, | |
| "learning_rate": 0.00017009292778000056, | |
| "loss": 0.6550620555877685, | |
| "mean_token_accuracy": 0.8347457438707352, | |
| "num_tokens": 8500064.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 0.5820012846495957, | |
| "epoch": 0.277203278795032, | |
| "grad_norm": 0.1826171875, | |
| "learning_rate": 0.00016969156163068548, | |
| "loss": 0.5726365089416504, | |
| "mean_token_accuracy": 0.8414584957063198, | |
| "num_tokens": 8554413.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 0.6192501490004361, | |
| "epoch": 0.27893579928750095, | |
| "grad_norm": 0.240234375, | |
| "learning_rate": 0.0001692880005900884, | |
| "loss": 0.6141728401184082, | |
| "mean_token_accuracy": 0.8348658731207251, | |
| "num_tokens": 8608546.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 0.5944610396865755, | |
| "epoch": 0.2806683197799699, | |
| "grad_norm": 0.2001953125, | |
| "learning_rate": 0.00016888225736810702, | |
| "loss": 0.5792739868164063, | |
| "mean_token_accuracy": 0.8423636559396982, | |
| "num_tokens": 8661380.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 0.5956152304075658, | |
| "epoch": 0.28240084027243884, | |
| "grad_norm": 0.2099609375, | |
| "learning_rate": 0.00016847434474336528, | |
| "loss": 0.5970348358154297, | |
| "mean_token_accuracy": 0.8401257161051034, | |
| "num_tokens": 8709577.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 0.6147611321881413, | |
| "epoch": 0.2841333607649078, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 0.00016806427556281106, | |
| "loss": 0.629329776763916, | |
| "mean_token_accuracy": 0.8385975230485201, | |
| "num_tokens": 8761040.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 0.6490127250086516, | |
| "epoch": 0.2858658812573768, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 0.0001676520627413117, | |
| "loss": 0.6809987545013427, | |
| "mean_token_accuracy": 0.8295384451746941, | |
| "num_tokens": 8815974.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 0.5769906338769942, | |
| "epoch": 0.2875984017498457, | |
| "grad_norm": 0.181640625, | |
| "learning_rate": 0.00016723771926124706, | |
| "loss": 0.6031839847564697, | |
| "mean_token_accuracy": 0.8421449929475784, | |
| "num_tokens": 8864858.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 0.5643401111476123, | |
| "epoch": 0.28933092224231466, | |
| "grad_norm": 0.1650390625, | |
| "learning_rate": 0.0001668212581721008, | |
| "loss": 0.5524356365203857, | |
| "mean_token_accuracy": 0.8459334097802639, | |
| "num_tokens": 8917743.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 0.5941579655511304, | |
| "epoch": 0.2910634427347836, | |
| "grad_norm": 0.1484375, | |
| "learning_rate": 0.0001664026925900492, | |
| "loss": 0.6215604782104492, | |
| "mean_token_accuracy": 0.8360832681879401, | |
| "num_tokens": 8974177.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 0.6097073512617499, | |
| "epoch": 0.29279596322725254, | |
| "grad_norm": 0.1953125, | |
| "learning_rate": 0.00016598203569754842, | |
| "loss": 0.6148754119873047, | |
| "mean_token_accuracy": 0.8349464479833841, | |
| "num_tokens": 9029784.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 0.5949376497417689, | |
| "epoch": 0.2945284837197215, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 0.00016555930074291892, | |
| "loss": 0.5629282474517823, | |
| "mean_token_accuracy": 0.8412305314093829, | |
| "num_tokens": 9086247.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 0.6209503551013767, | |
| "epoch": 0.2962610042121904, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 0.00016513450103992843, | |
| "loss": 0.6351428508758545, | |
| "mean_token_accuracy": 0.8299500808119774, | |
| "num_tokens": 9139348.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 0.6122556574642658, | |
| "epoch": 0.2979935247046594, | |
| "grad_norm": 0.259765625, | |
| "learning_rate": 0.0001647076499673727, | |
| "loss": 0.6054322719573975, | |
| "mean_token_accuracy": 0.8361066952347755, | |
| "num_tokens": 9189774.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 0.6057383619248867, | |
| "epoch": 0.29972604519712837, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.00016427876096865394, | |
| "loss": 0.5783013820648193, | |
| "mean_token_accuracy": 0.8409923903644085, | |
| "num_tokens": 9247091.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 0.6327047647442668, | |
| "epoch": 0.3014585656895973, | |
| "grad_norm": 0.1708984375, | |
| "learning_rate": 0.00016384784755135766, | |
| "loss": 0.6669343471527099, | |
| "mean_token_accuracy": 0.8293208103626967, | |
| "num_tokens": 9302230.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 0.5699484588578343, | |
| "epoch": 0.30319108618206625, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 0.00016341492328682703, | |
| "loss": 0.5571082592010498, | |
| "mean_token_accuracy": 0.8480747263878584, | |
| "num_tokens": 9356728.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 0.567579479701817, | |
| "epoch": 0.3049236066745352, | |
| "grad_norm": 0.1962890625, | |
| "learning_rate": 0.00016298000180973573, | |
| "loss": 0.5580705165863037, | |
| "mean_token_accuracy": 0.8437619034200907, | |
| "num_tokens": 9408140.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 0.5828627380309627, | |
| "epoch": 0.30665612716700413, | |
| "grad_norm": 0.18359375, | |
| "learning_rate": 0.00016254309681765813, | |
| "loss": 0.5716603755950928, | |
| "mean_token_accuracy": 0.8377308517694473, | |
| "num_tokens": 9467463.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 0.5848529391689226, | |
| "epoch": 0.3083886476594731, | |
| "grad_norm": 0.158203125, | |
| "learning_rate": 0.0001621042220706384, | |
| "loss": 0.5793115139007569, | |
| "mean_token_accuracy": 0.8402173619717359, | |
| "num_tokens": 9522306.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 0.6066678614355624, | |
| "epoch": 0.3101211681519421, | |
| "grad_norm": 0.1591796875, | |
| "learning_rate": 0.00016166339139075676, | |
| "loss": 0.6328657627105713, | |
| "mean_token_accuracy": 0.8367021255195141, | |
| "num_tokens": 9572434.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 0.6003833622671664, | |
| "epoch": 0.311853688644411, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 0.0001612206186616942, | |
| "loss": 0.6137086391448975, | |
| "mean_token_accuracy": 0.8334165547043085, | |
| "num_tokens": 9628519.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 0.590199672896415, | |
| "epoch": 0.31358620913687996, | |
| "grad_norm": 0.185546875, | |
| "learning_rate": 0.00016077591782829548, | |
| "loss": 0.5786579608917236, | |
| "mean_token_accuracy": 0.8455715507268906, | |
| "num_tokens": 9681885.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 0.5942349970573559, | |
| "epoch": 0.31531872962934887, | |
| "grad_norm": 0.203125, | |
| "learning_rate": 0.00016032930289612972, | |
| "loss": 0.603551721572876, | |
| "mean_token_accuracy": 0.8380775325000286, | |
| "num_tokens": 9731757.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 0.6340034159831702, | |
| "epoch": 0.31705125012181784, | |
| "grad_norm": 0.2255859375, | |
| "learning_rate": 0.0001598807879310493, | |
| "loss": 0.6752604007720947, | |
| "mean_token_accuracy": 0.8293415606021881, | |
| "num_tokens": 9784377.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 0.6373454562388361, | |
| "epoch": 0.3187837706142868, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 0.000159430387058747, | |
| "loss": 0.6538397312164307, | |
| "mean_token_accuracy": 0.8350980304181576, | |
| "num_tokens": 9834147.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 0.5898376687895507, | |
| "epoch": 0.3205162911067557, | |
| "grad_norm": 0.1767578125, | |
| "learning_rate": 0.00015897811446431094, | |
| "loss": 0.5761978149414062, | |
| "mean_token_accuracy": 0.8405380714684725, | |
| "num_tokens": 9886125.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 0.6033100615255534, | |
| "epoch": 0.3222488115992247, | |
| "grad_norm": 0.1953125, | |
| "learning_rate": 0.00015852398439177812, | |
| "loss": 0.6355989933013916, | |
| "mean_token_accuracy": 0.8382335666567087, | |
| "num_tokens": 9938648.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 0.5812505614478141, | |
| "epoch": 0.32398133209169366, | |
| "grad_norm": 0.1689453125, | |
| "learning_rate": 0.00015806801114368543, | |
| "loss": 0.6040312290191651, | |
| "mean_token_accuracy": 0.8389291629195214, | |
| "num_tokens": 9990548.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 0.5965979805681855, | |
| "epoch": 0.3257138525841626, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 0.00015761020908061947, | |
| "loss": 0.6084609985351562, | |
| "mean_token_accuracy": 0.8397494804114103, | |
| "num_tokens": 10043712.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 0.6055567375849933, | |
| "epoch": 0.32744637307663155, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 0.0001571505926207643, | |
| "loss": 0.5824664115905762, | |
| "mean_token_accuracy": 0.8369629330933094, | |
| "num_tokens": 10098633.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 0.622294892789796, | |
| "epoch": 0.3291788935691005, | |
| "grad_norm": 0.29296875, | |
| "learning_rate": 0.0001566891762394471, | |
| "loss": 0.6370018005371094, | |
| "mean_token_accuracy": 0.8303959008306265, | |
| "num_tokens": 10152668.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 0.6205999419093132, | |
| "epoch": 0.33091141406156943, | |
| "grad_norm": 0.1826171875, | |
| "learning_rate": 0.00015622597446868252, | |
| "loss": 0.6031853199005127, | |
| "mean_token_accuracy": 0.839716836810112, | |
| "num_tokens": 10203981.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 0.5835219689644873, | |
| "epoch": 0.3326439345540384, | |
| "grad_norm": 0.2099609375, | |
| "learning_rate": 0.00015576100189671488, | |
| "loss": 0.583237886428833, | |
| "mean_token_accuracy": 0.8391559388488531, | |
| "num_tokens": 10256722.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 0.5798515821807086, | |
| "epoch": 0.33437645504650737, | |
| "grad_norm": 0.1630859375, | |
| "learning_rate": 0.00015529427316755874, | |
| "loss": 0.621484899520874, | |
| "mean_token_accuracy": 0.8355384927242995, | |
| "num_tokens": 10310185.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 0.5843613225501031, | |
| "epoch": 0.3361089755389763, | |
| "grad_norm": 0.236328125, | |
| "learning_rate": 0.00015482580298053778, | |
| "loss": 0.6080245018005371, | |
| "mean_token_accuracy": 0.842098330333829, | |
| "num_tokens": 10365812.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 0.5864246059209108, | |
| "epoch": 0.33784149603144525, | |
| "grad_norm": 0.228515625, | |
| "learning_rate": 0.00015435560608982168, | |
| "loss": 0.5887944221496582, | |
| "mean_token_accuracy": 0.8388173773884773, | |
| "num_tokens": 10420413.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 0.5741982539650052, | |
| "epoch": 0.3395740165239142, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 0.0001538836973039616, | |
| "loss": 0.5880287647247314, | |
| "mean_token_accuracy": 0.8398171707987785, | |
| "num_tokens": 10477056.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 0.6004749670159072, | |
| "epoch": 0.34130653701638314, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 0.00015341009148542377, | |
| "loss": 0.619431734085083, | |
| "mean_token_accuracy": 0.8380085773766041, | |
| "num_tokens": 10530758.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 0.5911483001895249, | |
| "epoch": 0.3430390575088521, | |
| "grad_norm": 0.216796875, | |
| "learning_rate": 0.00015293480355012138, | |
| "loss": 0.5825908660888672, | |
| "mean_token_accuracy": 0.8379138492047786, | |
| "num_tokens": 10586548.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 0.5724553103093057, | |
| "epoch": 0.344771578001321, | |
| "grad_norm": 0.1640625, | |
| "learning_rate": 0.0001524578484669448, | |
| "loss": 0.5837036609649658, | |
| "mean_token_accuracy": 0.8414458900690078, | |
| "num_tokens": 10640208.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 0.5913511055056005, | |
| "epoch": 0.34650409849379, | |
| "grad_norm": 0.2294921875, | |
| "learning_rate": 0.00015197924125729016, | |
| "loss": 0.6037324905395508, | |
| "mean_token_accuracy": 0.8375172037631273, | |
| "num_tokens": 10689070.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 0.5623359635006636, | |
| "epoch": 0.34823661898625896, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 0.0001514989969945862, | |
| "loss": 0.5799863815307618, | |
| "mean_token_accuracy": 0.8434689830988645, | |
| "num_tokens": 10741791.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 0.595218509202823, | |
| "epoch": 0.3499691394787279, | |
| "grad_norm": 0.2021484375, | |
| "learning_rate": 0.0001510171308038197, | |
| "loss": 0.5759833335876465, | |
| "mean_token_accuracy": 0.8378583282232285, | |
| "num_tokens": 10792017.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 0.5926129624480382, | |
| "epoch": 0.35170165997119684, | |
| "grad_norm": 0.275390625, | |
| "learning_rate": 0.00015053365786105898, | |
| "loss": 0.6137632369995117, | |
| "mean_token_accuracy": 0.8360541388392448, | |
| "num_tokens": 10841822.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 0.588808442093432, | |
| "epoch": 0.3534341804636658, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 0.00015004859339297602, | |
| "loss": 0.6234822750091553, | |
| "mean_token_accuracy": 0.8365503929555416, | |
| "num_tokens": 10895402.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 0.6277590793790295, | |
| "epoch": 0.35516670095613473, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 0.0001495619526763668, | |
| "loss": 0.6404668807983398, | |
| "mean_token_accuracy": 0.8322111006826163, | |
| "num_tokens": 10948926.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 0.5735611078329385, | |
| "epoch": 0.3568992214486037, | |
| "grad_norm": 0.2138671875, | |
| "learning_rate": 0.00014907375103767037, | |
| "loss": 0.554630708694458, | |
| "mean_token_accuracy": 0.8440061457455158, | |
| "num_tokens": 11001006.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 0.582486811466515, | |
| "epoch": 0.35863174194107267, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 0.00014858400385248585, | |
| "loss": 0.565306568145752, | |
| "mean_token_accuracy": 0.8428201846778393, | |
| "num_tokens": 11057715.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 0.5820039538666606, | |
| "epoch": 0.3603642624335416, | |
| "grad_norm": 0.259765625, | |
| "learning_rate": 0.00014809272654508855, | |
| "loss": 0.5647046089172363, | |
| "mean_token_accuracy": 0.8435172945261001, | |
| "num_tokens": 11105950.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 0.6123531493823975, | |
| "epoch": 0.36209678292601055, | |
| "grad_norm": 0.18359375, | |
| "learning_rate": 0.00014759993458794387, | |
| "loss": 0.6230340003967285, | |
| "mean_token_accuracy": 0.8300592731684446, | |
| "num_tokens": 11159753.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 0.586882522655651, | |
| "epoch": 0.3638293034184795, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 0.00014710564350122021, | |
| "loss": 0.5888068199157714, | |
| "mean_token_accuracy": 0.8437575984746217, | |
| "num_tokens": 11217212.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 0.5973215179517866, | |
| "epoch": 0.36556182391094844, | |
| "grad_norm": 0.19921875, | |
| "learning_rate": 0.00014660986885230002, | |
| "loss": 0.6102025032043457, | |
| "mean_token_accuracy": 0.8387055590748786, | |
| "num_tokens": 11269879.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 0.5769942476414144, | |
| "epoch": 0.3672943444034174, | |
| "grad_norm": 0.2392578125, | |
| "learning_rate": 0.0001461126262552897, | |
| "loss": 0.577931547164917, | |
| "mean_token_accuracy": 0.8404097493737936, | |
| "num_tokens": 11319324.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 0.6094427598174661, | |
| "epoch": 0.3690268648958863, | |
| "grad_norm": 0.140625, | |
| "learning_rate": 0.00014561393137052766, | |
| "loss": 0.6362490653991699, | |
| "mean_token_accuracy": 0.8333139736205339, | |
| "num_tokens": 11375159.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 0.5666341712232679, | |
| "epoch": 0.3707593853883553, | |
| "grad_norm": 0.216796875, | |
| "learning_rate": 0.00014511379990409117, | |
| "loss": 0.567043685913086, | |
| "mean_token_accuracy": 0.8457438841462135, | |
| "num_tokens": 11426520.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 0.6225775457452982, | |
| "epoch": 0.37249190588082426, | |
| "grad_norm": 0.2216796875, | |
| "learning_rate": 0.00014461224760730187, | |
| "loss": 0.6647164821624756, | |
| "mean_token_accuracy": 0.8330285247415304, | |
| "num_tokens": 11484237.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 0.6187613100279122, | |
| "epoch": 0.3742244263732932, | |
| "grad_norm": 0.2314453125, | |
| "learning_rate": 0.00014410929027622934, | |
| "loss": 0.6382776260375976, | |
| "mean_token_accuracy": 0.8337401654571295, | |
| "num_tokens": 11536870.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 0.6030611063353717, | |
| "epoch": 0.37595694686576214, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.00014360494375119395, | |
| "loss": 0.5975234508514404, | |
| "mean_token_accuracy": 0.8363439656794072, | |
| "num_tokens": 11584488.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 0.6093014625832438, | |
| "epoch": 0.3776894673582311, | |
| "grad_norm": 0.240234375, | |
| "learning_rate": 0.00014309922391626784, | |
| "loss": 0.6156137943267822, | |
| "mean_token_accuracy": 0.8362408101558685, | |
| "num_tokens": 11639837.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 0.6037656621308998, | |
| "epoch": 0.3794219878507, | |
| "grad_norm": 0.24609375, | |
| "learning_rate": 0.0001425921466987746, | |
| "loss": 0.5895677089691163, | |
| "mean_token_accuracy": 0.8392930574715137, | |
| "num_tokens": 11691666.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 0.5695399052929133, | |
| "epoch": 0.381154508343169, | |
| "grad_norm": 0.181640625, | |
| "learning_rate": 0.00014208372806878784, | |
| "loss": 0.5762203693389892, | |
| "mean_token_accuracy": 0.8463476520031691, | |
| "num_tokens": 11744574.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 0.5971330104395747, | |
| "epoch": 0.38288702883563797, | |
| "grad_norm": 0.212890625, | |
| "learning_rate": 0.00014157398403862793, | |
| "loss": 0.610533332824707, | |
| "mean_token_accuracy": 0.8361469194293022, | |
| "num_tokens": 11803183.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 0.6277089732699096, | |
| "epoch": 0.3846195493281069, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 0.00014106293066235806, | |
| "loss": 0.6349636077880859, | |
| "mean_token_accuracy": 0.8273304011672735, | |
| "num_tokens": 11853042.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 0.6195264323614538, | |
| "epoch": 0.38635206982057585, | |
| "grad_norm": 0.17578125, | |
| "learning_rate": 0.00014055058403527828, | |
| "loss": 0.6387957572937012, | |
| "mean_token_accuracy": 0.8352078393101692, | |
| "num_tokens": 11907577.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 0.5621367298997939, | |
| "epoch": 0.3880845903130448, | |
| "grad_norm": 0.27734375, | |
| "learning_rate": 0.00014003696029341885, | |
| "loss": 0.5445407390594482, | |
| "mean_token_accuracy": 0.8438704308122397, | |
| "num_tokens": 11964072.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 0.5822187520563602, | |
| "epoch": 0.38981711080551373, | |
| "grad_norm": 0.1904296875, | |
| "learning_rate": 0.00013952207561303186, | |
| "loss": 0.5968410491943359, | |
| "mean_token_accuracy": 0.8352361563593149, | |
| "num_tokens": 12018364.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 0.5926231760531664, | |
| "epoch": 0.3915496312979827, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 0.000139005946210082, | |
| "loss": 0.5886177539825439, | |
| "mean_token_accuracy": 0.8381821203976869, | |
| "num_tokens": 12071181.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 0.6001140361186117, | |
| "epoch": 0.3932821517904517, | |
| "grad_norm": 0.1796875, | |
| "learning_rate": 0.00013848858833973555, | |
| "loss": 0.5883821487426758, | |
| "mean_token_accuracy": 0.8341061566025019, | |
| "num_tokens": 12123527.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 0.6000702895224095, | |
| "epoch": 0.3950146722829206, | |
| "grad_norm": 0.2470703125, | |
| "learning_rate": 0.00013797001829584868, | |
| "loss": 0.6160523891448975, | |
| "mean_token_accuracy": 0.8381300024688244, | |
| "num_tokens": 12179785.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 0.5846447445452213, | |
| "epoch": 0.39674719277538956, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 0.00013745025241045412, | |
| "loss": 0.5964017868041992, | |
| "mean_token_accuracy": 0.840913362056017, | |
| "num_tokens": 12233504.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 0.5862786662764847, | |
| "epoch": 0.39847971326785847, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 0.00013692930705324697, | |
| "loss": 0.607056713104248, | |
| "mean_token_accuracy": 0.8370703462511301, | |
| "num_tokens": 12289939.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 0.6146723322104662, | |
| "epoch": 0.40021223376032744, | |
| "grad_norm": 0.1708984375, | |
| "learning_rate": 0.00013640719863106888, | |
| "loss": 0.6222431182861328, | |
| "mean_token_accuracy": 0.8339255709201098, | |
| "num_tokens": 12344232.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 0.6121346159372478, | |
| "epoch": 0.4019447542527964, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 0.00013588394358739168, | |
| "loss": 0.6056359291076661, | |
| "mean_token_accuracy": 0.8359162289649248, | |
| "num_tokens": 12395354.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 0.5537781528197229, | |
| "epoch": 0.4036772747452653, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 0.00013535955840179918, | |
| "loss": 0.5524442195892334, | |
| "mean_token_accuracy": 0.8491223704069852, | |
| "num_tokens": 12443486.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 0.5908654337283223, | |
| "epoch": 0.4054097952377343, | |
| "grad_norm": 0.1748046875, | |
| "learning_rate": 0.0001348340595894683, | |
| "loss": 0.6637831211090088, | |
| "mean_token_accuracy": 0.8352008298039436, | |
| "num_tokens": 12498278.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 0.6369602079503238, | |
| "epoch": 0.40714231573020326, | |
| "grad_norm": 0.2216796875, | |
| "learning_rate": 0.00013430746370064905, | |
| "loss": 0.6277615070343018, | |
| "mean_token_accuracy": 0.830039632320404, | |
| "num_tokens": 12548979.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 0.5778507422655821, | |
| "epoch": 0.4088748362226722, | |
| "grad_norm": 0.248046875, | |
| "learning_rate": 0.00013377978732014297, | |
| "loss": 0.5777788162231445, | |
| "mean_token_accuracy": 0.8472949586808681, | |
| "num_tokens": 12600361.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 0.6153424762189388, | |
| "epoch": 0.41060735671514115, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 0.00013325104706678117, | |
| "loss": 0.6212099552154541, | |
| "mean_token_accuracy": 0.8323879513889552, | |
| "num_tokens": 12650080.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 0.5499768436653539, | |
| "epoch": 0.4123398772076101, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 0.0001327212595929006, | |
| "loss": 0.556803035736084, | |
| "mean_token_accuracy": 0.8466630782932043, | |
| "num_tokens": 12707694.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 0.5946451628580689, | |
| "epoch": 0.41407239770007903, | |
| "grad_norm": 0.1787109375, | |
| "learning_rate": 0.00013219044158381988, | |
| "loss": 0.6023283004760742, | |
| "mean_token_accuracy": 0.8404143087565898, | |
| "num_tokens": 12763899.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 0.5769397917203605, | |
| "epoch": 0.415804918192548, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 0.00013165860975731364, | |
| "loss": 0.5805276393890381, | |
| "mean_token_accuracy": 0.8394303295761347, | |
| "num_tokens": 12816977.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 0.6263184855692089, | |
| "epoch": 0.41753743868501697, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 0.00013112578086308603, | |
| "loss": 0.6258736610412597, | |
| "mean_token_accuracy": 0.8292172599583865, | |
| "num_tokens": 12867177.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 0.5767630891874432, | |
| "epoch": 0.4192699591774859, | |
| "grad_norm": 0.21875, | |
| "learning_rate": 0.0001305919716822432, | |
| "loss": 0.5918225765228271, | |
| "mean_token_accuracy": 0.8412780135869979, | |
| "num_tokens": 12921784.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 0.5780319124925881, | |
| "epoch": 0.42100247966995485, | |
| "grad_norm": 0.2060546875, | |
| "learning_rate": 0.00013005719902676484, | |
| "loss": 0.5864857196807861, | |
| "mean_token_accuracy": 0.8374421495944262, | |
| "num_tokens": 12974494.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 0.5848251041024923, | |
| "epoch": 0.42273500016242377, | |
| "grad_norm": 0.1787109375, | |
| "learning_rate": 0.00012952147973897463, | |
| "loss": 0.5625586032867431, | |
| "mean_token_accuracy": 0.8452736441045999, | |
| "num_tokens": 13029741.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 0.5782041396014392, | |
| "epoch": 0.42446752065489274, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 0.0001289848306910098, | |
| "loss": 0.5688180923461914, | |
| "mean_token_accuracy": 0.842210229113698, | |
| "num_tokens": 13082150.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 0.5863951063714922, | |
| "epoch": 0.4262000411473617, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 0.00012844726878428992, | |
| "loss": 0.5963150501251221, | |
| "mean_token_accuracy": 0.8403796773403883, | |
| "num_tokens": 13137759.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 0.5558338332921267, | |
| "epoch": 0.4279325616398306, | |
| "grad_norm": 0.21484375, | |
| "learning_rate": 0.00012790881094898427, | |
| "loss": 0.5558866024017334, | |
| "mean_token_accuracy": 0.8459072947502136, | |
| "num_tokens": 13192630.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 0.546316223940812, | |
| "epoch": 0.4296650821322996, | |
| "grad_norm": 0.203125, | |
| "learning_rate": 0.000127369474143479, | |
| "loss": 0.5630002975463867, | |
| "mean_token_accuracy": 0.8511018488556147, | |
| "num_tokens": 13247752.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 0.5771075886674225, | |
| "epoch": 0.43139760262476856, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 0.00012682927535384272, | |
| "loss": 0.5783199310302735, | |
| "mean_token_accuracy": 0.8392299171537161, | |
| "num_tokens": 13301263.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 0.6328532771673053, | |
| "epoch": 0.4331301231172375, | |
| "grad_norm": 0.1552734375, | |
| "learning_rate": 0.0001262882315932918, | |
| "loss": 0.6653527736663818, | |
| "mean_token_accuracy": 0.8329028349369765, | |
| "num_tokens": 13355347.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 0.5985511194681749, | |
| "epoch": 0.43486264360970645, | |
| "grad_norm": 0.2421875, | |
| "learning_rate": 0.0001257463599016544, | |
| "loss": 0.6060856342315674, | |
| "mean_token_accuracy": 0.8381591210141778, | |
| "num_tokens": 13410328.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 0.6097901756409556, | |
| "epoch": 0.4365951641021754, | |
| "grad_norm": 0.1689453125, | |
| "learning_rate": 0.00012520367734483376, | |
| "loss": 0.5944780826568603, | |
| "mean_token_accuracy": 0.8347636796534061, | |
| "num_tokens": 13458141.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 0.5965319158509373, | |
| "epoch": 0.43832768459464433, | |
| "grad_norm": 0.162109375, | |
| "learning_rate": 0.00012466020101427092, | |
| "loss": 0.6008960247039795, | |
| "mean_token_accuracy": 0.8366463247686624, | |
| "num_tokens": 13516437.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 0.6449747297912836, | |
| "epoch": 0.4400602050871133, | |
| "grad_norm": 0.27734375, | |
| "learning_rate": 0.0001241159480264062, | |
| "loss": 0.6599147319793701, | |
| "mean_token_accuracy": 0.8267238955944777, | |
| "num_tokens": 13565792.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 0.601561525510624, | |
| "epoch": 0.44179272557958227, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 0.00012357093552214042, | |
| "loss": 0.6049664974212646, | |
| "mean_token_accuracy": 0.8392731335014105, | |
| "num_tokens": 13622412.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 0.5839989837259054, | |
| "epoch": 0.4435252460720512, | |
| "grad_norm": 0.193359375, | |
| "learning_rate": 0.00012302518066629466, | |
| "loss": 0.5930441379547119, | |
| "mean_token_accuracy": 0.8389767237007618, | |
| "num_tokens": 13676864.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 0.5947200076654553, | |
| "epoch": 0.44525776656452015, | |
| "grad_norm": 0.1943359375, | |
| "learning_rate": 0.0001224787006470701, | |
| "loss": 0.632440710067749, | |
| "mean_token_accuracy": 0.8404598146677017, | |
| "num_tokens": 13739726.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 0.5818848529364914, | |
| "epoch": 0.4469902870569891, | |
| "grad_norm": 0.16796875, | |
| "learning_rate": 0.0001219315126755063, | |
| "loss": 0.5822898387908936, | |
| "mean_token_accuracy": 0.8407908231019974, | |
| "num_tokens": 13793872.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 0.5871871233917773, | |
| "epoch": 0.44872280754945804, | |
| "grad_norm": 0.2275390625, | |
| "learning_rate": 0.00012138363398493946, | |
| "loss": 0.5781790733337402, | |
| "mean_token_accuracy": 0.8415582459419966, | |
| "num_tokens": 13845952.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 0.5868519256589935, | |
| "epoch": 0.450455328041927, | |
| "grad_norm": 0.2138671875, | |
| "learning_rate": 0.00012083508183045946, | |
| "loss": 0.5890952587127686, | |
| "mean_token_accuracy": 0.8406406987458468, | |
| "num_tokens": 13900081.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 0.5717327733058483, | |
| "epoch": 0.4521878485343959, | |
| "grad_norm": 0.1982421875, | |
| "learning_rate": 0.00012028587348836654, | |
| "loss": 0.5796187400817872, | |
| "mean_token_accuracy": 0.8397781111299991, | |
| "num_tokens": 13952949.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 0.582226577727124, | |
| "epoch": 0.4539203690268649, | |
| "grad_norm": 0.1953125, | |
| "learning_rate": 0.00011973602625562711, | |
| "loss": 0.6070287704467774, | |
| "mean_token_accuracy": 0.8392535090446472, | |
| "num_tokens": 14004724.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 0.5673700920306146, | |
| "epoch": 0.45565288951933386, | |
| "grad_norm": 0.2412109375, | |
| "learning_rate": 0.00011918555744932904, | |
| "loss": 0.5730877876281738, | |
| "mean_token_accuracy": 0.8469384342432023, | |
| "num_tokens": 14062688.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 0.5877885912545026, | |
| "epoch": 0.4573854100118028, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 0.00011863448440613634, | |
| "loss": 0.5773820877075195, | |
| "mean_token_accuracy": 0.839915756508708, | |
| "num_tokens": 14113953.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 0.5963851167354732, | |
| "epoch": 0.45911793050427174, | |
| "grad_norm": 0.2060546875, | |
| "learning_rate": 0.00011808282448174295, | |
| "loss": 0.5954080104827881, | |
| "mean_token_accuracy": 0.8391872305423022, | |
| "num_tokens": 14165410.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 0.5849010232836008, | |
| "epoch": 0.4608504509967407, | |
| "grad_norm": 0.2177734375, | |
| "learning_rate": 0.00011753059505032635, | |
| "loss": 0.6184982776641845, | |
| "mean_token_accuracy": 0.8388860560953617, | |
| "num_tokens": 14219014.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 0.6050059227272868, | |
| "epoch": 0.4625829714892096, | |
| "grad_norm": 0.19921875, | |
| "learning_rate": 0.00011697781350400025, | |
| "loss": 0.5937928199768067, | |
| "mean_token_accuracy": 0.8371570736169816, | |
| "num_tokens": 14277983.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 0.55124610546045, | |
| "epoch": 0.4643154919816786, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 0.00011642449725226685, | |
| "loss": 0.5754414081573487, | |
| "mean_token_accuracy": 0.8441458832472563, | |
| "num_tokens": 14334686.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 0.6277578006032855, | |
| "epoch": 0.46604801247414757, | |
| "grad_norm": 0.2578125, | |
| "learning_rate": 0.00011587066372146861, | |
| "loss": 0.6408638000488281, | |
| "mean_token_accuracy": 0.8318171612918377, | |
| "num_tokens": 14386998.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 0.5673693493008614, | |
| "epoch": 0.4677805329666165, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.0001153163303542393, | |
| "loss": 0.5812714576721192, | |
| "mean_token_accuracy": 0.8425166368484497, | |
| "num_tokens": 14445548.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 0.613515446241945, | |
| "epoch": 0.46951305345908545, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.00011476151460895477, | |
| "loss": 0.6238789081573486, | |
| "mean_token_accuracy": 0.8347268708050251, | |
| "num_tokens": 14494120.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 0.6357726425863802, | |
| "epoch": 0.4712455739515544, | |
| "grad_norm": 0.1748046875, | |
| "learning_rate": 0.00011420623395918297, | |
| "loss": 0.6014580249786377, | |
| "mean_token_accuracy": 0.8301781140267849, | |
| "num_tokens": 14548742.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 0.5693127868697048, | |
| "epoch": 0.47297809444402333, | |
| "grad_norm": 0.208984375, | |
| "learning_rate": 0.00011365050589313391, | |
| "loss": 0.5637072563171387, | |
| "mean_token_accuracy": 0.8451267022639513, | |
| "num_tokens": 14600515.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 0.5784962127916515, | |
| "epoch": 0.4747106149364923, | |
| "grad_norm": 0.1533203125, | |
| "learning_rate": 0.00011309434791310846, | |
| "loss": 0.5662568092346192, | |
| "mean_token_accuracy": 0.8453169971704483, | |
| "num_tokens": 14652098.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 0.5996901510283351, | |
| "epoch": 0.4764431354289613, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 0.00011253777753494752, | |
| "loss": 0.5977088928222656, | |
| "mean_token_accuracy": 0.837460282444954, | |
| "num_tokens": 14705588.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 0.5490922763012349, | |
| "epoch": 0.4781756559214302, | |
| "grad_norm": 0.19921875, | |
| "learning_rate": 0.00011198081228748013, | |
| "loss": 0.5457263946533203, | |
| "mean_token_accuracy": 0.8470884084701538, | |
| "num_tokens": 14753632.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 0.572597084986046, | |
| "epoch": 0.47990817641389916, | |
| "grad_norm": 0.2421875, | |
| "learning_rate": 0.0001114234697119715, | |
| "loss": 0.549776268005371, | |
| "mean_token_accuracy": 0.8426673550158739, | |
| "num_tokens": 14804928.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 0.5902726739645004, | |
| "epoch": 0.48164069690636807, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.0001108657673615706, | |
| "loss": 0.6166749000549316, | |
| "mean_token_accuracy": 0.8378476161509752, | |
| "num_tokens": 14854574.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 0.5925680194981396, | |
| "epoch": 0.48337321739883704, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 0.00011030772280075714, | |
| "loss": 0.5907174587249756, | |
| "mean_token_accuracy": 0.8409414291381836, | |
| "num_tokens": 14906122.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 0.6074271734803915, | |
| "epoch": 0.485105737891306, | |
| "grad_norm": 0.2353515625, | |
| "learning_rate": 0.00010974935360478876, | |
| "loss": 0.6153085708618165, | |
| "mean_token_accuracy": 0.8358694747090339, | |
| "num_tokens": 14959790.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 0.5647475293837487, | |
| "epoch": 0.4868382583837749, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.00010919067735914699, | |
| "loss": 0.5801798820495605, | |
| "mean_token_accuracy": 0.8441315289586783, | |
| "num_tokens": 15015091.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 0.5615489536430687, | |
| "epoch": 0.4885707788762439, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 0.00010863171165898398, | |
| "loss": 0.5529567241668701, | |
| "mean_token_accuracy": 0.8446899481117726, | |
| "num_tokens": 15063799.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 0.587787312315777, | |
| "epoch": 0.49030329936871286, | |
| "grad_norm": 0.2001953125, | |
| "learning_rate": 0.00010807247410856783, | |
| "loss": 0.5839251518249512, | |
| "mean_token_accuracy": 0.8386691033840179, | |
| "num_tokens": 15118840.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 0.6014495314564556, | |
| "epoch": 0.4920358198611818, | |
| "grad_norm": 0.212890625, | |
| "learning_rate": 0.00010751298232072855, | |
| "loss": 0.6540067195892334, | |
| "mean_token_accuracy": 0.8377440456300974, | |
| "num_tokens": 15169526.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 0.6273791050072759, | |
| "epoch": 0.49376834035365075, | |
| "grad_norm": 0.2060546875, | |
| "learning_rate": 0.00010695325391630308, | |
| "loss": 0.6305361747741699, | |
| "mean_token_accuracy": 0.8297456104308367, | |
| "num_tokens": 15224473.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 0.59466298725456, | |
| "epoch": 0.4955008608461197, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 0.00010639330652358058, | |
| "loss": 0.5955989360809326, | |
| "mean_token_accuracy": 0.837109775096178, | |
| "num_tokens": 15281656.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 0.590182079654187, | |
| "epoch": 0.49723338133858863, | |
| "grad_norm": 0.2373046875, | |
| "learning_rate": 0.00010583315777774696, | |
| "loss": 0.6159713745117188, | |
| "mean_token_accuracy": 0.8404981274157762, | |
| "num_tokens": 15333150.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 0.57672467129305, | |
| "epoch": 0.4989659018310576, | |
| "grad_norm": 0.185546875, | |
| "learning_rate": 0.00010527282532032969, | |
| "loss": 0.5914871215820312, | |
| "mean_token_accuracy": 0.8392358284443617, | |
| "num_tokens": 15383289.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 0.5869773568119854, | |
| "epoch": 0.5006984223235266, | |
| "grad_norm": 0.2158203125, | |
| "learning_rate": 0.00010471232679864221, | |
| "loss": 0.6114672660827637, | |
| "mean_token_accuracy": 0.8400188889354467, | |
| "num_tokens": 15438613.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 0.6136800131760538, | |
| "epoch": 0.5024309428159955, | |
| "grad_norm": 0.2099609375, | |
| "learning_rate": 0.00010415167986522785, | |
| "loss": 0.6379248142242432, | |
| "mean_token_accuracy": 0.834352083876729, | |
| "num_tokens": 15490587.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 0.6086361592635512, | |
| "epoch": 0.5041634633084644, | |
| "grad_norm": 0.244140625, | |
| "learning_rate": 0.0001035909021773042, | |
| "loss": 0.6333293437957763, | |
| "mean_token_accuracy": 0.8300730381160975, | |
| "num_tokens": 15548870.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 0.6032880510669202, | |
| "epoch": 0.5058959838009334, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 0.00010303001139620689, | |
| "loss": 0.6444151878356934, | |
| "mean_token_accuracy": 0.8312817770987749, | |
| "num_tokens": 15598591.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 0.5855811305809766, | |
| "epoch": 0.5076285042934023, | |
| "grad_norm": 0.263671875, | |
| "learning_rate": 0.0001024690251868333, | |
| "loss": 0.6152175426483154, | |
| "mean_token_accuracy": 0.8414902746677398, | |
| "num_tokens": 15649064.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 0.6164896341506392, | |
| "epoch": 0.5093610247858713, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 0.00010190796121708628, | |
| "loss": 0.6313320159912109, | |
| "mean_token_accuracy": 0.8366707745939493, | |
| "num_tokens": 15704366.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 0.5785494175273925, | |
| "epoch": 0.5110935452783403, | |
| "grad_norm": 0.23046875, | |
| "learning_rate": 0.0001013468371573177, | |
| "loss": 0.5688902378082276, | |
| "mean_token_accuracy": 0.8470625583082437, | |
| "num_tokens": 15756519.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 0.5922784093767405, | |
| "epoch": 0.5128260657708092, | |
| "grad_norm": 0.1708984375, | |
| "learning_rate": 0.00010078567067977191, | |
| "loss": 0.6074170589447021, | |
| "mean_token_accuracy": 0.838723149895668, | |
| "num_tokens": 15811567.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 0.5760424341075122, | |
| "epoch": 0.5145585862632781, | |
| "grad_norm": 0.1982421875, | |
| "learning_rate": 0.00010022447945802917, | |
| "loss": 0.5844903945922851, | |
| "mean_token_accuracy": 0.8425237882882357, | |
| "num_tokens": 15864474.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 0.6029307945631445, | |
| "epoch": 0.5162911067557471, | |
| "grad_norm": 0.2109375, | |
| "learning_rate": 9.96632811664491e-05, | |
| "loss": 0.6089130401611328, | |
| "mean_token_accuracy": 0.8375063575804234, | |
| "num_tokens": 15915223.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 0.5315724958200008, | |
| "epoch": 0.518023627248216, | |
| "grad_norm": 0.2109375, | |
| "learning_rate": 9.910209347961389e-05, | |
| "loss": 0.5239943027496338, | |
| "mean_token_accuracy": 0.8512597348541021, | |
| "num_tokens": 15973757.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 0.574950763490051, | |
| "epoch": 0.519756147740685, | |
| "grad_norm": 0.2060546875, | |
| "learning_rate": 9.854093407177184e-05, | |
| "loss": 0.5746850490570068, | |
| "mean_token_accuracy": 0.8381776563823223, | |
| "num_tokens": 16025972.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 0.5852484166156501, | |
| "epoch": 0.521488668233154, | |
| "grad_norm": 0.16796875, | |
| "learning_rate": 9.797982061628055e-05, | |
| "loss": 0.5965889453887939, | |
| "mean_token_accuracy": 0.8383524172008038, | |
| "num_tokens": 16076695.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 0.5634748952230438, | |
| "epoch": 0.5232211887256228, | |
| "grad_norm": 0.2265625, | |
| "learning_rate": 9.741877078505045e-05, | |
| "loss": 0.5513391494750977, | |
| "mean_token_accuracy": 0.8460137024521828, | |
| "num_tokens": 16135215.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 0.5869616455864162, | |
| "epoch": 0.5249537092180918, | |
| "grad_norm": 0.2138671875, | |
| "learning_rate": 9.685780224798805e-05, | |
| "loss": 0.5826962471008301, | |
| "mean_token_accuracy": 0.8386240437626838, | |
| "num_tokens": 16188506.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 0.5738142973743379, | |
| "epoch": 0.5266862297105608, | |
| "grad_norm": 0.2197265625, | |
| "learning_rate": 9.629693267243962e-05, | |
| "loss": 0.5730494499206543, | |
| "mean_token_accuracy": 0.840570829808712, | |
| "num_tokens": 16243964.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 0.5921493870206177, | |
| "epoch": 0.5284187502030298, | |
| "grad_norm": 0.23828125, | |
| "learning_rate": 9.573617972263478e-05, | |
| "loss": 0.6039523124694824, | |
| "mean_token_accuracy": 0.8394287832081317, | |
| "num_tokens": 16299274.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 0.6072209506295622, | |
| "epoch": 0.5301512706954987, | |
| "grad_norm": 0.185546875, | |
| "learning_rate": 9.517556105912995e-05, | |
| "loss": 0.6261641979217529, | |
| "mean_token_accuracy": 0.8376805637031793, | |
| "num_tokens": 16355409.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 0.6185756172519177, | |
| "epoch": 0.5318837911879677, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 9.461509433825238e-05, | |
| "loss": 0.6353075504302979, | |
| "mean_token_accuracy": 0.8332322388887405, | |
| "num_tokens": 16410386.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 0.6121521357446909, | |
| "epoch": 0.5336163116804366, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 9.405479721154391e-05, | |
| "loss": 0.6405570983886719, | |
| "mean_token_accuracy": 0.8331318866461516, | |
| "num_tokens": 16464158.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 0.6069775213487446, | |
| "epoch": 0.5353488321729055, | |
| "grad_norm": 0.19140625, | |
| "learning_rate": 9.349468732520529e-05, | |
| "loss": 0.5938554763793945, | |
| "mean_token_accuracy": 0.8324613347649574, | |
| "num_tokens": 16521666.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 0.5699784771772102, | |
| "epoch": 0.5370813526653745, | |
| "grad_norm": 0.228515625, | |
| "learning_rate": 9.293478231953997e-05, | |
| "loss": 0.5687154293060303, | |
| "mean_token_accuracy": 0.8443257499486208, | |
| "num_tokens": 16576188.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 0.5675219805445522, | |
| "epoch": 0.5388138731578435, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 9.23750998283991e-05, | |
| "loss": 0.5806581020355225, | |
| "mean_token_accuracy": 0.843117181584239, | |
| "num_tokens": 16626551.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 0.5873679893091321, | |
| "epoch": 0.5405463936503124, | |
| "grad_norm": 0.18359375, | |
| "learning_rate": 9.181565747862574e-05, | |
| "loss": 0.6099284172058106, | |
| "mean_token_accuracy": 0.8380186520516872, | |
| "num_tokens": 16679481.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 0.5710663202451542, | |
| "epoch": 0.5422789141427814, | |
| "grad_norm": 0.15625, | |
| "learning_rate": 9.125647288949981e-05, | |
| "loss": 0.5839220523834229, | |
| "mean_token_accuracy": 0.8431031309068203, | |
| "num_tokens": 16732976.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 0.596511066146195, | |
| "epoch": 0.5440114346352503, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 9.069756367218331e-05, | |
| "loss": 0.6071121692657471, | |
| "mean_token_accuracy": 0.8361073154956102, | |
| "num_tokens": 16789389.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 0.6210895074298606, | |
| "epoch": 0.5457439551277192, | |
| "grad_norm": 0.2021484375, | |
| "learning_rate": 9.013894742916553e-05, | |
| "loss": 0.6283562660217286, | |
| "mean_token_accuracy": 0.8354116972535849, | |
| "num_tokens": 16846677.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 0.596269681211561, | |
| "epoch": 0.5474764756201882, | |
| "grad_norm": 0.2451171875, | |
| "learning_rate": 8.958064175370883e-05, | |
| "loss": 0.5808255195617675, | |
| "mean_token_accuracy": 0.838775647431612, | |
| "num_tokens": 16896654.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 0.5483348882757128, | |
| "epoch": 0.5492089961126572, | |
| "grad_norm": 0.1787109375, | |
| "learning_rate": 8.90226642292942e-05, | |
| "loss": 0.5343601703643799, | |
| "mean_token_accuracy": 0.8485178887844086, | |
| "num_tokens": 16944739.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 0.5849819808034227, | |
| "epoch": 0.5509415166051261, | |
| "grad_norm": 0.2451171875, | |
| "learning_rate": 8.846503242906798e-05, | |
| "loss": 0.624034833908081, | |
| "mean_token_accuracy": 0.8375435929745436, | |
| "num_tokens": 17001792.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 0.5735263123176992, | |
| "epoch": 0.552674037097595, | |
| "grad_norm": 0.240234375, | |
| "learning_rate": 8.790776391528803e-05, | |
| "loss": 0.5884189128875732, | |
| "mean_token_accuracy": 0.8433846581727267, | |
| "num_tokens": 17057122.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 0.5874220591969788, | |
| "epoch": 0.554406557590064, | |
| "grad_norm": 0.189453125, | |
| "learning_rate": 8.73508762387707e-05, | |
| "loss": 0.5811627864837646, | |
| "mean_token_accuracy": 0.840981874614954, | |
| "num_tokens": 17109057.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 0.5672381565906107, | |
| "epoch": 0.5561390780825329, | |
| "grad_norm": 0.26953125, | |
| "learning_rate": 8.679438693833822e-05, | |
| "loss": 0.5794447898864746, | |
| "mean_token_accuracy": 0.8454991206526756, | |
| "num_tokens": 17164048.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 0.571211804356426, | |
| "epoch": 0.5578715985750019, | |
| "grad_norm": 0.28125, | |
| "learning_rate": 8.623831354026608e-05, | |
| "loss": 0.5618424892425538, | |
| "mean_token_accuracy": 0.8462431959807872, | |
| "num_tokens": 17221820.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 0.60764075294137, | |
| "epoch": 0.5596041190674709, | |
| "grad_norm": 0.19921875, | |
| "learning_rate": 8.568267355773137e-05, | |
| "loss": 0.6284051895141601, | |
| "mean_token_accuracy": 0.8340359356254339, | |
| "num_tokens": 17274399.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 0.5799334913026541, | |
| "epoch": 0.5613366395599398, | |
| "grad_norm": 0.2431640625, | |
| "learning_rate": 8.512748449026087e-05, | |
| "loss": 0.5892360210418701, | |
| "mean_token_accuracy": 0.842689898610115, | |
| "num_tokens": 17327372.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 0.5794768249150366, | |
| "epoch": 0.5630691600524087, | |
| "grad_norm": 0.189453125, | |
| "learning_rate": 8.457276382318015e-05, | |
| "loss": 0.5738996505737305, | |
| "mean_token_accuracy": 0.8423306241631507, | |
| "num_tokens": 17383576.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 0.6024962943978608, | |
| "epoch": 0.5648016805448777, | |
| "grad_norm": 0.25, | |
| "learning_rate": 8.401852902706285e-05, | |
| "loss": 0.5932654857635498, | |
| "mean_token_accuracy": 0.836880574375391, | |
| "num_tokens": 17436218.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 0.5578272269805893, | |
| "epoch": 0.5665342010373466, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 8.346479755718028e-05, | |
| "loss": 0.5810702323913575, | |
| "mean_token_accuracy": 0.8456843707710504, | |
| "num_tokens": 17493828.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 0.5836522807134316, | |
| "epoch": 0.5682667215298156, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 8.29115868529519e-05, | |
| "loss": 0.5958133220672608, | |
| "mean_token_accuracy": 0.8417525358498097, | |
| "num_tokens": 17546507.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 0.582007565535605, | |
| "epoch": 0.5699992420222846, | |
| "grad_norm": 0.19921875, | |
| "learning_rate": 8.235891433739607e-05, | |
| "loss": 0.5615264892578125, | |
| "mean_token_accuracy": 0.8410556487739086, | |
| "num_tokens": 17599245.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 0.5506704148836434, | |
| "epoch": 0.5717317625147535, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 8.18067974165811e-05, | |
| "loss": 0.5327036380767822, | |
| "mean_token_accuracy": 0.8516118418425321, | |
| "num_tokens": 17644967.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 0.5811622153501957, | |
| "epoch": 0.5734642830072224, | |
| "grad_norm": 0.29296875, | |
| "learning_rate": 8.125525347907725e-05, | |
| "loss": 0.6177726268768311, | |
| "mean_token_accuracy": 0.8396083325147629, | |
| "num_tokens": 17700648.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 0.5715690411627292, | |
| "epoch": 0.5751968034996914, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 8.070429989540903e-05, | |
| "loss": 0.6089767456054688, | |
| "mean_token_accuracy": 0.8419048462063075, | |
| "num_tokens": 17759453.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 0.6150133638642729, | |
| "epoch": 0.5769293239921603, | |
| "grad_norm": 0.2392578125, | |
| "learning_rate": 8.015395401750816e-05, | |
| "loss": 0.6307916641235352, | |
| "mean_token_accuracy": 0.8332836613059044, | |
| "num_tokens": 17815319.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 0.6224826156627387, | |
| "epoch": 0.5786618444846293, | |
| "grad_norm": 0.24609375, | |
| "learning_rate": 7.960423317816707e-05, | |
| "loss": 0.6409733772277832, | |
| "mean_token_accuracy": 0.8375802997499704, | |
| "num_tokens": 17864939.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 0.588920985115692, | |
| "epoch": 0.5803943649770983, | |
| "grad_norm": 0.2265625, | |
| "learning_rate": 7.905515469049287e-05, | |
| "loss": 0.5952839374542236, | |
| "mean_token_accuracy": 0.8417891424149275, | |
| "num_tokens": 17918216.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 0.5630837785080075, | |
| "epoch": 0.5821268854695671, | |
| "grad_norm": 0.185546875, | |
| "learning_rate": 7.850673584736238e-05, | |
| "loss": 0.5541327953338623, | |
| "mean_token_accuracy": 0.8466249253600836, | |
| "num_tokens": 17975742.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 0.575827946467325, | |
| "epoch": 0.5838594059620361, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 7.795899392087727e-05, | |
| "loss": 0.6097724914550782, | |
| "mean_token_accuracy": 0.8444040916860104, | |
| "num_tokens": 18029585.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 0.5849282233975828, | |
| "epoch": 0.5855919264545051, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 7.74119461618201e-05, | |
| "loss": 0.5895652294158935, | |
| "mean_token_accuracy": 0.8412786796689034, | |
| "num_tokens": 18077047.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 0.589809303288348, | |
| "epoch": 0.587324446946974, | |
| "grad_norm": 0.2109375, | |
| "learning_rate": 7.686560979911115e-05, | |
| "loss": 0.6017866134643555, | |
| "mean_token_accuracy": 0.841454528272152, | |
| "num_tokens": 18131882.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 0.5898898280225694, | |
| "epoch": 0.589056967439443, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 7.632000203926565e-05, | |
| "loss": 0.5839109420776367, | |
| "mean_token_accuracy": 0.8408774256706237, | |
| "num_tokens": 18187052.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 0.59212601990439, | |
| "epoch": 0.590789487931912, | |
| "grad_norm": 0.1611328125, | |
| "learning_rate": 7.577514006585209e-05, | |
| "loss": 0.6250973224639893, | |
| "mean_token_accuracy": 0.8377660803496838, | |
| "num_tokens": 18239107.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 0.5656685329508037, | |
| "epoch": 0.5925220084243809, | |
| "grad_norm": 0.2001953125, | |
| "learning_rate": 7.523104103895065e-05, | |
| "loss": 0.5862621307373047, | |
| "mean_token_accuracy": 0.8441399410367012, | |
| "num_tokens": 18290779.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 0.5759195055346936, | |
| "epoch": 0.5942545289168498, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 7.468772209461323e-05, | |
| "loss": 0.5872469425201416, | |
| "mean_token_accuracy": 0.8414444755762815, | |
| "num_tokens": 18341930.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 0.5839247035328299, | |
| "epoch": 0.5959870494093188, | |
| "grad_norm": 0.283203125, | |
| "learning_rate": 7.414520034432344e-05, | |
| "loss": 0.5958654880523682, | |
| "mean_token_accuracy": 0.8407564666122198, | |
| "num_tokens": 18394611.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 0.5786849300027825, | |
| "epoch": 0.5977195699017878, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 7.360349287445774e-05, | |
| "loss": 0.5799434661865235, | |
| "mean_token_accuracy": 0.8445678118616342, | |
| "num_tokens": 18450041.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 0.5935896479059011, | |
| "epoch": 0.5994520903942567, | |
| "grad_norm": 0.21484375, | |
| "learning_rate": 7.306261674574733e-05, | |
| "loss": 0.5947081565856933, | |
| "mean_token_accuracy": 0.8432171389460563, | |
| "num_tokens": 18507564.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 0.5749802350997925, | |
| "epoch": 0.6011846108867256, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 7.252258899274095e-05, | |
| "loss": 0.5716835498809815, | |
| "mean_token_accuracy": 0.8433140508830548, | |
| "num_tokens": 18559199.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 0.54188243271783, | |
| "epoch": 0.6029171313791946, | |
| "grad_norm": 0.150390625, | |
| "learning_rate": 7.198342662326827e-05, | |
| "loss": 0.5425021171569824, | |
| "mean_token_accuracy": 0.8488159842789174, | |
| "num_tokens": 18609440.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 0.5910465456545353, | |
| "epoch": 0.6046496518716635, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 7.144514661790413e-05, | |
| "loss": 0.6077436447143555, | |
| "mean_token_accuracy": 0.8387968797236681, | |
| "num_tokens": 18668681.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 0.601060884213075, | |
| "epoch": 0.6063821723641325, | |
| "grad_norm": 0.1904296875, | |
| "learning_rate": 7.090776592943402e-05, | |
| "loss": 0.604709243774414, | |
| "mean_token_accuracy": 0.8362816657871008, | |
| "num_tokens": 18723477.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 0.5889260085299611, | |
| "epoch": 0.6081146928566015, | |
| "grad_norm": 0.248046875, | |
| "learning_rate": 7.037130148231998e-05, | |
| "loss": 0.6148191452026367, | |
| "mean_token_accuracy": 0.8380883693695068, | |
| "num_tokens": 18781011.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 0.5905653207097202, | |
| "epoch": 0.6098472133490704, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 6.983577017216754e-05, | |
| "loss": 0.5685397624969483, | |
| "mean_token_accuracy": 0.8412429638206959, | |
| "num_tokens": 18836362.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 0.561858502868563, | |
| "epoch": 0.6115797338415393, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 6.930118886519374e-05, | |
| "loss": 0.5529529094696045, | |
| "mean_token_accuracy": 0.8480452511459589, | |
| "num_tokens": 18889944.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 0.5512642343412153, | |
| "epoch": 0.6133122543340083, | |
| "grad_norm": 0.212890625, | |
| "learning_rate": 6.876757439769593e-05, | |
| "loss": 0.5571891784667968, | |
| "mean_token_accuracy": 0.850096445158124, | |
| "num_tokens": 18944063.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 0.5728070291690528, | |
| "epoch": 0.6150447748264772, | |
| "grad_norm": 0.208984375, | |
| "learning_rate": 6.823494357552136e-05, | |
| "loss": 0.5640948295593262, | |
| "mean_token_accuracy": 0.8431723900139332, | |
| "num_tokens": 18991394.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 0.5761209703050554, | |
| "epoch": 0.6167772953189462, | |
| "grad_norm": 0.17578125, | |
| "learning_rate": 6.770331317353805e-05, | |
| "loss": 0.5933984279632568, | |
| "mean_token_accuracy": 0.8404323156923056, | |
| "num_tokens": 19051491.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 0.5795182818546891, | |
| "epoch": 0.6185098158114152, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 6.717269993510642e-05, | |
| "loss": 0.5945269107818604, | |
| "mean_token_accuracy": 0.8381262317299842, | |
| "num_tokens": 19103454.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 0.586546707386151, | |
| "epoch": 0.6202423363038841, | |
| "grad_norm": 0.1865234375, | |
| "learning_rate": 6.664312057155199e-05, | |
| "loss": 0.6067633628845215, | |
| "mean_token_accuracy": 0.8356157563626766, | |
| "num_tokens": 19155618.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 0.5642004692927003, | |
| "epoch": 0.621974856796353, | |
| "grad_norm": 0.20703125, | |
| "learning_rate": 6.611459176163898e-05, | |
| "loss": 0.570903205871582, | |
| "mean_token_accuracy": 0.8450221214443445, | |
| "num_tokens": 19207279.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 0.5884431241080165, | |
| "epoch": 0.623707377288822, | |
| "grad_norm": 0.185546875, | |
| "learning_rate": 6.558713015104518e-05, | |
| "loss": 0.5947638988494873, | |
| "mean_token_accuracy": 0.839688852056861, | |
| "num_tokens": 19260880.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 0.5753527913009748, | |
| "epoch": 0.6254398977812909, | |
| "grad_norm": 0.208984375, | |
| "learning_rate": 6.50607523518376e-05, | |
| "loss": 0.5739696979522705, | |
| "mean_token_accuracy": 0.843867740407586, | |
| "num_tokens": 19314460.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 0.6017448433674872, | |
| "epoch": 0.6271724182737599, | |
| "grad_norm": 0.21484375, | |
| "learning_rate": 6.453547494194929e-05, | |
| "loss": 0.6191208839416504, | |
| "mean_token_accuracy": 0.8382684826850891, | |
| "num_tokens": 19368549.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 0.5728473928757012, | |
| "epoch": 0.6289049387662289, | |
| "grad_norm": 0.212890625, | |
| "learning_rate": 6.401131446465718e-05, | |
| "loss": 0.5917435646057129, | |
| "mean_token_accuracy": 0.8433002319186926, | |
| "num_tokens": 19424310.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 0.6017072153743357, | |
| "epoch": 0.6306374592586977, | |
| "grad_norm": 0.1923828125, | |
| "learning_rate": 6.348828742806121e-05, | |
| "loss": 0.6305885791778565, | |
| "mean_token_accuracy": 0.8348235942423343, | |
| "num_tokens": 19475276.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 0.5752246322226711, | |
| "epoch": 0.6323699797511667, | |
| "grad_norm": 0.25390625, | |
| "learning_rate": 6.296641030456431e-05, | |
| "loss": 0.5686737060546875, | |
| "mean_token_accuracy": 0.8426034320145845, | |
| "num_tokens": 19527832.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 0.5501401219982653, | |
| "epoch": 0.6341025002436357, | |
| "grad_norm": 0.244140625, | |
| "learning_rate": 6.244569953035355e-05, | |
| "loss": 0.5381704807281494, | |
| "mean_token_accuracy": 0.8496629562228918, | |
| "num_tokens": 19578680.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 0.5852787056937814, | |
| "epoch": 0.6358350207361047, | |
| "grad_norm": 0.2265625, | |
| "learning_rate": 6.19261715048827e-05, | |
| "loss": 0.5736754417419434, | |
| "mean_token_accuracy": 0.8424856297671794, | |
| "num_tokens": 19631489.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 0.5958160690963268, | |
| "epoch": 0.6375675412285736, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 6.140784259035552e-05, | |
| "loss": 0.6208570957183838, | |
| "mean_token_accuracy": 0.8383866585791111, | |
| "num_tokens": 19684521.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 0.5951701735146344, | |
| "epoch": 0.6393000617210426, | |
| "grad_norm": 0.203125, | |
| "learning_rate": 6.089072911121061e-05, | |
| "loss": 0.6026985168457031, | |
| "mean_token_accuracy": 0.8411695055663586, | |
| "num_tokens": 19740764.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 0.575906784972176, | |
| "epoch": 0.6410325822135114, | |
| "grad_norm": 0.3125, | |
| "learning_rate": 6.037484735360711e-05, | |
| "loss": 0.5890356063842773, | |
| "mean_token_accuracy": 0.842427759245038, | |
| "num_tokens": 19793481.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 0.5695828476920723, | |
| "epoch": 0.6427651027059804, | |
| "grad_norm": 0.1943359375, | |
| "learning_rate": 5.9860213564911916e-05, | |
| "loss": 0.5620457649230957, | |
| "mean_token_accuracy": 0.8452866446226835, | |
| "num_tokens": 19844497.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 0.5581729131285101, | |
| "epoch": 0.6444976231984494, | |
| "grad_norm": 0.19140625, | |
| "learning_rate": 5.934684395318806e-05, | |
| "loss": 0.5511328697204589, | |
| "mean_token_accuracy": 0.8449296887964011, | |
| "num_tokens": 19894794.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 0.5855876510962844, | |
| "epoch": 0.6462301436909184, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 5.8834754686683866e-05, | |
| "loss": 0.5966204166412353, | |
| "mean_token_accuracy": 0.8407878663390875, | |
| "num_tokens": 19947818.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 0.5957442070823162, | |
| "epoch": 0.6479626641833873, | |
| "grad_norm": 0.1826171875, | |
| "learning_rate": 5.832396189332423e-05, | |
| "loss": 0.60280442237854, | |
| "mean_token_accuracy": 0.8375787112861872, | |
| "num_tokens": 20003002.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 0.6144319356419146, | |
| "epoch": 0.6496951846758563, | |
| "grad_norm": 0.326171875, | |
| "learning_rate": 5.7814481660202424e-05, | |
| "loss": 0.611343240737915, | |
| "mean_token_accuracy": 0.8361466400325298, | |
| "num_tokens": 20053817.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 0.5885245742741972, | |
| "epoch": 0.6514277051683252, | |
| "grad_norm": 0.30859375, | |
| "learning_rate": 5.7306330033073376e-05, | |
| "loss": 0.5991326808929444, | |
| "mean_token_accuracy": 0.8377312365919352, | |
| "num_tokens": 20106764.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 0.5618473440874368, | |
| "epoch": 0.6531602256607941, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 5.679952301584844e-05, | |
| "loss": 0.5703360080718994, | |
| "mean_token_accuracy": 0.8465285055339337, | |
| "num_tokens": 20159017.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 0.6042450641281902, | |
| "epoch": 0.6548927461532631, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 5.629407657009143e-05, | |
| "loss": 0.5915566444396972, | |
| "mean_token_accuracy": 0.8349285993725062, | |
| "num_tokens": 20215650.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 0.571340271178633, | |
| "epoch": 0.6566252666457321, | |
| "grad_norm": 0.1689453125, | |
| "learning_rate": 5.579000661451573e-05, | |
| "loss": 0.5710691928863525, | |
| "mean_token_accuracy": 0.8451083436608314, | |
| "num_tokens": 20276446.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 0.5754610357806087, | |
| "epoch": 0.658357787138201, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 5.528732902448305e-05, | |
| "loss": 0.5327680110931396, | |
| "mean_token_accuracy": 0.844481249153614, | |
| "num_tokens": 20328728.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 0.6063968134578317, | |
| "epoch": 0.6600903076306699, | |
| "grad_norm": 0.1748046875, | |
| "learning_rate": 5.478605963150347e-05, | |
| "loss": 0.6289023876190185, | |
| "mean_token_accuracy": 0.8358895625919104, | |
| "num_tokens": 20382682.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 0.5941935436567292, | |
| "epoch": 0.6618228281231389, | |
| "grad_norm": 0.1611328125, | |
| "learning_rate": 5.4286214222736875e-05, | |
| "loss": 0.5898853778839112, | |
| "mean_token_accuracy": 0.8419016167521477, | |
| "num_tokens": 20435410.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 0.579904412291944, | |
| "epoch": 0.6635553486156078, | |
| "grad_norm": 0.1787109375, | |
| "learning_rate": 5.3787808540495534e-05, | |
| "loss": 0.5740793704986572, | |
| "mean_token_accuracy": 0.8450499411672354, | |
| "num_tokens": 20488002.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 0.5939912447705865, | |
| "epoch": 0.6652878691080768, | |
| "grad_norm": 0.1923828125, | |
| "learning_rate": 5.329085828174847e-05, | |
| "loss": 0.5808038234710693, | |
| "mean_token_accuracy": 0.8370831325650215, | |
| "num_tokens": 20537293.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 0.5658927114214748, | |
| "epoch": 0.6670203896005458, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 5.27953790976272e-05, | |
| "loss": 0.5806662559509277, | |
| "mean_token_accuracy": 0.8480444595217704, | |
| "num_tokens": 20592677.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 0.5773649536306038, | |
| "epoch": 0.6687529100930147, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 5.230138659293253e-05, | |
| "loss": 0.618853759765625, | |
| "mean_token_accuracy": 0.8424112224951387, | |
| "num_tokens": 20645296.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 0.5486746313516051, | |
| "epoch": 0.6704854305854836, | |
| "grad_norm": 0.1708984375, | |
| "learning_rate": 5.180889632564331e-05, | |
| "loss": 0.5274429321289062, | |
| "mean_token_accuracy": 0.8531730443239212, | |
| "num_tokens": 20696642.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 0.572584178717807, | |
| "epoch": 0.6722179510779526, | |
| "grad_norm": 0.208984375, | |
| "learning_rate": 5.131792380642639e-05, | |
| "loss": 0.5815223693847656, | |
| "mean_token_accuracy": 0.8469138272106648, | |
| "num_tokens": 20748366.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 0.5805146366590634, | |
| "epoch": 0.6739504715704215, | |
| "grad_norm": 0.2001953125, | |
| "learning_rate": 5.082848449814815e-05, | |
| "loss": 0.6078445434570312, | |
| "mean_token_accuracy": 0.8376872267574071, | |
| "num_tokens": 20799591.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 0.5745012188563123, | |
| "epoch": 0.6756829920628905, | |
| "grad_norm": 0.2265625, | |
| "learning_rate": 5.0340593815387394e-05, | |
| "loss": 0.578024435043335, | |
| "mean_token_accuracy": 0.8426983803510666, | |
| "num_tokens": 20854587.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 0.5941596085438505, | |
| "epoch": 0.6774155125553595, | |
| "grad_norm": 0.2060546875, | |
| "learning_rate": 4.985426712394994e-05, | |
| "loss": 0.6132090568542481, | |
| "mean_token_accuracy": 0.8365705825388432, | |
| "num_tokens": 20905558.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 0.558493199152872, | |
| "epoch": 0.6791480330478284, | |
| "grad_norm": 0.2177734375, | |
| "learning_rate": 4.9369519740384805e-05, | |
| "loss": 0.5631945610046387, | |
| "mean_token_accuracy": 0.8453404325991869, | |
| "num_tokens": 20961477.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 0.6204601846635341, | |
| "epoch": 0.6808805535402973, | |
| "grad_norm": 0.2255859375, | |
| "learning_rate": 4.8886366931501614e-05, | |
| "loss": 0.6358794689178466, | |
| "mean_token_accuracy": 0.8305168882012367, | |
| "num_tokens": 21009478.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 0.5932569999014958, | |
| "epoch": 0.6826130740327663, | |
| "grad_norm": 0.314453125, | |
| "learning_rate": 4.840482391388987e-05, | |
| "loss": 0.5845652103424073, | |
| "mean_token_accuracy": 0.8384004920721054, | |
| "num_tokens": 21062772.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 0.5521581314504147, | |
| "epoch": 0.6843455945252352, | |
| "grad_norm": 0.21875, | |
| "learning_rate": 4.792490585343983e-05, | |
| "loss": 0.5398716926574707, | |
| "mean_token_accuracy": 0.8492032889276743, | |
| "num_tokens": 21114869.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 0.583714248938486, | |
| "epoch": 0.6860781150177042, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 4.744662786486471e-05, | |
| "loss": 0.5952413558959961, | |
| "mean_token_accuracy": 0.8407733146101236, | |
| "num_tokens": 21172791.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 0.5898357476107776, | |
| "epoch": 0.6878106355101732, | |
| "grad_norm": 0.1923828125, | |
| "learning_rate": 4.697000501122467e-05, | |
| "loss": 0.5954113006591797, | |
| "mean_token_accuracy": 0.8401012167334556, | |
| "num_tokens": 21228419.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 0.548321096599102, | |
| "epoch": 0.689543156002642, | |
| "grad_norm": 0.193359375, | |
| "learning_rate": 4.649505230345244e-05, | |
| "loss": 0.5236709117889404, | |
| "mean_token_accuracy": 0.8472159929573536, | |
| "num_tokens": 21281778.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 0.5716894276440143, | |
| "epoch": 0.691275676495111, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 4.602178469988064e-05, | |
| "loss": 0.570991039276123, | |
| "mean_token_accuracy": 0.8435146156698465, | |
| "num_tokens": 21335385.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 0.5994025730295107, | |
| "epoch": 0.69300819698758, | |
| "grad_norm": 0.1884765625, | |
| "learning_rate": 4.5550217105770674e-05, | |
| "loss": 0.5998933792114258, | |
| "mean_token_accuracy": 0.8382619321346283, | |
| "num_tokens": 21393082.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 0.5763973373454064, | |
| "epoch": 0.694740717480049, | |
| "grad_norm": 0.2060546875, | |
| "learning_rate": 4.5080364372842976e-05, | |
| "loss": 0.5872276306152344, | |
| "mean_token_accuracy": 0.8479617930948734, | |
| "num_tokens": 21445710.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 0.6155249847099185, | |
| "epoch": 0.6964732379725179, | |
| "grad_norm": 0.19921875, | |
| "learning_rate": 4.4612241298809756e-05, | |
| "loss": 0.63254714012146, | |
| "mean_token_accuracy": 0.8309660295024515, | |
| "num_tokens": 21499068.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "entropy": 0.5553503627888858, | |
| "epoch": 0.6982057584649869, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 4.4145862626908684e-05, | |
| "loss": 0.5443556308746338, | |
| "mean_token_accuracy": 0.8461846563965082, | |
| "num_tokens": 21549682.0, | |
| "step": 4030 | |
| }, | |
| { | |
| "entropy": 0.53650197731331, | |
| "epoch": 0.6999382789574558, | |
| "grad_norm": 0.2109375, | |
| "learning_rate": 4.3681243045438515e-05, | |
| "loss": 0.5042569160461425, | |
| "mean_token_accuracy": 0.8553239502012729, | |
| "num_tokens": 21602773.0, | |
| "step": 4040 | |
| }, | |
| { | |
| "entropy": 0.5737016116734595, | |
| "epoch": 0.7016707994499247, | |
| "grad_norm": 0.1943359375, | |
| "learning_rate": 4.32183971872966e-05, | |
| "loss": 0.5885915279388427, | |
| "mean_token_accuracy": 0.8434899553656579, | |
| "num_tokens": 21652306.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 0.5552554502850399, | |
| "epoch": 0.7034033199423937, | |
| "grad_norm": 0.2412109375, | |
| "learning_rate": 4.2757339629518035e-05, | |
| "loss": 0.5580289840698243, | |
| "mean_token_accuracy": 0.8487752258777619, | |
| "num_tokens": 21703372.0, | |
| "step": 4060 | |
| }, | |
| { | |
| "entropy": 0.5768985984381289, | |
| "epoch": 0.7051358404348627, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 4.229808489281657e-05, | |
| "loss": 0.6017580032348633, | |
| "mean_token_accuracy": 0.8439400654286147, | |
| "num_tokens": 21755926.0, | |
| "step": 4070 | |
| }, | |
| { | |
| "entropy": 0.6120095189660788, | |
| "epoch": 0.7068683609273316, | |
| "grad_norm": 0.2216796875, | |
| "learning_rate": 4.184064744112718e-05, | |
| "loss": 0.6320703506469727, | |
| "mean_token_accuracy": 0.8355493500828743, | |
| "num_tokens": 21812681.0, | |
| "step": 4080 | |
| }, | |
| { | |
| "entropy": 0.5636088127736002, | |
| "epoch": 0.7086008814198006, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 4.1385041681150594e-05, | |
| "loss": 0.5749011993408203, | |
| "mean_token_accuracy": 0.8419094953685999, | |
| "num_tokens": 21867716.0, | |
| "step": 4090 | |
| }, | |
| { | |
| "entropy": 0.5694676558021456, | |
| "epoch": 0.7103334019122695, | |
| "grad_norm": 0.2275390625, | |
| "learning_rate": 4.09312819618997e-05, | |
| "loss": 0.5456663608551026, | |
| "mean_token_accuracy": 0.8421003673225641, | |
| "num_tokens": 21918203.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 0.5702879796735942, | |
| "epoch": 0.7120659224047384, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 4.047938257424739e-05, | |
| "loss": 0.5769749641418457, | |
| "mean_token_accuracy": 0.840731156617403, | |
| "num_tokens": 21969601.0, | |
| "step": 4110 | |
| }, | |
| { | |
| "entropy": 0.5680196524597705, | |
| "epoch": 0.7137984428972074, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 4.00293577504766e-05, | |
| "loss": 0.5617639064788819, | |
| "mean_token_accuracy": 0.8453905589878559, | |
| "num_tokens": 22023823.0, | |
| "step": 4120 | |
| }, | |
| { | |
| "entropy": 0.5798379408195615, | |
| "epoch": 0.7155309633896764, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 3.9581221663832166e-05, | |
| "loss": 0.6011070728302002, | |
| "mean_token_accuracy": 0.8384223252534866, | |
| "num_tokens": 22076897.0, | |
| "step": 4130 | |
| }, | |
| { | |
| "entropy": 0.5674789244541898, | |
| "epoch": 0.7172634838821453, | |
| "grad_norm": 0.244140625, | |
| "learning_rate": 3.913498842807433e-05, | |
| "loss": 0.5677319049835206, | |
| "mean_token_accuracy": 0.8429323259741068, | |
| "num_tokens": 22132468.0, | |
| "step": 4140 | |
| }, | |
| { | |
| "entropy": 0.5730633283033967, | |
| "epoch": 0.7189960043746142, | |
| "grad_norm": 0.1953125, | |
| "learning_rate": 3.8690672097034186e-05, | |
| "loss": 0.59276442527771, | |
| "mean_token_accuracy": 0.8416654709726572, | |
| "num_tokens": 22186702.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 0.6094420235138387, | |
| "epoch": 0.7207285248670832, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 3.824828666417114e-05, | |
| "loss": 0.6083714008331299, | |
| "mean_token_accuracy": 0.8370202928781509, | |
| "num_tokens": 22239147.0, | |
| "step": 4160 | |
| }, | |
| { | |
| "entropy": 0.5858336496166885, | |
| "epoch": 0.7224610453595521, | |
| "grad_norm": 0.267578125, | |
| "learning_rate": 3.780784606213229e-05, | |
| "loss": 0.6024020671844482, | |
| "mean_token_accuracy": 0.8398869067430497, | |
| "num_tokens": 22291494.0, | |
| "step": 4170 | |
| }, | |
| { | |
| "entropy": 0.5746008921880275, | |
| "epoch": 0.7241935658520211, | |
| "grad_norm": 0.193359375, | |
| "learning_rate": 3.7369364162313525e-05, | |
| "loss": 0.5637946605682373, | |
| "mean_token_accuracy": 0.8452662628144025, | |
| "num_tokens": 22347209.0, | |
| "step": 4180 | |
| }, | |
| { | |
| "entropy": 0.5705623811576516, | |
| "epoch": 0.7259260863444901, | |
| "grad_norm": 0.240234375, | |
| "learning_rate": 3.693285477442245e-05, | |
| "loss": 0.558026123046875, | |
| "mean_token_accuracy": 0.8441093850880861, | |
| "num_tokens": 22402861.0, | |
| "step": 4190 | |
| }, | |
| { | |
| "entropy": 0.6150487074628472, | |
| "epoch": 0.727658606836959, | |
| "grad_norm": 0.2412109375, | |
| "learning_rate": 3.6498331646043915e-05, | |
| "loss": 0.6077510833740234, | |
| "mean_token_accuracy": 0.8339765869081021, | |
| "num_tokens": 22459561.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 0.5854987013153732, | |
| "epoch": 0.7293911273294279, | |
| "grad_norm": 0.154296875, | |
| "learning_rate": 3.606580846220671e-05, | |
| "loss": 0.5959908485412597, | |
| "mean_token_accuracy": 0.8377656571567058, | |
| "num_tokens": 22513317.0, | |
| "step": 4210 | |
| }, | |
| { | |
| "entropy": 0.5632983278017492, | |
| "epoch": 0.7311236478218969, | |
| "grad_norm": 0.33984375, | |
| "learning_rate": 3.563529884495259e-05, | |
| "loss": 0.5580694675445557, | |
| "mean_token_accuracy": 0.8474770098924637, | |
| "num_tokens": 22567784.0, | |
| "step": 4220 | |
| }, | |
| { | |
| "entropy": 0.5178743036929518, | |
| "epoch": 0.7328561683143658, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 3.5206816352907347e-05, | |
| "loss": 0.5083220958709717, | |
| "mean_token_accuracy": 0.8617038175463676, | |
| "num_tokens": 22620493.0, | |
| "step": 4230 | |
| }, | |
| { | |
| "entropy": 0.5757345825433731, | |
| "epoch": 0.7345886888068348, | |
| "grad_norm": 0.2138671875, | |
| "learning_rate": 3.478037448085377e-05, | |
| "loss": 0.5746479034423828, | |
| "mean_token_accuracy": 0.8421594180166722, | |
| "num_tokens": 22667711.0, | |
| "step": 4240 | |
| }, | |
| { | |
| "entropy": 0.5781311514321714, | |
| "epoch": 0.7363212092993038, | |
| "grad_norm": 0.169921875, | |
| "learning_rate": 3.435598665930672e-05, | |
| "loss": 0.5761359214782715, | |
| "mean_token_accuracy": 0.8447645794600248, | |
| "num_tokens": 22715914.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 0.555015804246068, | |
| "epoch": 0.7380537297917726, | |
| "grad_norm": 0.220703125, | |
| "learning_rate": 3.393366625408979e-05, | |
| "loss": 0.5434780597686768, | |
| "mean_token_accuracy": 0.8475862570106983, | |
| "num_tokens": 22772021.0, | |
| "step": 4260 | |
| }, | |
| { | |
| "entropy": 0.5712562045897357, | |
| "epoch": 0.7397862502842416, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 3.351342656591485e-05, | |
| "loss": 0.5471843719482422, | |
| "mean_token_accuracy": 0.8448881905525922, | |
| "num_tokens": 22828411.0, | |
| "step": 4270 | |
| }, | |
| { | |
| "entropy": 0.5824979926692322, | |
| "epoch": 0.7415187707767106, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 3.309528082996287e-05, | |
| "loss": 0.5932351589202881, | |
| "mean_token_accuracy": 0.8430131062865257, | |
| "num_tokens": 22878451.0, | |
| "step": 4280 | |
| }, | |
| { | |
| "entropy": 0.5524549225345254, | |
| "epoch": 0.7432512912691795, | |
| "grad_norm": 0.27734375, | |
| "learning_rate": 3.267924221546707e-05, | |
| "loss": 0.5674274444580079, | |
| "mean_token_accuracy": 0.8445836905390024, | |
| "num_tokens": 22926711.0, | |
| "step": 4290 | |
| }, | |
| { | |
| "entropy": 0.5855007180478424, | |
| "epoch": 0.7449838117616485, | |
| "grad_norm": 0.248046875, | |
| "learning_rate": 3.226532382529819e-05, | |
| "loss": 0.5742456436157226, | |
| "mean_token_accuracy": 0.8387997157871723, | |
| "num_tokens": 22978219.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 0.5859048544429243, | |
| "epoch": 0.7467163322541175, | |
| "grad_norm": 0.263671875, | |
| "learning_rate": 3.185353869555197e-05, | |
| "loss": 0.6278098106384278, | |
| "mean_token_accuracy": 0.8396085597574711, | |
| "num_tokens": 23032320.0, | |
| "step": 4310 | |
| }, | |
| { | |
| "entropy": 0.5829876080388203, | |
| "epoch": 0.7484488527465863, | |
| "grad_norm": 0.240234375, | |
| "learning_rate": 3.1443899795138453e-05, | |
| "loss": 0.5955277919769287, | |
| "mean_token_accuracy": 0.8417782884091138, | |
| "num_tokens": 23085064.0, | |
| "step": 4320 | |
| }, | |
| { | |
| "entropy": 0.578710913611576, | |
| "epoch": 0.7501813732390553, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 3.103642002537349e-05, | |
| "loss": 0.5915605545043945, | |
| "mean_token_accuracy": 0.8424369305372238, | |
| "num_tokens": 23136211.0, | |
| "step": 4330 | |
| }, | |
| { | |
| "entropy": 0.5652547443984076, | |
| "epoch": 0.7519138937315243, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 3.06311122195725e-05, | |
| "loss": 0.5689744472503662, | |
| "mean_token_accuracy": 0.8439708940684796, | |
| "num_tokens": 23193103.0, | |
| "step": 4340 | |
| }, | |
| { | |
| "entropy": 0.5435447356197983, | |
| "epoch": 0.7536464142239933, | |
| "grad_norm": 0.1630859375, | |
| "learning_rate": 3.0227989142646328e-05, | |
| "loss": 0.5281671524047852, | |
| "mean_token_accuracy": 0.8518698431551457, | |
| "num_tokens": 23247160.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 0.5385241145500913, | |
| "epoch": 0.7553789347164622, | |
| "grad_norm": 0.19140625, | |
| "learning_rate": 2.9827063490699224e-05, | |
| "loss": 0.5298691749572754, | |
| "mean_token_accuracy": 0.8524676557630301, | |
| "num_tokens": 23297655.0, | |
| "step": 4360 | |
| }, | |
| { | |
| "entropy": 0.5880491819232703, | |
| "epoch": 0.7571114552089312, | |
| "grad_norm": 0.2216796875, | |
| "learning_rate": 2.942834789062876e-05, | |
| "loss": 0.6208145141601562, | |
| "mean_token_accuracy": 0.8424996003508568, | |
| "num_tokens": 23348699.0, | |
| "step": 4370 | |
| }, | |
| { | |
| "entropy": 0.5774009396787733, | |
| "epoch": 0.7588439757014, | |
| "grad_norm": 0.1875, | |
| "learning_rate": 2.9031854899728483e-05, | |
| "loss": 0.5922607421875, | |
| "mean_token_accuracy": 0.8419295348227024, | |
| "num_tokens": 23402802.0, | |
| "step": 4380 | |
| }, | |
| { | |
| "entropy": 0.5759732277598232, | |
| "epoch": 0.760576496193869, | |
| "grad_norm": 0.1962890625, | |
| "learning_rate": 2.8637597005292293e-05, | |
| "loss": 0.5788041114807129, | |
| "mean_token_accuracy": 0.8396513409912586, | |
| "num_tokens": 23456158.0, | |
| "step": 4390 | |
| }, | |
| { | |
| "entropy": 0.5810914925299585, | |
| "epoch": 0.762309016686338, | |
| "grad_norm": 0.283203125, | |
| "learning_rate": 2.8245586624221077e-05, | |
| "loss": 0.5863104343414307, | |
| "mean_token_accuracy": 0.8429031614214182, | |
| "num_tokens": 23509433.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 0.5689767023082822, | |
| "epoch": 0.764041537178807, | |
| "grad_norm": 0.275390625, | |
| "learning_rate": 2.7855836102631706e-05, | |
| "loss": 0.5630904197692871, | |
| "mean_token_accuracy": 0.8441053662449122, | |
| "num_tokens": 23562016.0, | |
| "step": 4410 | |
| }, | |
| { | |
| "entropy": 0.614728789892979, | |
| "epoch": 0.7657740576712759, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 2.7468357715468295e-05, | |
| "loss": 0.6392505168914795, | |
| "mean_token_accuracy": 0.8323461454361677, | |
| "num_tokens": 23617492.0, | |
| "step": 4420 | |
| }, | |
| { | |
| "entropy": 0.5409275959711521, | |
| "epoch": 0.7675065781637448, | |
| "grad_norm": 0.1962890625, | |
| "learning_rate": 2.7083163666115564e-05, | |
| "loss": 0.5301029682159424, | |
| "mean_token_accuracy": 0.850815711542964, | |
| "num_tokens": 23670181.0, | |
| "step": 4430 | |
| }, | |
| { | |
| "entropy": 0.5779091130942107, | |
| "epoch": 0.7692390986562138, | |
| "grad_norm": 0.291015625, | |
| "learning_rate": 2.670026608601429e-05, | |
| "loss": 0.5737006187438964, | |
| "mean_token_accuracy": 0.8406471200287342, | |
| "num_tokens": 23715480.0, | |
| "step": 4440 | |
| }, | |
| { | |
| "entropy": 0.5803326781373471, | |
| "epoch": 0.7709716191486827, | |
| "grad_norm": 0.2314453125, | |
| "learning_rate": 2.6319677034279588e-05, | |
| "loss": 0.594749927520752, | |
| "mean_token_accuracy": 0.8403228733688592, | |
| "num_tokens": 23771140.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 0.5970675764605403, | |
| "epoch": 0.7727041396411517, | |
| "grad_norm": 0.1962890625, | |
| "learning_rate": 2.5941408497320918e-05, | |
| "loss": 0.584465217590332, | |
| "mean_token_accuracy": 0.8358738787472249, | |
| "num_tokens": 23821701.0, | |
| "step": 4460 | |
| }, | |
| { | |
| "entropy": 0.5566497812396847, | |
| "epoch": 0.7744366601336207, | |
| "grad_norm": 0.171875, | |
| "learning_rate": 2.556547238846456e-05, | |
| "loss": 0.5480396747589111, | |
| "mean_token_accuracy": 0.8482368070632219, | |
| "num_tokens": 23877867.0, | |
| "step": 4470 | |
| }, | |
| { | |
| "entropy": 0.6114168071071617, | |
| "epoch": 0.7761691806260896, | |
| "grad_norm": 0.1826171875, | |
| "learning_rate": 2.519188054757844e-05, | |
| "loss": 0.6127332210540771, | |
| "mean_token_accuracy": 0.8352025974541902, | |
| "num_tokens": 23929405.0, | |
| "step": 4480 | |
| }, | |
| { | |
| "entropy": 0.5839661170262843, | |
| "epoch": 0.7779017011185585, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 2.482064474069933e-05, | |
| "loss": 0.6061002254486084, | |
| "mean_token_accuracy": 0.8387925371527671, | |
| "num_tokens": 23986820.0, | |
| "step": 4490 | |
| }, | |
| { | |
| "entropy": 0.5634350700303912, | |
| "epoch": 0.7796342216110275, | |
| "grad_norm": 0.24609375, | |
| "learning_rate": 2.4451776659662208e-05, | |
| "loss": 0.5573660850524902, | |
| "mean_token_accuracy": 0.8468219470232725, | |
| "num_tokens": 24042717.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 0.6055240669287741, | |
| "epoch": 0.7813667421034964, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 2.408528792173197e-05, | |
| "loss": 0.6256453514099121, | |
| "mean_token_accuracy": 0.8374260023236275, | |
| "num_tokens": 24091266.0, | |
| "step": 4510 | |
| }, | |
| { | |
| "entropy": 0.5546964854118415, | |
| "epoch": 0.7830992625959654, | |
| "grad_norm": 0.21875, | |
| "learning_rate": 2.3721190069237654e-05, | |
| "loss": 0.5397284984588623, | |
| "mean_token_accuracy": 0.8491404488682747, | |
| "num_tokens": 24151273.0, | |
| "step": 4520 | |
| }, | |
| { | |
| "entropy": 0.5505000121425837, | |
| "epoch": 0.7848317830884344, | |
| "grad_norm": 0.20703125, | |
| "learning_rate": 2.3359494569208928e-05, | |
| "loss": 0.5483803272247314, | |
| "mean_token_accuracy": 0.8495641268789769, | |
| "num_tokens": 24206696.0, | |
| "step": 4530 | |
| }, | |
| { | |
| "entropy": 0.5746214020065963, | |
| "epoch": 0.7865643035809033, | |
| "grad_norm": 0.263671875, | |
| "learning_rate": 2.3000212813014833e-05, | |
| "loss": 0.5868116855621338, | |
| "mean_token_accuracy": 0.8428641192615032, | |
| "num_tokens": 24259880.0, | |
| "step": 4540 | |
| }, | |
| { | |
| "entropy": 0.5514689449686557, | |
| "epoch": 0.7882968240733722, | |
| "grad_norm": 0.20703125, | |
| "learning_rate": 2.264335611600511e-05, | |
| "loss": 0.5632360458374024, | |
| "mean_token_accuracy": 0.8478600643575191, | |
| "num_tokens": 24311579.0, | |
| "step": 4550 | |
| }, | |
| { | |
| "entropy": 0.5926326899789274, | |
| "epoch": 0.7900293445658412, | |
| "grad_norm": 0.2265625, | |
| "learning_rate": 2.2288935717153826e-05, | |
| "loss": 0.5733819484710694, | |
| "mean_token_accuracy": 0.8435305185616017, | |
| "num_tokens": 24363728.0, | |
| "step": 4560 | |
| }, | |
| { | |
| "entropy": 0.5693248523864896, | |
| "epoch": 0.7917618650583101, | |
| "grad_norm": 0.263671875, | |
| "learning_rate": 2.1936962778705418e-05, | |
| "loss": 0.5535439491271973, | |
| "mean_token_accuracy": 0.8427335467189551, | |
| "num_tokens": 24417545.0, | |
| "step": 4570 | |
| }, | |
| { | |
| "entropy": 0.5928860791958869, | |
| "epoch": 0.7934943855507791, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 2.158744838582305e-05, | |
| "loss": 0.6109635829925537, | |
| "mean_token_accuracy": 0.8377186991274357, | |
| "num_tokens": 24469529.0, | |
| "step": 4580 | |
| }, | |
| { | |
| "entropy": 0.5517147674690932, | |
| "epoch": 0.7952269060432481, | |
| "grad_norm": 0.19140625, | |
| "learning_rate": 2.1240403546239573e-05, | |
| "loss": 0.55843505859375, | |
| "mean_token_accuracy": 0.8467742208391428, | |
| "num_tokens": 24526586.0, | |
| "step": 4590 | |
| }, | |
| { | |
| "entropy": 0.5572149983141571, | |
| "epoch": 0.7969594265357169, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 2.0895839189910903e-05, | |
| "loss": 0.5667229175567627, | |
| "mean_token_accuracy": 0.8488913148641586, | |
| "num_tokens": 24583652.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 0.5736112500540912, | |
| "epoch": 0.7986919470281859, | |
| "grad_norm": 0.2099609375, | |
| "learning_rate": 2.055376616867164e-05, | |
| "loss": 0.5669754028320313, | |
| "mean_token_accuracy": 0.8435257486999035, | |
| "num_tokens": 24642176.0, | |
| "step": 4610 | |
| }, | |
| { | |
| "entropy": 0.579422784037888, | |
| "epoch": 0.8004244675206549, | |
| "grad_norm": 0.2392578125, | |
| "learning_rate": 2.0214195255893363e-05, | |
| "loss": 0.5869145870208741, | |
| "mean_token_accuracy": 0.8378935415297747, | |
| "num_tokens": 24699945.0, | |
| "step": 4620 | |
| }, | |
| { | |
| "entropy": 0.6002859427593649, | |
| "epoch": 0.8021569880131239, | |
| "grad_norm": 0.203125, | |
| "learning_rate": 1.987713714614543e-05, | |
| "loss": 0.6259641647338867, | |
| "mean_token_accuracy": 0.8333838868886232, | |
| "num_tokens": 24755005.0, | |
| "step": 4630 | |
| }, | |
| { | |
| "entropy": 0.5577911037951708, | |
| "epoch": 0.8038895085055928, | |
| "grad_norm": 0.1728515625, | |
| "learning_rate": 1.9542602454858038e-05, | |
| "loss": 0.5876730442047119, | |
| "mean_token_accuracy": 0.8446177303791046, | |
| "num_tokens": 24807589.0, | |
| "step": 4640 | |
| }, | |
| { | |
| "entropy": 0.5511742249131203, | |
| "epoch": 0.8056220289980618, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 1.9210601717987886e-05, | |
| "loss": 0.5123077392578125, | |
| "mean_token_accuracy": 0.8508127823472023, | |
| "num_tokens": 24862286.0, | |
| "step": 4650 | |
| }, | |
| { | |
| "entropy": 0.5655517499893904, | |
| "epoch": 0.8073545494905306, | |
| "grad_norm": 0.236328125, | |
| "learning_rate": 1.8881145391686383e-05, | |
| "loss": 0.5731409549713135, | |
| "mean_token_accuracy": 0.8426301058381795, | |
| "num_tokens": 24919245.0, | |
| "step": 4660 | |
| }, | |
| { | |
| "entropy": 0.5823489186353982, | |
| "epoch": 0.8090870699829996, | |
| "grad_norm": 0.1611328125, | |
| "learning_rate": 1.8554243851970465e-05, | |
| "loss": 0.5956488132476807, | |
| "mean_token_accuracy": 0.8402592360973358, | |
| "num_tokens": 24972322.0, | |
| "step": 4670 | |
| }, | |
| { | |
| "entropy": 0.615665140748024, | |
| "epoch": 0.8108195904754686, | |
| "grad_norm": 0.244140625, | |
| "learning_rate": 1.822990739439556e-05, | |
| "loss": 0.6114068984985351, | |
| "mean_token_accuracy": 0.8344416070729495, | |
| "num_tokens": 25026301.0, | |
| "step": 4680 | |
| }, | |
| { | |
| "entropy": 0.5908701654989272, | |
| "epoch": 0.8125521109679376, | |
| "grad_norm": 0.1943359375, | |
| "learning_rate": 1.7908146233731516e-05, | |
| "loss": 0.5971941947937012, | |
| "mean_token_accuracy": 0.8422229964286089, | |
| "num_tokens": 25082425.0, | |
| "step": 4690 | |
| }, | |
| { | |
| "entropy": 0.6170886626467109, | |
| "epoch": 0.8142846314604065, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 1.758897050364089e-05, | |
| "loss": 0.6370350360870362, | |
| "mean_token_accuracy": 0.8319076154381037, | |
| "num_tokens": 25141282.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 0.5807770256418735, | |
| "epoch": 0.8160171519528755, | |
| "grad_norm": 0.236328125, | |
| "learning_rate": 1.7272390256359726e-05, | |
| "loss": 0.5834021091461181, | |
| "mean_token_accuracy": 0.8393303919583559, | |
| "num_tokens": 25192984.0, | |
| "step": 4710 | |
| }, | |
| { | |
| "entropy": 0.5795641975477338, | |
| "epoch": 0.8177496724453444, | |
| "grad_norm": 0.2001953125, | |
| "learning_rate": 1.6958415462380982e-05, | |
| "loss": 0.5941871166229248, | |
| "mean_token_accuracy": 0.842550129443407, | |
| "num_tokens": 25247078.0, | |
| "step": 4720 | |
| }, | |
| { | |
| "entropy": 0.5757013593101874, | |
| "epoch": 0.8194821929378133, | |
| "grad_norm": 0.2158203125, | |
| "learning_rate": 1.6647056010140494e-05, | |
| "loss": 0.6085315227508545, | |
| "mean_token_accuracy": 0.8438326179981231, | |
| "num_tokens": 25297441.0, | |
| "step": 4730 | |
| }, | |
| { | |
| "entropy": 0.5631363501306623, | |
| "epoch": 0.8212147134302823, | |
| "grad_norm": 0.181640625, | |
| "learning_rate": 1.633832170570565e-05, | |
| "loss": 0.5446923255920411, | |
| "mean_token_accuracy": 0.8464885164052248, | |
| "num_tokens": 25351087.0, | |
| "step": 4740 | |
| }, | |
| { | |
| "entropy": 0.5960177618311718, | |
| "epoch": 0.8229472339227513, | |
| "grad_norm": 0.18359375, | |
| "learning_rate": 1.6032222272466456e-05, | |
| "loss": 0.6015133857727051, | |
| "mean_token_accuracy": 0.8357700191438198, | |
| "num_tokens": 25406833.0, | |
| "step": 4750 | |
| }, | |
| { | |
| "entropy": 0.5622742976062, | |
| "epoch": 0.8246797544152202, | |
| "grad_norm": 0.267578125, | |
| "learning_rate": 1.572876735082931e-05, | |
| "loss": 0.5792129039764404, | |
| "mean_token_accuracy": 0.8478969302028417, | |
| "num_tokens": 25462922.0, | |
| "step": 4760 | |
| }, | |
| { | |
| "entropy": 0.5860844446811825, | |
| "epoch": 0.8264122749076891, | |
| "grad_norm": 0.1396484375, | |
| "learning_rate": 1.5427966497913382e-05, | |
| "loss": 0.5700845718383789, | |
| "mean_token_accuracy": 0.8390550728887319, | |
| "num_tokens": 25519835.0, | |
| "step": 4770 | |
| }, | |
| { | |
| "entropy": 0.5723399114562199, | |
| "epoch": 0.8281447954001581, | |
| "grad_norm": 0.205078125, | |
| "learning_rate": 1.5129829187249733e-05, | |
| "loss": 0.5587327480316162, | |
| "mean_token_accuracy": 0.8436962455511093, | |
| "num_tokens": 25572862.0, | |
| "step": 4780 | |
| }, | |
| { | |
| "entropy": 0.6173130693845451, | |
| "epoch": 0.829877315892627, | |
| "grad_norm": 0.24609375, | |
| "learning_rate": 1.483436480848276e-05, | |
| "loss": 0.6014991283416748, | |
| "mean_token_accuracy": 0.8375725369900465, | |
| "num_tokens": 25619756.0, | |
| "step": 4790 | |
| }, | |
| { | |
| "entropy": 0.5997563745826483, | |
| "epoch": 0.831609836385096, | |
| "grad_norm": 0.2158203125, | |
| "learning_rate": 1.4541582667074605e-05, | |
| "loss": 0.6501627922058105, | |
| "mean_token_accuracy": 0.8382502742111683, | |
| "num_tokens": 25672657.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 0.6088074346072971, | |
| "epoch": 0.833342356877565, | |
| "grad_norm": 0.2333984375, | |
| "learning_rate": 1.425149198401209e-05, | |
| "loss": 0.6090521335601806, | |
| "mean_token_accuracy": 0.8370539605617523, | |
| "num_tokens": 25726543.0, | |
| "step": 4810 | |
| }, | |
| { | |
| "entropy": 0.5758180576376617, | |
| "epoch": 0.8350748773700339, | |
| "grad_norm": 0.1787109375, | |
| "learning_rate": 1.3964101895516258e-05, | |
| "loss": 0.5777298927307128, | |
| "mean_token_accuracy": 0.8420398116111756, | |
| "num_tokens": 25780444.0, | |
| "step": 4820 | |
| }, | |
| { | |
| "entropy": 0.5725994257256388, | |
| "epoch": 0.8368073978625028, | |
| "grad_norm": 0.173828125, | |
| "learning_rate": 1.3679421452754627e-05, | |
| "loss": 0.6158907890319825, | |
| "mean_token_accuracy": 0.8438146792352199, | |
| "num_tokens": 25833018.0, | |
| "step": 4830 | |
| }, | |
| { | |
| "entropy": 0.5271360840764828, | |
| "epoch": 0.8385399183549718, | |
| "grad_norm": 0.1796875, | |
| "learning_rate": 1.339745962155613e-05, | |
| "loss": 0.4843564033508301, | |
| "mean_token_accuracy": 0.8528855789452792, | |
| "num_tokens": 25885932.0, | |
| "step": 4840 | |
| }, | |
| { | |
| "entropy": 0.5767460000701249, | |
| "epoch": 0.8402724388474407, | |
| "grad_norm": 0.1669921875, | |
| "learning_rate": 1.311822528212886e-05, | |
| "loss": 0.5902610778808594, | |
| "mean_token_accuracy": 0.8412225931882858, | |
| "num_tokens": 25935679.0, | |
| "step": 4850 | |
| }, | |
| { | |
| "entropy": 0.5638484083116054, | |
| "epoch": 0.8420049593399097, | |
| "grad_norm": 0.208984375, | |
| "learning_rate": 1.2841727228780187e-05, | |
| "loss": 0.5590053081512452, | |
| "mean_token_accuracy": 0.8466204077005386, | |
| "num_tokens": 25990464.0, | |
| "step": 4860 | |
| }, | |
| { | |
| "entropy": 0.5571088962838985, | |
| "epoch": 0.8437374798323787, | |
| "grad_norm": 0.2119140625, | |
| "learning_rate": 1.256797416963994e-05, | |
| "loss": 0.5606691360473632, | |
| "mean_token_accuracy": 0.8445250861346721, | |
| "num_tokens": 26047087.0, | |
| "step": 4870 | |
| }, | |
| { | |
| "entropy": 0.5812531022820622, | |
| "epoch": 0.8454700003248475, | |
| "grad_norm": 0.23046875, | |
| "learning_rate": 1.2296974726386123e-05, | |
| "loss": 0.595766830444336, | |
| "mean_token_accuracy": 0.8446589518338442, | |
| "num_tokens": 26098529.0, | |
| "step": 4880 | |
| }, | |
| { | |
| "entropy": 0.5640038163866847, | |
| "epoch": 0.8472025208173165, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 1.2028737433973358e-05, | |
| "loss": 0.5880807399749756, | |
| "mean_token_accuracy": 0.8454778704792261, | |
| "num_tokens": 26152935.0, | |
| "step": 4890 | |
| }, | |
| { | |
| "entropy": 0.5730855024885386, | |
| "epoch": 0.8489350413097855, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 1.1763270740364073e-05, | |
| "loss": 0.5882959842681885, | |
| "mean_token_accuracy": 0.8418738380074501, | |
| "num_tokens": 26207299.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 0.563043595594354, | |
| "epoch": 0.8506675618022544, | |
| "grad_norm": 0.296875, | |
| "learning_rate": 1.1500583006262423e-05, | |
| "loss": 0.587392520904541, | |
| "mean_token_accuracy": 0.8417437814176083, | |
| "num_tokens": 26259660.0, | |
| "step": 4910 | |
| }, | |
| { | |
| "entropy": 0.5787749814800918, | |
| "epoch": 0.8524000822947234, | |
| "grad_norm": 0.2734375, | |
| "learning_rate": 1.1240682504851096e-05, | |
| "loss": 0.5740055561065673, | |
| "mean_token_accuracy": 0.8416815143078565, | |
| "num_tokens": 26316406.0, | |
| "step": 4920 | |
| }, | |
| { | |
| "entropy": 0.5916237368946895, | |
| "epoch": 0.8541326027871924, | |
| "grad_norm": 0.201171875, | |
| "learning_rate": 1.0983577421530578e-05, | |
| "loss": 0.6176825046539307, | |
| "mean_token_accuracy": 0.8374281879514456, | |
| "num_tokens": 26371506.0, | |
| "step": 4930 | |
| }, | |
| { | |
| "entropy": 0.5775140485726297, | |
| "epoch": 0.8558651232796612, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 1.0729275853661503e-05, | |
| "loss": 0.5840110778808594, | |
| "mean_token_accuracy": 0.8430575907230378, | |
| "num_tokens": 26430372.0, | |
| "step": 4940 | |
| }, | |
| { | |
| "entropy": 0.5944045529700815, | |
| "epoch": 0.8575976437721302, | |
| "grad_norm": 0.19921875, | |
| "learning_rate": 1.0477785810309504e-05, | |
| "loss": 0.5982850074768067, | |
| "mean_token_accuracy": 0.8358097314834595, | |
| "num_tokens": 26483187.0, | |
| "step": 4950 | |
| }, | |
| { | |
| "entropy": 0.5662330114166252, | |
| "epoch": 0.8593301642645992, | |
| "grad_norm": 0.228515625, | |
| "learning_rate": 1.0229115211993146e-05, | |
| "loss": 0.5489250183105469, | |
| "mean_token_accuracy": 0.8467546600848437, | |
| "num_tokens": 26531742.0, | |
| "step": 4960 | |
| }, | |
| { | |
| "entropy": 0.5814009133726359, | |
| "epoch": 0.8610626847570682, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 9.983271890434276e-06, | |
| "loss": 0.5658225059509278, | |
| "mean_token_accuracy": 0.8422036103904247, | |
| "num_tokens": 26582463.0, | |
| "step": 4970 | |
| }, | |
| { | |
| "entropy": 0.5738571006804705, | |
| "epoch": 0.8627952052495371, | |
| "grad_norm": 0.1904296875, | |
| "learning_rate": 9.740263588311493e-06, | |
| "loss": 0.5560882568359375, | |
| "mean_token_accuracy": 0.8477094814181327, | |
| "num_tokens": 26635409.0, | |
| "step": 4980 | |
| }, | |
| { | |
| "entropy": 0.6064791481010616, | |
| "epoch": 0.8645277257420061, | |
| "grad_norm": 0.208984375, | |
| "learning_rate": 9.500097959016296e-06, | |
| "loss": 0.5998945236206055, | |
| "mean_token_accuracy": 0.8359555754810571, | |
| "num_tokens": 26688814.0, | |
| "step": 4990 | |
| }, | |
| { | |
| "entropy": 0.6118629967328161, | |
| "epoch": 0.866260246234475, | |
| "grad_norm": 0.2177734375, | |
| "learning_rate": 9.262782566411977e-06, | |
| "loss": 0.6543556690216065, | |
| "mean_token_accuracy": 0.8329808592796326, | |
| "num_tokens": 26739296.0, | |
| "step": 5000 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5772, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 200, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.1408570883984261e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |