Instructions to use cuongdk253/gptoss-raft with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cuongdk253/gptoss-raft with PEFT:
Task type is invalid.
- Transformers
How to use cuongdk253/gptoss-raft with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("cuongdk253/gptoss-raft", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 250, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.0973353385925293, | |
| "epoch": 0.004, | |
| "grad_norm": 56.63088607788086, | |
| "learning_rate": 0.0, | |
| "loss": 8.81, | |
| "mean_token_accuracy": 0.1589217633008957, | |
| "num_tokens": 11020.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 2.359926462173462, | |
| "epoch": 0.008, | |
| "grad_norm": 48.76058578491211, | |
| "learning_rate": 2.5e-05, | |
| "loss": 7.5185, | |
| "mean_token_accuracy": 0.20284946262836456, | |
| "num_tokens": 21059.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 2.3848068714141846, | |
| "epoch": 0.012, | |
| "grad_norm": 51.160762786865234, | |
| "learning_rate": 5e-05, | |
| "loss": 8.4107, | |
| "mean_token_accuracy": 0.1458083838224411, | |
| "num_tokens": 31081.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 2.5165743827819824, | |
| "epoch": 0.016, | |
| "grad_norm": 57.92226028442383, | |
| "learning_rate": 7.500000000000001e-05, | |
| "loss": 8.7345, | |
| "mean_token_accuracy": 0.10784424096345901, | |
| "num_tokens": 39994.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 3.0336835384368896, | |
| "epoch": 0.02, | |
| "grad_norm": 42.479244232177734, | |
| "learning_rate": 0.0001, | |
| "loss": 6.6625, | |
| "mean_token_accuracy": 0.15363158285617828, | |
| "num_tokens": 49317.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 3.2910828590393066, | |
| "epoch": 0.024, | |
| "grad_norm": 35.47465515136719, | |
| "learning_rate": 0.000125, | |
| "loss": 5.5297, | |
| "mean_token_accuracy": 0.2194845825433731, | |
| "num_tokens": 60805.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 2.9953644275665283, | |
| "epoch": 0.028, | |
| "grad_norm": 24.23429298400879, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": 3.7, | |
| "mean_token_accuracy": 0.40734514594078064, | |
| "num_tokens": 72706.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 2.88269305229187, | |
| "epoch": 0.032, | |
| "grad_norm": 25.993759155273438, | |
| "learning_rate": 0.000175, | |
| "loss": 2.7163, | |
| "mean_token_accuracy": 0.5192126631736755, | |
| "num_tokens": 85460.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 2.2315902709960938, | |
| "epoch": 0.036, | |
| "grad_norm": 11.012210845947266, | |
| "learning_rate": 0.0002, | |
| "loss": 2.1933, | |
| "mean_token_accuracy": 0.5909518003463745, | |
| "num_tokens": 99299.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.8418952226638794, | |
| "epoch": 0.04, | |
| "grad_norm": 5.978642463684082, | |
| "learning_rate": 0.00019999241639982352, | |
| "loss": 2.1315, | |
| "mean_token_accuracy": 0.6005287170410156, | |
| "num_tokens": 112919.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.6634621620178223, | |
| "epoch": 0.044, | |
| "grad_norm": 5.048736572265625, | |
| "learning_rate": 0.00019996966687731613, | |
| "loss": 2.092, | |
| "mean_token_accuracy": 0.6170734763145447, | |
| "num_tokens": 121074.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.4140448570251465, | |
| "epoch": 0.048, | |
| "grad_norm": 3.720097303390503, | |
| "learning_rate": 0.00019993175526632852, | |
| "loss": 1.7816, | |
| "mean_token_accuracy": 0.6572261452674866, | |
| "num_tokens": 132057.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.261852502822876, | |
| "epoch": 0.052, | |
| "grad_norm": 2.3393256664276123, | |
| "learning_rate": 0.0001998786879558941, | |
| "loss": 1.4815, | |
| "mean_token_accuracy": 0.6984454989433289, | |
| "num_tokens": 144153.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.5389002561569214, | |
| "epoch": 0.056, | |
| "grad_norm": 1.971347451210022, | |
| "learning_rate": 0.00019981047388915196, | |
| "loss": 1.6526, | |
| "mean_token_accuracy": 0.6537265777587891, | |
| "num_tokens": 154768.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.3573092222213745, | |
| "epoch": 0.06, | |
| "grad_norm": 1.3137863874435425, | |
| "learning_rate": 0.00019972712456184022, | |
| "loss": 1.3945, | |
| "mean_token_accuracy": 0.6989641189575195, | |
| "num_tokens": 165968.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.477573037147522, | |
| "epoch": 0.064, | |
| "grad_norm": 1.0724811553955078, | |
| "learning_rate": 0.00019962865402035814, | |
| "loss": 1.5077, | |
| "mean_token_accuracy": 0.6758458614349365, | |
| "num_tokens": 176610.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.062203288078308, | |
| "epoch": 0.068, | |
| "grad_norm": 0.7103755474090576, | |
| "learning_rate": 0.00019951507885939952, | |
| "loss": 1.1178, | |
| "mean_token_accuracy": 0.7602011561393738, | |
| "num_tokens": 188743.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.2973206043243408, | |
| "epoch": 0.072, | |
| "grad_norm": 0.6334678530693054, | |
| "learning_rate": 0.00019938641821915564, | |
| "loss": 1.3933, | |
| "mean_token_accuracy": 0.7131435871124268, | |
| "num_tokens": 201253.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.3070148229599, | |
| "epoch": 0.076, | |
| "grad_norm": 0.708212673664093, | |
| "learning_rate": 0.00019924269378208997, | |
| "loss": 1.3897, | |
| "mean_token_accuracy": 0.6967664361000061, | |
| "num_tokens": 211244.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.4724856615066528, | |
| "epoch": 0.08, | |
| "grad_norm": 0.6635432839393616, | |
| "learning_rate": 0.00019908392976928396, | |
| "loss": 1.5634, | |
| "mean_token_accuracy": 0.6638235449790955, | |
| "num_tokens": 221446.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.0885224342346191, | |
| "epoch": 0.084, | |
| "grad_norm": 0.535370409488678, | |
| "learning_rate": 0.0001989101529363553, | |
| "loss": 1.1798, | |
| "mean_token_accuracy": 0.7438462376594543, | |
| "num_tokens": 232945.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.2113245725631714, | |
| "epoch": 0.088, | |
| "grad_norm": 0.5345674753189087, | |
| "learning_rate": 0.00019872139256894885, | |
| "loss": 1.2599, | |
| "mean_token_accuracy": 0.7245048880577087, | |
| "num_tokens": 243753.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.2911491394042969, | |
| "epoch": 0.092, | |
| "grad_norm": 0.5416544079780579, | |
| "learning_rate": 0.00019851768047780144, | |
| "loss": 1.3408, | |
| "mean_token_accuracy": 0.7001619338989258, | |
| "num_tokens": 256105.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.128836750984192, | |
| "epoch": 0.096, | |
| "grad_norm": 0.48422297835350037, | |
| "learning_rate": 0.00019829905099338086, | |
| "loss": 1.1527, | |
| "mean_token_accuracy": 0.748742938041687, | |
| "num_tokens": 269432.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.5081233978271484, | |
| "epoch": 0.1, | |
| "grad_norm": 0.5165230631828308, | |
| "learning_rate": 0.00019806554096010035, | |
| "loss": 1.4886, | |
| "mean_token_accuracy": 0.680823802947998, | |
| "num_tokens": 279582.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.3273299932479858, | |
| "epoch": 0.104, | |
| "grad_norm": 0.534648597240448, | |
| "learning_rate": 0.00019781718973010948, | |
| "loss": 1.2789, | |
| "mean_token_accuracy": 0.7176167964935303, | |
| "num_tokens": 292021.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.508842945098877, | |
| "epoch": 0.108, | |
| "grad_norm": 0.4762946665287018, | |
| "learning_rate": 0.00019755403915666227, | |
| "loss": 1.4154, | |
| "mean_token_accuracy": 0.6926988959312439, | |
| "num_tokens": 303035.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.5553829669952393, | |
| "epoch": 0.112, | |
| "grad_norm": 0.5048977732658386, | |
| "learning_rate": 0.00019727613358706396, | |
| "loss": 1.4793, | |
| "mean_token_accuracy": 0.683097779750824, | |
| "num_tokens": 311456.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.1076712608337402, | |
| "epoch": 0.116, | |
| "grad_norm": 0.40861934423446655, | |
| "learning_rate": 0.00019698351985519735, | |
| "loss": 1.0217, | |
| "mean_token_accuracy": 0.7810451984405518, | |
| "num_tokens": 323666.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.2993760108947754, | |
| "epoch": 0.12, | |
| "grad_norm": 0.4528363049030304, | |
| "learning_rate": 0.00019667624727363019, | |
| "loss": 1.2028, | |
| "mean_token_accuracy": 0.7430762052536011, | |
| "num_tokens": 334753.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.3225066661834717, | |
| "epoch": 0.124, | |
| "grad_norm": 0.5367140173912048, | |
| "learning_rate": 0.0001963543676253048, | |
| "loss": 1.2189, | |
| "mean_token_accuracy": 0.7315188050270081, | |
| "num_tokens": 343683.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.677242398262024, | |
| "epoch": 0.128, | |
| "grad_norm": 0.4724753201007843, | |
| "learning_rate": 0.0001960179351548113, | |
| "loss": 1.602, | |
| "mean_token_accuracy": 0.6546955108642578, | |
| "num_tokens": 357496.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.9450194239616394, | |
| "epoch": 0.132, | |
| "grad_norm": 0.4643884003162384, | |
| "learning_rate": 0.00019566700655924626, | |
| "loss": 0.9468, | |
| "mean_token_accuracy": 0.7905657291412354, | |
| "num_tokens": 369306.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.4320679903030396, | |
| "epoch": 0.136, | |
| "grad_norm": 0.4968578815460205, | |
| "learning_rate": 0.00019530164097865768, | |
| "loss": 1.4105, | |
| "mean_token_accuracy": 0.6940935254096985, | |
| "num_tokens": 381024.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.4245866537094116, | |
| "epoch": 0.14, | |
| "grad_norm": 0.40614748001098633, | |
| "learning_rate": 0.0001949218999860784, | |
| "loss": 1.4487, | |
| "mean_token_accuracy": 0.6868099570274353, | |
| "num_tokens": 392891.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.1022300720214844, | |
| "epoch": 0.144, | |
| "grad_norm": 0.3792162835597992, | |
| "learning_rate": 0.00019452784757714974, | |
| "loss": 1.1092, | |
| "mean_token_accuracy": 0.761519730091095, | |
| "num_tokens": 404395.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.097092628479004, | |
| "epoch": 0.148, | |
| "grad_norm": 0.4267388880252838, | |
| "learning_rate": 0.00019411955015933657, | |
| "loss": 1.1114, | |
| "mean_token_accuracy": 0.7575680613517761, | |
| "num_tokens": 416190.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.1763945817947388, | |
| "epoch": 0.152, | |
| "grad_norm": 0.49878817796707153, | |
| "learning_rate": 0.00019369707654073601, | |
| "loss": 1.2312, | |
| "mean_token_accuracy": 0.7294224500656128, | |
| "num_tokens": 428329.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.103309154510498, | |
| "epoch": 0.156, | |
| "grad_norm": 0.5332479476928711, | |
| "learning_rate": 0.00019326049791848154, | |
| "loss": 1.0894, | |
| "mean_token_accuracy": 0.7563456892967224, | |
| "num_tokens": 438062.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.3513190746307373, | |
| "epoch": 0.16, | |
| "grad_norm": 0.665856122970581, | |
| "learning_rate": 0.00019280988786674467, | |
| "loss": 1.4117, | |
| "mean_token_accuracy": 0.6817158460617065, | |
| "num_tokens": 446503.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.1249470710754395, | |
| "epoch": 0.164, | |
| "grad_norm": 0.44063600897789, | |
| "learning_rate": 0.0001923453223243358, | |
| "loss": 1.1345, | |
| "mean_token_accuracy": 0.7451761960983276, | |
| "num_tokens": 457544.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.139631986618042, | |
| "epoch": 0.168, | |
| "grad_norm": 0.5003185272216797, | |
| "learning_rate": 0.00019186687958190667, | |
| "loss": 1.1346, | |
| "mean_token_accuracy": 0.7483499050140381, | |
| "num_tokens": 467091.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.9406906962394714, | |
| "epoch": 0.172, | |
| "grad_norm": 0.6294145584106445, | |
| "learning_rate": 0.00019137464026875654, | |
| "loss": 0.9044, | |
| "mean_token_accuracy": 0.7882066965103149, | |
| "num_tokens": 475318.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.039001703262329, | |
| "epoch": 0.176, | |
| "grad_norm": 0.4918760657310486, | |
| "learning_rate": 0.0001908686873392441, | |
| "loss": 1.0364, | |
| "mean_token_accuracy": 0.7681604623794556, | |
| "num_tokens": 485741.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.1919207572937012, | |
| "epoch": 0.18, | |
| "grad_norm": 0.5181702971458435, | |
| "learning_rate": 0.00019034910605880776, | |
| "loss": 1.1167, | |
| "mean_token_accuracy": 0.7450622916221619, | |
| "num_tokens": 498907.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.003733515739441, | |
| "epoch": 0.184, | |
| "grad_norm": 0.5143950581550598, | |
| "learning_rate": 0.0001898159839895961, | |
| "loss": 0.963, | |
| "mean_token_accuracy": 0.7841158509254456, | |
| "num_tokens": 510304.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.3185124397277832, | |
| "epoch": 0.188, | |
| "grad_norm": 0.5639718174934387, | |
| "learning_rate": 0.00018926941097571182, | |
| "loss": 1.268, | |
| "mean_token_accuracy": 0.7116304039955139, | |
| "num_tokens": 521389.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.1227295398712158, | |
| "epoch": 0.192, | |
| "grad_norm": 0.6089756488800049, | |
| "learning_rate": 0.00018870947912807048, | |
| "loss": 1.0814, | |
| "mean_token_accuracy": 0.7578927874565125, | |
| "num_tokens": 532097.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.2459306716918945, | |
| "epoch": 0.196, | |
| "grad_norm": 0.7441679239273071, | |
| "learning_rate": 0.00018813628280887795, | |
| "loss": 1.2047, | |
| "mean_token_accuracy": 0.7300441861152649, | |
| "num_tokens": 541382.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.0864311456680298, | |
| "epoch": 0.2, | |
| "grad_norm": 0.5735241174697876, | |
| "learning_rate": 0.00018754991861572766, | |
| "loss": 1.0827, | |
| "mean_token_accuracy": 0.7548420429229736, | |
| "num_tokens": 551039.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.9783708453178406, | |
| "epoch": 0.204, | |
| "grad_norm": 0.6659897565841675, | |
| "learning_rate": 0.00018695048536532182, | |
| "loss": 0.978, | |
| "mean_token_accuracy": 0.7748624682426453, | |
| "num_tokens": 562856.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.0906152725219727, | |
| "epoch": 0.208, | |
| "grad_norm": 0.5842542052268982, | |
| "learning_rate": 0.00018633808407681827, | |
| "loss": 1.1066, | |
| "mean_token_accuracy": 0.7530777454376221, | |
| "num_tokens": 575692.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.1353249549865723, | |
| "epoch": 0.212, | |
| "grad_norm": 1.0452736616134644, | |
| "learning_rate": 0.0001857128179548063, | |
| "loss": 1.2501, | |
| "mean_token_accuracy": 0.7129384875297546, | |
| "num_tokens": 587040.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.1658884286880493, | |
| "epoch": 0.216, | |
| "grad_norm": 0.7569848299026489, | |
| "learning_rate": 0.0001850747923719143, | |
| "loss": 1.1789, | |
| "mean_token_accuracy": 0.7339466214179993, | |
| "num_tokens": 598130.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.9339560866355896, | |
| "epoch": 0.22, | |
| "grad_norm": 0.6351683139801025, | |
| "learning_rate": 0.0001844241148510516, | |
| "loss": 0.9055, | |
| "mean_token_accuracy": 0.7876133322715759, | |
| "num_tokens": 611259.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.1959530115127563, | |
| "epoch": 0.224, | |
| "grad_norm": 0.8705658912658691, | |
| "learning_rate": 0.00018376089504728847, | |
| "loss": 1.1617, | |
| "mean_token_accuracy": 0.7372428774833679, | |
| "num_tokens": 622686.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.2461718320846558, | |
| "epoch": 0.228, | |
| "grad_norm": 0.8680962324142456, | |
| "learning_rate": 0.0001830852447293765, | |
| "loss": 1.1835, | |
| "mean_token_accuracy": 0.7315577864646912, | |
| "num_tokens": 632638.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.1705292463302612, | |
| "epoch": 0.232, | |
| "grad_norm": 0.7268466353416443, | |
| "learning_rate": 0.00018239727776091282, | |
| "loss": 1.1152, | |
| "mean_token_accuracy": 0.7414857745170593, | |
| "num_tokens": 643974.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.153640866279602, | |
| "epoch": 0.236, | |
| "grad_norm": 0.7480162978172302, | |
| "learning_rate": 0.00018169711008115126, | |
| "loss": 1.1153, | |
| "mean_token_accuracy": 0.7440808415412903, | |
| "num_tokens": 654366.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.097459077835083, | |
| "epoch": 0.24, | |
| "grad_norm": 0.7212317585945129, | |
| "learning_rate": 0.00018098485968546385, | |
| "loss": 1.0895, | |
| "mean_token_accuracy": 0.7482320666313171, | |
| "num_tokens": 666105.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.05923593044281, | |
| "epoch": 0.244, | |
| "grad_norm": 0.8075670599937439, | |
| "learning_rate": 0.00018026064660545552, | |
| "loss": 1.067, | |
| "mean_token_accuracy": 0.7528573870658875, | |
| "num_tokens": 676781.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.0399152040481567, | |
| "epoch": 0.248, | |
| "grad_norm": 0.9833256602287292, | |
| "learning_rate": 0.00017952459288873623, | |
| "loss": 1.0939, | |
| "mean_token_accuracy": 0.7464929819107056, | |
| "num_tokens": 686763.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.0377105474472046, | |
| "epoch": 0.252, | |
| "grad_norm": 0.852209210395813, | |
| "learning_rate": 0.00017877682257835242, | |
| "loss": 1.0704, | |
| "mean_token_accuracy": 0.7448949217796326, | |
| "num_tokens": 700085.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.8170187473297119, | |
| "epoch": 0.256, | |
| "grad_norm": 0.8792871832847595, | |
| "learning_rate": 0.00017801746169188328, | |
| "loss": 0.6947, | |
| "mean_token_accuracy": 0.833350419998169, | |
| "num_tokens": 709832.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.0612165927886963, | |
| "epoch": 0.26, | |
| "grad_norm": 0.8374829888343811, | |
| "learning_rate": 0.0001772466382002032, | |
| "loss": 0.9753, | |
| "mean_token_accuracy": 0.7734495401382446, | |
| "num_tokens": 720847.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.0511215925216675, | |
| "epoch": 0.264, | |
| "grad_norm": 0.8725335001945496, | |
| "learning_rate": 0.00017646448200591596, | |
| "loss": 1.0397, | |
| "mean_token_accuracy": 0.7560197710990906, | |
| "num_tokens": 732768.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.16708242893219, | |
| "epoch": 0.268, | |
| "grad_norm": 0.9981763958930969, | |
| "learning_rate": 0.0001756711249214627, | |
| "loss": 1.2386, | |
| "mean_token_accuracy": 0.7174420952796936, | |
| "num_tokens": 743044.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.9941532611846924, | |
| "epoch": 0.272, | |
| "grad_norm": 0.9159516096115112, | |
| "learning_rate": 0.0001748667006469085, | |
| "loss": 0.9769, | |
| "mean_token_accuracy": 0.7736346125602722, | |
| "num_tokens": 752915.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.9163703322410583, | |
| "epoch": 0.276, | |
| "grad_norm": 0.7718108892440796, | |
| "learning_rate": 0.0001740513447474104, | |
| "loss": 0.8858, | |
| "mean_token_accuracy": 0.79206782579422, | |
| "num_tokens": 765070.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.043192744255066, | |
| "epoch": 0.28, | |
| "grad_norm": 0.7897371649742126, | |
| "learning_rate": 0.00017322519463037168, | |
| "loss": 1.0291, | |
| "mean_token_accuracy": 0.7658995985984802, | |
| "num_tokens": 776110.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.8629508018493652, | |
| "epoch": 0.284, | |
| "grad_norm": 0.8085194230079651, | |
| "learning_rate": 0.00017238838952228502, | |
| "loss": 0.8871, | |
| "mean_token_accuracy": 0.7935369610786438, | |
| "num_tokens": 786850.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.0944290161132812, | |
| "epoch": 0.288, | |
| "grad_norm": 0.9569735527038574, | |
| "learning_rate": 0.00017154107044526964, | |
| "loss": 1.0377, | |
| "mean_token_accuracy": 0.7588126063346863, | |
| "num_tokens": 796554.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.7297062277793884, | |
| "epoch": 0.292, | |
| "grad_norm": 0.9553439021110535, | |
| "learning_rate": 0.00017068338019330564, | |
| "loss": 0.6367, | |
| "mean_token_accuracy": 0.8526090979576111, | |
| "num_tokens": 806387.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.9341362714767456, | |
| "epoch": 0.296, | |
| "grad_norm": 0.9124618768692017, | |
| "learning_rate": 0.00016981546330816953, | |
| "loss": 0.8903, | |
| "mean_token_accuracy": 0.7885122299194336, | |
| "num_tokens": 816626.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.5450064539909363, | |
| "epoch": 0.3, | |
| "grad_norm": 0.8968790769577026, | |
| "learning_rate": 0.0001689374660550757, | |
| "loss": 0.625, | |
| "mean_token_accuracy": 0.8518457412719727, | |
| "num_tokens": 828737.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.7374886870384216, | |
| "epoch": 0.304, | |
| "grad_norm": 1.0030460357666016, | |
| "learning_rate": 0.00016804953639802677, | |
| "loss": 0.7191, | |
| "mean_token_accuracy": 0.8276105523109436, | |
| "num_tokens": 840068.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.7412508130073547, | |
| "epoch": 0.308, | |
| "grad_norm": 1.2331219911575317, | |
| "learning_rate": 0.00016715182397487844, | |
| "loss": 0.8017, | |
| "mean_token_accuracy": 0.8093528151512146, | |
| "num_tokens": 851489.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.0338571071624756, | |
| "epoch": 0.312, | |
| "grad_norm": 0.9198253154754639, | |
| "learning_rate": 0.00016624448007212167, | |
| "loss": 1.0164, | |
| "mean_token_accuracy": 0.7691991329193115, | |
| "num_tokens": 863640.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.9462264776229858, | |
| "epoch": 0.316, | |
| "grad_norm": 0.7652691602706909, | |
| "learning_rate": 0.0001653276575993871, | |
| "loss": 0.9116, | |
| "mean_token_accuracy": 0.7878068089485168, | |
| "num_tokens": 878798.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.003931999206543, | |
| "epoch": 0.32, | |
| "grad_norm": 0.9275044202804565, | |
| "learning_rate": 0.0001644015110636762, | |
| "loss": 0.9505, | |
| "mean_token_accuracy": 0.774969220161438, | |
| "num_tokens": 889363.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.708422839641571, | |
| "epoch": 0.324, | |
| "grad_norm": 0.9531024694442749, | |
| "learning_rate": 0.00016346619654332298, | |
| "loss": 0.6343, | |
| "mean_token_accuracy": 0.8398601412773132, | |
| "num_tokens": 899375.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.028533935546875, | |
| "epoch": 0.328, | |
| "grad_norm": 0.9965426921844482, | |
| "learning_rate": 0.00016252187166169107, | |
| "loss": 0.9782, | |
| "mean_token_accuracy": 0.7718014121055603, | |
| "num_tokens": 908803.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.7851366400718689, | |
| "epoch": 0.332, | |
| "grad_norm": 0.8076054453849792, | |
| "learning_rate": 0.0001615686955606102, | |
| "loss": 0.765, | |
| "mean_token_accuracy": 0.8145228028297424, | |
| "num_tokens": 920855.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.9262005090713501, | |
| "epoch": 0.336, | |
| "grad_norm": 0.9758970737457275, | |
| "learning_rate": 0.000160606828873557, | |
| "loss": 0.9151, | |
| "mean_token_accuracy": 0.7844375371932983, | |
| "num_tokens": 931151.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.6350160837173462, | |
| "epoch": 0.34, | |
| "grad_norm": 1.0767849683761597, | |
| "learning_rate": 0.00015963643369858437, | |
| "loss": 0.7041, | |
| "mean_token_accuracy": 0.8317089080810547, | |
| "num_tokens": 940387.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.9434180855751038, | |
| "epoch": 0.344, | |
| "grad_norm": 1.190125823020935, | |
| "learning_rate": 0.0001586576735710038, | |
| "loss": 0.9578, | |
| "mean_token_accuracy": 0.7776371240615845, | |
| "num_tokens": 949869.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.8093811273574829, | |
| "epoch": 0.348, | |
| "grad_norm": 0.9406972527503967, | |
| "learning_rate": 0.00015767071343582588, | |
| "loss": 0.7415, | |
| "mean_token_accuracy": 0.8234021663665771, | |
| "num_tokens": 959118.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.7648224234580994, | |
| "epoch": 0.352, | |
| "grad_norm": 0.7738968729972839, | |
| "learning_rate": 0.00015667571961996296, | |
| "loss": 0.7306, | |
| "mean_token_accuracy": 0.8252065181732178, | |
| "num_tokens": 971466.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 0.659711480140686, | |
| "epoch": 0.356, | |
| "grad_norm": 0.801194965839386, | |
| "learning_rate": 0.000155672859804199, | |
| "loss": 0.6591, | |
| "mean_token_accuracy": 0.8405287265777588, | |
| "num_tokens": 983119.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.9075393080711365, | |
| "epoch": 0.36, | |
| "grad_norm": 1.1619821786880493, | |
| "learning_rate": 0.00015466230299493125, | |
| "loss": 0.8609, | |
| "mean_token_accuracy": 0.7937808632850647, | |
| "num_tokens": 992640.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.7225161790847778, | |
| "epoch": 0.364, | |
| "grad_norm": 0.9581741690635681, | |
| "learning_rate": 0.00015364421949568853, | |
| "loss": 0.688, | |
| "mean_token_accuracy": 0.8366522192955017, | |
| "num_tokens": 1003037.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 0.7597986459732056, | |
| "epoch": 0.368, | |
| "grad_norm": 1.0615458488464355, | |
| "learning_rate": 0.00015261878087843085, | |
| "loss": 0.7226, | |
| "mean_token_accuracy": 0.824986457824707, | |
| "num_tokens": 1014101.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 0.6454391479492188, | |
| "epoch": 0.372, | |
| "grad_norm": 0.9587013721466064, | |
| "learning_rate": 0.00015158615995463566, | |
| "loss": 0.6641, | |
| "mean_token_accuracy": 0.8425232172012329, | |
| "num_tokens": 1025311.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.8424079418182373, | |
| "epoch": 0.376, | |
| "grad_norm": 1.2206848859786987, | |
| "learning_rate": 0.00015054653074617443, | |
| "loss": 0.9094, | |
| "mean_token_accuracy": 0.7876355648040771, | |
| "num_tokens": 1037024.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 0.8714436292648315, | |
| "epoch": 0.38, | |
| "grad_norm": 1.2640056610107422, | |
| "learning_rate": 0.00014950006845598603, | |
| "loss": 0.8689, | |
| "mean_token_accuracy": 0.7946674823760986, | |
| "num_tokens": 1046815.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.5807708501815796, | |
| "epoch": 0.384, | |
| "grad_norm": 0.8595563173294067, | |
| "learning_rate": 0.00014844694943855067, | |
| "loss": 0.5039, | |
| "mean_token_accuracy": 0.8740711212158203, | |
| "num_tokens": 1056775.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 0.6972081661224365, | |
| "epoch": 0.388, | |
| "grad_norm": 0.8816290497779846, | |
| "learning_rate": 0.00014738735117016978, | |
| "loss": 0.6369, | |
| "mean_token_accuracy": 0.8466954827308655, | |
| "num_tokens": 1067429.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 0.5604634881019592, | |
| "epoch": 0.392, | |
| "grad_norm": 0.9110663533210754, | |
| "learning_rate": 0.0001463214522190571, | |
| "loss": 0.501, | |
| "mean_token_accuracy": 0.8726220726966858, | |
| "num_tokens": 1078838.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 0.8191442489624023, | |
| "epoch": 0.396, | |
| "grad_norm": 1.2301007509231567, | |
| "learning_rate": 0.00014524943221524533, | |
| "loss": 0.8723, | |
| "mean_token_accuracy": 0.7879535555839539, | |
| "num_tokens": 1089781.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 0.9090349674224854, | |
| "epoch": 0.4, | |
| "grad_norm": 1.0221482515335083, | |
| "learning_rate": 0.00014417147182031428, | |
| "loss": 0.8904, | |
| "mean_token_accuracy": 0.7897399067878723, | |
| "num_tokens": 1102239.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.6675378084182739, | |
| "epoch": 0.404, | |
| "grad_norm": 1.0766475200653076, | |
| "learning_rate": 0.0001430877526969448, | |
| "loss": 0.5804, | |
| "mean_token_accuracy": 0.8515596985816956, | |
| "num_tokens": 1113397.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 0.6440110802650452, | |
| "epoch": 0.408, | |
| "grad_norm": 0.9045482873916626, | |
| "learning_rate": 0.00014199845747830446, | |
| "loss": 0.6087, | |
| "mean_token_accuracy": 0.8539875149726868, | |
| "num_tokens": 1125261.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 0.8418194651603699, | |
| "epoch": 0.412, | |
| "grad_norm": 1.4091824293136597, | |
| "learning_rate": 0.00014090376973726896, | |
| "loss": 0.9077, | |
| "mean_token_accuracy": 0.7805910706520081, | |
| "num_tokens": 1136598.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 0.7668788433074951, | |
| "epoch": 0.416, | |
| "grad_norm": 1.2579201459884644, | |
| "learning_rate": 0.00013980387395548608, | |
| "loss": 0.8016, | |
| "mean_token_accuracy": 0.8103581070899963, | |
| "num_tokens": 1146988.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 0.9310951232910156, | |
| "epoch": 0.42, | |
| "grad_norm": 1.0861616134643555, | |
| "learning_rate": 0.0001386989554922857, | |
| "loss": 0.9118, | |
| "mean_token_accuracy": 0.7869442701339722, | |
| "num_tokens": 1157269.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.48249903321266174, | |
| "epoch": 0.424, | |
| "grad_norm": 1.08878755569458, | |
| "learning_rate": 0.00013758920055344226, | |
| "loss": 0.3668, | |
| "mean_token_accuracy": 0.9031632542610168, | |
| "num_tokens": 1167071.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.689582884311676, | |
| "epoch": 0.428, | |
| "grad_norm": 1.249678611755371, | |
| "learning_rate": 0.00013647479615979468, | |
| "loss": 0.581, | |
| "mean_token_accuracy": 0.8578310608863831, | |
| "num_tokens": 1175584.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 0.5986989736557007, | |
| "epoch": 0.432, | |
| "grad_norm": 0.9662414193153381, | |
| "learning_rate": 0.0001353559301157287, | |
| "loss": 0.5368, | |
| "mean_token_accuracy": 0.8663188219070435, | |
| "num_tokens": 1187278.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.9165630340576172, | |
| "epoch": 0.436, | |
| "grad_norm": 1.785701036453247, | |
| "learning_rate": 0.00013423279097752713, | |
| "loss": 1.015, | |
| "mean_token_accuracy": 0.7645655870437622, | |
| "num_tokens": 1196085.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.6729641556739807, | |
| "epoch": 0.44, | |
| "grad_norm": 1.1485984325408936, | |
| "learning_rate": 0.0001331055680215937, | |
| "loss": 0.6846, | |
| "mean_token_accuracy": 0.8309648633003235, | |
| "num_tokens": 1209457.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.5594127178192139, | |
| "epoch": 0.444, | |
| "grad_norm": 0.9643635153770447, | |
| "learning_rate": 0.00013197445121255523, | |
| "loss": 0.5453, | |
| "mean_token_accuracy": 0.8717948794364929, | |
| "num_tokens": 1219482.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.8685882687568665, | |
| "epoch": 0.448, | |
| "grad_norm": 1.0649855136871338, | |
| "learning_rate": 0.00013083963117124802, | |
| "loss": 0.8078, | |
| "mean_token_accuracy": 0.8030028939247131, | |
| "num_tokens": 1232205.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.6931924223899841, | |
| "epoch": 0.452, | |
| "grad_norm": 1.0093775987625122, | |
| "learning_rate": 0.00012970129914259356, | |
| "loss": 0.6155, | |
| "mean_token_accuracy": 0.8536151647567749, | |
| "num_tokens": 1242331.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.940833568572998, | |
| "epoch": 0.456, | |
| "grad_norm": 1.1867045164108276, | |
| "learning_rate": 0.00012855964696336896, | |
| "loss": 0.9769, | |
| "mean_token_accuracy": 0.7758588790893555, | |
| "num_tokens": 1253219.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 0.644160270690918, | |
| "epoch": 0.46, | |
| "grad_norm": 1.0405246019363403, | |
| "learning_rate": 0.00012741486702987797, | |
| "loss": 0.5985, | |
| "mean_token_accuracy": 0.853334367275238, | |
| "num_tokens": 1266012.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.6467909812927246, | |
| "epoch": 0.464, | |
| "grad_norm": 1.0041617155075073, | |
| "learning_rate": 0.00012626715226552745, | |
| "loss": 0.589, | |
| "mean_token_accuracy": 0.8532326817512512, | |
| "num_tokens": 1278728.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.6697924733161926, | |
| "epoch": 0.468, | |
| "grad_norm": 1.225751519203186, | |
| "learning_rate": 0.00012511669608831485, | |
| "loss": 0.6097, | |
| "mean_token_accuracy": 0.8501642942428589, | |
| "num_tokens": 1289989.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 0.5410375595092773, | |
| "epoch": 0.472, | |
| "grad_norm": 1.1570745706558228, | |
| "learning_rate": 0.00012396369237823286, | |
| "loss": 0.4868, | |
| "mean_token_accuracy": 0.8764288425445557, | |
| "num_tokens": 1300139.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 0.7634984254837036, | |
| "epoch": 0.476, | |
| "grad_norm": 1.26356041431427, | |
| "learning_rate": 0.00012280833544459568, | |
| "loss": 0.7205, | |
| "mean_token_accuracy": 0.8254125118255615, | |
| "num_tokens": 1310262.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 0.7683166265487671, | |
| "epoch": 0.48, | |
| "grad_norm": 1.263581395149231, | |
| "learning_rate": 0.0001216508199932932, | |
| "loss": 0.8117, | |
| "mean_token_accuracy": 0.8081841468811035, | |
| "num_tokens": 1322385.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.7120152115821838, | |
| "epoch": 0.484, | |
| "grad_norm": 1.0431994199752808, | |
| "learning_rate": 0.00012049134109397832, | |
| "loss": 0.6529, | |
| "mean_token_accuracy": 0.8445841073989868, | |
| "num_tokens": 1337186.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.7104185819625854, | |
| "epoch": 0.488, | |
| "grad_norm": 1.0483670234680176, | |
| "learning_rate": 0.00011933009414719301, | |
| "loss": 0.7264, | |
| "mean_token_accuracy": 0.8267722725868225, | |
| "num_tokens": 1349686.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.9004740118980408, | |
| "epoch": 0.492, | |
| "grad_norm": 1.2728326320648193, | |
| "learning_rate": 0.0001181672748514383, | |
| "loss": 0.8288, | |
| "mean_token_accuracy": 0.7991729378700256, | |
| "num_tokens": 1361295.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 0.7324482798576355, | |
| "epoch": 0.496, | |
| "grad_norm": 1.113187313079834, | |
| "learning_rate": 0.00011700307917019457, | |
| "loss": 0.6708, | |
| "mean_token_accuracy": 0.8380022048950195, | |
| "num_tokens": 1371328.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 0.4651513993740082, | |
| "epoch": 0.5, | |
| "grad_norm": 0.9615445733070374, | |
| "learning_rate": 0.00011583770329889687, | |
| "loss": 0.3927, | |
| "mean_token_accuracy": 0.8962194919586182, | |
| "num_tokens": 1383577.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.7203623056411743, | |
| "epoch": 0.504, | |
| "grad_norm": 1.9821685552597046, | |
| "learning_rate": 0.00011467134363187099, | |
| "loss": 0.7477, | |
| "mean_token_accuracy": 0.8203157782554626, | |
| "num_tokens": 1393079.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 0.6460074186325073, | |
| "epoch": 0.508, | |
| "grad_norm": 2.170309543609619, | |
| "learning_rate": 0.0001135041967292364, | |
| "loss": 0.7293, | |
| "mean_token_accuracy": 0.8246410489082336, | |
| "num_tokens": 1402553.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 0.5284869074821472, | |
| "epoch": 0.512, | |
| "grad_norm": 1.1976059675216675, | |
| "learning_rate": 0.00011233645928378105, | |
| "loss": 0.4515, | |
| "mean_token_accuracy": 0.8835397362709045, | |
| "num_tokens": 1412567.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 0.4933440089225769, | |
| "epoch": 0.516, | |
| "grad_norm": 1.259605050086975, | |
| "learning_rate": 0.00011116832808781378, | |
| "loss": 0.4273, | |
| "mean_token_accuracy": 0.8937007784843445, | |
| "num_tokens": 1424507.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.7313682436943054, | |
| "epoch": 0.52, | |
| "grad_norm": 1.3257278203964233, | |
| "learning_rate": 0.00011000000000000002, | |
| "loss": 0.6628, | |
| "mean_token_accuracy": 0.8386083245277405, | |
| "num_tokens": 1433419.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.4719448387622833, | |
| "epoch": 0.524, | |
| "grad_norm": 1.0190857648849487, | |
| "learning_rate": 0.00010883167191218624, | |
| "loss": 0.394, | |
| "mean_token_accuracy": 0.9015878438949585, | |
| "num_tokens": 1444568.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.671485185623169, | |
| "epoch": 0.528, | |
| "grad_norm": 1.0616258382797241, | |
| "learning_rate": 0.00010766354071621898, | |
| "loss": 0.6002, | |
| "mean_token_accuracy": 0.8531094193458557, | |
| "num_tokens": 1458029.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.37650296092033386, | |
| "epoch": 0.532, | |
| "grad_norm": 1.3387216329574585, | |
| "learning_rate": 0.00010649580327076363, | |
| "loss": 0.3286, | |
| "mean_token_accuracy": 0.9205968379974365, | |
| "num_tokens": 1469290.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.5341144800186157, | |
| "epoch": 0.536, | |
| "grad_norm": 1.3382490873336792, | |
| "learning_rate": 0.00010532865636812906, | |
| "loss": 0.5154, | |
| "mean_token_accuracy": 0.8731343150138855, | |
| "num_tokens": 1482290.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.5627509951591492, | |
| "epoch": 0.54, | |
| "grad_norm": 1.9341037273406982, | |
| "learning_rate": 0.00010416229670110314, | |
| "loss": 0.6165, | |
| "mean_token_accuracy": 0.8522540330886841, | |
| "num_tokens": 1491409.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.40396589040756226, | |
| "epoch": 0.544, | |
| "grad_norm": 1.1782172918319702, | |
| "learning_rate": 0.0001029969208298054, | |
| "loss": 0.3003, | |
| "mean_token_accuracy": 0.9240846037864685, | |
| "num_tokens": 1501106.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 0.7882451415061951, | |
| "epoch": 0.548, | |
| "grad_norm": 1.2071242332458496, | |
| "learning_rate": 0.00010183272514856172, | |
| "loss": 0.7402, | |
| "mean_token_accuracy": 0.8205325603485107, | |
| "num_tokens": 1511511.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.645850419998169, | |
| "epoch": 0.552, | |
| "grad_norm": 1.2258726358413696, | |
| "learning_rate": 0.00010066990585280704, | |
| "loss": 0.6628, | |
| "mean_token_accuracy": 0.8416417241096497, | |
| "num_tokens": 1523208.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.42336830496788025, | |
| "epoch": 0.556, | |
| "grad_norm": 1.5242387056350708, | |
| "learning_rate": 9.95086589060217e-05, | |
| "loss": 0.2851, | |
| "mean_token_accuracy": 0.9278303980827332, | |
| "num_tokens": 1532078.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.7408692240715027, | |
| "epoch": 0.56, | |
| "grad_norm": 1.1541547775268555, | |
| "learning_rate": 9.834918000670681e-05, | |
| "loss": 0.6626, | |
| "mean_token_accuracy": 0.8373293280601501, | |
| "num_tokens": 1544092.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.5522950887680054, | |
| "epoch": 0.564, | |
| "grad_norm": 1.2949033975601196, | |
| "learning_rate": 9.719166455540436e-05, | |
| "loss": 0.4288, | |
| "mean_token_accuracy": 0.8930450081825256, | |
| "num_tokens": 1554360.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.6674742698669434, | |
| "epoch": 0.568, | |
| "grad_norm": 1.4206823110580444, | |
| "learning_rate": 9.603630762176718e-05, | |
| "loss": 0.6521, | |
| "mean_token_accuracy": 0.8428549766540527, | |
| "num_tokens": 1567420.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.48524826765060425, | |
| "epoch": 0.572, | |
| "grad_norm": 2.079292058944702, | |
| "learning_rate": 9.488330391168516e-05, | |
| "loss": 0.5301, | |
| "mean_token_accuracy": 0.8732667565345764, | |
| "num_tokens": 1577735.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.6761812567710876, | |
| "epoch": 0.576, | |
| "grad_norm": 2.401937246322632, | |
| "learning_rate": 9.373284773447259e-05, | |
| "loss": 0.7367, | |
| "mean_token_accuracy": 0.8284353613853455, | |
| "num_tokens": 1587605.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 0.6450383067131042, | |
| "epoch": 0.58, | |
| "grad_norm": 1.4243282079696655, | |
| "learning_rate": 9.258513297012204e-05, | |
| "loss": 0.5896, | |
| "mean_token_accuracy": 0.8545143008232117, | |
| "num_tokens": 1598694.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.6930188536643982, | |
| "epoch": 0.584, | |
| "grad_norm": 1.256988763809204, | |
| "learning_rate": 9.14403530366311e-05, | |
| "loss": 0.6308, | |
| "mean_token_accuracy": 0.8471713662147522, | |
| "num_tokens": 1610716.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 0.5218924283981323, | |
| "epoch": 0.588, | |
| "grad_norm": 1.4413528442382812, | |
| "learning_rate": 9.029870085740649e-05, | |
| "loss": 0.3976, | |
| "mean_token_accuracy": 0.8993197083473206, | |
| "num_tokens": 1621743.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.6881991028785706, | |
| "epoch": 0.592, | |
| "grad_norm": 1.6851704120635986, | |
| "learning_rate": 8.916036882875198e-05, | |
| "loss": 0.5696, | |
| "mean_token_accuracy": 0.8667510151863098, | |
| "num_tokens": 1635186.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.5879225134849548, | |
| "epoch": 0.596, | |
| "grad_norm": 1.0631791353225708, | |
| "learning_rate": 8.802554878744481e-05, | |
| "loss": 0.5184, | |
| "mean_token_accuracy": 0.8734765648841858, | |
| "num_tokens": 1647660.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 0.2675434947013855, | |
| "epoch": 0.6, | |
| "grad_norm": 0.8148598670959473, | |
| "learning_rate": 8.689443197840636e-05, | |
| "loss": 0.1821, | |
| "mean_token_accuracy": 0.9514302015304565, | |
| "num_tokens": 1658080.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.7003239989280701, | |
| "epoch": 0.604, | |
| "grad_norm": 2.1313421726226807, | |
| "learning_rate": 8.576720902247291e-05, | |
| "loss": 0.7331, | |
| "mean_token_accuracy": 0.8224857449531555, | |
| "num_tokens": 1668622.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.3838817775249481, | |
| "epoch": 0.608, | |
| "grad_norm": 1.2568340301513672, | |
| "learning_rate": 8.464406988427134e-05, | |
| "loss": 0.3143, | |
| "mean_token_accuracy": 0.9187853336334229, | |
| "num_tokens": 1678536.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.5554172992706299, | |
| "epoch": 0.612, | |
| "grad_norm": 2.047208786010742, | |
| "learning_rate": 8.352520384020535e-05, | |
| "loss": 0.5846, | |
| "mean_token_accuracy": 0.8602444529533386, | |
| "num_tokens": 1690974.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.45566004514694214, | |
| "epoch": 0.616, | |
| "grad_norm": 1.319417953491211, | |
| "learning_rate": 8.241079944655776e-05, | |
| "loss": 0.429, | |
| "mean_token_accuracy": 0.8949615955352783, | |
| "num_tokens": 1702686.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.592678964138031, | |
| "epoch": 0.62, | |
| "grad_norm": 1.4309483766555786, | |
| "learning_rate": 8.130104450771434e-05, | |
| "loss": 0.5834, | |
| "mean_token_accuracy": 0.8569459319114685, | |
| "num_tokens": 1712845.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.6900731921195984, | |
| "epoch": 0.624, | |
| "grad_norm": 1.4166367053985596, | |
| "learning_rate": 8.019612604451394e-05, | |
| "loss": 0.5856, | |
| "mean_token_accuracy": 0.8577383160591125, | |
| "num_tokens": 1723883.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.6701188087463379, | |
| "epoch": 0.628, | |
| "grad_norm": 1.5286020040512085, | |
| "learning_rate": 7.909623026273107e-05, | |
| "loss": 0.5537, | |
| "mean_token_accuracy": 0.8609554767608643, | |
| "num_tokens": 1733702.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.6067744493484497, | |
| "epoch": 0.632, | |
| "grad_norm": 1.2828212976455688, | |
| "learning_rate": 7.80015425216956e-05, | |
| "loss": 0.5559, | |
| "mean_token_accuracy": 0.8636751770973206, | |
| "num_tokens": 1744245.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.510319173336029, | |
| "epoch": 0.636, | |
| "grad_norm": 1.2530028820037842, | |
| "learning_rate": 7.69122473030552e-05, | |
| "loss": 0.4339, | |
| "mean_token_accuracy": 0.8923482894897461, | |
| "num_tokens": 1755617.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 0.5396801829338074, | |
| "epoch": 0.64, | |
| "grad_norm": 1.4599785804748535, | |
| "learning_rate": 7.582852817968576e-05, | |
| "loss": 0.4212, | |
| "mean_token_accuracy": 0.8964771628379822, | |
| "num_tokens": 1766718.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.5178655385971069, | |
| "epoch": 0.644, | |
| "grad_norm": 1.1682523488998413, | |
| "learning_rate": 7.475056778475469e-05, | |
| "loss": 0.4751, | |
| "mean_token_accuracy": 0.8846276998519897, | |
| "num_tokens": 1776107.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.48712846636772156, | |
| "epoch": 0.648, | |
| "grad_norm": 1.3003511428833008, | |
| "learning_rate": 7.367854778094291e-05, | |
| "loss": 0.4654, | |
| "mean_token_accuracy": 0.8929698467254639, | |
| "num_tokens": 1786564.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.3912014961242676, | |
| "epoch": 0.652, | |
| "grad_norm": 1.110151767730713, | |
| "learning_rate": 7.261264882983024e-05, | |
| "loss": 0.3429, | |
| "mean_token_accuracy": 0.915362536907196, | |
| "num_tokens": 1798771.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.55037522315979, | |
| "epoch": 0.656, | |
| "grad_norm": 1.7164385318756104, | |
| "learning_rate": 7.155305056144937e-05, | |
| "loss": 0.5739, | |
| "mean_token_accuracy": 0.8635889291763306, | |
| "num_tokens": 1811228.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.47252118587493896, | |
| "epoch": 0.66, | |
| "grad_norm": 1.010840654373169, | |
| "learning_rate": 7.0499931544014e-05, | |
| "loss": 0.4453, | |
| "mean_token_accuracy": 0.890230119228363, | |
| "num_tokens": 1822745.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.4593927264213562, | |
| "epoch": 0.664, | |
| "grad_norm": 1.1940021514892578, | |
| "learning_rate": 6.94534692538256e-05, | |
| "loss": 0.3447, | |
| "mean_token_accuracy": 0.9129361510276794, | |
| "num_tokens": 1834497.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.5545728802680969, | |
| "epoch": 0.668, | |
| "grad_norm": 1.5106139183044434, | |
| "learning_rate": 6.841384004536434e-05, | |
| "loss": 0.5047, | |
| "mean_token_accuracy": 0.8748116493225098, | |
| "num_tokens": 1841800.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.4316740036010742, | |
| "epoch": 0.672, | |
| "grad_norm": 1.1023913621902466, | |
| "learning_rate": 6.738121912156914e-05, | |
| "loss": 0.3654, | |
| "mean_token_accuracy": 0.9105084538459778, | |
| "num_tokens": 1855077.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.5366147756576538, | |
| "epoch": 0.676, | |
| "grad_norm": 1.2672346830368042, | |
| "learning_rate": 6.63557805043115e-05, | |
| "loss": 0.4416, | |
| "mean_token_accuracy": 0.8936067819595337, | |
| "num_tokens": 1865465.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.5674976110458374, | |
| "epoch": 0.68, | |
| "grad_norm": 1.43003249168396, | |
| "learning_rate": 6.533769700506875e-05, | |
| "loss": 0.4565, | |
| "mean_token_accuracy": 0.8876559138298035, | |
| "num_tokens": 1875650.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.49446940422058105, | |
| "epoch": 0.684, | |
| "grad_norm": 1.2005430459976196, | |
| "learning_rate": 6.4327140195801e-05, | |
| "loss": 0.417, | |
| "mean_token_accuracy": 0.9007508158683777, | |
| "num_tokens": 1885375.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.6743717193603516, | |
| "epoch": 0.688, | |
| "grad_norm": 1.4010748863220215, | |
| "learning_rate": 6.332428038003706e-05, | |
| "loss": 0.637, | |
| "mean_token_accuracy": 0.8471227884292603, | |
| "num_tokens": 1896412.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.49895045161247253, | |
| "epoch": 0.692, | |
| "grad_norm": 1.7875854969024658, | |
| "learning_rate": 6.232928656417416e-05, | |
| "loss": 0.449, | |
| "mean_token_accuracy": 0.8918893933296204, | |
| "num_tokens": 1907116.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.3326154351234436, | |
| "epoch": 0.696, | |
| "grad_norm": 0.9512577652931213, | |
| "learning_rate": 6.134232642899626e-05, | |
| "loss": 0.2697, | |
| "mean_token_accuracy": 0.9238321781158447, | |
| "num_tokens": 1917201.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.4969325065612793, | |
| "epoch": 0.7, | |
| "grad_norm": 1.3267816305160522, | |
| "learning_rate": 6.036356630141565e-05, | |
| "loss": 0.4614, | |
| "mean_token_accuracy": 0.8914347887039185, | |
| "num_tokens": 1929205.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.5694164037704468, | |
| "epoch": 0.704, | |
| "grad_norm": 1.334541916847229, | |
| "learning_rate": 5.9393171126443005e-05, | |
| "loss": 0.5125, | |
| "mean_token_accuracy": 0.8812792301177979, | |
| "num_tokens": 1942246.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 0.658866286277771, | |
| "epoch": 0.708, | |
| "grad_norm": 1.2868497371673584, | |
| "learning_rate": 5.843130443938983e-05, | |
| "loss": 0.6569, | |
| "mean_token_accuracy": 0.8416849374771118, | |
| "num_tokens": 1956397.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 0.7168298959732056, | |
| "epoch": 0.712, | |
| "grad_norm": 1.1754109859466553, | |
| "learning_rate": 5.747812833830895e-05, | |
| "loss": 0.7006, | |
| "mean_token_accuracy": 0.8340783715248108, | |
| "num_tokens": 1967808.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.7076151967048645, | |
| "epoch": 0.716, | |
| "grad_norm": 1.5503113269805908, | |
| "learning_rate": 5.653380345667705e-05, | |
| "loss": 0.616, | |
| "mean_token_accuracy": 0.8446282148361206, | |
| "num_tokens": 1980869.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.7145153880119324, | |
| "epoch": 0.72, | |
| "grad_norm": 1.6007428169250488, | |
| "learning_rate": 5.559848893632385e-05, | |
| "loss": 0.6182, | |
| "mean_token_accuracy": 0.8411088585853577, | |
| "num_tokens": 1992703.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.698581337928772, | |
| "epoch": 0.724, | |
| "grad_norm": 1.5277796983718872, | |
| "learning_rate": 5.467234240061293e-05, | |
| "loss": 0.6196, | |
| "mean_token_accuracy": 0.8507580757141113, | |
| "num_tokens": 2001543.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.5171747803688049, | |
| "epoch": 0.728, | |
| "grad_norm": 1.39127516746521, | |
| "learning_rate": 5.375551992787835e-05, | |
| "loss": 0.3984, | |
| "mean_token_accuracy": 0.9049353003501892, | |
| "num_tokens": 2011980.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.509817898273468, | |
| "epoch": 0.732, | |
| "grad_norm": 1.0949788093566895, | |
| "learning_rate": 5.2848176025121535e-05, | |
| "loss": 0.4335, | |
| "mean_token_accuracy": 0.8921334147453308, | |
| "num_tokens": 2024516.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.4842955470085144, | |
| "epoch": 0.736, | |
| "grad_norm": 1.3567887544631958, | |
| "learning_rate": 5.195046360197325e-05, | |
| "loss": 0.4199, | |
| "mean_token_accuracy": 0.8933181762695312, | |
| "num_tokens": 2035054.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.48027482628822327, | |
| "epoch": 0.74, | |
| "grad_norm": 1.9636229276657104, | |
| "learning_rate": 5.106253394492435e-05, | |
| "loss": 0.4542, | |
| "mean_token_accuracy": 0.8890615105628967, | |
| "num_tokens": 2044710.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.47678428888320923, | |
| "epoch": 0.744, | |
| "grad_norm": 1.8577853441238403, | |
| "learning_rate": 5.0184536691830476e-05, | |
| "loss": 0.4531, | |
| "mean_token_accuracy": 0.8908271789550781, | |
| "num_tokens": 2056922.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.4041728079319, | |
| "epoch": 0.748, | |
| "grad_norm": 1.4495080709457397, | |
| "learning_rate": 4.931661980669439e-05, | |
| "loss": 0.3819, | |
| "mean_token_accuracy": 0.9036104083061218, | |
| "num_tokens": 2068834.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 0.3090624511241913, | |
| "epoch": 0.752, | |
| "grad_norm": 1.0853344202041626, | |
| "learning_rate": 4.845892955473038e-05, | |
| "loss": 0.291, | |
| "mean_token_accuracy": 0.9313488006591797, | |
| "num_tokens": 2080795.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.5363933444023132, | |
| "epoch": 0.756, | |
| "grad_norm": 1.2786738872528076, | |
| "learning_rate": 4.7611610477715026e-05, | |
| "loss": 0.5352, | |
| "mean_token_accuracy": 0.867972731590271, | |
| "num_tokens": 2093711.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.48970481753349304, | |
| "epoch": 0.76, | |
| "grad_norm": 1.483815312385559, | |
| "learning_rate": 4.6774805369628324e-05, | |
| "loss": 0.3646, | |
| "mean_token_accuracy": 0.9098596572875977, | |
| "num_tokens": 2104474.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.5898410081863403, | |
| "epoch": 0.764, | |
| "grad_norm": 1.2790271043777466, | |
| "learning_rate": 4.59486552525896e-05, | |
| "loss": 0.5362, | |
| "mean_token_accuracy": 0.8709191083908081, | |
| "num_tokens": 2114431.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 0.7715857028961182, | |
| "epoch": 0.768, | |
| "grad_norm": 1.4260997772216797, | |
| "learning_rate": 4.51332993530915e-05, | |
| "loss": 0.688, | |
| "mean_token_accuracy": 0.8307946920394897, | |
| "num_tokens": 2125922.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 0.5289206504821777, | |
| "epoch": 0.772, | |
| "grad_norm": 1.214869499206543, | |
| "learning_rate": 4.43288750785373e-05, | |
| "loss": 0.4668, | |
| "mean_token_accuracy": 0.8906829953193665, | |
| "num_tokens": 2136700.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.4115394949913025, | |
| "epoch": 0.776, | |
| "grad_norm": 1.061026930809021, | |
| "learning_rate": 4.3535517994084064e-05, | |
| "loss": 0.333, | |
| "mean_token_accuracy": 0.9176801443099976, | |
| "num_tokens": 2148789.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.4777131974697113, | |
| "epoch": 0.78, | |
| "grad_norm": 1.1228642463684082, | |
| "learning_rate": 4.275336179979683e-05, | |
| "loss": 0.4044, | |
| "mean_token_accuracy": 0.9039993286132812, | |
| "num_tokens": 2161093.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.42037472128868103, | |
| "epoch": 0.784, | |
| "grad_norm": 1.2192764282226562, | |
| "learning_rate": 4.198253830811677e-05, | |
| "loss": 0.3361, | |
| "mean_token_accuracy": 0.9074494242668152, | |
| "num_tokens": 2172116.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.549899160861969, | |
| "epoch": 0.788, | |
| "grad_norm": 1.4125242233276367, | |
| "learning_rate": 4.12231774216476e-05, | |
| "loss": 0.4924, | |
| "mean_token_accuracy": 0.879365086555481, | |
| "num_tokens": 2181883.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.42284148931503296, | |
| "epoch": 0.792, | |
| "grad_norm": 1.1463818550109863, | |
| "learning_rate": 4.0475407111263817e-05, | |
| "loss": 0.3531, | |
| "mean_token_accuracy": 0.9119821190834045, | |
| "num_tokens": 2194871.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.5124052166938782, | |
| "epoch": 0.796, | |
| "grad_norm": 1.7839992046356201, | |
| "learning_rate": 3.9739353394544477e-05, | |
| "loss": 0.4233, | |
| "mean_token_accuracy": 0.898973286151886, | |
| "num_tokens": 2204613.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.46030405163764954, | |
| "epoch": 0.8, | |
| "grad_norm": 1.3598767518997192, | |
| "learning_rate": 3.901514031453619e-05, | |
| "loss": 0.4143, | |
| "mean_token_accuracy": 0.9042191505432129, | |
| "num_tokens": 2215494.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.5470673441886902, | |
| "epoch": 0.804, | |
| "grad_norm": 1.4430607557296753, | |
| "learning_rate": 3.830288991884876e-05, | |
| "loss": 0.527, | |
| "mean_token_accuracy": 0.8680225610733032, | |
| "num_tokens": 2224543.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 0.43841931223869324, | |
| "epoch": 0.808, | |
| "grad_norm": 1.203965187072754, | |
| "learning_rate": 3.7602722239087204e-05, | |
| "loss": 0.4137, | |
| "mean_token_accuracy": 0.894135594367981, | |
| "num_tokens": 2236362.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.4509918987751007, | |
| "epoch": 0.812, | |
| "grad_norm": 1.2725450992584229, | |
| "learning_rate": 3.691475527062352e-05, | |
| "loss": 0.4209, | |
| "mean_token_accuracy": 0.8999525308609009, | |
| "num_tokens": 2246899.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 0.5433053970336914, | |
| "epoch": 0.816, | |
| "grad_norm": 1.3696599006652832, | |
| "learning_rate": 3.6239104952711543e-05, | |
| "loss": 0.463, | |
| "mean_token_accuracy": 0.8843159079551697, | |
| "num_tokens": 2254992.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.5255707502365112, | |
| "epoch": 0.82, | |
| "grad_norm": 1.202747106552124, | |
| "learning_rate": 3.557588514894843e-05, | |
| "loss": 0.453, | |
| "mean_token_accuracy": 0.8915954232215881, | |
| "num_tokens": 2268213.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.5911931395530701, | |
| "epoch": 0.824, | |
| "grad_norm": 1.4482736587524414, | |
| "learning_rate": 3.492520762808572e-05, | |
| "loss": 0.4987, | |
| "mean_token_accuracy": 0.8807631134986877, | |
| "num_tokens": 2279537.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 0.4150068759918213, | |
| "epoch": 0.828, | |
| "grad_norm": 1.2278997898101807, | |
| "learning_rate": 3.428718204519369e-05, | |
| "loss": 0.2919, | |
| "mean_token_accuracy": 0.9287025928497314, | |
| "num_tokens": 2292611.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 0.3332892954349518, | |
| "epoch": 0.832, | |
| "grad_norm": 1.3437390327453613, | |
| "learning_rate": 3.366191592318176e-05, | |
| "loss": 0.2095, | |
| "mean_token_accuracy": 0.9491567015647888, | |
| "num_tokens": 2304886.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 0.6497487425804138, | |
| "epoch": 0.836, | |
| "grad_norm": 1.673365831375122, | |
| "learning_rate": 3.3049514634678204e-05, | |
| "loss": 0.6501, | |
| "mean_token_accuracy": 0.8420344591140747, | |
| "num_tokens": 2313067.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 0.6357022523880005, | |
| "epoch": 0.84, | |
| "grad_norm": 1.2789956331253052, | |
| "learning_rate": 3.245008138427235e-05, | |
| "loss": 0.5881, | |
| "mean_token_accuracy": 0.8542210459709167, | |
| "num_tokens": 2327248.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.5384138226509094, | |
| "epoch": 0.844, | |
| "grad_norm": 1.6131337881088257, | |
| "learning_rate": 3.186371719112206e-05, | |
| "loss": 0.5152, | |
| "mean_token_accuracy": 0.8732239007949829, | |
| "num_tokens": 2339918.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 0.5150956511497498, | |
| "epoch": 0.848, | |
| "grad_norm": 1.2851109504699707, | |
| "learning_rate": 3.1290520871929525e-05, | |
| "loss": 0.4407, | |
| "mean_token_accuracy": 0.8878676295280457, | |
| "num_tokens": 2350800.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 0.5567672252655029, | |
| "epoch": 0.852, | |
| "grad_norm": 1.4837950468063354, | |
| "learning_rate": 3.0730589024288226e-05, | |
| "loss": 0.4587, | |
| "mean_token_accuracy": 0.8859366774559021, | |
| "num_tokens": 2364163.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 0.5855469107627869, | |
| "epoch": 0.856, | |
| "grad_norm": 1.4510327577590942, | |
| "learning_rate": 3.0184016010403938e-05, | |
| "loss": 0.5231, | |
| "mean_token_accuracy": 0.8731569647789001, | |
| "num_tokens": 2373389.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 0.42299529910087585, | |
| "epoch": 0.86, | |
| "grad_norm": 1.2330726385116577, | |
| "learning_rate": 2.965089394119227e-05, | |
| "loss": 0.332, | |
| "mean_token_accuracy": 0.9186156392097473, | |
| "num_tokens": 2387116.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.43762826919555664, | |
| "epoch": 0.864, | |
| "grad_norm": 1.1993961334228516, | |
| "learning_rate": 2.9131312660755904e-05, | |
| "loss": 0.3706, | |
| "mean_token_accuracy": 0.9101641178131104, | |
| "num_tokens": 2399062.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 0.5866155624389648, | |
| "epoch": 0.868, | |
| "grad_norm": 1.4377245903015137, | |
| "learning_rate": 2.8625359731243486e-05, | |
| "loss": 0.4993, | |
| "mean_token_accuracy": 0.8804880380630493, | |
| "num_tokens": 2410703.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 0.5209600329399109, | |
| "epoch": 0.872, | |
| "grad_norm": 1.2498382329940796, | |
| "learning_rate": 2.8133120418093347e-05, | |
| "loss": 0.4693, | |
| "mean_token_accuracy": 0.8875941634178162, | |
| "num_tokens": 2420660.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 0.4361816346645355, | |
| "epoch": 0.876, | |
| "grad_norm": 1.188899040222168, | |
| "learning_rate": 2.765467767566422e-05, | |
| "loss": 0.3418, | |
| "mean_token_accuracy": 0.9192692637443542, | |
| "num_tokens": 2430460.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 0.5995680093765259, | |
| "epoch": 0.88, | |
| "grad_norm": 1.4681471586227417, | |
| "learning_rate": 2.7190112133255337e-05, | |
| "loss": 0.5184, | |
| "mean_token_accuracy": 0.8720136284828186, | |
| "num_tokens": 2439838.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.5519295930862427, | |
| "epoch": 0.884, | |
| "grad_norm": 1.2246594429016113, | |
| "learning_rate": 2.673950208151847e-05, | |
| "loss": 0.477, | |
| "mean_token_accuracy": 0.8802193403244019, | |
| "num_tokens": 2450234.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 0.6201585531234741, | |
| "epoch": 0.888, | |
| "grad_norm": 1.4758093357086182, | |
| "learning_rate": 2.6302923459264006e-05, | |
| "loss": 0.5529, | |
| "mean_token_accuracy": 0.8612440228462219, | |
| "num_tokens": 2460686.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 0.5428203344345093, | |
| "epoch": 0.892, | |
| "grad_norm": 1.0732289552688599, | |
| "learning_rate": 2.5880449840663413e-05, | |
| "loss": 0.4952, | |
| "mean_token_accuracy": 0.8789449334144592, | |
| "num_tokens": 2473806.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 0.5736177563667297, | |
| "epoch": 0.896, | |
| "grad_norm": 1.1641875505447388, | |
| "learning_rate": 2.547215242285026e-05, | |
| "loss": 0.5083, | |
| "mean_token_accuracy": 0.8738900423049927, | |
| "num_tokens": 2486646.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 0.3208327293395996, | |
| "epoch": 0.9, | |
| "grad_norm": 1.3467357158660889, | |
| "learning_rate": 2.507810001392163e-05, | |
| "loss": 0.2289, | |
| "mean_token_accuracy": 0.9426351189613342, | |
| "num_tokens": 2495399.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.43385663628578186, | |
| "epoch": 0.904, | |
| "grad_norm": 1.3956007957458496, | |
| "learning_rate": 2.469835902134236e-05, | |
| "loss": 0.3405, | |
| "mean_token_accuracy": 0.9122757315635681, | |
| "num_tokens": 2505934.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 0.399286150932312, | |
| "epoch": 0.908, | |
| "grad_norm": 1.0955601930618286, | |
| "learning_rate": 2.4332993440753746e-05, | |
| "loss": 0.322, | |
| "mean_token_accuracy": 0.9209378957748413, | |
| "num_tokens": 2518091.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 0.5215837955474854, | |
| "epoch": 0.912, | |
| "grad_norm": 1.1155186891555786, | |
| "learning_rate": 2.398206484518871e-05, | |
| "loss": 0.4673, | |
| "mean_token_accuracy": 0.8811452984809875, | |
| "num_tokens": 2532657.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 0.5278834104537964, | |
| "epoch": 0.916, | |
| "grad_norm": 1.7340788841247559, | |
| "learning_rate": 2.3645632374695246e-05, | |
| "loss": 0.4788, | |
| "mean_token_accuracy": 0.8789379596710205, | |
| "num_tokens": 2542150.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 0.47815102338790894, | |
| "epoch": 0.92, | |
| "grad_norm": 1.61054265499115, | |
| "learning_rate": 2.3323752726369835e-05, | |
| "loss": 0.442, | |
| "mean_token_accuracy": 0.8940832614898682, | |
| "num_tokens": 2554473.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.4165140390396118, | |
| "epoch": 0.924, | |
| "grad_norm": 1.14963698387146, | |
| "learning_rate": 2.3016480144802675e-05, | |
| "loss": 0.328, | |
| "mean_token_accuracy": 0.9183060526847839, | |
| "num_tokens": 2564794.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 0.38186386227607727, | |
| "epoch": 0.928, | |
| "grad_norm": 1.187225580215454, | |
| "learning_rate": 2.272386641293606e-05, | |
| "loss": 0.3076, | |
| "mean_token_accuracy": 0.9227842688560486, | |
| "num_tokens": 2574522.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 0.46965232491493225, | |
| "epoch": 0.932, | |
| "grad_norm": 1.2771713733673096, | |
| "learning_rate": 2.2445960843337744e-05, | |
| "loss": 0.3789, | |
| "mean_token_accuracy": 0.9045142531394958, | |
| "num_tokens": 2587793.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 0.39393627643585205, | |
| "epoch": 0.936, | |
| "grad_norm": 1.0977147817611694, | |
| "learning_rate": 2.218281026989053e-05, | |
| "loss": 0.2874, | |
| "mean_token_accuracy": 0.933529257774353, | |
| "num_tokens": 2597664.0, | |
| "step": 234 | |
| }, | |
| { | |
| "entropy": 0.4673425555229187, | |
| "epoch": 0.94, | |
| "grad_norm": 1.0229376554489136, | |
| "learning_rate": 2.1934459039899662e-05, | |
| "loss": 0.3796, | |
| "mean_token_accuracy": 0.9101356267929077, | |
| "num_tokens": 2611676.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 0.3621935546398163, | |
| "epoch": 0.944, | |
| "grad_norm": 1.1729012727737427, | |
| "learning_rate": 2.1700949006619168e-05, | |
| "loss": 0.2125, | |
| "mean_token_accuracy": 0.9498928785324097, | |
| "num_tokens": 2622415.0, | |
| "step": 236 | |
| }, | |
| { | |
| "entropy": 0.47119855880737305, | |
| "epoch": 0.948, | |
| "grad_norm": 1.2110202312469482, | |
| "learning_rate": 2.1482319522198588e-05, | |
| "loss": 0.3581, | |
| "mean_token_accuracy": 0.9117594957351685, | |
| "num_tokens": 2633693.0, | |
| "step": 237 | |
| }, | |
| { | |
| "entropy": 0.6427318453788757, | |
| "epoch": 0.952, | |
| "grad_norm": 1.4238137006759644, | |
| "learning_rate": 2.127860743105119e-05, | |
| "loss": 0.6113, | |
| "mean_token_accuracy": 0.8502632975578308, | |
| "num_tokens": 2646798.0, | |
| "step": 238 | |
| }, | |
| { | |
| "entropy": 0.6078838109970093, | |
| "epoch": 0.956, | |
| "grad_norm": 1.5493922233581543, | |
| "learning_rate": 2.108984706364474e-05, | |
| "loss": 0.5309, | |
| "mean_token_accuracy": 0.874631941318512, | |
| "num_tokens": 2657329.0, | |
| "step": 239 | |
| }, | |
| { | |
| "entropy": 0.4323933720588684, | |
| "epoch": 0.96, | |
| "grad_norm": 1.1048017740249634, | |
| "learning_rate": 2.0916070230716063e-05, | |
| "loss": 0.3455, | |
| "mean_token_accuracy": 0.9157264232635498, | |
| "num_tokens": 2668853.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.6867014169692993, | |
| "epoch": 0.964, | |
| "grad_norm": 1.5176868438720703, | |
| "learning_rate": 2.0757306217910032e-05, | |
| "loss": 0.7058, | |
| "mean_token_accuracy": 0.8293052911758423, | |
| "num_tokens": 2680068.0, | |
| "step": 241 | |
| }, | |
| { | |
| "entropy": 0.4175410568714142, | |
| "epoch": 0.968, | |
| "grad_norm": 1.427336573600769, | |
| "learning_rate": 2.0613581780844353e-05, | |
| "loss": 0.3294, | |
| "mean_token_accuracy": 0.9166304469108582, | |
| "num_tokens": 2689270.0, | |
| "step": 242 | |
| }, | |
| { | |
| "entropy": 0.30933189392089844, | |
| "epoch": 0.972, | |
| "grad_norm": 1.0740463733673096, | |
| "learning_rate": 2.048492114060048e-05, | |
| "loss": 0.2382, | |
| "mean_token_accuracy": 0.9348580837249756, | |
| "num_tokens": 2701077.0, | |
| "step": 243 | |
| }, | |
| { | |
| "entropy": 0.4613304138183594, | |
| "epoch": 0.976, | |
| "grad_norm": 1.318914532661438, | |
| "learning_rate": 2.037134597964185e-05, | |
| "loss": 0.4104, | |
| "mean_token_accuracy": 0.8936565518379211, | |
| "num_tokens": 2711846.0, | |
| "step": 244 | |
| }, | |
| { | |
| "entropy": 0.4268723130226135, | |
| "epoch": 0.98, | |
| "grad_norm": 1.142288327217102, | |
| "learning_rate": 2.0272875438159798e-05, | |
| "loss": 0.3691, | |
| "mean_token_accuracy": 0.9119612574577332, | |
| "num_tokens": 2725467.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 0.5718749165534973, | |
| "epoch": 0.984, | |
| "grad_norm": 1.352400541305542, | |
| "learning_rate": 2.018952611084803e-05, | |
| "loss": 0.4803, | |
| "mean_token_accuracy": 0.8806823492050171, | |
| "num_tokens": 2735962.0, | |
| "step": 246 | |
| }, | |
| { | |
| "entropy": 0.4914339780807495, | |
| "epoch": 0.988, | |
| "grad_norm": 1.3557024002075195, | |
| "learning_rate": 2.012131204410593e-05, | |
| "loss": 0.4089, | |
| "mean_token_accuracy": 0.8950228095054626, | |
| "num_tokens": 2745166.0, | |
| "step": 247 | |
| }, | |
| { | |
| "entropy": 0.3986694812774658, | |
| "epoch": 0.992, | |
| "grad_norm": 1.19772469997406, | |
| "learning_rate": 2.0068244733671478e-05, | |
| "loss": 0.283, | |
| "mean_token_accuracy": 0.9307823777198792, | |
| "num_tokens": 2757477.0, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 0.49750185012817383, | |
| "epoch": 0.996, | |
| "grad_norm": 1.2758872509002686, | |
| "learning_rate": 2.0030333122683887e-05, | |
| "loss": 0.4291, | |
| "mean_token_accuracy": 0.8971313834190369, | |
| "num_tokens": 2767414.0, | |
| "step": 249 | |
| }, | |
| { | |
| "entropy": 0.41299375891685486, | |
| "epoch": 1.0, | |
| "grad_norm": 1.3803913593292236, | |
| "learning_rate": 2.0007583600176482e-05, | |
| "loss": 0.3336, | |
| "mean_token_accuracy": 0.9214777946472168, | |
| "num_tokens": 2777133.0, | |
| "step": 250 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 250, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.78349455918081e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |