{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 250, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.0973353385925293, "epoch": 0.004, "grad_norm": 56.63088607788086, "learning_rate": 0.0, "loss": 8.81, "mean_token_accuracy": 0.1589217633008957, "num_tokens": 11020.0, "step": 1 }, { "entropy": 2.359926462173462, "epoch": 0.008, "grad_norm": 48.76058578491211, "learning_rate": 2.5e-05, "loss": 7.5185, "mean_token_accuracy": 0.20284946262836456, "num_tokens": 21059.0, "step": 2 }, { "entropy": 2.3848068714141846, "epoch": 0.012, "grad_norm": 51.160762786865234, "learning_rate": 5e-05, "loss": 8.4107, "mean_token_accuracy": 0.1458083838224411, "num_tokens": 31081.0, "step": 3 }, { "entropy": 2.5165743827819824, "epoch": 0.016, "grad_norm": 57.92226028442383, "learning_rate": 7.500000000000001e-05, "loss": 8.7345, "mean_token_accuracy": 0.10784424096345901, "num_tokens": 39994.0, "step": 4 }, { "entropy": 3.0336835384368896, "epoch": 0.02, "grad_norm": 42.479244232177734, "learning_rate": 0.0001, "loss": 6.6625, "mean_token_accuracy": 0.15363158285617828, "num_tokens": 49317.0, "step": 5 }, { "entropy": 3.2910828590393066, "epoch": 0.024, "grad_norm": 35.47465515136719, "learning_rate": 0.000125, "loss": 5.5297, "mean_token_accuracy": 0.2194845825433731, "num_tokens": 60805.0, "step": 6 }, { "entropy": 2.9953644275665283, "epoch": 0.028, "grad_norm": 24.23429298400879, "learning_rate": 0.00015000000000000001, "loss": 3.7, "mean_token_accuracy": 0.40734514594078064, "num_tokens": 72706.0, "step": 7 }, { "entropy": 2.88269305229187, "epoch": 0.032, "grad_norm": 25.993759155273438, "learning_rate": 0.000175, "loss": 2.7163, "mean_token_accuracy": 0.5192126631736755, "num_tokens": 85460.0, "step": 8 }, { "entropy": 2.2315902709960938, "epoch": 0.036, "grad_norm": 11.012210845947266, "learning_rate": 0.0002, "loss": 2.1933, "mean_token_accuracy": 0.5909518003463745, "num_tokens": 99299.0, "step": 9 }, { "entropy": 1.8418952226638794, "epoch": 0.04, "grad_norm": 5.978642463684082, "learning_rate": 0.00019999241639982352, "loss": 2.1315, "mean_token_accuracy": 0.6005287170410156, "num_tokens": 112919.0, "step": 10 }, { "entropy": 1.6634621620178223, "epoch": 0.044, "grad_norm": 5.048736572265625, "learning_rate": 0.00019996966687731613, "loss": 2.092, "mean_token_accuracy": 0.6170734763145447, "num_tokens": 121074.0, "step": 11 }, { "entropy": 1.4140448570251465, "epoch": 0.048, "grad_norm": 3.720097303390503, "learning_rate": 0.00019993175526632852, "loss": 1.7816, "mean_token_accuracy": 0.6572261452674866, "num_tokens": 132057.0, "step": 12 }, { "entropy": 1.261852502822876, "epoch": 0.052, "grad_norm": 2.3393256664276123, "learning_rate": 0.0001998786879558941, "loss": 1.4815, "mean_token_accuracy": 0.6984454989433289, "num_tokens": 144153.0, "step": 13 }, { "entropy": 1.5389002561569214, "epoch": 0.056, "grad_norm": 1.971347451210022, "learning_rate": 0.00019981047388915196, "loss": 1.6526, "mean_token_accuracy": 0.6537265777587891, "num_tokens": 154768.0, "step": 14 }, { "entropy": 1.3573092222213745, "epoch": 0.06, "grad_norm": 1.3137863874435425, "learning_rate": 0.00019972712456184022, "loss": 1.3945, "mean_token_accuracy": 0.6989641189575195, "num_tokens": 165968.0, "step": 15 }, { "entropy": 1.477573037147522, "epoch": 0.064, "grad_norm": 1.0724811553955078, "learning_rate": 0.00019962865402035814, "loss": 1.5077, "mean_token_accuracy": 0.6758458614349365, "num_tokens": 176610.0, "step": 16 }, { "entropy": 1.062203288078308, "epoch": 0.068, "grad_norm": 0.7103755474090576, "learning_rate": 0.00019951507885939952, "loss": 1.1178, "mean_token_accuracy": 0.7602011561393738, "num_tokens": 188743.0, "step": 17 }, { "entropy": 1.2973206043243408, "epoch": 0.072, "grad_norm": 0.6334678530693054, "learning_rate": 0.00019938641821915564, "loss": 1.3933, "mean_token_accuracy": 0.7131435871124268, "num_tokens": 201253.0, "step": 18 }, { "entropy": 1.3070148229599, "epoch": 0.076, "grad_norm": 0.708212673664093, "learning_rate": 0.00019924269378208997, "loss": 1.3897, "mean_token_accuracy": 0.6967664361000061, "num_tokens": 211244.0, "step": 19 }, { "entropy": 1.4724856615066528, "epoch": 0.08, "grad_norm": 0.6635432839393616, "learning_rate": 0.00019908392976928396, "loss": 1.5634, "mean_token_accuracy": 0.6638235449790955, "num_tokens": 221446.0, "step": 20 }, { "entropy": 1.0885224342346191, "epoch": 0.084, "grad_norm": 0.535370409488678, "learning_rate": 0.0001989101529363553, "loss": 1.1798, "mean_token_accuracy": 0.7438462376594543, "num_tokens": 232945.0, "step": 21 }, { "entropy": 1.2113245725631714, "epoch": 0.088, "grad_norm": 0.5345674753189087, "learning_rate": 0.00019872139256894885, "loss": 1.2599, "mean_token_accuracy": 0.7245048880577087, "num_tokens": 243753.0, "step": 22 }, { "entropy": 1.2911491394042969, "epoch": 0.092, "grad_norm": 0.5416544079780579, "learning_rate": 0.00019851768047780144, "loss": 1.3408, "mean_token_accuracy": 0.7001619338989258, "num_tokens": 256105.0, "step": 23 }, { "entropy": 1.128836750984192, "epoch": 0.096, "grad_norm": 0.48422297835350037, "learning_rate": 0.00019829905099338086, "loss": 1.1527, "mean_token_accuracy": 0.748742938041687, "num_tokens": 269432.0, "step": 24 }, { "entropy": 1.5081233978271484, "epoch": 0.1, "grad_norm": 0.5165230631828308, "learning_rate": 0.00019806554096010035, "loss": 1.4886, "mean_token_accuracy": 0.680823802947998, "num_tokens": 279582.0, "step": 25 }, { "entropy": 1.3273299932479858, "epoch": 0.104, "grad_norm": 0.534648597240448, "learning_rate": 0.00019781718973010948, "loss": 1.2789, "mean_token_accuracy": 0.7176167964935303, "num_tokens": 292021.0, "step": 26 }, { "entropy": 1.508842945098877, "epoch": 0.108, "grad_norm": 0.4762946665287018, "learning_rate": 0.00019755403915666227, "loss": 1.4154, "mean_token_accuracy": 0.6926988959312439, "num_tokens": 303035.0, "step": 27 }, { "entropy": 1.5553829669952393, "epoch": 0.112, "grad_norm": 0.5048977732658386, "learning_rate": 0.00019727613358706396, "loss": 1.4793, "mean_token_accuracy": 0.683097779750824, "num_tokens": 311456.0, "step": 28 }, { "entropy": 1.1076712608337402, "epoch": 0.116, "grad_norm": 0.40861934423446655, "learning_rate": 0.00019698351985519735, "loss": 1.0217, "mean_token_accuracy": 0.7810451984405518, "num_tokens": 323666.0, "step": 29 }, { "entropy": 1.2993760108947754, "epoch": 0.12, "grad_norm": 0.4528363049030304, "learning_rate": 0.00019667624727363019, "loss": 1.2028, "mean_token_accuracy": 0.7430762052536011, "num_tokens": 334753.0, "step": 30 }, { "entropy": 1.3225066661834717, "epoch": 0.124, "grad_norm": 0.5367140173912048, "learning_rate": 0.0001963543676253048, "loss": 1.2189, "mean_token_accuracy": 0.7315188050270081, "num_tokens": 343683.0, "step": 31 }, { "entropy": 1.677242398262024, "epoch": 0.128, "grad_norm": 0.4724753201007843, "learning_rate": 0.0001960179351548113, "loss": 1.602, "mean_token_accuracy": 0.6546955108642578, "num_tokens": 357496.0, "step": 32 }, { "entropy": 0.9450194239616394, "epoch": 0.132, "grad_norm": 0.4643884003162384, "learning_rate": 0.00019566700655924626, "loss": 0.9468, "mean_token_accuracy": 0.7905657291412354, "num_tokens": 369306.0, "step": 33 }, { "entropy": 1.4320679903030396, "epoch": 0.136, "grad_norm": 0.4968578815460205, "learning_rate": 0.00019530164097865768, "loss": 1.4105, "mean_token_accuracy": 0.6940935254096985, "num_tokens": 381024.0, "step": 34 }, { "entropy": 1.4245866537094116, "epoch": 0.14, "grad_norm": 0.40614748001098633, "learning_rate": 0.0001949218999860784, "loss": 1.4487, "mean_token_accuracy": 0.6868099570274353, "num_tokens": 392891.0, "step": 35 }, { "entropy": 1.1022300720214844, "epoch": 0.144, "grad_norm": 0.3792162835597992, "learning_rate": 0.00019452784757714974, "loss": 1.1092, "mean_token_accuracy": 0.761519730091095, "num_tokens": 404395.0, "step": 36 }, { "entropy": 1.097092628479004, "epoch": 0.148, "grad_norm": 0.4267388880252838, "learning_rate": 0.00019411955015933657, "loss": 1.1114, "mean_token_accuracy": 0.7575680613517761, "num_tokens": 416190.0, "step": 37 }, { "entropy": 1.1763945817947388, "epoch": 0.152, "grad_norm": 0.49878817796707153, "learning_rate": 0.00019369707654073601, "loss": 1.2312, "mean_token_accuracy": 0.7294224500656128, "num_tokens": 428329.0, "step": 38 }, { "entropy": 1.103309154510498, "epoch": 0.156, "grad_norm": 0.5332479476928711, "learning_rate": 0.00019326049791848154, "loss": 1.0894, "mean_token_accuracy": 0.7563456892967224, "num_tokens": 438062.0, "step": 39 }, { "entropy": 1.3513190746307373, "epoch": 0.16, "grad_norm": 0.665856122970581, "learning_rate": 0.00019280988786674467, "loss": 1.4117, "mean_token_accuracy": 0.6817158460617065, "num_tokens": 446503.0, "step": 40 }, { "entropy": 1.1249470710754395, "epoch": 0.164, "grad_norm": 0.44063600897789, "learning_rate": 0.0001923453223243358, "loss": 1.1345, "mean_token_accuracy": 0.7451761960983276, "num_tokens": 457544.0, "step": 41 }, { "entropy": 1.139631986618042, "epoch": 0.168, "grad_norm": 0.5003185272216797, "learning_rate": 0.00019186687958190667, "loss": 1.1346, "mean_token_accuracy": 0.7483499050140381, "num_tokens": 467091.0, "step": 42 }, { "entropy": 0.9406906962394714, "epoch": 0.172, "grad_norm": 0.6294145584106445, "learning_rate": 0.00019137464026875654, "loss": 0.9044, "mean_token_accuracy": 0.7882066965103149, "num_tokens": 475318.0, "step": 43 }, { "entropy": 1.039001703262329, "epoch": 0.176, "grad_norm": 0.4918760657310486, "learning_rate": 0.0001908686873392441, "loss": 1.0364, "mean_token_accuracy": 0.7681604623794556, "num_tokens": 485741.0, "step": 44 }, { "entropy": 1.1919207572937012, "epoch": 0.18, "grad_norm": 0.5181702971458435, "learning_rate": 0.00019034910605880776, "loss": 1.1167, "mean_token_accuracy": 0.7450622916221619, "num_tokens": 498907.0, "step": 45 }, { "entropy": 1.003733515739441, "epoch": 0.184, "grad_norm": 0.5143950581550598, "learning_rate": 0.0001898159839895961, "loss": 0.963, "mean_token_accuracy": 0.7841158509254456, "num_tokens": 510304.0, "step": 46 }, { "entropy": 1.3185124397277832, "epoch": 0.188, "grad_norm": 0.5639718174934387, "learning_rate": 0.00018926941097571182, "loss": 1.268, "mean_token_accuracy": 0.7116304039955139, "num_tokens": 521389.0, "step": 47 }, { "entropy": 1.1227295398712158, "epoch": 0.192, "grad_norm": 0.6089756488800049, "learning_rate": 0.00018870947912807048, "loss": 1.0814, "mean_token_accuracy": 0.7578927874565125, "num_tokens": 532097.0, "step": 48 }, { "entropy": 1.2459306716918945, "epoch": 0.196, "grad_norm": 0.7441679239273071, "learning_rate": 0.00018813628280887795, "loss": 1.2047, "mean_token_accuracy": 0.7300441861152649, "num_tokens": 541382.0, "step": 49 }, { "entropy": 1.0864311456680298, "epoch": 0.2, "grad_norm": 0.5735241174697876, "learning_rate": 0.00018754991861572766, "loss": 1.0827, "mean_token_accuracy": 0.7548420429229736, "num_tokens": 551039.0, "step": 50 }, { "entropy": 0.9783708453178406, "epoch": 0.204, "grad_norm": 0.6659897565841675, "learning_rate": 0.00018695048536532182, "loss": 0.978, "mean_token_accuracy": 0.7748624682426453, "num_tokens": 562856.0, "step": 51 }, { "entropy": 1.0906152725219727, "epoch": 0.208, "grad_norm": 0.5842542052268982, "learning_rate": 0.00018633808407681827, "loss": 1.1066, "mean_token_accuracy": 0.7530777454376221, "num_tokens": 575692.0, "step": 52 }, { "entropy": 1.1353249549865723, "epoch": 0.212, "grad_norm": 1.0452736616134644, "learning_rate": 0.0001857128179548063, "loss": 1.2501, "mean_token_accuracy": 0.7129384875297546, "num_tokens": 587040.0, "step": 53 }, { "entropy": 1.1658884286880493, "epoch": 0.216, "grad_norm": 0.7569848299026489, "learning_rate": 0.0001850747923719143, "loss": 1.1789, "mean_token_accuracy": 0.7339466214179993, "num_tokens": 598130.0, "step": 54 }, { "entropy": 0.9339560866355896, "epoch": 0.22, "grad_norm": 0.6351683139801025, "learning_rate": 0.0001844241148510516, "loss": 0.9055, "mean_token_accuracy": 0.7876133322715759, "num_tokens": 611259.0, "step": 55 }, { "entropy": 1.1959530115127563, "epoch": 0.224, "grad_norm": 0.8705658912658691, "learning_rate": 0.00018376089504728847, "loss": 1.1617, "mean_token_accuracy": 0.7372428774833679, "num_tokens": 622686.0, "step": 56 }, { "entropy": 1.2461718320846558, "epoch": 0.228, "grad_norm": 0.8680962324142456, "learning_rate": 0.0001830852447293765, "loss": 1.1835, "mean_token_accuracy": 0.7315577864646912, "num_tokens": 632638.0, "step": 57 }, { "entropy": 1.1705292463302612, "epoch": 0.232, "grad_norm": 0.7268466353416443, "learning_rate": 0.00018239727776091282, "loss": 1.1152, "mean_token_accuracy": 0.7414857745170593, "num_tokens": 643974.0, "step": 58 }, { "entropy": 1.153640866279602, "epoch": 0.236, "grad_norm": 0.7480162978172302, "learning_rate": 0.00018169711008115126, "loss": 1.1153, "mean_token_accuracy": 0.7440808415412903, "num_tokens": 654366.0, "step": 59 }, { "entropy": 1.097459077835083, "epoch": 0.24, "grad_norm": 0.7212317585945129, "learning_rate": 0.00018098485968546385, "loss": 1.0895, "mean_token_accuracy": 0.7482320666313171, "num_tokens": 666105.0, "step": 60 }, { "entropy": 1.05923593044281, "epoch": 0.244, "grad_norm": 0.8075670599937439, "learning_rate": 0.00018026064660545552, "loss": 1.067, "mean_token_accuracy": 0.7528573870658875, "num_tokens": 676781.0, "step": 61 }, { "entropy": 1.0399152040481567, "epoch": 0.248, "grad_norm": 0.9833256602287292, "learning_rate": 0.00017952459288873623, "loss": 1.0939, "mean_token_accuracy": 0.7464929819107056, "num_tokens": 686763.0, "step": 62 }, { "entropy": 1.0377105474472046, "epoch": 0.252, "grad_norm": 0.852209210395813, "learning_rate": 0.00017877682257835242, "loss": 1.0704, "mean_token_accuracy": 0.7448949217796326, "num_tokens": 700085.0, "step": 63 }, { "entropy": 0.8170187473297119, "epoch": 0.256, "grad_norm": 0.8792871832847595, "learning_rate": 0.00017801746169188328, "loss": 0.6947, "mean_token_accuracy": 0.833350419998169, "num_tokens": 709832.0, "step": 64 }, { "entropy": 1.0612165927886963, "epoch": 0.26, "grad_norm": 0.8374829888343811, "learning_rate": 0.0001772466382002032, "loss": 0.9753, "mean_token_accuracy": 0.7734495401382446, "num_tokens": 720847.0, "step": 65 }, { "entropy": 1.0511215925216675, "epoch": 0.264, "grad_norm": 0.8725335001945496, "learning_rate": 0.00017646448200591596, "loss": 1.0397, "mean_token_accuracy": 0.7560197710990906, "num_tokens": 732768.0, "step": 66 }, { "entropy": 1.16708242893219, "epoch": 0.268, "grad_norm": 0.9981763958930969, "learning_rate": 0.0001756711249214627, "loss": 1.2386, "mean_token_accuracy": 0.7174420952796936, "num_tokens": 743044.0, "step": 67 }, { "entropy": 0.9941532611846924, "epoch": 0.272, "grad_norm": 0.9159516096115112, "learning_rate": 0.0001748667006469085, "loss": 0.9769, "mean_token_accuracy": 0.7736346125602722, "num_tokens": 752915.0, "step": 68 }, { "entropy": 0.9163703322410583, "epoch": 0.276, "grad_norm": 0.7718108892440796, "learning_rate": 0.0001740513447474104, "loss": 0.8858, "mean_token_accuracy": 0.79206782579422, "num_tokens": 765070.0, "step": 69 }, { "entropy": 1.043192744255066, "epoch": 0.28, "grad_norm": 0.7897371649742126, "learning_rate": 0.00017322519463037168, "loss": 1.0291, "mean_token_accuracy": 0.7658995985984802, "num_tokens": 776110.0, "step": 70 }, { "entropy": 0.8629508018493652, "epoch": 0.284, "grad_norm": 0.8085194230079651, "learning_rate": 0.00017238838952228502, "loss": 0.8871, "mean_token_accuracy": 0.7935369610786438, "num_tokens": 786850.0, "step": 71 }, { "entropy": 1.0944290161132812, "epoch": 0.288, "grad_norm": 0.9569735527038574, "learning_rate": 0.00017154107044526964, "loss": 1.0377, "mean_token_accuracy": 0.7588126063346863, "num_tokens": 796554.0, "step": 72 }, { "entropy": 0.7297062277793884, "epoch": 0.292, "grad_norm": 0.9553439021110535, "learning_rate": 0.00017068338019330564, "loss": 0.6367, "mean_token_accuracy": 0.8526090979576111, "num_tokens": 806387.0, "step": 73 }, { "entropy": 0.9341362714767456, "epoch": 0.296, "grad_norm": 0.9124618768692017, "learning_rate": 0.00016981546330816953, "loss": 0.8903, "mean_token_accuracy": 0.7885122299194336, "num_tokens": 816626.0, "step": 74 }, { "entropy": 0.5450064539909363, "epoch": 0.3, "grad_norm": 0.8968790769577026, "learning_rate": 0.0001689374660550757, "loss": 0.625, "mean_token_accuracy": 0.8518457412719727, "num_tokens": 828737.0, "step": 75 }, { "entropy": 0.7374886870384216, "epoch": 0.304, "grad_norm": 1.0030460357666016, "learning_rate": 0.00016804953639802677, "loss": 0.7191, "mean_token_accuracy": 0.8276105523109436, "num_tokens": 840068.0, "step": 76 }, { "entropy": 0.7412508130073547, "epoch": 0.308, "grad_norm": 1.2331219911575317, "learning_rate": 0.00016715182397487844, "loss": 0.8017, "mean_token_accuracy": 0.8093528151512146, "num_tokens": 851489.0, "step": 77 }, { "entropy": 1.0338571071624756, "epoch": 0.312, "grad_norm": 0.9198253154754639, "learning_rate": 0.00016624448007212167, "loss": 1.0164, "mean_token_accuracy": 0.7691991329193115, "num_tokens": 863640.0, "step": 78 }, { "entropy": 0.9462264776229858, "epoch": 0.316, "grad_norm": 0.7652691602706909, "learning_rate": 0.0001653276575993871, "loss": 0.9116, "mean_token_accuracy": 0.7878068089485168, "num_tokens": 878798.0, "step": 79 }, { "entropy": 1.003931999206543, "epoch": 0.32, "grad_norm": 0.9275044202804565, "learning_rate": 0.0001644015110636762, "loss": 0.9505, "mean_token_accuracy": 0.774969220161438, "num_tokens": 889363.0, "step": 80 }, { "entropy": 0.708422839641571, "epoch": 0.324, "grad_norm": 0.9531024694442749, "learning_rate": 0.00016346619654332298, "loss": 0.6343, "mean_token_accuracy": 0.8398601412773132, "num_tokens": 899375.0, "step": 81 }, { "entropy": 1.028533935546875, "epoch": 0.328, "grad_norm": 0.9965426921844482, "learning_rate": 0.00016252187166169107, "loss": 0.9782, "mean_token_accuracy": 0.7718014121055603, "num_tokens": 908803.0, "step": 82 }, { "entropy": 0.7851366400718689, "epoch": 0.332, "grad_norm": 0.8076054453849792, "learning_rate": 0.0001615686955606102, "loss": 0.765, "mean_token_accuracy": 0.8145228028297424, "num_tokens": 920855.0, "step": 83 }, { "entropy": 0.9262005090713501, "epoch": 0.336, "grad_norm": 0.9758970737457275, "learning_rate": 0.000160606828873557, "loss": 0.9151, "mean_token_accuracy": 0.7844375371932983, "num_tokens": 931151.0, "step": 84 }, { "entropy": 0.6350160837173462, "epoch": 0.34, "grad_norm": 1.0767849683761597, "learning_rate": 0.00015963643369858437, "loss": 0.7041, "mean_token_accuracy": 0.8317089080810547, "num_tokens": 940387.0, "step": 85 }, { "entropy": 0.9434180855751038, "epoch": 0.344, "grad_norm": 1.190125823020935, "learning_rate": 0.0001586576735710038, "loss": 0.9578, "mean_token_accuracy": 0.7776371240615845, "num_tokens": 949869.0, "step": 86 }, { "entropy": 0.8093811273574829, "epoch": 0.348, "grad_norm": 0.9406972527503967, "learning_rate": 0.00015767071343582588, "loss": 0.7415, "mean_token_accuracy": 0.8234021663665771, "num_tokens": 959118.0, "step": 87 }, { "entropy": 0.7648224234580994, "epoch": 0.352, "grad_norm": 0.7738968729972839, "learning_rate": 0.00015667571961996296, "loss": 0.7306, "mean_token_accuracy": 0.8252065181732178, "num_tokens": 971466.0, "step": 88 }, { "entropy": 0.659711480140686, "epoch": 0.356, "grad_norm": 0.801194965839386, "learning_rate": 0.000155672859804199, "loss": 0.6591, "mean_token_accuracy": 0.8405287265777588, "num_tokens": 983119.0, "step": 89 }, { "entropy": 0.9075393080711365, "epoch": 0.36, "grad_norm": 1.1619821786880493, "learning_rate": 0.00015466230299493125, "loss": 0.8609, "mean_token_accuracy": 0.7937808632850647, "num_tokens": 992640.0, "step": 90 }, { "entropy": 0.7225161790847778, "epoch": 0.364, "grad_norm": 0.9581741690635681, "learning_rate": 0.00015364421949568853, "loss": 0.688, "mean_token_accuracy": 0.8366522192955017, "num_tokens": 1003037.0, "step": 91 }, { "entropy": 0.7597986459732056, "epoch": 0.368, "grad_norm": 1.0615458488464355, "learning_rate": 0.00015261878087843085, "loss": 0.7226, "mean_token_accuracy": 0.824986457824707, "num_tokens": 1014101.0, "step": 92 }, { "entropy": 0.6454391479492188, "epoch": 0.372, "grad_norm": 0.9587013721466064, "learning_rate": 0.00015158615995463566, "loss": 0.6641, "mean_token_accuracy": 0.8425232172012329, "num_tokens": 1025311.0, "step": 93 }, { "entropy": 0.8424079418182373, "epoch": 0.376, "grad_norm": 1.2206848859786987, "learning_rate": 0.00015054653074617443, "loss": 0.9094, "mean_token_accuracy": 0.7876355648040771, "num_tokens": 1037024.0, "step": 94 }, { "entropy": 0.8714436292648315, "epoch": 0.38, "grad_norm": 1.2640056610107422, "learning_rate": 0.00014950006845598603, "loss": 0.8689, "mean_token_accuracy": 0.7946674823760986, "num_tokens": 1046815.0, "step": 95 }, { "entropy": 0.5807708501815796, "epoch": 0.384, "grad_norm": 0.8595563173294067, "learning_rate": 0.00014844694943855067, "loss": 0.5039, "mean_token_accuracy": 0.8740711212158203, "num_tokens": 1056775.0, "step": 96 }, { "entropy": 0.6972081661224365, "epoch": 0.388, "grad_norm": 0.8816290497779846, "learning_rate": 0.00014738735117016978, "loss": 0.6369, "mean_token_accuracy": 0.8466954827308655, "num_tokens": 1067429.0, "step": 97 }, { "entropy": 0.5604634881019592, "epoch": 0.392, "grad_norm": 0.9110663533210754, "learning_rate": 0.0001463214522190571, "loss": 0.501, "mean_token_accuracy": 0.8726220726966858, "num_tokens": 1078838.0, "step": 98 }, { "entropy": 0.8191442489624023, "epoch": 0.396, "grad_norm": 1.2301007509231567, "learning_rate": 0.00014524943221524533, "loss": 0.8723, "mean_token_accuracy": 0.7879535555839539, "num_tokens": 1089781.0, "step": 99 }, { "entropy": 0.9090349674224854, "epoch": 0.4, "grad_norm": 1.0221482515335083, "learning_rate": 0.00014417147182031428, "loss": 0.8904, "mean_token_accuracy": 0.7897399067878723, "num_tokens": 1102239.0, "step": 100 }, { "entropy": 0.6675378084182739, "epoch": 0.404, "grad_norm": 1.0766475200653076, "learning_rate": 0.0001430877526969448, "loss": 0.5804, "mean_token_accuracy": 0.8515596985816956, "num_tokens": 1113397.0, "step": 101 }, { "entropy": 0.6440110802650452, "epoch": 0.408, "grad_norm": 0.9045482873916626, "learning_rate": 0.00014199845747830446, "loss": 0.6087, "mean_token_accuracy": 0.8539875149726868, "num_tokens": 1125261.0, "step": 102 }, { "entropy": 0.8418194651603699, "epoch": 0.412, "grad_norm": 1.4091824293136597, "learning_rate": 0.00014090376973726896, "loss": 0.9077, "mean_token_accuracy": 0.7805910706520081, "num_tokens": 1136598.0, "step": 103 }, { "entropy": 0.7668788433074951, "epoch": 0.416, "grad_norm": 1.2579201459884644, "learning_rate": 0.00013980387395548608, "loss": 0.8016, "mean_token_accuracy": 0.8103581070899963, "num_tokens": 1146988.0, "step": 104 }, { "entropy": 0.9310951232910156, "epoch": 0.42, "grad_norm": 1.0861616134643555, "learning_rate": 0.0001386989554922857, "loss": 0.9118, "mean_token_accuracy": 0.7869442701339722, "num_tokens": 1157269.0, "step": 105 }, { "entropy": 0.48249903321266174, "epoch": 0.424, "grad_norm": 1.08878755569458, "learning_rate": 0.00013758920055344226, "loss": 0.3668, "mean_token_accuracy": 0.9031632542610168, "num_tokens": 1167071.0, "step": 106 }, { "entropy": 0.689582884311676, "epoch": 0.428, "grad_norm": 1.249678611755371, "learning_rate": 0.00013647479615979468, "loss": 0.581, "mean_token_accuracy": 0.8578310608863831, "num_tokens": 1175584.0, "step": 107 }, { "entropy": 0.5986989736557007, "epoch": 0.432, "grad_norm": 0.9662414193153381, "learning_rate": 0.0001353559301157287, "loss": 0.5368, "mean_token_accuracy": 0.8663188219070435, "num_tokens": 1187278.0, "step": 108 }, { "entropy": 0.9165630340576172, "epoch": 0.436, "grad_norm": 1.785701036453247, "learning_rate": 0.00013423279097752713, "loss": 1.015, "mean_token_accuracy": 0.7645655870437622, "num_tokens": 1196085.0, "step": 109 }, { "entropy": 0.6729641556739807, "epoch": 0.44, "grad_norm": 1.1485984325408936, "learning_rate": 0.0001331055680215937, "loss": 0.6846, "mean_token_accuracy": 0.8309648633003235, "num_tokens": 1209457.0, "step": 110 }, { "entropy": 0.5594127178192139, "epoch": 0.444, "grad_norm": 0.9643635153770447, "learning_rate": 0.00013197445121255523, "loss": 0.5453, "mean_token_accuracy": 0.8717948794364929, "num_tokens": 1219482.0, "step": 111 }, { "entropy": 0.8685882687568665, "epoch": 0.448, "grad_norm": 1.0649855136871338, "learning_rate": 0.00013083963117124802, "loss": 0.8078, "mean_token_accuracy": 0.8030028939247131, "num_tokens": 1232205.0, "step": 112 }, { "entropy": 0.6931924223899841, "epoch": 0.452, "grad_norm": 1.0093775987625122, "learning_rate": 0.00012970129914259356, "loss": 0.6155, "mean_token_accuracy": 0.8536151647567749, "num_tokens": 1242331.0, "step": 113 }, { "entropy": 0.940833568572998, "epoch": 0.456, "grad_norm": 1.1867045164108276, "learning_rate": 0.00012855964696336896, "loss": 0.9769, "mean_token_accuracy": 0.7758588790893555, "num_tokens": 1253219.0, "step": 114 }, { "entropy": 0.644160270690918, "epoch": 0.46, "grad_norm": 1.0405246019363403, "learning_rate": 0.00012741486702987797, "loss": 0.5985, "mean_token_accuracy": 0.853334367275238, "num_tokens": 1266012.0, "step": 115 }, { "entropy": 0.6467909812927246, "epoch": 0.464, "grad_norm": 1.0041617155075073, "learning_rate": 0.00012626715226552745, "loss": 0.589, "mean_token_accuracy": 0.8532326817512512, "num_tokens": 1278728.0, "step": 116 }, { "entropy": 0.6697924733161926, "epoch": 0.468, "grad_norm": 1.225751519203186, "learning_rate": 0.00012511669608831485, "loss": 0.6097, "mean_token_accuracy": 0.8501642942428589, "num_tokens": 1289989.0, "step": 117 }, { "entropy": 0.5410375595092773, "epoch": 0.472, "grad_norm": 1.1570745706558228, "learning_rate": 0.00012396369237823286, "loss": 0.4868, "mean_token_accuracy": 0.8764288425445557, "num_tokens": 1300139.0, "step": 118 }, { "entropy": 0.7634984254837036, "epoch": 0.476, "grad_norm": 1.26356041431427, "learning_rate": 0.00012280833544459568, "loss": 0.7205, "mean_token_accuracy": 0.8254125118255615, "num_tokens": 1310262.0, "step": 119 }, { "entropy": 0.7683166265487671, "epoch": 0.48, "grad_norm": 1.263581395149231, "learning_rate": 0.0001216508199932932, "loss": 0.8117, "mean_token_accuracy": 0.8081841468811035, "num_tokens": 1322385.0, "step": 120 }, { "entropy": 0.7120152115821838, "epoch": 0.484, "grad_norm": 1.0431994199752808, "learning_rate": 0.00012049134109397832, "loss": 0.6529, "mean_token_accuracy": 0.8445841073989868, "num_tokens": 1337186.0, "step": 121 }, { "entropy": 0.7104185819625854, "epoch": 0.488, "grad_norm": 1.0483670234680176, "learning_rate": 0.00011933009414719301, "loss": 0.7264, "mean_token_accuracy": 0.8267722725868225, "num_tokens": 1349686.0, "step": 122 }, { "entropy": 0.9004740118980408, "epoch": 0.492, "grad_norm": 1.2728326320648193, "learning_rate": 0.0001181672748514383, "loss": 0.8288, "mean_token_accuracy": 0.7991729378700256, "num_tokens": 1361295.0, "step": 123 }, { "entropy": 0.7324482798576355, "epoch": 0.496, "grad_norm": 1.113187313079834, "learning_rate": 0.00011700307917019457, "loss": 0.6708, "mean_token_accuracy": 0.8380022048950195, "num_tokens": 1371328.0, "step": 124 }, { "entropy": 0.4651513993740082, "epoch": 0.5, "grad_norm": 0.9615445733070374, "learning_rate": 0.00011583770329889687, "loss": 0.3927, "mean_token_accuracy": 0.8962194919586182, "num_tokens": 1383577.0, "step": 125 }, { "entropy": 0.7203623056411743, "epoch": 0.504, "grad_norm": 1.9821685552597046, "learning_rate": 0.00011467134363187099, "loss": 0.7477, "mean_token_accuracy": 0.8203157782554626, "num_tokens": 1393079.0, "step": 126 }, { "entropy": 0.6460074186325073, "epoch": 0.508, "grad_norm": 2.170309543609619, "learning_rate": 0.0001135041967292364, "loss": 0.7293, "mean_token_accuracy": 0.8246410489082336, "num_tokens": 1402553.0, "step": 127 }, { "entropy": 0.5284869074821472, "epoch": 0.512, "grad_norm": 1.1976059675216675, "learning_rate": 0.00011233645928378105, "loss": 0.4515, "mean_token_accuracy": 0.8835397362709045, "num_tokens": 1412567.0, "step": 128 }, { "entropy": 0.4933440089225769, "epoch": 0.516, "grad_norm": 1.259605050086975, "learning_rate": 0.00011116832808781378, "loss": 0.4273, "mean_token_accuracy": 0.8937007784843445, "num_tokens": 1424507.0, "step": 129 }, { "entropy": 0.7313682436943054, "epoch": 0.52, "grad_norm": 1.3257278203964233, "learning_rate": 0.00011000000000000002, "loss": 0.6628, "mean_token_accuracy": 0.8386083245277405, "num_tokens": 1433419.0, "step": 130 }, { "entropy": 0.4719448387622833, "epoch": 0.524, "grad_norm": 1.0190857648849487, "learning_rate": 0.00010883167191218624, "loss": 0.394, "mean_token_accuracy": 0.9015878438949585, "num_tokens": 1444568.0, "step": 131 }, { "entropy": 0.671485185623169, "epoch": 0.528, "grad_norm": 1.0616258382797241, "learning_rate": 0.00010766354071621898, "loss": 0.6002, "mean_token_accuracy": 0.8531094193458557, "num_tokens": 1458029.0, "step": 132 }, { "entropy": 0.37650296092033386, "epoch": 0.532, "grad_norm": 1.3387216329574585, "learning_rate": 0.00010649580327076363, "loss": 0.3286, "mean_token_accuracy": 0.9205968379974365, "num_tokens": 1469290.0, "step": 133 }, { "entropy": 0.5341144800186157, "epoch": 0.536, "grad_norm": 1.3382490873336792, "learning_rate": 0.00010532865636812906, "loss": 0.5154, "mean_token_accuracy": 0.8731343150138855, "num_tokens": 1482290.0, "step": 134 }, { "entropy": 0.5627509951591492, "epoch": 0.54, "grad_norm": 1.9341037273406982, "learning_rate": 0.00010416229670110314, "loss": 0.6165, "mean_token_accuracy": 0.8522540330886841, "num_tokens": 1491409.0, "step": 135 }, { "entropy": 0.40396589040756226, "epoch": 0.544, "grad_norm": 1.1782172918319702, "learning_rate": 0.0001029969208298054, "loss": 0.3003, "mean_token_accuracy": 0.9240846037864685, "num_tokens": 1501106.0, "step": 136 }, { "entropy": 0.7882451415061951, "epoch": 0.548, "grad_norm": 1.2071242332458496, "learning_rate": 0.00010183272514856172, "loss": 0.7402, "mean_token_accuracy": 0.8205325603485107, "num_tokens": 1511511.0, "step": 137 }, { "entropy": 0.645850419998169, "epoch": 0.552, "grad_norm": 1.2258726358413696, "learning_rate": 0.00010066990585280704, "loss": 0.6628, "mean_token_accuracy": 0.8416417241096497, "num_tokens": 1523208.0, "step": 138 }, { "entropy": 0.42336830496788025, "epoch": 0.556, "grad_norm": 1.5242387056350708, "learning_rate": 9.95086589060217e-05, "loss": 0.2851, "mean_token_accuracy": 0.9278303980827332, "num_tokens": 1532078.0, "step": 139 }, { "entropy": 0.7408692240715027, "epoch": 0.56, "grad_norm": 1.1541547775268555, "learning_rate": 9.834918000670681e-05, "loss": 0.6626, "mean_token_accuracy": 0.8373293280601501, "num_tokens": 1544092.0, "step": 140 }, { "entropy": 0.5522950887680054, "epoch": 0.564, "grad_norm": 1.2949033975601196, "learning_rate": 9.719166455540436e-05, "loss": 0.4288, "mean_token_accuracy": 0.8930450081825256, "num_tokens": 1554360.0, "step": 141 }, { "entropy": 0.6674742698669434, "epoch": 0.568, "grad_norm": 1.4206823110580444, "learning_rate": 9.603630762176718e-05, "loss": 0.6521, "mean_token_accuracy": 0.8428549766540527, "num_tokens": 1567420.0, "step": 142 }, { "entropy": 0.48524826765060425, "epoch": 0.572, "grad_norm": 2.079292058944702, "learning_rate": 9.488330391168516e-05, "loss": 0.5301, "mean_token_accuracy": 0.8732667565345764, "num_tokens": 1577735.0, "step": 143 }, { "entropy": 0.6761812567710876, "epoch": 0.576, "grad_norm": 2.401937246322632, "learning_rate": 9.373284773447259e-05, "loss": 0.7367, "mean_token_accuracy": 0.8284353613853455, "num_tokens": 1587605.0, "step": 144 }, { "entropy": 0.6450383067131042, "epoch": 0.58, "grad_norm": 1.4243282079696655, "learning_rate": 9.258513297012204e-05, "loss": 0.5896, "mean_token_accuracy": 0.8545143008232117, "num_tokens": 1598694.0, "step": 145 }, { "entropy": 0.6930188536643982, "epoch": 0.584, "grad_norm": 1.256988763809204, "learning_rate": 9.14403530366311e-05, "loss": 0.6308, "mean_token_accuracy": 0.8471713662147522, "num_tokens": 1610716.0, "step": 146 }, { "entropy": 0.5218924283981323, "epoch": 0.588, "grad_norm": 1.4413528442382812, "learning_rate": 9.029870085740649e-05, "loss": 0.3976, "mean_token_accuracy": 0.8993197083473206, "num_tokens": 1621743.0, "step": 147 }, { "entropy": 0.6881991028785706, "epoch": 0.592, "grad_norm": 1.6851704120635986, "learning_rate": 8.916036882875198e-05, "loss": 0.5696, "mean_token_accuracy": 0.8667510151863098, "num_tokens": 1635186.0, "step": 148 }, { "entropy": 0.5879225134849548, "epoch": 0.596, "grad_norm": 1.0631791353225708, "learning_rate": 8.802554878744481e-05, "loss": 0.5184, "mean_token_accuracy": 0.8734765648841858, "num_tokens": 1647660.0, "step": 149 }, { "entropy": 0.2675434947013855, "epoch": 0.6, "grad_norm": 0.8148598670959473, "learning_rate": 8.689443197840636e-05, "loss": 0.1821, "mean_token_accuracy": 0.9514302015304565, "num_tokens": 1658080.0, "step": 150 }, { "entropy": 0.7003239989280701, "epoch": 0.604, "grad_norm": 2.1313421726226807, "learning_rate": 8.576720902247291e-05, "loss": 0.7331, "mean_token_accuracy": 0.8224857449531555, "num_tokens": 1668622.0, "step": 151 }, { "entropy": 0.3838817775249481, "epoch": 0.608, "grad_norm": 1.2568340301513672, "learning_rate": 8.464406988427134e-05, "loss": 0.3143, "mean_token_accuracy": 0.9187853336334229, "num_tokens": 1678536.0, "step": 152 }, { "entropy": 0.5554172992706299, "epoch": 0.612, "grad_norm": 2.047208786010742, "learning_rate": 8.352520384020535e-05, "loss": 0.5846, "mean_token_accuracy": 0.8602444529533386, "num_tokens": 1690974.0, "step": 153 }, { "entropy": 0.45566004514694214, "epoch": 0.616, "grad_norm": 1.319417953491211, "learning_rate": 8.241079944655776e-05, "loss": 0.429, "mean_token_accuracy": 0.8949615955352783, "num_tokens": 1702686.0, "step": 154 }, { "entropy": 0.592678964138031, "epoch": 0.62, "grad_norm": 1.4309483766555786, "learning_rate": 8.130104450771434e-05, "loss": 0.5834, "mean_token_accuracy": 0.8569459319114685, "num_tokens": 1712845.0, "step": 155 }, { "entropy": 0.6900731921195984, "epoch": 0.624, "grad_norm": 1.4166367053985596, "learning_rate": 8.019612604451394e-05, "loss": 0.5856, "mean_token_accuracy": 0.8577383160591125, "num_tokens": 1723883.0, "step": 156 }, { "entropy": 0.6701188087463379, "epoch": 0.628, "grad_norm": 1.5286020040512085, "learning_rate": 7.909623026273107e-05, "loss": 0.5537, "mean_token_accuracy": 0.8609554767608643, "num_tokens": 1733702.0, "step": 157 }, { "entropy": 0.6067744493484497, "epoch": 0.632, "grad_norm": 1.2828212976455688, "learning_rate": 7.80015425216956e-05, "loss": 0.5559, "mean_token_accuracy": 0.8636751770973206, "num_tokens": 1744245.0, "step": 158 }, { "entropy": 0.510319173336029, "epoch": 0.636, "grad_norm": 1.2530028820037842, "learning_rate": 7.69122473030552e-05, "loss": 0.4339, "mean_token_accuracy": 0.8923482894897461, "num_tokens": 1755617.0, "step": 159 }, { "entropy": 0.5396801829338074, "epoch": 0.64, "grad_norm": 1.4599785804748535, "learning_rate": 7.582852817968576e-05, "loss": 0.4212, "mean_token_accuracy": 0.8964771628379822, "num_tokens": 1766718.0, "step": 160 }, { "entropy": 0.5178655385971069, "epoch": 0.644, "grad_norm": 1.1682523488998413, "learning_rate": 7.475056778475469e-05, "loss": 0.4751, "mean_token_accuracy": 0.8846276998519897, "num_tokens": 1776107.0, "step": 161 }, { "entropy": 0.48712846636772156, "epoch": 0.648, "grad_norm": 1.3003511428833008, "learning_rate": 7.367854778094291e-05, "loss": 0.4654, "mean_token_accuracy": 0.8929698467254639, "num_tokens": 1786564.0, "step": 162 }, { "entropy": 0.3912014961242676, "epoch": 0.652, "grad_norm": 1.110151767730713, "learning_rate": 7.261264882983024e-05, "loss": 0.3429, "mean_token_accuracy": 0.915362536907196, "num_tokens": 1798771.0, "step": 163 }, { "entropy": 0.55037522315979, "epoch": 0.656, "grad_norm": 1.7164385318756104, "learning_rate": 7.155305056144937e-05, "loss": 0.5739, "mean_token_accuracy": 0.8635889291763306, "num_tokens": 1811228.0, "step": 164 }, { "entropy": 0.47252118587493896, "epoch": 0.66, "grad_norm": 1.010840654373169, "learning_rate": 7.0499931544014e-05, "loss": 0.4453, "mean_token_accuracy": 0.890230119228363, "num_tokens": 1822745.0, "step": 165 }, { "entropy": 0.4593927264213562, "epoch": 0.664, "grad_norm": 1.1940021514892578, "learning_rate": 6.94534692538256e-05, "loss": 0.3447, "mean_token_accuracy": 0.9129361510276794, "num_tokens": 1834497.0, "step": 166 }, { "entropy": 0.5545728802680969, "epoch": 0.668, "grad_norm": 1.5106139183044434, "learning_rate": 6.841384004536434e-05, "loss": 0.5047, "mean_token_accuracy": 0.8748116493225098, "num_tokens": 1841800.0, "step": 167 }, { "entropy": 0.4316740036010742, "epoch": 0.672, "grad_norm": 1.1023913621902466, "learning_rate": 6.738121912156914e-05, "loss": 0.3654, "mean_token_accuracy": 0.9105084538459778, "num_tokens": 1855077.0, "step": 168 }, { "entropy": 0.5366147756576538, "epoch": 0.676, "grad_norm": 1.2672346830368042, "learning_rate": 6.63557805043115e-05, "loss": 0.4416, "mean_token_accuracy": 0.8936067819595337, "num_tokens": 1865465.0, "step": 169 }, { "entropy": 0.5674976110458374, "epoch": 0.68, "grad_norm": 1.43003249168396, "learning_rate": 6.533769700506875e-05, "loss": 0.4565, "mean_token_accuracy": 0.8876559138298035, "num_tokens": 1875650.0, "step": 170 }, { "entropy": 0.49446940422058105, "epoch": 0.684, "grad_norm": 1.2005430459976196, "learning_rate": 6.4327140195801e-05, "loss": 0.417, "mean_token_accuracy": 0.9007508158683777, "num_tokens": 1885375.0, "step": 171 }, { "entropy": 0.6743717193603516, "epoch": 0.688, "grad_norm": 1.4010748863220215, "learning_rate": 6.332428038003706e-05, "loss": 0.637, "mean_token_accuracy": 0.8471227884292603, "num_tokens": 1896412.0, "step": 172 }, { "entropy": 0.49895045161247253, "epoch": 0.692, "grad_norm": 1.7875854969024658, "learning_rate": 6.232928656417416e-05, "loss": 0.449, "mean_token_accuracy": 0.8918893933296204, "num_tokens": 1907116.0, "step": 173 }, { "entropy": 0.3326154351234436, "epoch": 0.696, "grad_norm": 0.9512577652931213, "learning_rate": 6.134232642899626e-05, "loss": 0.2697, "mean_token_accuracy": 0.9238321781158447, "num_tokens": 1917201.0, "step": 174 }, { "entropy": 0.4969325065612793, "epoch": 0.7, "grad_norm": 1.3267816305160522, "learning_rate": 6.036356630141565e-05, "loss": 0.4614, "mean_token_accuracy": 0.8914347887039185, "num_tokens": 1929205.0, "step": 175 }, { "entropy": 0.5694164037704468, "epoch": 0.704, "grad_norm": 1.334541916847229, "learning_rate": 5.9393171126443005e-05, "loss": 0.5125, "mean_token_accuracy": 0.8812792301177979, "num_tokens": 1942246.0, "step": 176 }, { "entropy": 0.658866286277771, "epoch": 0.708, "grad_norm": 1.2868497371673584, "learning_rate": 5.843130443938983e-05, "loss": 0.6569, "mean_token_accuracy": 0.8416849374771118, "num_tokens": 1956397.0, "step": 177 }, { "entropy": 0.7168298959732056, "epoch": 0.712, "grad_norm": 1.1754109859466553, "learning_rate": 5.747812833830895e-05, "loss": 0.7006, "mean_token_accuracy": 0.8340783715248108, "num_tokens": 1967808.0, "step": 178 }, { "entropy": 0.7076151967048645, "epoch": 0.716, "grad_norm": 1.5503113269805908, "learning_rate": 5.653380345667705e-05, "loss": 0.616, "mean_token_accuracy": 0.8446282148361206, "num_tokens": 1980869.0, "step": 179 }, { "entropy": 0.7145153880119324, "epoch": 0.72, "grad_norm": 1.6007428169250488, "learning_rate": 5.559848893632385e-05, "loss": 0.6182, "mean_token_accuracy": 0.8411088585853577, "num_tokens": 1992703.0, "step": 180 }, { "entropy": 0.698581337928772, "epoch": 0.724, "grad_norm": 1.5277796983718872, "learning_rate": 5.467234240061293e-05, "loss": 0.6196, "mean_token_accuracy": 0.8507580757141113, "num_tokens": 2001543.0, "step": 181 }, { "entropy": 0.5171747803688049, "epoch": 0.728, "grad_norm": 1.39127516746521, "learning_rate": 5.375551992787835e-05, "loss": 0.3984, "mean_token_accuracy": 0.9049353003501892, "num_tokens": 2011980.0, "step": 182 }, { "entropy": 0.509817898273468, "epoch": 0.732, "grad_norm": 1.0949788093566895, "learning_rate": 5.2848176025121535e-05, "loss": 0.4335, "mean_token_accuracy": 0.8921334147453308, "num_tokens": 2024516.0, "step": 183 }, { "entropy": 0.4842955470085144, "epoch": 0.736, "grad_norm": 1.3567887544631958, "learning_rate": 5.195046360197325e-05, "loss": 0.4199, "mean_token_accuracy": 0.8933181762695312, "num_tokens": 2035054.0, "step": 184 }, { "entropy": 0.48027482628822327, "epoch": 0.74, "grad_norm": 1.9636229276657104, "learning_rate": 5.106253394492435e-05, "loss": 0.4542, "mean_token_accuracy": 0.8890615105628967, "num_tokens": 2044710.0, "step": 185 }, { "entropy": 0.47678428888320923, "epoch": 0.744, "grad_norm": 1.8577853441238403, "learning_rate": 5.0184536691830476e-05, "loss": 0.4531, "mean_token_accuracy": 0.8908271789550781, "num_tokens": 2056922.0, "step": 186 }, { "entropy": 0.4041728079319, "epoch": 0.748, "grad_norm": 1.4495080709457397, "learning_rate": 4.931661980669439e-05, "loss": 0.3819, "mean_token_accuracy": 0.9036104083061218, "num_tokens": 2068834.0, "step": 187 }, { "entropy": 0.3090624511241913, "epoch": 0.752, "grad_norm": 1.0853344202041626, "learning_rate": 4.845892955473038e-05, "loss": 0.291, "mean_token_accuracy": 0.9313488006591797, "num_tokens": 2080795.0, "step": 188 }, { "entropy": 0.5363933444023132, "epoch": 0.756, "grad_norm": 1.2786738872528076, "learning_rate": 4.7611610477715026e-05, "loss": 0.5352, "mean_token_accuracy": 0.867972731590271, "num_tokens": 2093711.0, "step": 189 }, { "entropy": 0.48970481753349304, "epoch": 0.76, "grad_norm": 1.483815312385559, "learning_rate": 4.6774805369628324e-05, "loss": 0.3646, "mean_token_accuracy": 0.9098596572875977, "num_tokens": 2104474.0, "step": 190 }, { "entropy": 0.5898410081863403, "epoch": 0.764, "grad_norm": 1.2790271043777466, "learning_rate": 4.59486552525896e-05, "loss": 0.5362, "mean_token_accuracy": 0.8709191083908081, "num_tokens": 2114431.0, "step": 191 }, { "entropy": 0.7715857028961182, "epoch": 0.768, "grad_norm": 1.4260997772216797, "learning_rate": 4.51332993530915e-05, "loss": 0.688, "mean_token_accuracy": 0.8307946920394897, "num_tokens": 2125922.0, "step": 192 }, { "entropy": 0.5289206504821777, "epoch": 0.772, "grad_norm": 1.214869499206543, "learning_rate": 4.43288750785373e-05, "loss": 0.4668, "mean_token_accuracy": 0.8906829953193665, "num_tokens": 2136700.0, "step": 193 }, { "entropy": 0.4115394949913025, "epoch": 0.776, "grad_norm": 1.061026930809021, "learning_rate": 4.3535517994084064e-05, "loss": 0.333, "mean_token_accuracy": 0.9176801443099976, "num_tokens": 2148789.0, "step": 194 }, { "entropy": 0.4777131974697113, "epoch": 0.78, "grad_norm": 1.1228642463684082, "learning_rate": 4.275336179979683e-05, "loss": 0.4044, "mean_token_accuracy": 0.9039993286132812, "num_tokens": 2161093.0, "step": 195 }, { "entropy": 0.42037472128868103, "epoch": 0.784, "grad_norm": 1.2192764282226562, "learning_rate": 4.198253830811677e-05, "loss": 0.3361, "mean_token_accuracy": 0.9074494242668152, "num_tokens": 2172116.0, "step": 196 }, { "entropy": 0.549899160861969, "epoch": 0.788, "grad_norm": 1.4125242233276367, "learning_rate": 4.12231774216476e-05, "loss": 0.4924, "mean_token_accuracy": 0.879365086555481, "num_tokens": 2181883.0, "step": 197 }, { "entropy": 0.42284148931503296, "epoch": 0.792, "grad_norm": 1.1463818550109863, "learning_rate": 4.0475407111263817e-05, "loss": 0.3531, "mean_token_accuracy": 0.9119821190834045, "num_tokens": 2194871.0, "step": 198 }, { "entropy": 0.5124052166938782, "epoch": 0.796, "grad_norm": 1.7839992046356201, "learning_rate": 3.9739353394544477e-05, "loss": 0.4233, "mean_token_accuracy": 0.898973286151886, "num_tokens": 2204613.0, "step": 199 }, { "entropy": 0.46030405163764954, "epoch": 0.8, "grad_norm": 1.3598767518997192, "learning_rate": 3.901514031453619e-05, "loss": 0.4143, "mean_token_accuracy": 0.9042191505432129, "num_tokens": 2215494.0, "step": 200 }, { "entropy": 0.5470673441886902, "epoch": 0.804, "grad_norm": 1.4430607557296753, "learning_rate": 3.830288991884876e-05, "loss": 0.527, "mean_token_accuracy": 0.8680225610733032, "num_tokens": 2224543.0, "step": 201 }, { "entropy": 0.43841931223869324, "epoch": 0.808, "grad_norm": 1.203965187072754, "learning_rate": 3.7602722239087204e-05, "loss": 0.4137, "mean_token_accuracy": 0.894135594367981, "num_tokens": 2236362.0, "step": 202 }, { "entropy": 0.4509918987751007, "epoch": 0.812, "grad_norm": 1.2725450992584229, "learning_rate": 3.691475527062352e-05, "loss": 0.4209, "mean_token_accuracy": 0.8999525308609009, "num_tokens": 2246899.0, "step": 203 }, { "entropy": 0.5433053970336914, "epoch": 0.816, "grad_norm": 1.3696599006652832, "learning_rate": 3.6239104952711543e-05, "loss": 0.463, "mean_token_accuracy": 0.8843159079551697, "num_tokens": 2254992.0, "step": 204 }, { "entropy": 0.5255707502365112, "epoch": 0.82, "grad_norm": 1.202747106552124, "learning_rate": 3.557588514894843e-05, "loss": 0.453, "mean_token_accuracy": 0.8915954232215881, "num_tokens": 2268213.0, "step": 205 }, { "entropy": 0.5911931395530701, "epoch": 0.824, "grad_norm": 1.4482736587524414, "learning_rate": 3.492520762808572e-05, "loss": 0.4987, "mean_token_accuracy": 0.8807631134986877, "num_tokens": 2279537.0, "step": 206 }, { "entropy": 0.4150068759918213, "epoch": 0.828, "grad_norm": 1.2278997898101807, "learning_rate": 3.428718204519369e-05, "loss": 0.2919, "mean_token_accuracy": 0.9287025928497314, "num_tokens": 2292611.0, "step": 207 }, { "entropy": 0.3332892954349518, "epoch": 0.832, "grad_norm": 1.3437390327453613, "learning_rate": 3.366191592318176e-05, "loss": 0.2095, "mean_token_accuracy": 0.9491567015647888, "num_tokens": 2304886.0, "step": 208 }, { "entropy": 0.6497487425804138, "epoch": 0.836, "grad_norm": 1.673365831375122, "learning_rate": 3.3049514634678204e-05, "loss": 0.6501, "mean_token_accuracy": 0.8420344591140747, "num_tokens": 2313067.0, "step": 209 }, { "entropy": 0.6357022523880005, "epoch": 0.84, "grad_norm": 1.2789956331253052, "learning_rate": 3.245008138427235e-05, "loss": 0.5881, "mean_token_accuracy": 0.8542210459709167, "num_tokens": 2327248.0, "step": 210 }, { "entropy": 0.5384138226509094, "epoch": 0.844, "grad_norm": 1.6131337881088257, "learning_rate": 3.186371719112206e-05, "loss": 0.5152, "mean_token_accuracy": 0.8732239007949829, "num_tokens": 2339918.0, "step": 211 }, { "entropy": 0.5150956511497498, "epoch": 0.848, "grad_norm": 1.2851109504699707, "learning_rate": 3.1290520871929525e-05, "loss": 0.4407, "mean_token_accuracy": 0.8878676295280457, "num_tokens": 2350800.0, "step": 212 }, { "entropy": 0.5567672252655029, "epoch": 0.852, "grad_norm": 1.4837950468063354, "learning_rate": 3.0730589024288226e-05, "loss": 0.4587, "mean_token_accuracy": 0.8859366774559021, "num_tokens": 2364163.0, "step": 213 }, { "entropy": 0.5855469107627869, "epoch": 0.856, "grad_norm": 1.4510327577590942, "learning_rate": 3.0184016010403938e-05, "loss": 0.5231, "mean_token_accuracy": 0.8731569647789001, "num_tokens": 2373389.0, "step": 214 }, { "entropy": 0.42299529910087585, "epoch": 0.86, "grad_norm": 1.2330726385116577, "learning_rate": 2.965089394119227e-05, "loss": 0.332, "mean_token_accuracy": 0.9186156392097473, "num_tokens": 2387116.0, "step": 215 }, { "entropy": 0.43762826919555664, "epoch": 0.864, "grad_norm": 1.1993961334228516, "learning_rate": 2.9131312660755904e-05, "loss": 0.3706, "mean_token_accuracy": 0.9101641178131104, "num_tokens": 2399062.0, "step": 216 }, { "entropy": 0.5866155624389648, "epoch": 0.868, "grad_norm": 1.4377245903015137, "learning_rate": 2.8625359731243486e-05, "loss": 0.4993, "mean_token_accuracy": 0.8804880380630493, "num_tokens": 2410703.0, "step": 217 }, { "entropy": 0.5209600329399109, "epoch": 0.872, "grad_norm": 1.2498382329940796, "learning_rate": 2.8133120418093347e-05, "loss": 0.4693, "mean_token_accuracy": 0.8875941634178162, "num_tokens": 2420660.0, "step": 218 }, { "entropy": 0.4361816346645355, "epoch": 0.876, "grad_norm": 1.188899040222168, "learning_rate": 2.765467767566422e-05, "loss": 0.3418, "mean_token_accuracy": 0.9192692637443542, "num_tokens": 2430460.0, "step": 219 }, { "entropy": 0.5995680093765259, "epoch": 0.88, "grad_norm": 1.4681471586227417, "learning_rate": 2.7190112133255337e-05, "loss": 0.5184, "mean_token_accuracy": 0.8720136284828186, "num_tokens": 2439838.0, "step": 220 }, { "entropy": 0.5519295930862427, "epoch": 0.884, "grad_norm": 1.2246594429016113, "learning_rate": 2.673950208151847e-05, "loss": 0.477, "mean_token_accuracy": 0.8802193403244019, "num_tokens": 2450234.0, "step": 221 }, { "entropy": 0.6201585531234741, "epoch": 0.888, "grad_norm": 1.4758093357086182, "learning_rate": 2.6302923459264006e-05, "loss": 0.5529, "mean_token_accuracy": 0.8612440228462219, "num_tokens": 2460686.0, "step": 222 }, { "entropy": 0.5428203344345093, "epoch": 0.892, "grad_norm": 1.0732289552688599, "learning_rate": 2.5880449840663413e-05, "loss": 0.4952, "mean_token_accuracy": 0.8789449334144592, "num_tokens": 2473806.0, "step": 223 }, { "entropy": 0.5736177563667297, "epoch": 0.896, "grad_norm": 1.1641875505447388, "learning_rate": 2.547215242285026e-05, "loss": 0.5083, "mean_token_accuracy": 0.8738900423049927, "num_tokens": 2486646.0, "step": 224 }, { "entropy": 0.3208327293395996, "epoch": 0.9, "grad_norm": 1.3467357158660889, "learning_rate": 2.507810001392163e-05, "loss": 0.2289, "mean_token_accuracy": 0.9426351189613342, "num_tokens": 2495399.0, "step": 225 }, { "entropy": 0.43385663628578186, "epoch": 0.904, "grad_norm": 1.3956007957458496, "learning_rate": 2.469835902134236e-05, "loss": 0.3405, "mean_token_accuracy": 0.9122757315635681, "num_tokens": 2505934.0, "step": 226 }, { "entropy": 0.399286150932312, "epoch": 0.908, "grad_norm": 1.0955601930618286, "learning_rate": 2.4332993440753746e-05, "loss": 0.322, "mean_token_accuracy": 0.9209378957748413, "num_tokens": 2518091.0, "step": 227 }, { "entropy": 0.5215837955474854, "epoch": 0.912, "grad_norm": 1.1155186891555786, "learning_rate": 2.398206484518871e-05, "loss": 0.4673, "mean_token_accuracy": 0.8811452984809875, "num_tokens": 2532657.0, "step": 228 }, { "entropy": 0.5278834104537964, "epoch": 0.916, "grad_norm": 1.7340788841247559, "learning_rate": 2.3645632374695246e-05, "loss": 0.4788, "mean_token_accuracy": 0.8789379596710205, "num_tokens": 2542150.0, "step": 229 }, { "entropy": 0.47815102338790894, "epoch": 0.92, "grad_norm": 1.61054265499115, "learning_rate": 2.3323752726369835e-05, "loss": 0.442, "mean_token_accuracy": 0.8940832614898682, "num_tokens": 2554473.0, "step": 230 }, { "entropy": 0.4165140390396118, "epoch": 0.924, "grad_norm": 1.14963698387146, "learning_rate": 2.3016480144802675e-05, "loss": 0.328, "mean_token_accuracy": 0.9183060526847839, "num_tokens": 2564794.0, "step": 231 }, { "entropy": 0.38186386227607727, "epoch": 0.928, "grad_norm": 1.187225580215454, "learning_rate": 2.272386641293606e-05, "loss": 0.3076, "mean_token_accuracy": 0.9227842688560486, "num_tokens": 2574522.0, "step": 232 }, { "entropy": 0.46965232491493225, "epoch": 0.932, "grad_norm": 1.2771713733673096, "learning_rate": 2.2445960843337744e-05, "loss": 0.3789, "mean_token_accuracy": 0.9045142531394958, "num_tokens": 2587793.0, "step": 233 }, { "entropy": 0.39393627643585205, "epoch": 0.936, "grad_norm": 1.0977147817611694, "learning_rate": 2.218281026989053e-05, "loss": 0.2874, "mean_token_accuracy": 0.933529257774353, "num_tokens": 2597664.0, "step": 234 }, { "entropy": 0.4673425555229187, "epoch": 0.94, "grad_norm": 1.0229376554489136, "learning_rate": 2.1934459039899662e-05, "loss": 0.3796, "mean_token_accuracy": 0.9101356267929077, "num_tokens": 2611676.0, "step": 235 }, { "entropy": 0.3621935546398163, "epoch": 0.944, "grad_norm": 1.1729012727737427, "learning_rate": 2.1700949006619168e-05, "loss": 0.2125, "mean_token_accuracy": 0.9498928785324097, "num_tokens": 2622415.0, "step": 236 }, { "entropy": 0.47119855880737305, "epoch": 0.948, "grad_norm": 1.2110202312469482, "learning_rate": 2.1482319522198588e-05, "loss": 0.3581, "mean_token_accuracy": 0.9117594957351685, "num_tokens": 2633693.0, "step": 237 }, { "entropy": 0.6427318453788757, "epoch": 0.952, "grad_norm": 1.4238137006759644, "learning_rate": 2.127860743105119e-05, "loss": 0.6113, "mean_token_accuracy": 0.8502632975578308, "num_tokens": 2646798.0, "step": 238 }, { "entropy": 0.6078838109970093, "epoch": 0.956, "grad_norm": 1.5493922233581543, "learning_rate": 2.108984706364474e-05, "loss": 0.5309, "mean_token_accuracy": 0.874631941318512, "num_tokens": 2657329.0, "step": 239 }, { "entropy": 0.4323933720588684, "epoch": 0.96, "grad_norm": 1.1048017740249634, "learning_rate": 2.0916070230716063e-05, "loss": 0.3455, "mean_token_accuracy": 0.9157264232635498, "num_tokens": 2668853.0, "step": 240 }, { "entropy": 0.6867014169692993, "epoch": 0.964, "grad_norm": 1.5176868438720703, "learning_rate": 2.0757306217910032e-05, "loss": 0.7058, "mean_token_accuracy": 0.8293052911758423, "num_tokens": 2680068.0, "step": 241 }, { "entropy": 0.4175410568714142, "epoch": 0.968, "grad_norm": 1.427336573600769, "learning_rate": 2.0613581780844353e-05, "loss": 0.3294, "mean_token_accuracy": 0.9166304469108582, "num_tokens": 2689270.0, "step": 242 }, { "entropy": 0.30933189392089844, "epoch": 0.972, "grad_norm": 1.0740463733673096, "learning_rate": 2.048492114060048e-05, "loss": 0.2382, "mean_token_accuracy": 0.9348580837249756, "num_tokens": 2701077.0, "step": 243 }, { "entropy": 0.4613304138183594, "epoch": 0.976, "grad_norm": 1.318914532661438, "learning_rate": 2.037134597964185e-05, "loss": 0.4104, "mean_token_accuracy": 0.8936565518379211, "num_tokens": 2711846.0, "step": 244 }, { "entropy": 0.4268723130226135, "epoch": 0.98, "grad_norm": 1.142288327217102, "learning_rate": 2.0272875438159798e-05, "loss": 0.3691, "mean_token_accuracy": 0.9119612574577332, "num_tokens": 2725467.0, "step": 245 }, { "entropy": 0.5718749165534973, "epoch": 0.984, "grad_norm": 1.352400541305542, "learning_rate": 2.018952611084803e-05, "loss": 0.4803, "mean_token_accuracy": 0.8806823492050171, "num_tokens": 2735962.0, "step": 246 }, { "entropy": 0.4914339780807495, "epoch": 0.988, "grad_norm": 1.3557024002075195, "learning_rate": 2.012131204410593e-05, "loss": 0.4089, "mean_token_accuracy": 0.8950228095054626, "num_tokens": 2745166.0, "step": 247 }, { "entropy": 0.3986694812774658, "epoch": 0.992, "grad_norm": 1.19772469997406, "learning_rate": 2.0068244733671478e-05, "loss": 0.283, "mean_token_accuracy": 0.9307823777198792, "num_tokens": 2757477.0, "step": 248 }, { "entropy": 0.49750185012817383, "epoch": 0.996, "grad_norm": 1.2758872509002686, "learning_rate": 2.0030333122683887e-05, "loss": 0.4291, "mean_token_accuracy": 0.8971313834190369, "num_tokens": 2767414.0, "step": 249 }, { "entropy": 0.41299375891685486, "epoch": 1.0, "grad_norm": 1.3803913593292236, "learning_rate": 2.0007583600176482e-05, "loss": 0.3336, "mean_token_accuracy": 0.9214777946472168, "num_tokens": 2777133.0, "step": 250 } ], "logging_steps": 1, "max_steps": 250, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.78349455918081e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }