{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 103, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3152819871902466, "epoch": 0.009708737864077669, "grad_norm": 1.013494849205017, "learning_rate": 0.0, "loss": 2.06831431388855, "mean_token_accuracy": 0.5338841378688812, "num_tokens": 97105.0, "step": 1 }, { "entropy": 1.3242674767971039, "epoch": 0.019417475728155338, "grad_norm": 1.0874853134155273, "learning_rate": 3.125e-06, "loss": 2.139530658721924, "mean_token_accuracy": 0.5263050831854343, "num_tokens": 192679.0, "step": 2 }, { "entropy": 1.355704814195633, "epoch": 0.02912621359223301, "grad_norm": 0.998701274394989, "learning_rate": 6.25e-06, "loss": 2.0967135429382324, "mean_token_accuracy": 0.525411419570446, "num_tokens": 290599.0, "step": 3 }, { "entropy": 1.4417763948440552, "epoch": 0.038834951456310676, "grad_norm": 0.8833345770835876, "learning_rate": 9.375000000000001e-06, "loss": 2.1067581176757812, "mean_token_accuracy": 0.5188259109854698, "num_tokens": 388130.0, "step": 4 }, { "entropy": 1.4466145783662796, "epoch": 0.04854368932038835, "grad_norm": 0.7175306081771851, "learning_rate": 1.25e-05, "loss": 1.998451590538025, "mean_token_accuracy": 0.5344960391521454, "num_tokens": 485983.0, "step": 5 }, { "entropy": 1.521438479423523, "epoch": 0.05825242718446602, "grad_norm": 0.5840274691581726, "learning_rate": 1.5625e-05, "loss": 1.966963768005371, "mean_token_accuracy": 0.5378070250153542, "num_tokens": 583257.0, "step": 6 }, { "entropy": 1.590747281908989, "epoch": 0.06796116504854369, "grad_norm": 0.5097014904022217, "learning_rate": 1.8750000000000002e-05, "loss": 1.9825010299682617, "mean_token_accuracy": 0.5324273854494095, "num_tokens": 678553.0, "step": 7 }, { "entropy": 1.6503181159496307, "epoch": 0.07766990291262135, "grad_norm": 0.374606192111969, "learning_rate": 2.1875e-05, "loss": 1.8895000219345093, "mean_token_accuracy": 0.5438744276762009, "num_tokens": 774991.0, "step": 8 }, { "entropy": 1.7381516695022583, "epoch": 0.08737864077669903, "grad_norm": 0.3151414096355438, "learning_rate": 2.5e-05, "loss": 1.8734210729599, "mean_token_accuracy": 0.5423448756337166, "num_tokens": 871685.0, "step": 9 }, { "entropy": 1.72954061627388, "epoch": 0.0970873786407767, "grad_norm": 0.26697251200675964, "learning_rate": 2.8125000000000003e-05, "loss": 1.7822761535644531, "mean_token_accuracy": 0.5574369356036186, "num_tokens": 968934.0, "step": 10 }, { "entropy": 1.8142512142658234, "epoch": 0.10679611650485436, "grad_norm": 0.26576197147369385, "learning_rate": 3.125e-05, "loss": 1.7738474607467651, "mean_token_accuracy": 0.5553920194506645, "num_tokens": 1066190.0, "step": 11 }, { "entropy": 1.8880750685930252, "epoch": 0.11650485436893204, "grad_norm": 0.2821778357028961, "learning_rate": 3.4375e-05, "loss": 1.7811144590377808, "mean_token_accuracy": 0.554568275809288, "num_tokens": 1163717.0, "step": 12 }, { "entropy": 1.8850630968809128, "epoch": 0.1262135922330097, "grad_norm": 0.2994160056114197, "learning_rate": 3.7500000000000003e-05, "loss": 1.731427550315857, "mean_token_accuracy": 0.5632588267326355, "num_tokens": 1261260.0, "step": 13 }, { "entropy": 1.9034151881933212, "epoch": 0.13592233009708737, "grad_norm": 0.3169096112251282, "learning_rate": 4.0625000000000005e-05, "loss": 1.7296199798583984, "mean_token_accuracy": 0.5644616037607193, "num_tokens": 1358315.0, "step": 14 }, { "entropy": 1.861739456653595, "epoch": 0.14563106796116504, "grad_norm": 0.3155674636363983, "learning_rate": 4.375e-05, "loss": 1.673210859298706, "mean_token_accuracy": 0.576985627412796, "num_tokens": 1455424.0, "step": 15 }, { "entropy": 1.838089257478714, "epoch": 0.1553398058252427, "grad_norm": 0.30909860134124756, "learning_rate": 4.6875e-05, "loss": 1.6549508571624756, "mean_token_accuracy": 0.5776421800255775, "num_tokens": 1552741.0, "step": 16 }, { "entropy": 1.8052831888198853, "epoch": 0.1650485436893204, "grad_norm": 0.2848927080631256, "learning_rate": 5e-05, "loss": 1.6311283111572266, "mean_token_accuracy": 0.5776514038443565, "num_tokens": 1650044.0, "step": 17 }, { "entropy": 1.7298080027103424, "epoch": 0.17475728155339806, "grad_norm": 0.24145011603832245, "learning_rate": 4.999856295503635e-05, "loss": 1.6070364713668823, "mean_token_accuracy": 0.5808622017502785, "num_tokens": 1747782.0, "step": 18 }, { "entropy": 1.64244344830513, "epoch": 0.18446601941747573, "grad_norm": 0.20389729738235474, "learning_rate": 4.999425198535325e-05, "loss": 1.5785616636276245, "mean_token_accuracy": 0.5904434770345688, "num_tokens": 1845724.0, "step": 19 }, { "entropy": 1.5861433744430542, "epoch": 0.1941747572815534, "grad_norm": 0.1882556676864624, "learning_rate": 4.998706758655528e-05, "loss": 1.561955213546753, "mean_token_accuracy": 0.5861038938164711, "num_tokens": 1943411.0, "step": 20 }, { "entropy": 1.4805333763360977, "epoch": 0.20388349514563106, "grad_norm": 0.19283851981163025, "learning_rate": 4.997701058458676e-05, "loss": 1.510377287864685, "mean_token_accuracy": 0.5976782292127609, "num_tokens": 2041045.0, "step": 21 }, { "entropy": 1.4247176200151443, "epoch": 0.21359223300970873, "grad_norm": 0.2663690149784088, "learning_rate": 4.996408213563684e-05, "loss": 1.5150444507598877, "mean_token_accuracy": 0.5990786626935005, "num_tokens": 2138535.0, "step": 22 }, { "entropy": 1.4107022881507874, "epoch": 0.22330097087378642, "grad_norm": 0.24283358454704285, "learning_rate": 4.994828372600649e-05, "loss": 1.4896345138549805, "mean_token_accuracy": 0.6046600863337517, "num_tokens": 2235538.0, "step": 23 }, { "entropy": 1.3890789598226547, "epoch": 0.23300970873786409, "grad_norm": 0.2506687343120575, "learning_rate": 4.9929617171937724e-05, "loss": 1.4759382009506226, "mean_token_accuracy": 0.6044173762202263, "num_tokens": 2332954.0, "step": 24 }, { "entropy": 1.4158536195755005, "epoch": 0.24271844660194175, "grad_norm": 0.2098265439271927, "learning_rate": 4.9908084619404735e-05, "loss": 1.4671399593353271, "mean_token_accuracy": 0.6056077107787132, "num_tokens": 2431031.0, "step": 25 }, { "entropy": 1.4332131743431091, "epoch": 0.2524271844660194, "grad_norm": 0.17440126836299896, "learning_rate": 4.988368854386722e-05, "loss": 1.4597738981246948, "mean_token_accuracy": 0.6085917800664902, "num_tokens": 2527933.0, "step": 26 }, { "entropy": 1.4164835065603256, "epoch": 0.2621359223300971, "grad_norm": 0.1584484875202179, "learning_rate": 4.985643174998578e-05, "loss": 1.4157624244689941, "mean_token_accuracy": 0.6172334477305412, "num_tokens": 2625130.0, "step": 27 }, { "entropy": 1.448016420006752, "epoch": 0.27184466019417475, "grad_norm": 0.15808650851249695, "learning_rate": 4.982631737129948e-05, "loss": 1.4137294292449951, "mean_token_accuracy": 0.6172233298420906, "num_tokens": 2722735.0, "step": 28 }, { "entropy": 1.4877165704965591, "epoch": 0.2815533980582524, "grad_norm": 0.15937305986881256, "learning_rate": 4.9793348869865616e-05, "loss": 1.4389235973358154, "mean_token_accuracy": 0.6117468476295471, "num_tokens": 2820721.0, "step": 29 }, { "entropy": 1.4804623126983643, "epoch": 0.2912621359223301, "grad_norm": 0.15408481657505035, "learning_rate": 4.9757530035861716e-05, "loss": 1.4307830333709717, "mean_token_accuracy": 0.6147695183753967, "num_tokens": 2918531.0, "step": 30 }, { "entropy": 1.431130662560463, "epoch": 0.30097087378640774, "grad_norm": 0.15174533426761627, "learning_rate": 4.971886498714977e-05, "loss": 1.3788732290267944, "mean_token_accuracy": 0.6244773417711258, "num_tokens": 3014027.0, "step": 31 }, { "entropy": 1.432707354426384, "epoch": 0.3106796116504854, "grad_norm": 0.14417818188667297, "learning_rate": 4.967735816880286e-05, "loss": 1.3854697942733765, "mean_token_accuracy": 0.6244093701243401, "num_tokens": 3111172.0, "step": 32 }, { "entropy": 1.408346712589264, "epoch": 0.32038834951456313, "grad_norm": 0.13806791603565216, "learning_rate": 4.963301435259413e-05, "loss": 1.37909734249115, "mean_token_accuracy": 0.6215110719203949, "num_tokens": 3208860.0, "step": 33 }, { "entropy": 1.3968226611614227, "epoch": 0.3300970873786408, "grad_norm": 0.14189019799232483, "learning_rate": 4.95858386364482e-05, "loss": 1.3762025833129883, "mean_token_accuracy": 0.6241011992096901, "num_tokens": 3305964.0, "step": 34 }, { "entropy": 1.3652866929769516, "epoch": 0.33980582524271846, "grad_norm": 0.13668735325336456, "learning_rate": 4.9535836443855096e-05, "loss": 1.3661797046661377, "mean_token_accuracy": 0.6231197491288185, "num_tokens": 3403337.0, "step": 35 }, { "entropy": 1.3354476243257523, "epoch": 0.34951456310679613, "grad_norm": 0.13242210447788239, "learning_rate": 4.948301352324673e-05, "loss": 1.3337945938110352, "mean_token_accuracy": 0.6336007639765739, "num_tokens": 3500500.0, "step": 36 }, { "entropy": 1.3027702569961548, "epoch": 0.3592233009708738, "grad_norm": 0.12860701978206635, "learning_rate": 4.942737594733609e-05, "loss": 1.3151164054870605, "mean_token_accuracy": 0.6383665949106216, "num_tokens": 3597306.0, "step": 37 }, { "entropy": 1.3396568596363068, "epoch": 0.36893203883495146, "grad_norm": 0.1314004808664322, "learning_rate": 4.9368930112419e-05, "loss": 1.3459738492965698, "mean_token_accuracy": 0.6287253126502037, "num_tokens": 3694352.0, "step": 38 }, { "entropy": 1.331050619482994, "epoch": 0.3786407766990291, "grad_norm": 0.12769116461277008, "learning_rate": 4.930768273763889e-05, "loss": 1.3475216627120972, "mean_token_accuracy": 0.6293819546699524, "num_tokens": 3792464.0, "step": 39 }, { "entropy": 1.328546553850174, "epoch": 0.3883495145631068, "grad_norm": 0.1277284175157547, "learning_rate": 4.92436408642143e-05, "loss": 1.3299285173416138, "mean_token_accuracy": 0.6318994611501694, "num_tokens": 3889619.0, "step": 40 }, { "entropy": 1.320247620344162, "epoch": 0.39805825242718446, "grad_norm": 0.12813310325145721, "learning_rate": 4.917681185462934e-05, "loss": 1.3119574785232544, "mean_token_accuracy": 0.6348763853311539, "num_tokens": 3986630.0, "step": 41 }, { "entropy": 1.3185490667819977, "epoch": 0.4077669902912621, "grad_norm": 0.1228400245308876, "learning_rate": 4.910720339178735e-05, "loss": 1.310436725616455, "mean_token_accuracy": 0.6377311646938324, "num_tokens": 4083691.0, "step": 42 }, { "entropy": 1.3097300678491592, "epoch": 0.4174757281553398, "grad_norm": 0.12255794554948807, "learning_rate": 4.90348234781276e-05, "loss": 1.2923684120178223, "mean_token_accuracy": 0.6398537456989288, "num_tokens": 4181870.0, "step": 43 }, { "entropy": 1.3270199447870255, "epoch": 0.42718446601941745, "grad_norm": 0.13049428164958954, "learning_rate": 4.895968043470532e-05, "loss": 1.3082845211029053, "mean_token_accuracy": 0.6348344013094902, "num_tokens": 4277672.0, "step": 44 }, { "entropy": 1.2746291309595108, "epoch": 0.4368932038834951, "grad_norm": 0.11880674958229065, "learning_rate": 4.8881782900235094e-05, "loss": 1.2675082683563232, "mean_token_accuracy": 0.6442193761467934, "num_tokens": 4375365.0, "step": 45 }, { "entropy": 1.2948976457118988, "epoch": 0.44660194174757284, "grad_norm": 0.12034562975168228, "learning_rate": 4.880113983009768e-05, "loss": 1.2931270599365234, "mean_token_accuracy": 0.638730451464653, "num_tokens": 4472689.0, "step": 46 }, { "entropy": 1.3306090533733368, "epoch": 0.4563106796116505, "grad_norm": 0.12678076326847076, "learning_rate": 4.87177604953105e-05, "loss": 1.3286418914794922, "mean_token_accuracy": 0.630160316824913, "num_tokens": 4569961.0, "step": 47 }, { "entropy": 1.2873755544424057, "epoch": 0.46601941747572817, "grad_norm": 0.12189076095819473, "learning_rate": 4.86316544814618e-05, "loss": 1.2889766693115234, "mean_token_accuracy": 0.6420179456472397, "num_tokens": 4667359.0, "step": 48 }, { "entropy": 1.2845768928527832, "epoch": 0.47572815533980584, "grad_norm": 0.12239941954612732, "learning_rate": 4.854283168760868e-05, "loss": 1.2809079885482788, "mean_token_accuracy": 0.6406335309147835, "num_tokens": 4765400.0, "step": 49 }, { "entropy": 1.271145537495613, "epoch": 0.4854368932038835, "grad_norm": 0.11950168758630753, "learning_rate": 4.8451302325139004e-05, "loss": 1.2703527212142944, "mean_token_accuracy": 0.6420813724398613, "num_tokens": 4863204.0, "step": 50 }, { "entropy": 1.2670437693595886, "epoch": 0.49514563106796117, "grad_norm": 0.12081712484359741, "learning_rate": 4.835707691659753e-05, "loss": 1.2614223957061768, "mean_token_accuracy": 0.6454492062330246, "num_tokens": 4960926.0, "step": 51 }, { "entropy": 1.2643397003412247, "epoch": 0.5048543689320388, "grad_norm": 0.12239903211593628, "learning_rate": 4.8260166294476164e-05, "loss": 1.2616130113601685, "mean_token_accuracy": 0.645437128841877, "num_tokens": 5058013.0, "step": 52 }, { "entropy": 1.2825093269348145, "epoch": 0.5145631067961165, "grad_norm": 0.1260427087545395, "learning_rate": 4.8160581599968625e-05, "loss": 1.277658224105835, "mean_token_accuracy": 0.6420258656144142, "num_tokens": 5153970.0, "step": 53 }, { "entropy": 1.2708389461040497, "epoch": 0.5242718446601942, "grad_norm": 0.12050087749958038, "learning_rate": 4.8058334281689595e-05, "loss": 1.2695984840393066, "mean_token_accuracy": 0.642313040792942, "num_tokens": 5251276.0, "step": 54 }, { "entropy": 1.2563078105449677, "epoch": 0.5339805825242718, "grad_norm": 0.11743330955505371, "learning_rate": 4.7953436094358595e-05, "loss": 1.2539889812469482, "mean_token_accuracy": 0.6447448581457138, "num_tokens": 5348605.0, "step": 55 }, { "entropy": 1.2068996280431747, "epoch": 0.5436893203883495, "grad_norm": 0.12018584460020065, "learning_rate": 4.784589909744855e-05, "loss": 1.216509222984314, "mean_token_accuracy": 0.6554165631532669, "num_tokens": 5446513.0, "step": 56 }, { "entropy": 1.2394993752241135, "epoch": 0.5533980582524272, "grad_norm": 0.12352150678634644, "learning_rate": 4.7735735653799463e-05, "loss": 1.2473233938217163, "mean_token_accuracy": 0.6503345593810081, "num_tokens": 5543963.0, "step": 57 }, { "entropy": 1.246939942240715, "epoch": 0.5631067961165048, "grad_norm": 0.12477197498083115, "learning_rate": 4.762295842819707e-05, "loss": 1.250666618347168, "mean_token_accuracy": 0.6479302644729614, "num_tokens": 5641181.0, "step": 58 }, { "entropy": 1.2309289276599884, "epoch": 0.5728155339805825, "grad_norm": 0.12381109595298767, "learning_rate": 4.75075803859169e-05, "loss": 1.2395830154418945, "mean_token_accuracy": 0.6485741809010506, "num_tokens": 5738020.0, "step": 59 }, { "entropy": 1.2478574961423874, "epoch": 0.5825242718446602, "grad_norm": 0.11805979907512665, "learning_rate": 4.7389614791233726e-05, "loss": 1.2468922138214111, "mean_token_accuracy": 0.6481822803616524, "num_tokens": 5835528.0, "step": 60 }, { "entropy": 1.2492798864841461, "epoch": 0.5922330097087378, "grad_norm": 0.12080500274896622, "learning_rate": 4.726907520589664e-05, "loss": 1.237337589263916, "mean_token_accuracy": 0.6492728218436241, "num_tokens": 5933622.0, "step": 61 }, { "entropy": 1.2176159173250198, "epoch": 0.6019417475728155, "grad_norm": 0.11797010898590088, "learning_rate": 4.714597548756996e-05, "loss": 1.2085245847702026, "mean_token_accuracy": 0.6568486616015434, "num_tokens": 6030609.0, "step": 62 }, { "entropy": 1.2172307223081589, "epoch": 0.6116504854368932, "grad_norm": 0.12290960550308228, "learning_rate": 4.702032978824011e-05, "loss": 1.209407091140747, "mean_token_accuracy": 0.6554706916213036, "num_tokens": 6127908.0, "step": 63 }, { "entropy": 1.2215903252363205, "epoch": 0.6213592233009708, "grad_norm": 0.12479083985090256, "learning_rate": 4.6892152552588655e-05, "loss": 1.2204253673553467, "mean_token_accuracy": 0.6541763246059418, "num_tokens": 6225260.0, "step": 64 }, { "entropy": 1.235756516456604, "epoch": 0.6310679611650486, "grad_norm": 0.12294752150774002, "learning_rate": 4.6761458516331655e-05, "loss": 1.2323334217071533, "mean_token_accuracy": 0.6487969532608986, "num_tokens": 6322811.0, "step": 65 }, { "entropy": 1.2219218015670776, "epoch": 0.6407766990291263, "grad_norm": 0.12319876253604889, "learning_rate": 4.662826270452565e-05, "loss": 1.2222312688827515, "mean_token_accuracy": 0.6520592123270035, "num_tokens": 6419134.0, "step": 66 }, { "entropy": 1.2260529547929764, "epoch": 0.6504854368932039, "grad_norm": 0.12657777965068817, "learning_rate": 4.649258042984026e-05, "loss": 1.2416422367095947, "mean_token_accuracy": 0.6495706215500832, "num_tokens": 6516137.0, "step": 67 }, { "entropy": 1.1933054029941559, "epoch": 0.6601941747572816, "grad_norm": 0.12323662638664246, "learning_rate": 4.6354427290797875e-05, "loss": 1.2011079788208008, "mean_token_accuracy": 0.6561424136161804, "num_tokens": 6613796.0, "step": 68 }, { "entropy": 1.221726194024086, "epoch": 0.6699029126213593, "grad_norm": 0.12489137798547745, "learning_rate": 4.621381916998029e-05, "loss": 1.2248003482818604, "mean_token_accuracy": 0.6516422927379608, "num_tokens": 6711660.0, "step": 69 }, { "entropy": 1.206027626991272, "epoch": 0.6796116504854369, "grad_norm": 0.12634317576885223, "learning_rate": 4.607077223220285e-05, "loss": 1.2010035514831543, "mean_token_accuracy": 0.6585103869438171, "num_tokens": 6808587.0, "step": 70 }, { "entropy": 1.2234635204076767, "epoch": 0.6893203883495146, "grad_norm": 0.12501473724842072, "learning_rate": 4.592530292265609e-05, "loss": 1.214389681816101, "mean_token_accuracy": 0.652966596186161, "num_tokens": 6906120.0, "step": 71 }, { "entropy": 1.20992873609066, "epoch": 0.6990291262135923, "grad_norm": 0.12392093241214752, "learning_rate": 4.5777427965015096e-05, "loss": 1.2072722911834717, "mean_token_accuracy": 0.6577531844377518, "num_tokens": 7004058.0, "step": 72 }, { "entropy": 1.1975662112236023, "epoch": 0.7087378640776699, "grad_norm": 0.12035489082336426, "learning_rate": 4.562716435951692e-05, "loss": 1.1932990550994873, "mean_token_accuracy": 0.6592987105250359, "num_tokens": 7101920.0, "step": 73 }, { "entropy": 1.210291549563408, "epoch": 0.7184466019417476, "grad_norm": 0.12668585777282715, "learning_rate": 4.5474529381006146e-05, "loss": 1.1978528499603271, "mean_token_accuracy": 0.6573837548494339, "num_tokens": 7198756.0, "step": 74 }, { "entropy": 1.2065477669239044, "epoch": 0.7281553398058253, "grad_norm": 0.1260020136833191, "learning_rate": 4.531954057694897e-05, "loss": 1.211967945098877, "mean_token_accuracy": 0.6572022661566734, "num_tokens": 7296339.0, "step": 75 }, { "entropy": 1.2129930704832077, "epoch": 0.7378640776699029, "grad_norm": 0.12252921611070633, "learning_rate": 4.516221576541581e-05, "loss": 1.2114158868789673, "mean_token_accuracy": 0.6573594808578491, "num_tokens": 7393950.0, "step": 76 }, { "entropy": 1.1850701719522476, "epoch": 0.7475728155339806, "grad_norm": 0.1253945231437683, "learning_rate": 4.5002573033032904e-05, "loss": 1.1827876567840576, "mean_token_accuracy": 0.6604309305548668, "num_tokens": 7489205.0, "step": 77 }, { "entropy": 1.2005933076143265, "epoch": 0.7572815533980582, "grad_norm": 0.126405268907547, "learning_rate": 4.484063073290301e-05, "loss": 1.1962429285049438, "mean_token_accuracy": 0.6605332940816879, "num_tokens": 7584161.0, "step": 78 }, { "entropy": 1.167565494775772, "epoch": 0.7669902912621359, "grad_norm": 0.12077456712722778, "learning_rate": 4.467640748249548e-05, "loss": 1.173671841621399, "mean_token_accuracy": 0.666810154914856, "num_tokens": 7681353.0, "step": 79 }, { "entropy": 1.1648044735193253, "epoch": 0.7766990291262136, "grad_norm": 0.1220446452498436, "learning_rate": 4.4509922161505926e-05, "loss": 1.1669106483459473, "mean_token_accuracy": 0.6648600175976753, "num_tokens": 7778582.0, "step": 80 }, { "entropy": 1.1993677020072937, "epoch": 0.7864077669902912, "grad_norm": 0.12758223712444305, "learning_rate": 4.4341193909685686e-05, "loss": 1.2060935497283936, "mean_token_accuracy": 0.656955823302269, "num_tokens": 7874950.0, "step": 81 }, { "entropy": 1.1694086194038391, "epoch": 0.7961165048543689, "grad_norm": 0.12749262154102325, "learning_rate": 4.417024212464152e-05, "loss": 1.1744275093078613, "mean_token_accuracy": 0.6638457253575325, "num_tokens": 7971956.0, "step": 82 }, { "entropy": 1.1816840171813965, "epoch": 0.8058252427184466, "grad_norm": 0.12547384202480316, "learning_rate": 4.399708645960559e-05, "loss": 1.1782863140106201, "mean_token_accuracy": 0.6614864841103554, "num_tokens": 8068461.0, "step": 83 }, { "entropy": 1.1679448634386063, "epoch": 0.8155339805825242, "grad_norm": 0.12635710835456848, "learning_rate": 4.382174682117598e-05, "loss": 1.1667355298995972, "mean_token_accuracy": 0.6685158833861351, "num_tokens": 8166250.0, "step": 84 }, { "entropy": 1.1952285468578339, "epoch": 0.8252427184466019, "grad_norm": 0.12347149848937988, "learning_rate": 4.364424336702825e-05, "loss": 1.1968965530395508, "mean_token_accuracy": 0.6564839482307434, "num_tokens": 8263412.0, "step": 85 }, { "entropy": 1.162320762872696, "epoch": 0.8349514563106796, "grad_norm": 0.1282951831817627, "learning_rate": 4.346459650359798e-05, "loss": 1.165436029434204, "mean_token_accuracy": 0.6640432700514793, "num_tokens": 8361054.0, "step": 86 }, { "entropy": 1.1757322996854782, "epoch": 0.8446601941747572, "grad_norm": 0.12616223096847534, "learning_rate": 4.328282688373479e-05, "loss": 1.1854305267333984, "mean_token_accuracy": 0.6585058197379112, "num_tokens": 8458058.0, "step": 87 }, { "entropy": 1.2041359692811966, "epoch": 0.8543689320388349, "grad_norm": 0.12326717376708984, "learning_rate": 4.3098955404328045e-05, "loss": 1.2033782005310059, "mean_token_accuracy": 0.6559617221355438, "num_tokens": 8552707.0, "step": 88 }, { "entropy": 1.1909528076648712, "epoch": 0.8640776699029126, "grad_norm": 0.12603110074996948, "learning_rate": 4.29130032039044e-05, "loss": 1.1859486103057861, "mean_token_accuracy": 0.6600593701004982, "num_tokens": 8648715.0, "step": 89 }, { "entropy": 1.1856964826583862, "epoch": 0.8737864077669902, "grad_norm": 0.1260392963886261, "learning_rate": 4.272499166019771e-05, "loss": 1.1915158033370972, "mean_token_accuracy": 0.6585908159613609, "num_tokens": 8744790.0, "step": 90 }, { "entropy": 1.1794664412736893, "epoch": 0.883495145631068, "grad_norm": 0.12392019480466843, "learning_rate": 4.253494238769134e-05, "loss": 1.183051586151123, "mean_token_accuracy": 0.6626226082444191, "num_tokens": 8841963.0, "step": 91 }, { "entropy": 1.170656368136406, "epoch": 0.8932038834951457, "grad_norm": 0.12465117126703262, "learning_rate": 4.234287723513326e-05, "loss": 1.1673667430877686, "mean_token_accuracy": 0.6653531640768051, "num_tokens": 8938823.0, "step": 92 }, { "entropy": 1.1882077753543854, "epoch": 0.9029126213592233, "grad_norm": 0.12566819787025452, "learning_rate": 4.2148818283024304e-05, "loss": 1.1874932050704956, "mean_token_accuracy": 0.6594797223806381, "num_tokens": 9036976.0, "step": 93 }, { "entropy": 1.1583750993013382, "epoch": 0.912621359223301, "grad_norm": 0.12392456829547882, "learning_rate": 4.195278784107964e-05, "loss": 1.1598093509674072, "mean_token_accuracy": 0.6643186137080193, "num_tokens": 9134903.0, "step": 94 }, { "entropy": 1.18809275329113, "epoch": 0.9223300970873787, "grad_norm": 0.12459253519773483, "learning_rate": 4.175480844566404e-05, "loss": 1.1854370832443237, "mean_token_accuracy": 0.6601575016975403, "num_tokens": 9231494.0, "step": 95 }, { "entropy": 1.175073578953743, "epoch": 0.9320388349514563, "grad_norm": 0.12408064305782318, "learning_rate": 4.1554902857200924e-05, "loss": 1.1680026054382324, "mean_token_accuracy": 0.6664741188287735, "num_tokens": 9328418.0, "step": 96 }, { "entropy": 1.1660194247961044, "epoch": 0.941747572815534, "grad_norm": 0.1269122213125229, "learning_rate": 4.135309405755583e-05, "loss": 1.1648091077804565, "mean_token_accuracy": 0.6640554815530777, "num_tokens": 9426256.0, "step": 97 }, { "entropy": 1.1806619465351105, "epoch": 0.9514563106796117, "grad_norm": 0.12446007132530212, "learning_rate": 4.11494052473943e-05, "loss": 1.1816036701202393, "mean_token_accuracy": 0.6603836715221405, "num_tokens": 9523841.0, "step": 98 }, { "entropy": 1.143372431397438, "epoch": 0.9611650485436893, "grad_norm": 0.12895351648330688, "learning_rate": 4.094385984351462e-05, "loss": 1.1549444198608398, "mean_token_accuracy": 0.6684554740786552, "num_tokens": 9621225.0, "step": 99 }, { "entropy": 1.157622754573822, "epoch": 0.970873786407767, "grad_norm": 0.12986451387405396, "learning_rate": 4.073648147615579e-05, "loss": 1.1613187789916992, "mean_token_accuracy": 0.6658940613269806, "num_tokens": 9718805.0, "step": 100 }, { "entropy": 1.1661712676286697, "epoch": 0.9805825242718447, "grad_norm": 0.12773863971233368, "learning_rate": 4.052729398628089e-05, "loss": 1.1692513227462769, "mean_token_accuracy": 0.6620098426938057, "num_tokens": 9816814.0, "step": 101 }, { "entropy": 1.1614899933338165, "epoch": 0.9902912621359223, "grad_norm": 0.12632128596305847, "learning_rate": 4.031632142283622e-05, "loss": 1.155547857284546, "mean_token_accuracy": 0.6674634590744972, "num_tokens": 9914411.0, "step": 102 }, { "entropy": 1.145766094326973, "epoch": 1.0, "grad_norm": 0.12433107942342758, "learning_rate": 4.0103588039986556e-05, "loss": 1.14786958694458, "mean_token_accuracy": 0.6690786927938461, "num_tokens": 10010251.0, "step": 103 } ], "logging_steps": 1, "max_steps": 309, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.510969357210747e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }