{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.0, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.699141651391983, "epoch": 0.02, "grad_norm": 1.7043750286102295, "learning_rate": 0.0, "loss": 1.5967991352081299, "mean_token_accuracy": 0.665926069021225, "num_tokens": 74699.0, "step": 1 }, { "entropy": 0.6601996421813965, "epoch": 0.04, "grad_norm": 1.6597099304199219, "learning_rate": 1e-05, "loss": 1.5338245630264282, "mean_token_accuracy": 0.6820768415927887, "num_tokens": 138614.0, "step": 2 }, { "entropy": 0.7289904654026031, "epoch": 0.06, "grad_norm": 1.796127438545227, "learning_rate": 2e-05, "loss": 1.6285251379013062, "mean_token_accuracy": 0.6539906561374664, "num_tokens": 209509.0, "step": 3 }, { "entropy": 0.7412302494049072, "epoch": 0.08, "grad_norm": 1.4846091270446777, "learning_rate": 3e-05, "loss": 1.5454721450805664, "mean_token_accuracy": 0.6691758334636688, "num_tokens": 283751.0, "step": 4 }, { "entropy": 0.7322555780410767, "epoch": 0.1, "grad_norm": 1.4136911630630493, "learning_rate": 4e-05, "loss": 1.5077476501464844, "mean_token_accuracy": 0.6744928658008575, "num_tokens": 354066.0, "step": 5 }, { "entropy": 0.7739330530166626, "epoch": 0.12, "grad_norm": 0.9657893180847168, "learning_rate": 5e-05, "loss": 1.43147611618042, "mean_token_accuracy": 0.6826294660568237, "num_tokens": 422170.0, "step": 6 }, { "entropy": 0.8858513236045837, "epoch": 0.14, "grad_norm": 0.7331474423408508, "learning_rate": 6e-05, "loss": 1.450822353363037, "mean_token_accuracy": 0.6648280322551727, "num_tokens": 494040.0, "step": 7 }, { "entropy": 0.9634815156459808, "epoch": 0.16, "grad_norm": 0.5526663661003113, "learning_rate": 7e-05, "loss": 1.3808112144470215, "mean_token_accuracy": 0.6719212830066681, "num_tokens": 566616.0, "step": 8 }, { "entropy": 1.0627405643463135, "epoch": 0.18, "grad_norm": 0.48948273062705994, "learning_rate": 8e-05, "loss": 1.3656816482543945, "mean_token_accuracy": 0.663449615240097, "num_tokens": 637093.0, "step": 9 }, { "entropy": 1.1328747868537903, "epoch": 0.2, "grad_norm": 0.37054377794265747, "learning_rate": 9e-05, "loss": 1.2878801822662354, "mean_token_accuracy": 0.6749334335327148, "num_tokens": 701945.0, "step": 10 }, { "entropy": 1.2100302577018738, "epoch": 0.22, "grad_norm": 0.3048469126224518, "learning_rate": 0.0001, "loss": 1.236545443534851, "mean_token_accuracy": 0.6853303909301758, "num_tokens": 774533.0, "step": 11 }, { "entropy": 1.2940571904182434, "epoch": 0.24, "grad_norm": 0.3031807243824005, "learning_rate": 0.0001, "loss": 1.211038589477539, "mean_token_accuracy": 0.6858378350734711, "num_tokens": 847636.0, "step": 12 }, { "entropy": 1.299929440021515, "epoch": 0.26, "grad_norm": 0.2886947691440582, "learning_rate": 0.0001, "loss": 1.197202205657959, "mean_token_accuracy": 0.6924754083156586, "num_tokens": 923420.0, "step": 13 }, { "entropy": 1.252187728881836, "epoch": 0.28, "grad_norm": 0.25853437185287476, "learning_rate": 0.0001, "loss": 1.1612238883972168, "mean_token_accuracy": 0.6976969540119171, "num_tokens": 992109.0, "step": 14 }, { "entropy": 1.220507800579071, "epoch": 0.3, "grad_norm": 0.24553938210010529, "learning_rate": 0.0001, "loss": 1.1456246376037598, "mean_token_accuracy": 0.6981014311313629, "num_tokens": 1065114.0, "step": 15 }, { "entropy": 1.198462724685669, "epoch": 0.32, "grad_norm": 0.24306544661521912, "learning_rate": 0.0001, "loss": 1.1577763557434082, "mean_token_accuracy": 0.6941779851913452, "num_tokens": 1136722.0, "step": 16 }, { "entropy": 1.1386296153068542, "epoch": 0.34, "grad_norm": 0.22727081179618835, "learning_rate": 0.0001, "loss": 1.0986605882644653, "mean_token_accuracy": 0.7019487023353577, "num_tokens": 1209030.0, "step": 17 }, { "entropy": 1.117907702922821, "epoch": 0.36, "grad_norm": 0.21270814538002014, "learning_rate": 0.0001, "loss": 1.110465407371521, "mean_token_accuracy": 0.701825737953186, "num_tokens": 1276624.0, "step": 18 }, { "entropy": 1.1316577792167664, "epoch": 0.38, "grad_norm": 0.1995684653520584, "learning_rate": 0.0001, "loss": 1.1611299514770508, "mean_token_accuracy": 0.6892036497592926, "num_tokens": 1348478.0, "step": 19 }, { "entropy": 1.0270569920539856, "epoch": 0.4, "grad_norm": 0.18478907644748688, "learning_rate": 0.0001, "loss": 1.04264235496521, "mean_token_accuracy": 0.7172180116176605, "num_tokens": 1421488.0, "step": 20 }, { "entropy": 1.01737579703331, "epoch": 0.42, "grad_norm": 0.19284074008464813, "learning_rate": 0.0001, "loss": 1.0274319648742676, "mean_token_accuracy": 0.718668669462204, "num_tokens": 1488403.0, "step": 21 }, { "entropy": 1.0264459252357483, "epoch": 0.44, "grad_norm": 0.1576310396194458, "learning_rate": 0.0001, "loss": 1.0518046617507935, "mean_token_accuracy": 0.7142763733863831, "num_tokens": 1564657.0, "step": 22 }, { "entropy": 1.059712529182434, "epoch": 0.46, "grad_norm": 0.15488146245479584, "learning_rate": 0.0001, "loss": 1.082923412322998, "mean_token_accuracy": 0.7053070664405823, "num_tokens": 1633972.0, "step": 23 }, { "entropy": 1.0438059866428375, "epoch": 0.48, "grad_norm": 0.15164747834205627, "learning_rate": 0.0001, "loss": 1.0578590631484985, "mean_token_accuracy": 0.7133743166923523, "num_tokens": 1700893.0, "step": 24 }, { "entropy": 0.9979909062385559, "epoch": 0.5, "grad_norm": 0.14712916314601898, "learning_rate": 0.0001, "loss": 1.0294842720031738, "mean_token_accuracy": 0.7216654419898987, "num_tokens": 1767721.0, "step": 25 }, { "entropy": 1.0120922327041626, "epoch": 0.52, "grad_norm": 0.1360112428665161, "learning_rate": 0.0001, "loss": 1.0354883670806885, "mean_token_accuracy": 0.7223899960517883, "num_tokens": 1835156.0, "step": 26 }, { "entropy": 0.9896539449691772, "epoch": 0.54, "grad_norm": 0.12824475765228271, "learning_rate": 0.0001, "loss": 1.0203971862792969, "mean_token_accuracy": 0.7212119996547699, "num_tokens": 1910430.0, "step": 27 }, { "entropy": 0.9603240489959717, "epoch": 0.56, "grad_norm": 0.1179676204919815, "learning_rate": 0.0001, "loss": 0.9597353339195251, "mean_token_accuracy": 0.7346547842025757, "num_tokens": 1985373.0, "step": 28 }, { "entropy": 1.0493255257606506, "epoch": 0.58, "grad_norm": 0.12462859600782394, "learning_rate": 0.0001, "loss": 1.0499563217163086, "mean_token_accuracy": 0.7120701968669891, "num_tokens": 2054409.0, "step": 29 }, { "entropy": 1.0497854351997375, "epoch": 0.6, "grad_norm": 0.11791805922985077, "learning_rate": 0.0001, "loss": 1.0524396896362305, "mean_token_accuracy": 0.7136416733264923, "num_tokens": 2122893.0, "step": 30 }, { "entropy": 1.0638166069984436, "epoch": 0.62, "grad_norm": 0.12578116357326508, "learning_rate": 0.0001, "loss": 1.067002534866333, "mean_token_accuracy": 0.7095249891281128, "num_tokens": 2194755.0, "step": 31 }, { "entropy": 1.099778175354004, "epoch": 0.64, "grad_norm": 0.12349284440279007, "learning_rate": 0.0001, "loss": 1.0939478874206543, "mean_token_accuracy": 0.7056429386138916, "num_tokens": 2262214.0, "step": 32 }, { "entropy": 1.0646151900291443, "epoch": 0.66, "grad_norm": 0.12846575677394867, "learning_rate": 0.0001, "loss": 1.0653318166732788, "mean_token_accuracy": 0.7122560441493988, "num_tokens": 2331419.0, "step": 33 }, { "entropy": 1.0158570408821106, "epoch": 0.68, "grad_norm": 0.11879603564739227, "learning_rate": 0.0001, "loss": 1.0267729759216309, "mean_token_accuracy": 0.7170567810535431, "num_tokens": 2403814.0, "step": 34 }, { "entropy": 1.0103608667850494, "epoch": 0.7, "grad_norm": 0.12001688033342361, "learning_rate": 0.0001, "loss": 1.0078749656677246, "mean_token_accuracy": 0.7219332754611969, "num_tokens": 2474066.0, "step": 35 }, { "entropy": 1.0085046291351318, "epoch": 0.72, "grad_norm": 0.11229556053876877, "learning_rate": 0.0001, "loss": 1.015348196029663, "mean_token_accuracy": 0.7219782471656799, "num_tokens": 2547283.0, "step": 36 }, { "entropy": 1.0116952955722809, "epoch": 0.74, "grad_norm": 0.12163597345352173, "learning_rate": 0.0001, "loss": 1.0121233463287354, "mean_token_accuracy": 0.7187064588069916, "num_tokens": 2613331.0, "step": 37 }, { "entropy": 0.9940676093101501, "epoch": 0.76, "grad_norm": 0.11075941473245621, "learning_rate": 0.0001, "loss": 0.992800235748291, "mean_token_accuracy": 0.7255141139030457, "num_tokens": 2683528.0, "step": 38 }, { "entropy": 1.0126079320907593, "epoch": 0.78, "grad_norm": 0.11469519883394241, "learning_rate": 0.0001, "loss": 0.9988532066345215, "mean_token_accuracy": 0.7211731672286987, "num_tokens": 2750069.0, "step": 39 }, { "entropy": 0.9906446635723114, "epoch": 0.8, "grad_norm": 0.11193952709436417, "learning_rate": 0.0001, "loss": 0.9900511503219604, "mean_token_accuracy": 0.722189337015152, "num_tokens": 2821887.0, "step": 40 }, { "entropy": 0.9898229837417603, "epoch": 0.82, "grad_norm": 0.11920945346355438, "learning_rate": 0.0001, "loss": 0.9936800599098206, "mean_token_accuracy": 0.7267130017280579, "num_tokens": 2885811.0, "step": 41 }, { "entropy": 0.9716921448707581, "epoch": 0.84, "grad_norm": 0.11293631792068481, "learning_rate": 0.0001, "loss": 0.9800352454185486, "mean_token_accuracy": 0.7265651822090149, "num_tokens": 2955201.0, "step": 42 }, { "entropy": 0.9296073317527771, "epoch": 0.86, "grad_norm": 0.11454292386770248, "learning_rate": 0.0001, "loss": 0.9429284334182739, "mean_token_accuracy": 0.734944611787796, "num_tokens": 3019665.0, "step": 43 }, { "entropy": 0.9590237438678741, "epoch": 0.88, "grad_norm": 0.1102190762758255, "learning_rate": 0.0001, "loss": 0.9501940011978149, "mean_token_accuracy": 0.7321249544620514, "num_tokens": 3093335.0, "step": 44 }, { "entropy": 0.9053312838077545, "epoch": 0.9, "grad_norm": 0.11164271831512451, "learning_rate": 0.0001, "loss": 0.9103053212165833, "mean_token_accuracy": 0.7460834383964539, "num_tokens": 3159757.0, "step": 45 }, { "entropy": 0.9606629908084869, "epoch": 0.92, "grad_norm": 0.11079204827547073, "learning_rate": 0.0001, "loss": 0.9644097089767456, "mean_token_accuracy": 0.7342032492160797, "num_tokens": 3230892.0, "step": 46 }, { "entropy": 0.943544864654541, "epoch": 0.94, "grad_norm": 0.11624015867710114, "learning_rate": 0.0001, "loss": 0.9410842061042786, "mean_token_accuracy": 0.7351740300655365, "num_tokens": 3299869.0, "step": 47 }, { "entropy": 0.9592801034450531, "epoch": 0.96, "grad_norm": 0.11560477316379547, "learning_rate": 0.0001, "loss": 0.975141704082489, "mean_token_accuracy": 0.7269536554813385, "num_tokens": 3371272.0, "step": 48 }, { "entropy": 0.9194359481334686, "epoch": 0.98, "grad_norm": 0.11588755995035172, "learning_rate": 0.0001, "loss": 0.9375251531600952, "mean_token_accuracy": 0.7386307418346405, "num_tokens": 3439636.0, "step": 49 }, { "entropy": 0.9375229477882385, "epoch": 1.0, "grad_norm": 0.10675432533025742, "learning_rate": 0.0001, "loss": 0.9375709891319275, "mean_token_accuracy": 0.7371015846729279, "num_tokens": 3515643.0, "step": 50 }, { "entropy": 0.9784637987613678, "epoch": 1.02, "grad_norm": 0.12157473713159561, "learning_rate": 0.0001, "loss": 0.9589431881904602, "mean_token_accuracy": 0.7312025725841522, "num_tokens": 3579936.0, "step": 51 }, { "entropy": 0.9976795613765717, "epoch": 1.04, "grad_norm": 0.1218739002943039, "learning_rate": 0.0001, "loss": 0.9651644825935364, "mean_token_accuracy": 0.7295917272567749, "num_tokens": 3645097.0, "step": 52 }, { "entropy": 0.9457567930221558, "epoch": 1.06, "grad_norm": 0.11789195984601974, "learning_rate": 0.0001, "loss": 0.924875020980835, "mean_token_accuracy": 0.7387276589870453, "num_tokens": 3722386.0, "step": 53 }, { "entropy": 0.9368592202663422, "epoch": 1.08, "grad_norm": 0.11367881298065186, "learning_rate": 0.0001, "loss": 0.9108861088752747, "mean_token_accuracy": 0.7435753047466278, "num_tokens": 3795107.0, "step": 54 }, { "entropy": 0.9856767952442169, "epoch": 1.1, "grad_norm": 0.1143391951918602, "learning_rate": 0.0001, "loss": 0.9522716999053955, "mean_token_accuracy": 0.7351356148719788, "num_tokens": 3863645.0, "step": 55 }, { "entropy": 0.9017468690872192, "epoch": 1.12, "grad_norm": 0.11213760077953339, "learning_rate": 0.0001, "loss": 0.890508770942688, "mean_token_accuracy": 0.75059974193573, "num_tokens": 3933157.0, "step": 56 }, { "entropy": 0.9076333045959473, "epoch": 1.1400000000000001, "grad_norm": 0.10830755531787872, "learning_rate": 0.0001, "loss": 0.8893829584121704, "mean_token_accuracy": 0.7474276721477509, "num_tokens": 4002549.0, "step": 57 }, { "entropy": 0.9090627431869507, "epoch": 1.16, "grad_norm": 0.11783402413129807, "learning_rate": 0.0001, "loss": 0.9097412824630737, "mean_token_accuracy": 0.7423691749572754, "num_tokens": 4068026.0, "step": 58 }, { "entropy": 0.928420215845108, "epoch": 1.18, "grad_norm": 0.11873085796833038, "learning_rate": 0.0001, "loss": 0.9404212236404419, "mean_token_accuracy": 0.7362638711929321, "num_tokens": 4136948.0, "step": 59 }, { "entropy": 0.9221147298812866, "epoch": 1.2, "grad_norm": 0.11550325155258179, "learning_rate": 0.0001, "loss": 0.924960732460022, "mean_token_accuracy": 0.7427571713924408, "num_tokens": 4204112.0, "step": 60 }, { "entropy": 0.9216603636741638, "epoch": 1.22, "grad_norm": 0.11623509228229523, "learning_rate": 0.0001, "loss": 0.9106500148773193, "mean_token_accuracy": 0.7429015040397644, "num_tokens": 4272140.0, "step": 61 }, { "entropy": 0.9455150067806244, "epoch": 1.24, "grad_norm": 0.11591103672981262, "learning_rate": 0.0001, "loss": 0.9491208791732788, "mean_token_accuracy": 0.7350127100944519, "num_tokens": 4346769.0, "step": 62 }, { "entropy": 0.8898249566555023, "epoch": 1.26, "grad_norm": 0.11488021910190582, "learning_rate": 0.0001, "loss": 0.8970361351966858, "mean_token_accuracy": 0.7481776773929596, "num_tokens": 4418760.0, "step": 63 }, { "entropy": 0.8663885295391083, "epoch": 1.28, "grad_norm": 0.1245160847902298, "learning_rate": 0.0001, "loss": 0.8572047352790833, "mean_token_accuracy": 0.7511683106422424, "num_tokens": 4483453.0, "step": 64 }, { "entropy": 0.9115520715713501, "epoch": 1.3, "grad_norm": 0.12362005561590195, "learning_rate": 0.0001, "loss": 0.9021918773651123, "mean_token_accuracy": 0.7433571219444275, "num_tokens": 4553398.0, "step": 65 }, { "entropy": 0.9173152148723602, "epoch": 1.32, "grad_norm": 0.11844731867313385, "learning_rate": 0.0001, "loss": 0.9107658863067627, "mean_token_accuracy": 0.7352526783943176, "num_tokens": 4626227.0, "step": 66 }, { "entropy": 0.849992573261261, "epoch": 1.34, "grad_norm": 0.11784010380506516, "learning_rate": 0.0001, "loss": 0.8525710105895996, "mean_token_accuracy": 0.7550307512283325, "num_tokens": 4701977.0, "step": 67 }, { "entropy": 0.9553567171096802, "epoch": 1.3599999999999999, "grad_norm": 0.1190195307135582, "learning_rate": 0.0001, "loss": 0.9455575346946716, "mean_token_accuracy": 0.7316735982894897, "num_tokens": 4774545.0, "step": 68 }, { "entropy": 0.8593668639659882, "epoch": 1.38, "grad_norm": 0.11937589198350906, "learning_rate": 0.0001, "loss": 0.8549792170524597, "mean_token_accuracy": 0.7569719552993774, "num_tokens": 4847366.0, "step": 69 }, { "entropy": 0.9686211943626404, "epoch": 1.4, "grad_norm": 0.12214019149541855, "learning_rate": 0.0001, "loss": 0.9648027420043945, "mean_token_accuracy": 0.7249570488929749, "num_tokens": 4923060.0, "step": 70 }, { "entropy": 0.867369145154953, "epoch": 1.42, "grad_norm": 0.11730711907148361, "learning_rate": 0.0001, "loss": 0.8510935306549072, "mean_token_accuracy": 0.7553304731845856, "num_tokens": 4996176.0, "step": 71 }, { "entropy": 0.9160025417804718, "epoch": 1.44, "grad_norm": 0.12190750241279602, "learning_rate": 0.0001, "loss": 0.9096644520759583, "mean_token_accuracy": 0.7384364008903503, "num_tokens": 5068522.0, "step": 72 }, { "entropy": 0.9069952070713043, "epoch": 1.46, "grad_norm": 0.13640820980072021, "learning_rate": 0.0001, "loss": 0.8875448703765869, "mean_token_accuracy": 0.7457329034805298, "num_tokens": 5137623.0, "step": 73 }, { "entropy": 0.9026708900928497, "epoch": 1.48, "grad_norm": 0.12538853287696838, "learning_rate": 0.0001, "loss": 0.8914889097213745, "mean_token_accuracy": 0.7435721457004547, "num_tokens": 5208737.0, "step": 74 }, { "entropy": 0.9324445724487305, "epoch": 1.5, "grad_norm": 0.13337835669517517, "learning_rate": 0.0001, "loss": 0.9412592649459839, "mean_token_accuracy": 0.7320683300495148, "num_tokens": 5279457.0, "step": 75 }, { "entropy": 0.8831305801868439, "epoch": 1.52, "grad_norm": 0.1287890523672104, "learning_rate": 0.0001, "loss": 0.890162467956543, "mean_token_accuracy": 0.7474140524864197, "num_tokens": 5344457.0, "step": 76 }, { "entropy": 0.8844259679317474, "epoch": 1.54, "grad_norm": 0.12595458328723907, "learning_rate": 0.0001, "loss": 0.8862929940223694, "mean_token_accuracy": 0.7448306679725647, "num_tokens": 5416486.0, "step": 77 }, { "entropy": 0.9768937230110168, "epoch": 1.56, "grad_norm": 0.13385823369026184, "learning_rate": 0.0001, "loss": 0.9855270981788635, "mean_token_accuracy": 0.7242069244384766, "num_tokens": 5488930.0, "step": 78 }, { "entropy": 0.8970398604869843, "epoch": 1.58, "grad_norm": 0.12776781618595123, "learning_rate": 0.0001, "loss": 0.9010695219039917, "mean_token_accuracy": 0.7380562722682953, "num_tokens": 5558044.0, "step": 79 }, { "entropy": 0.8510560393333435, "epoch": 1.6, "grad_norm": 0.12845851480960846, "learning_rate": 0.0001, "loss": 0.8674848675727844, "mean_token_accuracy": 0.7530980706214905, "num_tokens": 5630814.0, "step": 80 }, { "entropy": 0.9194655120372772, "epoch": 1.62, "grad_norm": 0.12733094394207, "learning_rate": 0.0001, "loss": 0.9001493453979492, "mean_token_accuracy": 0.7473941147327423, "num_tokens": 5696496.0, "step": 81 }, { "entropy": 0.9078547358512878, "epoch": 1.6400000000000001, "grad_norm": 0.12357509136199951, "learning_rate": 0.0001, "loss": 0.9031519889831543, "mean_token_accuracy": 0.7443413436412811, "num_tokens": 5765578.0, "step": 82 }, { "entropy": 0.9426756799221039, "epoch": 1.6600000000000001, "grad_norm": 0.12899024784564972, "learning_rate": 0.0001, "loss": 0.9363412857055664, "mean_token_accuracy": 0.7349725663661957, "num_tokens": 5831979.0, "step": 83 }, { "entropy": 0.9146726131439209, "epoch": 1.6800000000000002, "grad_norm": 0.12931226193904877, "learning_rate": 0.0001, "loss": 0.9105992317199707, "mean_token_accuracy": 0.7388072907924652, "num_tokens": 5905661.0, "step": 84 }, { "entropy": 0.9316370487213135, "epoch": 1.7, "grad_norm": 0.13409629464149475, "learning_rate": 0.0001, "loss": 0.9174567461013794, "mean_token_accuracy": 0.7437045872211456, "num_tokens": 5973162.0, "step": 85 }, { "entropy": 0.9444582164287567, "epoch": 1.72, "grad_norm": 0.13663342595100403, "learning_rate": 0.0001, "loss": 0.9291839599609375, "mean_token_accuracy": 0.7356755137443542, "num_tokens": 6040751.0, "step": 86 }, { "entropy": 0.8949260711669922, "epoch": 1.74, "grad_norm": 0.12818805873394012, "learning_rate": 0.0001, "loss": 0.8870834112167358, "mean_token_accuracy": 0.7440982460975647, "num_tokens": 6112173.0, "step": 87 }, { "entropy": 0.9360968768596649, "epoch": 1.76, "grad_norm": 0.14662906527519226, "learning_rate": 0.0001, "loss": 0.9298614859580994, "mean_token_accuracy": 0.7370602786540985, "num_tokens": 6179601.0, "step": 88 }, { "entropy": 0.8710778653621674, "epoch": 1.78, "grad_norm": 0.13221921026706696, "learning_rate": 0.0001, "loss": 0.8649511337280273, "mean_token_accuracy": 0.7522627413272858, "num_tokens": 6246710.0, "step": 89 }, { "entropy": 0.8752692639827728, "epoch": 1.8, "grad_norm": 0.14055795967578888, "learning_rate": 0.0001, "loss": 0.8573565483093262, "mean_token_accuracy": 0.754420816898346, "num_tokens": 6319796.0, "step": 90 }, { "entropy": 0.779484897851944, "epoch": 1.8199999999999998, "grad_norm": 0.12845420837402344, "learning_rate": 0.0001, "loss": 0.7835309505462646, "mean_token_accuracy": 0.7740673124790192, "num_tokens": 6389425.0, "step": 91 }, { "entropy": 0.8905294835567474, "epoch": 1.8399999999999999, "grad_norm": 0.1387389600276947, "learning_rate": 0.0001, "loss": 0.8962739706039429, "mean_token_accuracy": 0.7440564632415771, "num_tokens": 6460606.0, "step": 92 }, { "entropy": 0.8370858132839203, "epoch": 1.8599999999999999, "grad_norm": 0.13243098556995392, "learning_rate": 0.0001, "loss": 0.8395211696624756, "mean_token_accuracy": 0.7600894570350647, "num_tokens": 6532762.0, "step": 93 }, { "entropy": 0.9130788445472717, "epoch": 1.88, "grad_norm": 0.13279658555984497, "learning_rate": 0.0001, "loss": 0.9157933592796326, "mean_token_accuracy": 0.7389859557151794, "num_tokens": 6601952.0, "step": 94 }, { "entropy": 0.889918178319931, "epoch": 1.9, "grad_norm": 0.134121835231781, "learning_rate": 0.0001, "loss": 0.8863574266433716, "mean_token_accuracy": 0.7509450018405914, "num_tokens": 6667993.0, "step": 95 }, { "entropy": 0.8806619942188263, "epoch": 1.92, "grad_norm": 0.1342441886663437, "learning_rate": 0.0001, "loss": 0.8897389769554138, "mean_token_accuracy": 0.751017302274704, "num_tokens": 6741003.0, "step": 96 }, { "entropy": 0.8719884157180786, "epoch": 1.94, "grad_norm": 0.13280296325683594, "learning_rate": 0.0001, "loss": 0.8737912178039551, "mean_token_accuracy": 0.748961865901947, "num_tokens": 6814733.0, "step": 97 }, { "entropy": 0.9378086924552917, "epoch": 1.96, "grad_norm": 0.142800435423851, "learning_rate": 0.0001, "loss": 0.928570032119751, "mean_token_accuracy": 0.7347837388515472, "num_tokens": 6887723.0, "step": 98 }, { "entropy": 0.8699579238891602, "epoch": 1.98, "grad_norm": 0.13884496688842773, "learning_rate": 0.0001, "loss": 0.8652123808860779, "mean_token_accuracy": 0.7550584077835083, "num_tokens": 6957156.0, "step": 99 }, { "entropy": 0.8680048286914825, "epoch": 2.0, "grad_norm": 0.13625894486904144, "learning_rate": 0.0001, "loss": 0.8566628694534302, "mean_token_accuracy": 0.7550990581512451, "num_tokens": 7030824.0, "step": 100 }, { "entropy": 0.8759163916110992, "epoch": 2.02, "grad_norm": 0.13642925024032593, "learning_rate": 0.0001, "loss": 0.8173877596855164, "mean_token_accuracy": 0.7642171382904053, "num_tokens": 7099794.0, "step": 101 }, { "entropy": 0.872030109167099, "epoch": 2.04, "grad_norm": 0.13444599509239197, "learning_rate": 0.0001, "loss": 0.8315644860267639, "mean_token_accuracy": 0.7598301768302917, "num_tokens": 7168851.0, "step": 102 }, { "entropy": 0.8999165594577789, "epoch": 2.06, "grad_norm": 0.14029845595359802, "learning_rate": 0.0001, "loss": 0.8543646335601807, "mean_token_accuracy": 0.7513293921947479, "num_tokens": 7239717.0, "step": 103 }, { "entropy": 0.8488370180130005, "epoch": 2.08, "grad_norm": 0.13906973600387573, "learning_rate": 0.0001, "loss": 0.8071736097335815, "mean_token_accuracy": 0.768627405166626, "num_tokens": 7310897.0, "step": 104 }, { "entropy": 0.8458687663078308, "epoch": 2.1, "grad_norm": 0.14410872757434845, "learning_rate": 0.0001, "loss": 0.8336784243583679, "mean_token_accuracy": 0.7576306164264679, "num_tokens": 7381044.0, "step": 105 }, { "entropy": 0.8117028772830963, "epoch": 2.12, "grad_norm": 0.15016138553619385, "learning_rate": 0.0001, "loss": 0.8016491532325745, "mean_token_accuracy": 0.761463850736618, "num_tokens": 7448539.0, "step": 106 }, { "entropy": 0.8423402607440948, "epoch": 2.14, "grad_norm": 0.14620108902454376, "learning_rate": 0.0001, "loss": 0.8520156145095825, "mean_token_accuracy": 0.7559936344623566, "num_tokens": 7523326.0, "step": 107 }, { "entropy": 0.7789672613143921, "epoch": 2.16, "grad_norm": 0.14582377672195435, "learning_rate": 0.0001, "loss": 0.7745522260665894, "mean_token_accuracy": 0.7746096849441528, "num_tokens": 7589964.0, "step": 108 }, { "entropy": 0.8252202570438385, "epoch": 2.18, "grad_norm": 0.15269358456134796, "learning_rate": 0.0001, "loss": 0.8253834247589111, "mean_token_accuracy": 0.760587066411972, "num_tokens": 7663822.0, "step": 109 }, { "entropy": 0.8460159599781036, "epoch": 2.2, "grad_norm": 0.15312956273555756, "learning_rate": 0.0001, "loss": 0.834621012210846, "mean_token_accuracy": 0.7548129558563232, "num_tokens": 7736094.0, "step": 110 }, { "entropy": 0.8546044528484344, "epoch": 2.22, "grad_norm": 0.1496986299753189, "learning_rate": 0.0001, "loss": 0.8300120830535889, "mean_token_accuracy": 0.759436160326004, "num_tokens": 7812027.0, "step": 111 }, { "entropy": 0.754067599773407, "epoch": 2.24, "grad_norm": 0.1404401957988739, "learning_rate": 0.0001, "loss": 0.7299779653549194, "mean_token_accuracy": 0.7858331501483917, "num_tokens": 7881889.0, "step": 112 }, { "entropy": 0.8271636366844177, "epoch": 2.26, "grad_norm": 0.15130330622196198, "learning_rate": 0.0001, "loss": 0.8026934862136841, "mean_token_accuracy": 0.7606152594089508, "num_tokens": 7958772.0, "step": 113 }, { "entropy": 0.8311681747436523, "epoch": 2.2800000000000002, "grad_norm": 0.15545408427715302, "learning_rate": 0.0001, "loss": 0.8179649114608765, "mean_token_accuracy": 0.7627213597297668, "num_tokens": 8029445.0, "step": 114 }, { "entropy": 0.8371923565864563, "epoch": 2.3, "grad_norm": 0.15620867908000946, "learning_rate": 0.0001, "loss": 0.8322392106056213, "mean_token_accuracy": 0.7557950615882874, "num_tokens": 8100496.0, "step": 115 }, { "entropy": 0.8774853646755219, "epoch": 2.32, "grad_norm": 0.16020546853542328, "learning_rate": 0.0001, "loss": 0.8756296634674072, "mean_token_accuracy": 0.7484939396381378, "num_tokens": 8172797.0, "step": 116 }, { "entropy": 0.7841235101222992, "epoch": 2.34, "grad_norm": 0.16341933608055115, "learning_rate": 0.0001, "loss": 0.7845247387886047, "mean_token_accuracy": 0.7680597603321075, "num_tokens": 8239973.0, "step": 117 }, { "entropy": 0.8059554100036621, "epoch": 2.36, "grad_norm": 0.14973363280296326, "learning_rate": 0.0001, "loss": 0.7868502140045166, "mean_token_accuracy": 0.7696151733398438, "num_tokens": 8312997.0, "step": 118 }, { "entropy": 0.790012925863266, "epoch": 2.38, "grad_norm": 0.15735657513141632, "learning_rate": 0.0001, "loss": 0.7770582437515259, "mean_token_accuracy": 0.7715879082679749, "num_tokens": 8380963.0, "step": 119 }, { "entropy": 0.7878563702106476, "epoch": 2.4, "grad_norm": 0.15908536314964294, "learning_rate": 0.0001, "loss": 0.7946950197219849, "mean_token_accuracy": 0.7720945775508881, "num_tokens": 8453009.0, "step": 120 }, { "entropy": 0.8163405060768127, "epoch": 2.42, "grad_norm": 0.15914228558540344, "learning_rate": 0.0001, "loss": 0.8022626042366028, "mean_token_accuracy": 0.765992671251297, "num_tokens": 8522525.0, "step": 121 }, { "entropy": 0.8679061532020569, "epoch": 2.44, "grad_norm": 0.1549653708934784, "learning_rate": 0.0001, "loss": 0.8452656269073486, "mean_token_accuracy": 0.7564500868320465, "num_tokens": 8591511.0, "step": 122 }, { "entropy": 0.8327716588973999, "epoch": 2.46, "grad_norm": 0.16247446835041046, "learning_rate": 0.0001, "loss": 0.8243684768676758, "mean_token_accuracy": 0.7590730786323547, "num_tokens": 8665286.0, "step": 123 }, { "entropy": 0.7765352427959442, "epoch": 2.48, "grad_norm": 0.15758228302001953, "learning_rate": 0.0001, "loss": 0.7422535419464111, "mean_token_accuracy": 0.783282607793808, "num_tokens": 8730146.0, "step": 124 }, { "entropy": 0.8039740025997162, "epoch": 2.5, "grad_norm": 0.1573210507631302, "learning_rate": 0.0001, "loss": 0.7967308759689331, "mean_token_accuracy": 0.7692459225654602, "num_tokens": 8801629.0, "step": 125 }, { "entropy": 0.8415170609951019, "epoch": 2.52, "grad_norm": 0.16268476843833923, "learning_rate": 0.0001, "loss": 0.8165377378463745, "mean_token_accuracy": 0.7615750133991241, "num_tokens": 8877985.0, "step": 126 }, { "entropy": 0.8203210234642029, "epoch": 2.54, "grad_norm": 0.16346436738967896, "learning_rate": 0.0001, "loss": 0.8121747970581055, "mean_token_accuracy": 0.761315256357193, "num_tokens": 8951559.0, "step": 127 }, { "entropy": 0.8293347358703613, "epoch": 2.56, "grad_norm": 0.17023281753063202, "learning_rate": 0.0001, "loss": 0.8173530101776123, "mean_token_accuracy": 0.759048581123352, "num_tokens": 9021509.0, "step": 128 }, { "entropy": 0.7746993601322174, "epoch": 2.58, "grad_norm": 0.1615564227104187, "learning_rate": 0.0001, "loss": 0.7658690214157104, "mean_token_accuracy": 0.7726005017757416, "num_tokens": 9090508.0, "step": 129 }, { "entropy": 0.8143576085567474, "epoch": 2.6, "grad_norm": 0.1704084575176239, "learning_rate": 0.0001, "loss": 0.8276199102401733, "mean_token_accuracy": 0.7586769461631775, "num_tokens": 9156045.0, "step": 130 }, { "entropy": 0.7868927419185638, "epoch": 2.62, "grad_norm": 0.16065886616706848, "learning_rate": 0.0001, "loss": 0.7649659514427185, "mean_token_accuracy": 0.7774228751659393, "num_tokens": 9221515.0, "step": 131 }, { "entropy": 0.8241930305957794, "epoch": 2.64, "grad_norm": 0.1710738241672516, "learning_rate": 0.0001, "loss": 0.8104192018508911, "mean_token_accuracy": 0.7651428282260895, "num_tokens": 9290829.0, "step": 132 }, { "entropy": 0.7782109975814819, "epoch": 2.66, "grad_norm": 0.3252999484539032, "learning_rate": 0.0001, "loss": 0.7537873983383179, "mean_token_accuracy": 0.7770578563213348, "num_tokens": 9358923.0, "step": 133 }, { "entropy": 0.7932650744915009, "epoch": 2.68, "grad_norm": 0.16687457263469696, "learning_rate": 0.0001, "loss": 0.771995484828949, "mean_token_accuracy": 0.7717720866203308, "num_tokens": 9431495.0, "step": 134 }, { "entropy": 0.8635589182376862, "epoch": 2.7, "grad_norm": 0.17788194119930267, "learning_rate": 0.0001, "loss": 0.839271605014801, "mean_token_accuracy": 0.7549299001693726, "num_tokens": 9502949.0, "step": 135 }, { "entropy": 0.8827160894870758, "epoch": 2.7199999999999998, "grad_norm": 0.17214906215667725, "learning_rate": 0.0001, "loss": 0.8584389686584473, "mean_token_accuracy": 0.7523661851882935, "num_tokens": 9572738.0, "step": 136 }, { "entropy": 0.7438818514347076, "epoch": 2.74, "grad_norm": 0.15866513550281525, "learning_rate": 0.0001, "loss": 0.7251607179641724, "mean_token_accuracy": 0.7865616679191589, "num_tokens": 9643339.0, "step": 137 }, { "entropy": 0.8008526265621185, "epoch": 2.76, "grad_norm": 0.17728553712368011, "learning_rate": 0.0001, "loss": 0.7907190322875977, "mean_token_accuracy": 0.7696272730827332, "num_tokens": 9712087.0, "step": 138 }, { "entropy": 0.7775652408599854, "epoch": 2.7800000000000002, "grad_norm": 0.16898134350776672, "learning_rate": 0.0001, "loss": 0.7762832641601562, "mean_token_accuracy": 0.7671337127685547, "num_tokens": 9787274.0, "step": 139 }, { "entropy": 0.7524736523628235, "epoch": 2.8, "grad_norm": 0.1687132865190506, "learning_rate": 0.0001, "loss": 0.7515966892242432, "mean_token_accuracy": 0.7743718028068542, "num_tokens": 9850649.0, "step": 140 }, { "entropy": 0.784816324710846, "epoch": 2.82, "grad_norm": 0.16266104578971863, "learning_rate": 0.0001, "loss": 0.7850303649902344, "mean_token_accuracy": 0.7671224176883698, "num_tokens": 9919647.0, "step": 141 }, { "entropy": 0.845661848783493, "epoch": 2.84, "grad_norm": 0.177549347281456, "learning_rate": 0.0001, "loss": 0.8321537375450134, "mean_token_accuracy": 0.7545971870422363, "num_tokens": 9988951.0, "step": 142 }, { "entropy": 0.7890813946723938, "epoch": 2.86, "grad_norm": 0.16998162865638733, "learning_rate": 0.0001, "loss": 0.7851375937461853, "mean_token_accuracy": 0.77273029088974, "num_tokens": 10059418.0, "step": 143 }, { "entropy": 0.8383583724498749, "epoch": 2.88, "grad_norm": 0.16811728477478027, "learning_rate": 0.0001, "loss": 0.8264563083648682, "mean_token_accuracy": 0.7561212778091431, "num_tokens": 10130582.0, "step": 144 }, { "entropy": 0.7998828291893005, "epoch": 2.9, "grad_norm": 0.162356436252594, "learning_rate": 0.0001, "loss": 0.7867046594619751, "mean_token_accuracy": 0.7678299248218536, "num_tokens": 10205184.0, "step": 145 }, { "entropy": 0.8201400637626648, "epoch": 2.92, "grad_norm": 0.1775413304567337, "learning_rate": 0.0001, "loss": 0.8155138492584229, "mean_token_accuracy": 0.7631427645683289, "num_tokens": 10272128.0, "step": 146 }, { "entropy": 0.8001563251018524, "epoch": 2.94, "grad_norm": 0.1714172512292862, "learning_rate": 0.0001, "loss": 0.7718967795372009, "mean_token_accuracy": 0.7731671333312988, "num_tokens": 10339140.0, "step": 147 }, { "entropy": 0.8686825633049011, "epoch": 2.96, "grad_norm": 0.1718156337738037, "learning_rate": 0.0001, "loss": 0.841813862323761, "mean_token_accuracy": 0.7538741528987885, "num_tokens": 10405402.0, "step": 148 }, { "entropy": 0.8255911767482758, "epoch": 2.98, "grad_norm": 0.17787101864814758, "learning_rate": 0.0001, "loss": 0.7991260290145874, "mean_token_accuracy": 0.7636489570140839, "num_tokens": 10473811.0, "step": 149 }, { "entropy": 0.8001417219638824, "epoch": 3.0, "grad_norm": 0.17027507722377777, "learning_rate": 0.0001, "loss": 0.7719438076019287, "mean_token_accuracy": 0.7698873281478882, "num_tokens": 10546089.0, "step": 150 }, { "entropy": 0.8200977146625519, "epoch": 3.02, "grad_norm": 0.16800017654895782, "learning_rate": 0.0001, "loss": 0.7360785007476807, "mean_token_accuracy": 0.7826903462409973, "num_tokens": 10618015.0, "step": 151 }, { "entropy": 0.8175333142280579, "epoch": 3.04, "grad_norm": 0.18896523118019104, "learning_rate": 0.0001, "loss": 0.7504415512084961, "mean_token_accuracy": 0.7746379971504211, "num_tokens": 10688911.0, "step": 152 }, { "entropy": 0.7592836618423462, "epoch": 3.06, "grad_norm": 0.18069066107273102, "learning_rate": 0.0001, "loss": 0.7176339626312256, "mean_token_accuracy": 0.7862937152385712, "num_tokens": 10755190.0, "step": 153 }, { "entropy": 0.7064773738384247, "epoch": 3.08, "grad_norm": 0.17506442964076996, "learning_rate": 0.0001, "loss": 0.6661837697029114, "mean_token_accuracy": 0.7990798652172089, "num_tokens": 10824572.0, "step": 154 }, { "entropy": 0.7049046158790588, "epoch": 3.1, "grad_norm": 0.18128055334091187, "learning_rate": 0.0001, "loss": 0.6970986127853394, "mean_token_accuracy": 0.7910968661308289, "num_tokens": 10897921.0, "step": 155 }, { "entropy": 0.7131330072879791, "epoch": 3.12, "grad_norm": 0.1793287843465805, "learning_rate": 0.0001, "loss": 0.6969539523124695, "mean_token_accuracy": 0.7904528379440308, "num_tokens": 10967473.0, "step": 156 }, { "entropy": 0.7718028426170349, "epoch": 3.14, "grad_norm": 0.18882189691066742, "learning_rate": 0.0001, "loss": 0.7447178959846497, "mean_token_accuracy": 0.7770456969738007, "num_tokens": 11040256.0, "step": 157 }, { "entropy": 0.753845751285553, "epoch": 3.16, "grad_norm": 0.20335878431797028, "learning_rate": 0.0001, "loss": 0.7178476452827454, "mean_token_accuracy": 0.7853229939937592, "num_tokens": 11106853.0, "step": 158 }, { "entropy": 0.6985587477684021, "epoch": 3.18, "grad_norm": 0.18876291811466217, "learning_rate": 0.0001, "loss": 0.6741787195205688, "mean_token_accuracy": 0.7952553629875183, "num_tokens": 11178868.0, "step": 159 }, { "entropy": 0.7184737622737885, "epoch": 3.2, "grad_norm": 0.19795499742031097, "learning_rate": 0.0001, "loss": 0.6854847073554993, "mean_token_accuracy": 0.7917522490024567, "num_tokens": 11246484.0, "step": 160 }, { "entropy": 0.7506313323974609, "epoch": 3.22, "grad_norm": 0.2013498693704605, "learning_rate": 0.0001, "loss": 0.7236944437026978, "mean_token_accuracy": 0.7839900851249695, "num_tokens": 11319820.0, "step": 161 }, { "entropy": 0.7317833006381989, "epoch": 3.24, "grad_norm": 0.19697904586791992, "learning_rate": 0.0001, "loss": 0.7071319222450256, "mean_token_accuracy": 0.7910904288291931, "num_tokens": 11389201.0, "step": 162 }, { "entropy": 0.7270588874816895, "epoch": 3.26, "grad_norm": 0.19727207720279694, "learning_rate": 0.0001, "loss": 0.7034903168678284, "mean_token_accuracy": 0.7924522161483765, "num_tokens": 11458094.0, "step": 163 }, { "entropy": 0.6620264649391174, "epoch": 3.2800000000000002, "grad_norm": 0.1949145644903183, "learning_rate": 0.0001, "loss": 0.6431432366371155, "mean_token_accuracy": 0.8045243918895721, "num_tokens": 11526439.0, "step": 164 }, { "entropy": 0.7114729583263397, "epoch": 3.3, "grad_norm": 0.2044411301612854, "learning_rate": 0.0001, "loss": 0.6916588544845581, "mean_token_accuracy": 0.7911301851272583, "num_tokens": 11593907.0, "step": 165 }, { "entropy": 0.7394631803035736, "epoch": 3.32, "grad_norm": 0.20598116517066956, "learning_rate": 0.0001, "loss": 0.7143540978431702, "mean_token_accuracy": 0.7861869037151337, "num_tokens": 11659313.0, "step": 166 }, { "entropy": 0.7148211598396301, "epoch": 3.34, "grad_norm": 0.19798815250396729, "learning_rate": 0.0001, "loss": 0.6806311011314392, "mean_token_accuracy": 0.7966620624065399, "num_tokens": 11729203.0, "step": 167 }, { "entropy": 0.7278057634830475, "epoch": 3.36, "grad_norm": 0.2106526643037796, "learning_rate": 0.0001, "loss": 0.6907294392585754, "mean_token_accuracy": 0.7917556762695312, "num_tokens": 11798662.0, "step": 168 }, { "entropy": 0.7575972974300385, "epoch": 3.38, "grad_norm": 0.19657012820243835, "learning_rate": 0.0001, "loss": 0.7215894460678101, "mean_token_accuracy": 0.7850257754325867, "num_tokens": 11874700.0, "step": 169 }, { "entropy": 0.7198713719844818, "epoch": 3.4, "grad_norm": 0.19392815232276917, "learning_rate": 0.0001, "loss": 0.6976982355117798, "mean_token_accuracy": 0.7894782423973083, "num_tokens": 11946770.0, "step": 170 }, { "entropy": 0.6691116690635681, "epoch": 3.42, "grad_norm": 0.1919872909784317, "learning_rate": 0.0001, "loss": 0.6429901123046875, "mean_token_accuracy": 0.8067097663879395, "num_tokens": 12016943.0, "step": 171 }, { "entropy": 0.7087913751602173, "epoch": 3.44, "grad_norm": 0.19245345890522003, "learning_rate": 0.0001, "loss": 0.6743010878562927, "mean_token_accuracy": 0.8007382750511169, "num_tokens": 12088223.0, "step": 172 }, { "entropy": 0.7334369122982025, "epoch": 3.46, "grad_norm": 0.1944996863603592, "learning_rate": 0.0001, "loss": 0.7241754531860352, "mean_token_accuracy": 0.781945675611496, "num_tokens": 12164031.0, "step": 173 }, { "entropy": 0.7216465771198273, "epoch": 3.48, "grad_norm": 0.195100337266922, "learning_rate": 0.0001, "loss": 0.6905370950698853, "mean_token_accuracy": 0.7926844656467438, "num_tokens": 12235488.0, "step": 174 }, { "entropy": 0.7634322941303253, "epoch": 3.5, "grad_norm": 0.20126116275787354, "learning_rate": 0.0001, "loss": 0.7199342250823975, "mean_token_accuracy": 0.784062385559082, "num_tokens": 12304402.0, "step": 175 }, { "entropy": 0.7162297964096069, "epoch": 3.52, "grad_norm": 0.19708800315856934, "learning_rate": 0.0001, "loss": 0.6828768253326416, "mean_token_accuracy": 0.7963770925998688, "num_tokens": 12376874.0, "step": 176 }, { "entropy": 0.7292175590991974, "epoch": 3.54, "grad_norm": 0.19853827357292175, "learning_rate": 0.0001, "loss": 0.6944613456726074, "mean_token_accuracy": 0.7901931405067444, "num_tokens": 12443682.0, "step": 177 }, { "entropy": 0.7690876424312592, "epoch": 3.56, "grad_norm": 0.2102740854024887, "learning_rate": 0.0001, "loss": 0.7348027229309082, "mean_token_accuracy": 0.7807092070579529, "num_tokens": 12511430.0, "step": 178 }, { "entropy": 0.7362220287322998, "epoch": 3.58, "grad_norm": 0.20193730294704437, "learning_rate": 0.0001, "loss": 0.7197112441062927, "mean_token_accuracy": 0.7791264057159424, "num_tokens": 12582173.0, "step": 179 }, { "entropy": 0.716655433177948, "epoch": 3.6, "grad_norm": 0.19548293948173523, "learning_rate": 0.0001, "loss": 0.7020804286003113, "mean_token_accuracy": 0.789775550365448, "num_tokens": 12655124.0, "step": 180 }, { "entropy": 0.7400652468204498, "epoch": 3.62, "grad_norm": 0.20551350712776184, "learning_rate": 0.0001, "loss": 0.7202802300453186, "mean_token_accuracy": 0.7863712012767792, "num_tokens": 12728612.0, "step": 181 }, { "entropy": 0.7541409730911255, "epoch": 3.64, "grad_norm": 0.200267493724823, "learning_rate": 0.0001, "loss": 0.713320255279541, "mean_token_accuracy": 0.7859389185905457, "num_tokens": 12800056.0, "step": 182 }, { "entropy": 0.6940381526947021, "epoch": 3.66, "grad_norm": 0.19558116793632507, "learning_rate": 0.0001, "loss": 0.6574203968048096, "mean_token_accuracy": 0.8014397621154785, "num_tokens": 12868372.0, "step": 183 }, { "entropy": 0.7630845606327057, "epoch": 3.68, "grad_norm": 0.20073311030864716, "learning_rate": 0.0001, "loss": 0.7155758738517761, "mean_token_accuracy": 0.7896965146064758, "num_tokens": 12937518.0, "step": 184 }, { "entropy": 0.7708411812782288, "epoch": 3.7, "grad_norm": 0.22150248289108276, "learning_rate": 0.0001, "loss": 0.7369881868362427, "mean_token_accuracy": 0.7802594602108002, "num_tokens": 13003915.0, "step": 185 }, { "entropy": 0.7173754870891571, "epoch": 3.7199999999999998, "grad_norm": 0.19912731647491455, "learning_rate": 0.0001, "loss": 0.6876958608627319, "mean_token_accuracy": 0.7933018803596497, "num_tokens": 13075561.0, "step": 186 }, { "entropy": 0.7382989227771759, "epoch": 3.74, "grad_norm": 0.20131585001945496, "learning_rate": 0.0001, "loss": 0.7099729180335999, "mean_token_accuracy": 0.7907689809799194, "num_tokens": 13147726.0, "step": 187 }, { "entropy": 0.7296792566776276, "epoch": 3.76, "grad_norm": 0.19849984347820282, "learning_rate": 0.0001, "loss": 0.7037006616592407, "mean_token_accuracy": 0.7868267595767975, "num_tokens": 13219764.0, "step": 188 }, { "entropy": 0.7335399687290192, "epoch": 3.7800000000000002, "grad_norm": 0.20115980505943298, "learning_rate": 0.0001, "loss": 0.7100788354873657, "mean_token_accuracy": 0.786194235086441, "num_tokens": 13291698.0, "step": 189 }, { "entropy": 0.7148082256317139, "epoch": 3.8, "grad_norm": 0.19843769073486328, "learning_rate": 0.0001, "loss": 0.6846855878829956, "mean_token_accuracy": 0.7930681705474854, "num_tokens": 13364738.0, "step": 190 }, { "entropy": 0.71998131275177, "epoch": 3.82, "grad_norm": 0.20854182541370392, "learning_rate": 0.0001, "loss": 0.6897561550140381, "mean_token_accuracy": 0.7933003902435303, "num_tokens": 13436984.0, "step": 191 }, { "entropy": 0.7520318031311035, "epoch": 3.84, "grad_norm": 0.21299579739570618, "learning_rate": 0.0001, "loss": 0.7223616242408752, "mean_token_accuracy": 0.7838756442070007, "num_tokens": 13504383.0, "step": 192 }, { "entropy": 0.7173813283443451, "epoch": 3.86, "grad_norm": 0.20238681137561798, "learning_rate": 0.0001, "loss": 0.6963660717010498, "mean_token_accuracy": 0.7877775430679321, "num_tokens": 13578910.0, "step": 193 }, { "entropy": 0.7405160069465637, "epoch": 3.88, "grad_norm": 0.21617071330547333, "learning_rate": 0.0001, "loss": 0.7227989435195923, "mean_token_accuracy": 0.782155841588974, "num_tokens": 13646579.0, "step": 194 }, { "entropy": 0.6996143460273743, "epoch": 3.9, "grad_norm": 0.20972195267677307, "learning_rate": 0.0001, "loss": 0.6725365519523621, "mean_token_accuracy": 0.7987044751644135, "num_tokens": 13712265.0, "step": 195 }, { "entropy": 0.6924785077571869, "epoch": 3.92, "grad_norm": 0.20143532752990723, "learning_rate": 0.0001, "loss": 0.6744241118431091, "mean_token_accuracy": 0.7988313138484955, "num_tokens": 13778938.0, "step": 196 }, { "entropy": 0.7586347460746765, "epoch": 3.94, "grad_norm": 0.21675406396389008, "learning_rate": 0.0001, "loss": 0.720883846282959, "mean_token_accuracy": 0.7846451103687286, "num_tokens": 13850680.0, "step": 197 }, { "entropy": 0.7003247439861298, "epoch": 3.96, "grad_norm": 0.20092730224132538, "learning_rate": 0.0001, "loss": 0.6743336915969849, "mean_token_accuracy": 0.797335296869278, "num_tokens": 13922486.0, "step": 198 }, { "entropy": 0.7424158155918121, "epoch": 3.98, "grad_norm": 0.2068347930908203, "learning_rate": 0.0001, "loss": 0.7222142815589905, "mean_token_accuracy": 0.7855294048786163, "num_tokens": 13994794.0, "step": 199 }, { "entropy": 0.7328775823116302, "epoch": 4.0, "grad_norm": 0.21473339200019836, "learning_rate": 0.0001, "loss": 0.6824338436126709, "mean_token_accuracy": 0.7947524189949036, "num_tokens": 14060764.0, "step": 200 } ], "logging_steps": 1, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 8.561776579712123e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }