Instructions to use azeemazam/Qwen2.5-0.5B-SQL with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use azeemazam/Qwen2.5-0.5B-SQL with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-0.5B-Instruct") model = PeftModel.from_pretrained(base_model, "azeemazam/Qwen2.5-0.5B-SQL") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 2976, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.4401287615299225, | |
| "epoch": 0.010085728693898134, | |
| "grad_norm": 2.4543752670288086, | |
| "learning_rate": 9.96975806451613e-05, | |
| "loss": 1.6213287353515624, | |
| "mean_token_accuracy": 0.7053921639919281, | |
| "num_tokens": 79097.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.7891692698001862, | |
| "epoch": 0.020171457387796268, | |
| "grad_norm": 0.5390229821205139, | |
| "learning_rate": 9.936155913978495e-05, | |
| "loss": 0.7798945903778076, | |
| "mean_token_accuracy": 0.8249495834112167, | |
| "num_tokens": 158299.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.724391582608223, | |
| "epoch": 0.030257186081694403, | |
| "grad_norm": 0.5045413374900818, | |
| "learning_rate": 9.90255376344086e-05, | |
| "loss": 0.7134008407592773, | |
| "mean_token_accuracy": 0.8398919939994812, | |
| "num_tokens": 238224.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.7293597489595414, | |
| "epoch": 0.040342914775592535, | |
| "grad_norm": 0.46384477615356445, | |
| "learning_rate": 9.868951612903227e-05, | |
| "loss": 0.7243994235992431, | |
| "mean_token_accuracy": 0.8363275468349457, | |
| "num_tokens": 317353.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.7545649409294128, | |
| "epoch": 0.05042864346949067, | |
| "grad_norm": 0.45745861530303955, | |
| "learning_rate": 9.835349462365592e-05, | |
| "loss": 0.7480543613433838, | |
| "mean_token_accuracy": 0.8288968414068222, | |
| "num_tokens": 397144.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.7276962548494339, | |
| "epoch": 0.060514372163388806, | |
| "grad_norm": 0.4223039448261261, | |
| "learning_rate": 9.801747311827957e-05, | |
| "loss": 0.7222286701202393, | |
| "mean_token_accuracy": 0.8347062259912491, | |
| "num_tokens": 476208.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.7208940893411636, | |
| "epoch": 0.07060010085728693, | |
| "grad_norm": 0.407697468996048, | |
| "learning_rate": 9.768145161290323e-05, | |
| "loss": 0.722746753692627, | |
| "mean_token_accuracy": 0.8354023069143295, | |
| "num_tokens": 554635.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.6870111703872681, | |
| "epoch": 0.08068582955118507, | |
| "grad_norm": 0.4341161549091339, | |
| "learning_rate": 9.734543010752689e-05, | |
| "loss": 0.678754472732544, | |
| "mean_token_accuracy": 0.8434581071138382, | |
| "num_tokens": 634099.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.712015038728714, | |
| "epoch": 0.0907715582450832, | |
| "grad_norm": 0.44776472449302673, | |
| "learning_rate": 9.700940860215055e-05, | |
| "loss": 0.7065191268920898, | |
| "mean_token_accuracy": 0.8397477447986603, | |
| "num_tokens": 714006.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.7148925572633743, | |
| "epoch": 0.10085728693898134, | |
| "grad_norm": 0.5683232545852661, | |
| "learning_rate": 9.667338709677419e-05, | |
| "loss": 0.7013186454772949, | |
| "mean_token_accuracy": 0.8386768013238907, | |
| "num_tokens": 793605.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.6803987801074982, | |
| "epoch": 0.11094301563287948, | |
| "grad_norm": 0.4578818678855896, | |
| "learning_rate": 9.633736559139785e-05, | |
| "loss": 0.6829161643981934, | |
| "mean_token_accuracy": 0.8444311052560807, | |
| "num_tokens": 873358.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.7018243819475174, | |
| "epoch": 0.12102874432677761, | |
| "grad_norm": 0.5580450892448425, | |
| "learning_rate": 9.600134408602151e-05, | |
| "loss": 0.6889585018157959, | |
| "mean_token_accuracy": 0.837009659409523, | |
| "num_tokens": 951272.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.6722540825605392, | |
| "epoch": 0.13111447302067575, | |
| "grad_norm": 0.4111092984676361, | |
| "learning_rate": 9.566532258064517e-05, | |
| "loss": 0.671303653717041, | |
| "mean_token_accuracy": 0.8431149035692215, | |
| "num_tokens": 1030605.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.6760291874408721, | |
| "epoch": 0.14120020171457387, | |
| "grad_norm": 0.4307563900947571, | |
| "learning_rate": 9.532930107526882e-05, | |
| "loss": 0.6683278560638428, | |
| "mean_token_accuracy": 0.8399741470813751, | |
| "num_tokens": 1110880.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.6972564935684205, | |
| "epoch": 0.15128593040847202, | |
| "grad_norm": 0.4529708921909332, | |
| "learning_rate": 9.499327956989248e-05, | |
| "loss": 0.6857415199279785, | |
| "mean_token_accuracy": 0.8408671110868454, | |
| "num_tokens": 1190751.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.6963291883468627, | |
| "epoch": 0.16137165910237014, | |
| "grad_norm": 0.5361336469650269, | |
| "learning_rate": 9.465725806451613e-05, | |
| "loss": 0.6925512313842773, | |
| "mean_token_accuracy": 0.8375045716762543, | |
| "num_tokens": 1270609.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.66875439286232, | |
| "epoch": 0.1714573877962683, | |
| "grad_norm": 0.46975305676460266, | |
| "learning_rate": 9.43212365591398e-05, | |
| "loss": 0.6634211063385009, | |
| "mean_token_accuracy": 0.8445858895778656, | |
| "num_tokens": 1349205.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.655107605457306, | |
| "epoch": 0.1815431164901664, | |
| "grad_norm": 0.4822644293308258, | |
| "learning_rate": 9.398521505376344e-05, | |
| "loss": 0.6485553741455078, | |
| "mean_token_accuracy": 0.8466801524162293, | |
| "num_tokens": 1429188.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.6764869809150695, | |
| "epoch": 0.19162884518406456, | |
| "grad_norm": 0.4278046488761902, | |
| "learning_rate": 9.36491935483871e-05, | |
| "loss": 0.6674195289611816, | |
| "mean_token_accuracy": 0.8449790179729462, | |
| "num_tokens": 1508657.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.6527546226978302, | |
| "epoch": 0.20171457387796268, | |
| "grad_norm": 0.4304865598678589, | |
| "learning_rate": 9.331317204301076e-05, | |
| "loss": 0.6533342361450195, | |
| "mean_token_accuracy": 0.8459020614624023, | |
| "num_tokens": 1588683.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.6602984070777893, | |
| "epoch": 0.2118003025718608, | |
| "grad_norm": 0.4939623177051544, | |
| "learning_rate": 9.297715053763442e-05, | |
| "loss": 0.648746109008789, | |
| "mean_token_accuracy": 0.8454504400491715, | |
| "num_tokens": 1668136.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.6352969735860825, | |
| "epoch": 0.22188603126575895, | |
| "grad_norm": 0.509572446346283, | |
| "learning_rate": 9.264112903225807e-05, | |
| "loss": 0.6338551044464111, | |
| "mean_token_accuracy": 0.8501922994852066, | |
| "num_tokens": 1747761.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.640106874704361, | |
| "epoch": 0.23197175995965708, | |
| "grad_norm": 0.4373609721660614, | |
| "learning_rate": 9.230510752688173e-05, | |
| "loss": 0.63339204788208, | |
| "mean_token_accuracy": 0.8499221503734589, | |
| "num_tokens": 1826998.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.6553326368331909, | |
| "epoch": 0.24205748865355523, | |
| "grad_norm": 0.5667263269424438, | |
| "learning_rate": 9.196908602150538e-05, | |
| "loss": 0.6620019912719727, | |
| "mean_token_accuracy": 0.8443398654460907, | |
| "num_tokens": 1906898.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.6542477309703827, | |
| "epoch": 0.2521432173474534, | |
| "grad_norm": 0.42866837978363037, | |
| "learning_rate": 9.163306451612905e-05, | |
| "loss": 0.6385551452636719, | |
| "mean_token_accuracy": 0.8501411974430084, | |
| "num_tokens": 1986598.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.6644888401031495, | |
| "epoch": 0.2622289460413515, | |
| "grad_norm": 0.471479594707489, | |
| "learning_rate": 9.129704301075269e-05, | |
| "loss": 0.6652373790740966, | |
| "mean_token_accuracy": 0.8430449545383454, | |
| "num_tokens": 2065968.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.6506140828132629, | |
| "epoch": 0.2723146747352496, | |
| "grad_norm": 0.5871238112449646, | |
| "learning_rate": 9.096102150537635e-05, | |
| "loss": 0.6394162654876709, | |
| "mean_token_accuracy": 0.8478008478879928, | |
| "num_tokens": 2144807.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.6450737684965133, | |
| "epoch": 0.28240040342914774, | |
| "grad_norm": 0.4758750796318054, | |
| "learning_rate": 9.062500000000001e-05, | |
| "loss": 0.6317679405212402, | |
| "mean_token_accuracy": 0.8477421134710312, | |
| "num_tokens": 2224756.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.6312454760074615, | |
| "epoch": 0.2924861321230459, | |
| "grad_norm": 0.40708398818969727, | |
| "learning_rate": 9.028897849462365e-05, | |
| "loss": 0.6294290065765381, | |
| "mean_token_accuracy": 0.8498372942209244, | |
| "num_tokens": 2303755.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.6435921430587769, | |
| "epoch": 0.30257186081694404, | |
| "grad_norm": 0.4586315155029297, | |
| "learning_rate": 8.995295698924732e-05, | |
| "loss": 0.6426968574523926, | |
| "mean_token_accuracy": 0.851655799150467, | |
| "num_tokens": 2383438.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.6444200366735459, | |
| "epoch": 0.31265758951084216, | |
| "grad_norm": 0.41651129722595215, | |
| "learning_rate": 8.961693548387097e-05, | |
| "loss": 0.6398116111755371, | |
| "mean_token_accuracy": 0.8491226196289062, | |
| "num_tokens": 2462092.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.630822691321373, | |
| "epoch": 0.3227433182047403, | |
| "grad_norm": 0.3903122842311859, | |
| "learning_rate": 8.928091397849463e-05, | |
| "loss": 0.6180138111114502, | |
| "mean_token_accuracy": 0.8523771226406097, | |
| "num_tokens": 2540813.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.6329970508813858, | |
| "epoch": 0.3328290468986384, | |
| "grad_norm": 0.487721711397171, | |
| "learning_rate": 8.894489247311828e-05, | |
| "loss": 0.6315666198730469, | |
| "mean_token_accuracy": 0.851043239235878, | |
| "num_tokens": 2619658.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.6223464220762253, | |
| "epoch": 0.3429147755925366, | |
| "grad_norm": 0.44329893589019775, | |
| "learning_rate": 8.860887096774194e-05, | |
| "loss": 0.60896897315979, | |
| "mean_token_accuracy": 0.8548593938350677, | |
| "num_tokens": 2698558.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.629158017039299, | |
| "epoch": 0.3530005042864347, | |
| "grad_norm": 0.4763728976249695, | |
| "learning_rate": 8.827284946236559e-05, | |
| "loss": 0.6243833541870117, | |
| "mean_token_accuracy": 0.8506437599658966, | |
| "num_tokens": 2777589.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.6252221703529358, | |
| "epoch": 0.3630862329803328, | |
| "grad_norm": 0.573401153087616, | |
| "learning_rate": 8.793682795698926e-05, | |
| "loss": 0.6311960697174073, | |
| "mean_token_accuracy": 0.8492237269878388, | |
| "num_tokens": 2857260.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.6388662099838257, | |
| "epoch": 0.37317196167423095, | |
| "grad_norm": 0.43780848383903503, | |
| "learning_rate": 8.76008064516129e-05, | |
| "loss": 0.6235979557037353, | |
| "mean_token_accuracy": 0.8501455813646317, | |
| "num_tokens": 2937031.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.6401920437812805, | |
| "epoch": 0.3832576903681291, | |
| "grad_norm": 0.6186213493347168, | |
| "learning_rate": 8.726478494623656e-05, | |
| "loss": 0.6394696712493897, | |
| "mean_token_accuracy": 0.8473399400711059, | |
| "num_tokens": 3016793.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.636756744980812, | |
| "epoch": 0.39334341906202724, | |
| "grad_norm": 0.4315045177936554, | |
| "learning_rate": 8.692876344086022e-05, | |
| "loss": 0.633165979385376, | |
| "mean_token_accuracy": 0.8462948054075241, | |
| "num_tokens": 3096882.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.6365224033594131, | |
| "epoch": 0.40342914775592537, | |
| "grad_norm": 0.4226789176464081, | |
| "learning_rate": 8.659274193548388e-05, | |
| "loss": 0.6305986404418945, | |
| "mean_token_accuracy": 0.8494676142930985, | |
| "num_tokens": 3176078.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.6208570182323456, | |
| "epoch": 0.4135148764498235, | |
| "grad_norm": 0.4235779643058777, | |
| "learning_rate": 8.625672043010753e-05, | |
| "loss": 0.6180022716522217, | |
| "mean_token_accuracy": 0.8546466052532196, | |
| "num_tokens": 3254722.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.6532779157161712, | |
| "epoch": 0.4236006051437216, | |
| "grad_norm": 0.4319876730442047, | |
| "learning_rate": 8.592069892473119e-05, | |
| "loss": 0.6470151901245117, | |
| "mean_token_accuracy": 0.8489160239696503, | |
| "num_tokens": 3334393.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.6273243516683579, | |
| "epoch": 0.4336863338376198, | |
| "grad_norm": 0.46169838309288025, | |
| "learning_rate": 8.558467741935484e-05, | |
| "loss": 0.6159895896911621, | |
| "mean_token_accuracy": 0.8507320910692215, | |
| "num_tokens": 3413175.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.605324798822403, | |
| "epoch": 0.4437720625315179, | |
| "grad_norm": 0.4526413083076477, | |
| "learning_rate": 8.524865591397851e-05, | |
| "loss": 0.6038426876068115, | |
| "mean_token_accuracy": 0.8523322999477386, | |
| "num_tokens": 3492802.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.6320730000734329, | |
| "epoch": 0.45385779122541603, | |
| "grad_norm": 0.44433295726776123, | |
| "learning_rate": 8.491263440860215e-05, | |
| "loss": 0.6316131114959717, | |
| "mean_token_accuracy": 0.8506852626800537, | |
| "num_tokens": 3572664.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.6317211121320725, | |
| "epoch": 0.46394351991931415, | |
| "grad_norm": 0.4498536288738251, | |
| "learning_rate": 8.457661290322581e-05, | |
| "loss": 0.6204007148742676, | |
| "mean_token_accuracy": 0.853309515118599, | |
| "num_tokens": 3652196.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.6048054486513138, | |
| "epoch": 0.47402924861321233, | |
| "grad_norm": 0.45512956380844116, | |
| "learning_rate": 8.424059139784947e-05, | |
| "loss": 0.5983153820037842, | |
| "mean_token_accuracy": 0.8557393223047256, | |
| "num_tokens": 3731796.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.6131872147321701, | |
| "epoch": 0.48411497730711045, | |
| "grad_norm": 0.39910048246383667, | |
| "learning_rate": 8.390456989247311e-05, | |
| "loss": 0.6079683303833008, | |
| "mean_token_accuracy": 0.8534030020236969, | |
| "num_tokens": 3811294.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.6184361279010773, | |
| "epoch": 0.49420070600100857, | |
| "grad_norm": 0.45986732840538025, | |
| "learning_rate": 8.356854838709678e-05, | |
| "loss": 0.6137691497802734, | |
| "mean_token_accuracy": 0.8516123294830322, | |
| "num_tokens": 3890846.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.6471396833658218, | |
| "epoch": 0.5042864346949067, | |
| "grad_norm": 0.49332594871520996, | |
| "learning_rate": 8.323252688172043e-05, | |
| "loss": 0.6466721057891845, | |
| "mean_token_accuracy": 0.8456789135932923, | |
| "num_tokens": 3970491.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.6282050013542175, | |
| "epoch": 0.5143721633888049, | |
| "grad_norm": 0.4807436168193817, | |
| "learning_rate": 8.289650537634409e-05, | |
| "loss": 0.6175512313842774, | |
| "mean_token_accuracy": 0.8522112727165222, | |
| "num_tokens": 4050021.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.6226097255945205, | |
| "epoch": 0.524457892082703, | |
| "grad_norm": 0.40654024481773376, | |
| "learning_rate": 8.256048387096774e-05, | |
| "loss": 0.6200938701629639, | |
| "mean_token_accuracy": 0.8494216620922088, | |
| "num_tokens": 4129976.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.6335893511772156, | |
| "epoch": 0.5345436207766011, | |
| "grad_norm": 0.4114026427268982, | |
| "learning_rate": 8.22244623655914e-05, | |
| "loss": 0.6252026081085205, | |
| "mean_token_accuracy": 0.8503925174474716, | |
| "num_tokens": 4210291.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.6135816037654876, | |
| "epoch": 0.5446293494704992, | |
| "grad_norm": 0.41848844289779663, | |
| "learning_rate": 8.188844086021506e-05, | |
| "loss": 0.6145244121551514, | |
| "mean_token_accuracy": 0.8571697324514389, | |
| "num_tokens": 4290179.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.6119378715753555, | |
| "epoch": 0.5547150781643974, | |
| "grad_norm": 0.48698148131370544, | |
| "learning_rate": 8.155241935483872e-05, | |
| "loss": 0.6051679134368897, | |
| "mean_token_accuracy": 0.853746697306633, | |
| "num_tokens": 4368707.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.603636771440506, | |
| "epoch": 0.5648008068582955, | |
| "grad_norm": 0.4577937424182892, | |
| "learning_rate": 8.121639784946236e-05, | |
| "loss": 0.5904152870178223, | |
| "mean_token_accuracy": 0.854565218091011, | |
| "num_tokens": 4448005.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.6001244992017746, | |
| "epoch": 0.5748865355521936, | |
| "grad_norm": 0.5210131406784058, | |
| "learning_rate": 8.088037634408603e-05, | |
| "loss": 0.6008370399475098, | |
| "mean_token_accuracy": 0.8562947660684586, | |
| "num_tokens": 4526862.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.6188263714313507, | |
| "epoch": 0.5849722642460918, | |
| "grad_norm": 0.47299662232398987, | |
| "learning_rate": 8.054435483870968e-05, | |
| "loss": 0.6188117027282715, | |
| "mean_token_accuracy": 0.8530359834432601, | |
| "num_tokens": 4605637.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.6129011958837509, | |
| "epoch": 0.59505799293999, | |
| "grad_norm": 0.465508371591568, | |
| "learning_rate": 8.020833333333334e-05, | |
| "loss": 0.6022593021392822, | |
| "mean_token_accuracy": 0.8554005295038223, | |
| "num_tokens": 4685017.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.6162968903779984, | |
| "epoch": 0.6051437216338881, | |
| "grad_norm": 0.43233755230903625, | |
| "learning_rate": 7.9872311827957e-05, | |
| "loss": 0.6092077732086182, | |
| "mean_token_accuracy": 0.8540722340345382, | |
| "num_tokens": 4765201.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.600800535082817, | |
| "epoch": 0.6152294503277862, | |
| "grad_norm": 0.38787180185317993, | |
| "learning_rate": 7.953629032258065e-05, | |
| "loss": 0.5950473785400391, | |
| "mean_token_accuracy": 0.8578711360692978, | |
| "num_tokens": 4844272.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.6160470128059388, | |
| "epoch": 0.6253151790216843, | |
| "grad_norm": 0.5581951141357422, | |
| "learning_rate": 7.920026881720431e-05, | |
| "loss": 0.6130586624145508, | |
| "mean_token_accuracy": 0.8534553349018097, | |
| "num_tokens": 4923984.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.6198133587837219, | |
| "epoch": 0.6354009077155824, | |
| "grad_norm": 0.4616735279560089, | |
| "learning_rate": 7.886424731182797e-05, | |
| "loss": 0.6103284358978271, | |
| "mean_token_accuracy": 0.8518910020589828, | |
| "num_tokens": 5003560.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.6080410033464432, | |
| "epoch": 0.6454866364094806, | |
| "grad_norm": 0.42364850640296936, | |
| "learning_rate": 7.852822580645161e-05, | |
| "loss": 0.6008682250976562, | |
| "mean_token_accuracy": 0.8532625198364258, | |
| "num_tokens": 5083721.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.6005331248044967, | |
| "epoch": 0.6555723651033787, | |
| "grad_norm": 0.4882436692714691, | |
| "learning_rate": 7.819220430107528e-05, | |
| "loss": 0.6017726421356201, | |
| "mean_token_accuracy": 0.8539737015962601, | |
| "num_tokens": 5162794.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.6231147140264511, | |
| "epoch": 0.6656580937972768, | |
| "grad_norm": 0.43205761909484863, | |
| "learning_rate": 7.785618279569893e-05, | |
| "loss": 0.6104018688201904, | |
| "mean_token_accuracy": 0.8523163944482803, | |
| "num_tokens": 5242716.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.5988608807325363, | |
| "epoch": 0.675743822491175, | |
| "grad_norm": 0.45438122749328613, | |
| "learning_rate": 7.752016129032259e-05, | |
| "loss": 0.6024129390716553, | |
| "mean_token_accuracy": 0.8553207635879516, | |
| "num_tokens": 5321928.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.6223491996526718, | |
| "epoch": 0.6858295511850732, | |
| "grad_norm": 0.4512474834918976, | |
| "learning_rate": 7.718413978494624e-05, | |
| "loss": 0.6082096099853516, | |
| "mean_token_accuracy": 0.8545188844203949, | |
| "num_tokens": 5401348.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.6194269865751266, | |
| "epoch": 0.6959152798789713, | |
| "grad_norm": 0.4599096179008484, | |
| "learning_rate": 7.684811827956989e-05, | |
| "loss": 0.6193777561187744, | |
| "mean_token_accuracy": 0.8514397442340851, | |
| "num_tokens": 5480681.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.6062219262123107, | |
| "epoch": 0.7060010085728694, | |
| "grad_norm": 0.5039567947387695, | |
| "learning_rate": 7.651209677419356e-05, | |
| "loss": 0.5999524116516113, | |
| "mean_token_accuracy": 0.8567820072174073, | |
| "num_tokens": 5559946.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.59709934592247, | |
| "epoch": 0.7160867372667675, | |
| "grad_norm": 0.3883519470691681, | |
| "learning_rate": 7.61760752688172e-05, | |
| "loss": 0.5958030700683594, | |
| "mean_token_accuracy": 0.8547020137310029, | |
| "num_tokens": 5638762.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.6092049956321717, | |
| "epoch": 0.7261724659606656, | |
| "grad_norm": 0.4532882273197174, | |
| "learning_rate": 7.584005376344086e-05, | |
| "loss": 0.5958750724792481, | |
| "mean_token_accuracy": 0.8556324869394303, | |
| "num_tokens": 5718851.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.6095692694187165, | |
| "epoch": 0.7362581946545638, | |
| "grad_norm": 0.4741406738758087, | |
| "learning_rate": 7.550403225806452e-05, | |
| "loss": 0.610473346710205, | |
| "mean_token_accuracy": 0.8528454750776291, | |
| "num_tokens": 5797970.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.6113681852817535, | |
| "epoch": 0.7463439233484619, | |
| "grad_norm": 0.4759446382522583, | |
| "learning_rate": 7.516801075268818e-05, | |
| "loss": 0.6012178421020508, | |
| "mean_token_accuracy": 0.8544665992259979, | |
| "num_tokens": 5876757.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.6085548311471939, | |
| "epoch": 0.75642965204236, | |
| "grad_norm": 0.41346922516822815, | |
| "learning_rate": 7.483198924731182e-05, | |
| "loss": 0.6044020652770996, | |
| "mean_token_accuracy": 0.8550712764263153, | |
| "num_tokens": 5955819.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.6155774682760239, | |
| "epoch": 0.7665153807362582, | |
| "grad_norm": 0.4597516357898712, | |
| "learning_rate": 7.44959677419355e-05, | |
| "loss": 0.6060014247894288, | |
| "mean_token_accuracy": 0.8542042136192322, | |
| "num_tokens": 6035167.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.6068645745515824, | |
| "epoch": 0.7766011094301564, | |
| "grad_norm": 0.4649045765399933, | |
| "learning_rate": 7.415994623655914e-05, | |
| "loss": 0.6007673740386963, | |
| "mean_token_accuracy": 0.8525227665901184, | |
| "num_tokens": 6113853.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.6005396485328675, | |
| "epoch": 0.7866868381240545, | |
| "grad_norm": 0.48349109292030334, | |
| "learning_rate": 7.382392473118281e-05, | |
| "loss": 0.5998473167419434, | |
| "mean_token_accuracy": 0.8538594901561737, | |
| "num_tokens": 6193206.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.6022996723651886, | |
| "epoch": 0.7967725668179526, | |
| "grad_norm": 0.49629247188568115, | |
| "learning_rate": 7.348790322580645e-05, | |
| "loss": 0.597620677947998, | |
| "mean_token_accuracy": 0.8530676156282425, | |
| "num_tokens": 6271687.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.5972118631005288, | |
| "epoch": 0.8068582955118507, | |
| "grad_norm": 0.4917770028114319, | |
| "learning_rate": 7.315188172043011e-05, | |
| "loss": 0.5890127658843994, | |
| "mean_token_accuracy": 0.8561224609613418, | |
| "num_tokens": 6351649.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.5830775499343872, | |
| "epoch": 0.8169440242057489, | |
| "grad_norm": 0.43750327825546265, | |
| "learning_rate": 7.281586021505377e-05, | |
| "loss": 0.5748737335205079, | |
| "mean_token_accuracy": 0.857504940032959, | |
| "num_tokens": 6431689.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.5911667436361313, | |
| "epoch": 0.827029752899647, | |
| "grad_norm": 0.45151153206825256, | |
| "learning_rate": 7.247983870967743e-05, | |
| "loss": 0.5893730163574219, | |
| "mean_token_accuracy": 0.8561951071023941, | |
| "num_tokens": 6510170.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 0.6108928948640824, | |
| "epoch": 0.8371154815935451, | |
| "grad_norm": 0.42554008960723877, | |
| "learning_rate": 7.214381720430107e-05, | |
| "loss": 0.6033421039581299, | |
| "mean_token_accuracy": 0.8555109530687333, | |
| "num_tokens": 6590115.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 0.6150878429412842, | |
| "epoch": 0.8472012102874432, | |
| "grad_norm": 0.4883771538734436, | |
| "learning_rate": 7.180779569892473e-05, | |
| "loss": 0.6113218307495117, | |
| "mean_token_accuracy": 0.8518930107355118, | |
| "num_tokens": 6669457.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 0.6158306688070297, | |
| "epoch": 0.8572869389813415, | |
| "grad_norm": 0.4417215883731842, | |
| "learning_rate": 7.147177419354839e-05, | |
| "loss": 0.6072550296783448, | |
| "mean_token_accuracy": 0.852121776342392, | |
| "num_tokens": 6748544.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.6014792859554291, | |
| "epoch": 0.8673726676752396, | |
| "grad_norm": 0.47120651602745056, | |
| "learning_rate": 7.113575268817205e-05, | |
| "loss": 0.6035449504852295, | |
| "mean_token_accuracy": 0.855668443441391, | |
| "num_tokens": 6828527.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 0.610417115688324, | |
| "epoch": 0.8774583963691377, | |
| "grad_norm": 0.4029320478439331, | |
| "learning_rate": 7.07997311827957e-05, | |
| "loss": 0.5991814613342286, | |
| "mean_token_accuracy": 0.8501907676458359, | |
| "num_tokens": 6907265.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 0.5880232125520706, | |
| "epoch": 0.8875441250630358, | |
| "grad_norm": 0.44422170519828796, | |
| "learning_rate": 7.046370967741935e-05, | |
| "loss": 0.589336633682251, | |
| "mean_token_accuracy": 0.8592681288719177, | |
| "num_tokens": 6987355.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 0.6167952179908752, | |
| "epoch": 0.8976298537569339, | |
| "grad_norm": 0.47287294268608093, | |
| "learning_rate": 7.012768817204302e-05, | |
| "loss": 0.6005054950714112, | |
| "mean_token_accuracy": 0.8538300514221191, | |
| "num_tokens": 7067079.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 0.6062485039234161, | |
| "epoch": 0.9077155824508321, | |
| "grad_norm": 0.4330484867095947, | |
| "learning_rate": 6.979166666666666e-05, | |
| "loss": 0.6009212017059327, | |
| "mean_token_accuracy": 0.8540766119956971, | |
| "num_tokens": 7146070.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.6166725903749466, | |
| "epoch": 0.9178013111447302, | |
| "grad_norm": 0.4636240303516388, | |
| "learning_rate": 6.945564516129032e-05, | |
| "loss": 0.6120401859283447, | |
| "mean_token_accuracy": 0.8512512564659118, | |
| "num_tokens": 7225040.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 0.5857499420642853, | |
| "epoch": 0.9278870398386283, | |
| "grad_norm": 0.45182108879089355, | |
| "learning_rate": 6.911962365591398e-05, | |
| "loss": 0.5876169204711914, | |
| "mean_token_accuracy": 0.8554476648569107, | |
| "num_tokens": 7304455.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 0.6012028098106384, | |
| "epoch": 0.9379727685325264, | |
| "grad_norm": 0.4051869213581085, | |
| "learning_rate": 6.878360215053764e-05, | |
| "loss": 0.5880671977996826, | |
| "mean_token_accuracy": 0.8549540996551513, | |
| "num_tokens": 7383515.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 0.6061528742313385, | |
| "epoch": 0.9480584972264247, | |
| "grad_norm": 0.4764135479927063, | |
| "learning_rate": 6.84475806451613e-05, | |
| "loss": 0.5949277877807617, | |
| "mean_token_accuracy": 0.8549325942993165, | |
| "num_tokens": 7462560.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 0.5890018880367279, | |
| "epoch": 0.9581442259203228, | |
| "grad_norm": 0.3977248966693878, | |
| "learning_rate": 6.811155913978495e-05, | |
| "loss": 0.5861643314361572, | |
| "mean_token_accuracy": 0.8562160313129425, | |
| "num_tokens": 7542318.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.569082447886467, | |
| "epoch": 0.9682299546142209, | |
| "grad_norm": 0.45443686842918396, | |
| "learning_rate": 6.77755376344086e-05, | |
| "loss": 0.5597212314605713, | |
| "mean_token_accuracy": 0.8636837095022202, | |
| "num_tokens": 7619896.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 0.6035693377256394, | |
| "epoch": 0.978315683308119, | |
| "grad_norm": 0.4136727452278137, | |
| "learning_rate": 6.743951612903227e-05, | |
| "loss": 0.5982972145080566, | |
| "mean_token_accuracy": 0.852931946516037, | |
| "num_tokens": 7699479.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 0.6018765300512314, | |
| "epoch": 0.9884014120020171, | |
| "grad_norm": 0.4627329707145691, | |
| "learning_rate": 6.710349462365591e-05, | |
| "loss": 0.6014264106750489, | |
| "mean_token_accuracy": 0.8550704807043076, | |
| "num_tokens": 7777973.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 0.6101315438747406, | |
| "epoch": 0.9984871406959153, | |
| "grad_norm": 0.43074938654899597, | |
| "learning_rate": 6.676747311827957e-05, | |
| "loss": 0.6003837585449219, | |
| "mean_token_accuracy": 0.8531194061040879, | |
| "num_tokens": 7857491.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 0.5885249046902907, | |
| "epoch": 1.0080685829551186, | |
| "grad_norm": 0.43550798296928406, | |
| "learning_rate": 6.643145161290323e-05, | |
| "loss": 0.5827617645263672, | |
| "mean_token_accuracy": 0.8590492982613412, | |
| "num_tokens": 7931419.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.5786265924572944, | |
| "epoch": 1.0181543116490166, | |
| "grad_norm": 0.4006239175796509, | |
| "learning_rate": 6.609543010752689e-05, | |
| "loss": 0.5741347312927246, | |
| "mean_token_accuracy": 0.859987598657608, | |
| "num_tokens": 8010076.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 0.6029427081346512, | |
| "epoch": 1.0282400403429148, | |
| "grad_norm": 0.5301637649536133, | |
| "learning_rate": 6.575940860215055e-05, | |
| "loss": 0.5843387603759765, | |
| "mean_token_accuracy": 0.8552656710147858, | |
| "num_tokens": 8089226.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 0.5827758759260178, | |
| "epoch": 1.0383257690368128, | |
| "grad_norm": 0.46098172664642334, | |
| "learning_rate": 6.542338709677419e-05, | |
| "loss": 0.5769033432006836, | |
| "mean_token_accuracy": 0.8591033697128296, | |
| "num_tokens": 8168296.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 0.578029453754425, | |
| "epoch": 1.048411497730711, | |
| "grad_norm": 0.4419442117214203, | |
| "learning_rate": 6.508736559139785e-05, | |
| "loss": 0.5668691158294678, | |
| "mean_token_accuracy": 0.8618250399827957, | |
| "num_tokens": 8247389.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 0.57004164904356, | |
| "epoch": 1.058497226424609, | |
| "grad_norm": 0.42728376388549805, | |
| "learning_rate": 6.47513440860215e-05, | |
| "loss": 0.5635159492492676, | |
| "mean_token_accuracy": 0.8611066967248917, | |
| "num_tokens": 8327733.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.5766539484262466, | |
| "epoch": 1.0685829551185073, | |
| "grad_norm": 0.45730945467948914, | |
| "learning_rate": 6.441532258064516e-05, | |
| "loss": 0.5666641235351563, | |
| "mean_token_accuracy": 0.8593446314334869, | |
| "num_tokens": 8407817.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 0.5864439934492112, | |
| "epoch": 1.0786686838124055, | |
| "grad_norm": 0.4544226825237274, | |
| "learning_rate": 6.407930107526882e-05, | |
| "loss": 0.5757258415222168, | |
| "mean_token_accuracy": 0.8577850371599197, | |
| "num_tokens": 8487535.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 0.5884994626045227, | |
| "epoch": 1.0887544125063036, | |
| "grad_norm": 0.48623108863830566, | |
| "learning_rate": 6.374327956989248e-05, | |
| "loss": 0.5825486183166504, | |
| "mean_token_accuracy": 0.8567618876695633, | |
| "num_tokens": 8567287.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 0.5760734975337982, | |
| "epoch": 1.0988401412002018, | |
| "grad_norm": 0.4508640468120575, | |
| "learning_rate": 6.340725806451612e-05, | |
| "loss": 0.5734494209289551, | |
| "mean_token_accuracy": 0.858697172999382, | |
| "num_tokens": 8646370.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 0.590225487947464, | |
| "epoch": 1.1089258698940998, | |
| "grad_norm": 0.43003523349761963, | |
| "learning_rate": 6.30712365591398e-05, | |
| "loss": 0.5778960704803466, | |
| "mean_token_accuracy": 0.8560095846652984, | |
| "num_tokens": 8726482.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.5984179466962815, | |
| "epoch": 1.119011598587998, | |
| "grad_norm": 0.4635157883167267, | |
| "learning_rate": 6.273521505376344e-05, | |
| "loss": 0.5918797016143799, | |
| "mean_token_accuracy": 0.8553583979606628, | |
| "num_tokens": 8805451.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 0.5844434216618538, | |
| "epoch": 1.129097327281896, | |
| "grad_norm": 0.4477420151233673, | |
| "learning_rate": 6.23991935483871e-05, | |
| "loss": 0.57535400390625, | |
| "mean_token_accuracy": 0.8573390394449234, | |
| "num_tokens": 8884601.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 0.5594617292284966, | |
| "epoch": 1.1391830559757943, | |
| "grad_norm": 0.4664854407310486, | |
| "learning_rate": 6.206317204301076e-05, | |
| "loss": 0.5436801910400391, | |
| "mean_token_accuracy": 0.8645383834838867, | |
| "num_tokens": 8962133.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 0.5811979010701179, | |
| "epoch": 1.1492687846696923, | |
| "grad_norm": 0.44287121295928955, | |
| "learning_rate": 6.172715053763441e-05, | |
| "loss": 0.5768415451049804, | |
| "mean_token_accuracy": 0.8589100211858749, | |
| "num_tokens": 9041544.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 0.5857019424438477, | |
| "epoch": 1.1593545133635905, | |
| "grad_norm": 0.49549591541290283, | |
| "learning_rate": 6.139112903225806e-05, | |
| "loss": 0.583711576461792, | |
| "mean_token_accuracy": 0.8538704454898834, | |
| "num_tokens": 9120658.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.5798764854669571, | |
| "epoch": 1.1694402420574885, | |
| "grad_norm": 0.45661458373069763, | |
| "learning_rate": 6.105510752688173e-05, | |
| "loss": 0.5687499046325684, | |
| "mean_token_accuracy": 0.8593120962381363, | |
| "num_tokens": 9200441.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 0.5608216986060143, | |
| "epoch": 1.1795259707513868, | |
| "grad_norm": 0.4311324656009674, | |
| "learning_rate": 6.0719086021505375e-05, | |
| "loss": 0.5529376029968261, | |
| "mean_token_accuracy": 0.8649492233991622, | |
| "num_tokens": 9280337.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 0.5674901068210602, | |
| "epoch": 1.189611699445285, | |
| "grad_norm": 0.42369771003723145, | |
| "learning_rate": 6.038306451612904e-05, | |
| "loss": 0.5703757762908935, | |
| "mean_token_accuracy": 0.8604072660207749, | |
| "num_tokens": 9359718.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 0.5913670003414154, | |
| "epoch": 1.199697428139183, | |
| "grad_norm": 0.42738214135169983, | |
| "learning_rate": 6.004704301075269e-05, | |
| "loss": 0.5724913597106933, | |
| "mean_token_accuracy": 0.8573768496513366, | |
| "num_tokens": 9438541.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 0.5946374118328095, | |
| "epoch": 1.2097831568330812, | |
| "grad_norm": 0.4449988901615143, | |
| "learning_rate": 5.9711021505376355e-05, | |
| "loss": 0.587339973449707, | |
| "mean_token_accuracy": 0.8539384603500366, | |
| "num_tokens": 9518019.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.5591581493616105, | |
| "epoch": 1.2198688855269793, | |
| "grad_norm": 0.500762939453125, | |
| "learning_rate": 5.9375e-05, | |
| "loss": 0.5534748077392578, | |
| "mean_token_accuracy": 0.8654944837093353, | |
| "num_tokens": 9598123.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 0.5613914996385574, | |
| "epoch": 1.2299546142208775, | |
| "grad_norm": 0.49419164657592773, | |
| "learning_rate": 5.903897849462365e-05, | |
| "loss": 0.552029800415039, | |
| "mean_token_accuracy": 0.8651645094156265, | |
| "num_tokens": 9677061.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 0.5790321677923203, | |
| "epoch": 1.2400403429147757, | |
| "grad_norm": 0.45684942603111267, | |
| "learning_rate": 5.8702956989247316e-05, | |
| "loss": 0.5709888935089111, | |
| "mean_token_accuracy": 0.8570766538381577, | |
| "num_tokens": 9755822.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 0.5670598953962326, | |
| "epoch": 1.2501260716086737, | |
| "grad_norm": 0.4502805471420288, | |
| "learning_rate": 5.836693548387097e-05, | |
| "loss": 0.5562293052673339, | |
| "mean_token_accuracy": 0.8617229491472245, | |
| "num_tokens": 9833630.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 0.5812987759709358, | |
| "epoch": 1.2602118003025717, | |
| "grad_norm": 0.47911354899406433, | |
| "learning_rate": 5.8030913978494625e-05, | |
| "loss": 0.5785074710845948, | |
| "mean_token_accuracy": 0.8579352408647537, | |
| "num_tokens": 9913298.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.5942406296730042, | |
| "epoch": 1.27029752899647, | |
| "grad_norm": 0.5416054129600525, | |
| "learning_rate": 5.7694892473118276e-05, | |
| "loss": 0.5871072769165039, | |
| "mean_token_accuracy": 0.8525298267602921, | |
| "num_tokens": 9992390.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 0.5730470806360245, | |
| "epoch": 1.2803832576903682, | |
| "grad_norm": 0.42904311418533325, | |
| "learning_rate": 5.735887096774194e-05, | |
| "loss": 0.5617104530334472, | |
| "mean_token_accuracy": 0.8585203140974045, | |
| "num_tokens": 10072228.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 0.576186053454876, | |
| "epoch": 1.2904689863842662, | |
| "grad_norm": 0.48196178674697876, | |
| "learning_rate": 5.702284946236559e-05, | |
| "loss": 0.564885950088501, | |
| "mean_token_accuracy": 0.8605964362621308, | |
| "num_tokens": 10151335.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 0.6046586632728577, | |
| "epoch": 1.3005547150781644, | |
| "grad_norm": 0.5057108998298645, | |
| "learning_rate": 5.668682795698925e-05, | |
| "loss": 0.5939000129699707, | |
| "mean_token_accuracy": 0.8541617125272751, | |
| "num_tokens": 10231293.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 0.5814134299755096, | |
| "epoch": 1.3106404437720625, | |
| "grad_norm": 0.4809938669204712, | |
| "learning_rate": 5.63508064516129e-05, | |
| "loss": 0.5762624740600586, | |
| "mean_token_accuracy": 0.8582640796899795, | |
| "num_tokens": 10310793.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.5876763761043549, | |
| "epoch": 1.3207261724659607, | |
| "grad_norm": 0.4530595541000366, | |
| "learning_rate": 5.6014784946236566e-05, | |
| "loss": 0.5883693695068359, | |
| "mean_token_accuracy": 0.855881854891777, | |
| "num_tokens": 10390285.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 0.5655333667993545, | |
| "epoch": 1.330811901159859, | |
| "grad_norm": 0.4557790756225586, | |
| "learning_rate": 5.567876344086022e-05, | |
| "loss": 0.5549901962280274, | |
| "mean_token_accuracy": 0.8610905766487121, | |
| "num_tokens": 10470065.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 0.5945004314184189, | |
| "epoch": 1.340897629853757, | |
| "grad_norm": 0.436661958694458, | |
| "learning_rate": 5.5342741935483875e-05, | |
| "loss": 0.5859263896942138, | |
| "mean_token_accuracy": 0.8548474669456482, | |
| "num_tokens": 10549649.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 0.5685078948736191, | |
| "epoch": 1.350983358547655, | |
| "grad_norm": 0.4716840088367462, | |
| "learning_rate": 5.5006720430107526e-05, | |
| "loss": 0.5484930992126464, | |
| "mean_token_accuracy": 0.8640597611665726, | |
| "num_tokens": 10629189.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 0.5654298186302185, | |
| "epoch": 1.3610690872415532, | |
| "grad_norm": 0.42921242117881775, | |
| "learning_rate": 5.467069892473119e-05, | |
| "loss": 0.5640359401702881, | |
| "mean_token_accuracy": 0.860820859670639, | |
| "num_tokens": 10708703.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.5941716223955155, | |
| "epoch": 1.3711548159354514, | |
| "grad_norm": 0.46565788984298706, | |
| "learning_rate": 5.433467741935484e-05, | |
| "loss": 0.594744873046875, | |
| "mean_token_accuracy": 0.8517325460910797, | |
| "num_tokens": 10788480.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 0.5812072679400444, | |
| "epoch": 1.3812405446293494, | |
| "grad_norm": 0.4489298462867737, | |
| "learning_rate": 5.39986559139785e-05, | |
| "loss": 0.5654291152954102, | |
| "mean_token_accuracy": 0.8605479776859284, | |
| "num_tokens": 10868434.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 0.5879675418138504, | |
| "epoch": 1.3913262733232477, | |
| "grad_norm": 0.46651822328567505, | |
| "learning_rate": 5.366263440860215e-05, | |
| "loss": 0.5838429450988769, | |
| "mean_token_accuracy": 0.8583901137113571, | |
| "num_tokens": 10948050.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 0.5686550527811051, | |
| "epoch": 1.4014120020171457, | |
| "grad_norm": 0.43968766927719116, | |
| "learning_rate": 5.3326612903225816e-05, | |
| "loss": 0.558499813079834, | |
| "mean_token_accuracy": 0.8613751292228699, | |
| "num_tokens": 11028113.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 0.5755997136235237, | |
| "epoch": 1.411497730711044, | |
| "grad_norm": 0.4646352231502533, | |
| "learning_rate": 5.299059139784947e-05, | |
| "loss": 0.5624261856079101, | |
| "mean_token_accuracy": 0.8600882589817047, | |
| "num_tokens": 11107425.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.564902774989605, | |
| "epoch": 1.4215834594049421, | |
| "grad_norm": 0.49692341685295105, | |
| "learning_rate": 5.265456989247312e-05, | |
| "loss": 0.559935188293457, | |
| "mean_token_accuracy": 0.860372531414032, | |
| "num_tokens": 11186952.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 0.5890892148017883, | |
| "epoch": 1.4316691880988401, | |
| "grad_norm": 0.46546879410743713, | |
| "learning_rate": 5.2318548387096776e-05, | |
| "loss": 0.5763956546783447, | |
| "mean_token_accuracy": 0.8564515620470047, | |
| "num_tokens": 11266572.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 0.5781215921044349, | |
| "epoch": 1.4417549167927382, | |
| "grad_norm": 0.44149070978164673, | |
| "learning_rate": 5.198252688172043e-05, | |
| "loss": 0.572498369216919, | |
| "mean_token_accuracy": 0.8586721986532211, | |
| "num_tokens": 11346213.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 0.5667644247412682, | |
| "epoch": 1.4518406454866364, | |
| "grad_norm": 0.4551633894443512, | |
| "learning_rate": 5.164650537634409e-05, | |
| "loss": 0.562723970413208, | |
| "mean_token_accuracy": 0.8600044697523117, | |
| "num_tokens": 11425510.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 0.57702035009861, | |
| "epoch": 1.4619263741805346, | |
| "grad_norm": 0.45487403869628906, | |
| "learning_rate": 5.131048387096774e-05, | |
| "loss": 0.5618971824645996, | |
| "mean_token_accuracy": 0.8618997722864151, | |
| "num_tokens": 11503529.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.5790243059396744, | |
| "epoch": 1.4720121028744326, | |
| "grad_norm": 0.481052041053772, | |
| "learning_rate": 5.09744623655914e-05, | |
| "loss": 0.5712011814117431, | |
| "mean_token_accuracy": 0.8604255467653275, | |
| "num_tokens": 11581888.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 0.5728526920080185, | |
| "epoch": 1.4820978315683309, | |
| "grad_norm": 0.4831527769565582, | |
| "learning_rate": 5.063844086021505e-05, | |
| "loss": 0.5751055717468262, | |
| "mean_token_accuracy": 0.8597662955522537, | |
| "num_tokens": 11661311.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 0.5620998844504357, | |
| "epoch": 1.4921835602622289, | |
| "grad_norm": 0.462201327085495, | |
| "learning_rate": 5.030241935483872e-05, | |
| "loss": 0.5486450672149659, | |
| "mean_token_accuracy": 0.8637843191623688, | |
| "num_tokens": 11740118.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 0.5603026807308197, | |
| "epoch": 1.502269288956127, | |
| "grad_norm": 0.47398635745048523, | |
| "learning_rate": 4.996639784946237e-05, | |
| "loss": 0.545743751525879, | |
| "mean_token_accuracy": 0.8636046230793, | |
| "num_tokens": 11817914.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 0.5598662227392197, | |
| "epoch": 1.5123550176500253, | |
| "grad_norm": 0.4725417494773865, | |
| "learning_rate": 4.963037634408602e-05, | |
| "loss": 0.5522914409637452, | |
| "mean_token_accuracy": 0.8619683742523193, | |
| "num_tokens": 11896470.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 0.5722532019019126, | |
| "epoch": 1.5224407463439233, | |
| "grad_norm": 0.47333210706710815, | |
| "learning_rate": 4.929435483870968e-05, | |
| "loss": 0.5686895370483398, | |
| "mean_token_accuracy": 0.8594554871320724, | |
| "num_tokens": 11975221.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 0.5743500784039497, | |
| "epoch": 1.5325264750378214, | |
| "grad_norm": 0.498080313205719, | |
| "learning_rate": 4.8958333333333335e-05, | |
| "loss": 0.5648915290832519, | |
| "mean_token_accuracy": 0.858995920419693, | |
| "num_tokens": 12053927.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 0.5615316748619079, | |
| "epoch": 1.5426122037317196, | |
| "grad_norm": 0.4675048589706421, | |
| "learning_rate": 4.862231182795699e-05, | |
| "loss": 0.5583067893981933, | |
| "mean_token_accuracy": 0.862602812051773, | |
| "num_tokens": 12133779.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 0.5674820989370346, | |
| "epoch": 1.5526979324256178, | |
| "grad_norm": 0.479189932346344, | |
| "learning_rate": 4.8286290322580644e-05, | |
| "loss": 0.5581048965454102, | |
| "mean_token_accuracy": 0.859470346570015, | |
| "num_tokens": 12213321.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 0.5720546498894692, | |
| "epoch": 1.5627836611195158, | |
| "grad_norm": 0.4640292823314667, | |
| "learning_rate": 4.79502688172043e-05, | |
| "loss": 0.5651350498199463, | |
| "mean_token_accuracy": 0.8625688463449478, | |
| "num_tokens": 12293425.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 0.5659960642457008, | |
| "epoch": 1.572869389813414, | |
| "grad_norm": 0.4951878488063812, | |
| "learning_rate": 4.761424731182796e-05, | |
| "loss": 0.5468338966369629, | |
| "mean_token_accuracy": 0.8602778345346451, | |
| "num_tokens": 12371939.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 0.5816718444228173, | |
| "epoch": 1.582955118507312, | |
| "grad_norm": 0.4827718436717987, | |
| "learning_rate": 4.727822580645161e-05, | |
| "loss": 0.5749332427978515, | |
| "mean_token_accuracy": 0.8562595009803772, | |
| "num_tokens": 12451620.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 0.5692623853683472, | |
| "epoch": 1.5930408472012103, | |
| "grad_norm": 0.5074397921562195, | |
| "learning_rate": 4.694220430107527e-05, | |
| "loss": 0.5635262489318847, | |
| "mean_token_accuracy": 0.859693843126297, | |
| "num_tokens": 12531500.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 0.5688315823674202, | |
| "epoch": 1.6031265758951085, | |
| "grad_norm": 0.47028103470802307, | |
| "learning_rate": 4.660618279569893e-05, | |
| "loss": 0.5646557331085205, | |
| "mean_token_accuracy": 0.8609416097402572, | |
| "num_tokens": 12610056.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 0.578702774643898, | |
| "epoch": 1.6132123045890066, | |
| "grad_norm": 0.4792572259902954, | |
| "learning_rate": 4.6270161290322585e-05, | |
| "loss": 0.5608342170715332, | |
| "mean_token_accuracy": 0.8583951354026794, | |
| "num_tokens": 12689520.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 0.5461821883916855, | |
| "epoch": 1.6232980332829046, | |
| "grad_norm": 0.4682954251766205, | |
| "learning_rate": 4.5934139784946236e-05, | |
| "loss": 0.5470096588134765, | |
| "mean_token_accuracy": 0.8660473883152008, | |
| "num_tokens": 12769300.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 0.5409149259328843, | |
| "epoch": 1.6333837619768028, | |
| "grad_norm": 0.4313759207725525, | |
| "learning_rate": 4.5598118279569894e-05, | |
| "loss": 0.5290946960449219, | |
| "mean_token_accuracy": 0.8687306940555573, | |
| "num_tokens": 12848928.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 0.5602993786334991, | |
| "epoch": 1.643469490670701, | |
| "grad_norm": 0.43227389454841614, | |
| "learning_rate": 4.526209677419355e-05, | |
| "loss": 0.5636171340942383, | |
| "mean_token_accuracy": 0.8613378524780273, | |
| "num_tokens": 12928356.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 0.5802386716008187, | |
| "epoch": 1.653555219364599, | |
| "grad_norm": 0.47118210792541504, | |
| "learning_rate": 4.492607526881721e-05, | |
| "loss": 0.5586458683013916, | |
| "mean_token_accuracy": 0.8608706951141357, | |
| "num_tokens": 13008403.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 0.5646507054567337, | |
| "epoch": 1.6636409480584973, | |
| "grad_norm": 0.4425702393054962, | |
| "learning_rate": 4.459005376344086e-05, | |
| "loss": 0.5531969547271729, | |
| "mean_token_accuracy": 0.8616601437330246, | |
| "num_tokens": 13088085.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 0.554588295519352, | |
| "epoch": 1.6737266767523953, | |
| "grad_norm": 0.4520638883113861, | |
| "learning_rate": 4.425403225806452e-05, | |
| "loss": 0.557581090927124, | |
| "mean_token_accuracy": 0.8634083062410355, | |
| "num_tokens": 13166818.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 0.5726349860429764, | |
| "epoch": 1.6838124054462935, | |
| "grad_norm": 0.6098994612693787, | |
| "learning_rate": 4.391801075268818e-05, | |
| "loss": 0.5592772483825683, | |
| "mean_token_accuracy": 0.8583408266305923, | |
| "num_tokens": 13246430.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 0.5743449658155442, | |
| "epoch": 1.6938981341401917, | |
| "grad_norm": 0.5307788848876953, | |
| "learning_rate": 4.358198924731183e-05, | |
| "loss": 0.5716012954711914, | |
| "mean_token_accuracy": 0.858471828699112, | |
| "num_tokens": 13325991.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 0.5580974891781807, | |
| "epoch": 1.7039838628340898, | |
| "grad_norm": 0.4562699794769287, | |
| "learning_rate": 4.3245967741935486e-05, | |
| "loss": 0.5490761756896972, | |
| "mean_token_accuracy": 0.8642932444810867, | |
| "num_tokens": 13405218.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 0.5611451357603073, | |
| "epoch": 1.7140695915279878, | |
| "grad_norm": 0.4747970700263977, | |
| "learning_rate": 4.290994623655914e-05, | |
| "loss": 0.55002760887146, | |
| "mean_token_accuracy": 0.8629568427801132, | |
| "num_tokens": 13483327.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 0.5680546730756759, | |
| "epoch": 1.724155320221886, | |
| "grad_norm": 0.4508069157600403, | |
| "learning_rate": 4.2573924731182796e-05, | |
| "loss": 0.5625165939331055, | |
| "mean_token_accuracy": 0.8583694219589233, | |
| "num_tokens": 13562046.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 0.5620178505778313, | |
| "epoch": 1.7342410489157842, | |
| "grad_norm": 0.4658072888851166, | |
| "learning_rate": 4.2237903225806454e-05, | |
| "loss": 0.5550461769104004, | |
| "mean_token_accuracy": 0.8632882922887802, | |
| "num_tokens": 13641490.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 0.5530170306563378, | |
| "epoch": 1.7443267776096822, | |
| "grad_norm": 0.5042744278907776, | |
| "learning_rate": 4.190188172043011e-05, | |
| "loss": 0.5403203010559082, | |
| "mean_token_accuracy": 0.8652596682310104, | |
| "num_tokens": 13721635.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 0.5663056463003159, | |
| "epoch": 1.7544125063035805, | |
| "grad_norm": 0.48429322242736816, | |
| "learning_rate": 4.156586021505376e-05, | |
| "loss": 0.5637138366699219, | |
| "mean_token_accuracy": 0.86119324862957, | |
| "num_tokens": 13801115.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 0.5869442075490952, | |
| "epoch": 1.7644982349974785, | |
| "grad_norm": 0.47282740473747253, | |
| "learning_rate": 4.122983870967742e-05, | |
| "loss": 0.5740327358245849, | |
| "mean_token_accuracy": 0.8570831835269928, | |
| "num_tokens": 13880836.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 0.5692236006259919, | |
| "epoch": 1.7745839636913767, | |
| "grad_norm": 0.48522087931632996, | |
| "learning_rate": 4.089381720430108e-05, | |
| "loss": 0.5549083232879639, | |
| "mean_token_accuracy": 0.8620316475629807, | |
| "num_tokens": 13960547.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 0.5681909918785095, | |
| "epoch": 1.784669692385275, | |
| "grad_norm": 0.5211447477340698, | |
| "learning_rate": 4.0557795698924737e-05, | |
| "loss": 0.5676622867584229, | |
| "mean_token_accuracy": 0.8572598755359649, | |
| "num_tokens": 14039751.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 0.5653912618756294, | |
| "epoch": 1.794755421079173, | |
| "grad_norm": 0.48671814799308777, | |
| "learning_rate": 4.022177419354839e-05, | |
| "loss": 0.5509668827056885, | |
| "mean_token_accuracy": 0.8620099276304245, | |
| "num_tokens": 14119860.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 0.5805320516228676, | |
| "epoch": 1.804841149773071, | |
| "grad_norm": 0.46735525131225586, | |
| "learning_rate": 3.9885752688172046e-05, | |
| "loss": 0.5758527278900146, | |
| "mean_token_accuracy": 0.8575719922780991, | |
| "num_tokens": 14198802.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 0.5776771619915962, | |
| "epoch": 1.8149268784669692, | |
| "grad_norm": 0.46059489250183105, | |
| "learning_rate": 3.9549731182795704e-05, | |
| "loss": 0.5662201404571533, | |
| "mean_token_accuracy": 0.8602292090654373, | |
| "num_tokens": 14277819.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 0.5446759209036827, | |
| "epoch": 1.8250126071608674, | |
| "grad_norm": 0.4299936890602112, | |
| "learning_rate": 3.9213709677419355e-05, | |
| "loss": 0.5321237087249756, | |
| "mean_token_accuracy": 0.8672592252492904, | |
| "num_tokens": 14356885.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 0.5735299795866012, | |
| "epoch": 1.8350983358547657, | |
| "grad_norm": 0.4611278176307678, | |
| "learning_rate": 3.887768817204301e-05, | |
| "loss": 0.5636817932128906, | |
| "mean_token_accuracy": 0.8613359600305557, | |
| "num_tokens": 14436671.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 0.5580099940299987, | |
| "epoch": 1.8451840645486637, | |
| "grad_norm": 0.44665414094924927, | |
| "learning_rate": 3.854166666666667e-05, | |
| "loss": 0.5478529453277587, | |
| "mean_token_accuracy": 0.865882283449173, | |
| "num_tokens": 14516240.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 0.5468813553452492, | |
| "epoch": 1.8552697932425617, | |
| "grad_norm": 0.48118823766708374, | |
| "learning_rate": 3.820564516129033e-05, | |
| "loss": 0.5421140670776368, | |
| "mean_token_accuracy": 0.8648819357156754, | |
| "num_tokens": 14594410.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 0.5601179748773575, | |
| "epoch": 1.86535552193646, | |
| "grad_norm": 0.47143810987472534, | |
| "learning_rate": 3.786962365591398e-05, | |
| "loss": 0.5547156810760498, | |
| "mean_token_accuracy": 0.8629712164402008, | |
| "num_tokens": 14674458.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 0.5468712210655212, | |
| "epoch": 1.8754412506303582, | |
| "grad_norm": 0.4703015089035034, | |
| "learning_rate": 3.753360215053764e-05, | |
| "loss": 0.5343079566955566, | |
| "mean_token_accuracy": 0.8661370754241944, | |
| "num_tokens": 14753930.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 0.5559142023324967, | |
| "epoch": 1.8855269793242562, | |
| "grad_norm": 0.5115091800689697, | |
| "learning_rate": 3.719758064516129e-05, | |
| "loss": 0.5517262935638427, | |
| "mean_token_accuracy": 0.8617942541837692, | |
| "num_tokens": 14832932.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 0.5663068994879723, | |
| "epoch": 1.8956127080181542, | |
| "grad_norm": 0.5054985880851746, | |
| "learning_rate": 3.686155913978495e-05, | |
| "loss": 0.5602648735046387, | |
| "mean_token_accuracy": 0.8621524393558502, | |
| "num_tokens": 14912738.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 0.5654321074485779, | |
| "epoch": 1.9056984367120524, | |
| "grad_norm": 0.6112289428710938, | |
| "learning_rate": 3.6525537634408605e-05, | |
| "loss": 0.5629604816436767, | |
| "mean_token_accuracy": 0.8605375409126281, | |
| "num_tokens": 14991840.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 0.576673474907875, | |
| "epoch": 1.9157841654059506, | |
| "grad_norm": 0.4323459565639496, | |
| "learning_rate": 3.6189516129032256e-05, | |
| "loss": 0.5591244220733642, | |
| "mean_token_accuracy": 0.8580433249473571, | |
| "num_tokens": 15071706.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 0.5643190979957581, | |
| "epoch": 1.9258698940998489, | |
| "grad_norm": 0.4710509479045868, | |
| "learning_rate": 3.5853494623655914e-05, | |
| "loss": 0.5512382507324218, | |
| "mean_token_accuracy": 0.8628631055355072, | |
| "num_tokens": 15151394.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 0.5628313675522805, | |
| "epoch": 1.9359556227937469, | |
| "grad_norm": 0.49328237771987915, | |
| "learning_rate": 3.551747311827957e-05, | |
| "loss": 0.5587539672851562, | |
| "mean_token_accuracy": 0.860697939991951, | |
| "num_tokens": 15231319.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 0.5748488426208496, | |
| "epoch": 1.946041351487645, | |
| "grad_norm": 0.4674327075481415, | |
| "learning_rate": 3.518145161290323e-05, | |
| "loss": 0.5687310695648193, | |
| "mean_token_accuracy": 0.8577084749937057, | |
| "num_tokens": 15310775.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 0.5803794890642167, | |
| "epoch": 1.9561270801815431, | |
| "grad_norm": 0.5266663432121277, | |
| "learning_rate": 3.484543010752688e-05, | |
| "loss": 0.563091516494751, | |
| "mean_token_accuracy": 0.8584628343582154, | |
| "num_tokens": 15390587.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 0.5552488923072815, | |
| "epoch": 1.9662128088754414, | |
| "grad_norm": 0.4923759996891022, | |
| "learning_rate": 3.450940860215054e-05, | |
| "loss": 0.5511169910430909, | |
| "mean_token_accuracy": 0.8629322975873948, | |
| "num_tokens": 15469965.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 0.5615150198340416, | |
| "epoch": 1.9762985375693394, | |
| "grad_norm": 0.48817864060401917, | |
| "learning_rate": 3.41733870967742e-05, | |
| "loss": 0.5568130016326904, | |
| "mean_token_accuracy": 0.8619527310132981, | |
| "num_tokens": 15549750.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 0.5814961880445481, | |
| "epoch": 1.9863842662632374, | |
| "grad_norm": 0.5092481970787048, | |
| "learning_rate": 3.3837365591397855e-05, | |
| "loss": 0.5730830669403076, | |
| "mean_token_accuracy": 0.8569308757781983, | |
| "num_tokens": 15629403.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 0.5555408030748368, | |
| "epoch": 1.9964699949571356, | |
| "grad_norm": 0.47072556614875793, | |
| "learning_rate": 3.3501344086021506e-05, | |
| "loss": 0.5473050117492676, | |
| "mean_token_accuracy": 0.8649396389722824, | |
| "num_tokens": 15709076.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 0.569047212600708, | |
| "epoch": 2.006051437216339, | |
| "grad_norm": 0.4627280831336975, | |
| "learning_rate": 3.3165322580645164e-05, | |
| "loss": 0.5441355228424072, | |
| "mean_token_accuracy": 0.864699639772114, | |
| "num_tokens": 15782771.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 0.539261668920517, | |
| "epoch": 2.016137165910237, | |
| "grad_norm": 0.48832473158836365, | |
| "learning_rate": 3.282930107526882e-05, | |
| "loss": 0.5297918796539307, | |
| "mean_token_accuracy": 0.8658891975879669, | |
| "num_tokens": 15862421.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 0.5377178519964219, | |
| "epoch": 2.026222894604135, | |
| "grad_norm": 0.48553702235221863, | |
| "learning_rate": 3.249327956989247e-05, | |
| "loss": 0.5355194091796875, | |
| "mean_token_accuracy": 0.8657042533159256, | |
| "num_tokens": 15941198.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 0.5516590684652328, | |
| "epoch": 2.036308623298033, | |
| "grad_norm": 0.5379918217658997, | |
| "learning_rate": 3.215725806451613e-05, | |
| "loss": 0.5353228092193604, | |
| "mean_token_accuracy": 0.8652983129024505, | |
| "num_tokens": 16021211.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 0.5461470827460289, | |
| "epoch": 2.0463943519919314, | |
| "grad_norm": 0.4731438457965851, | |
| "learning_rate": 3.182123655913979e-05, | |
| "loss": 0.5283015727996826, | |
| "mean_token_accuracy": 0.8663630455732345, | |
| "num_tokens": 16100444.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 0.5638475820422173, | |
| "epoch": 2.0564800806858297, | |
| "grad_norm": 0.5005958676338196, | |
| "learning_rate": 3.148521505376345e-05, | |
| "loss": 0.5557540893554688, | |
| "mean_token_accuracy": 0.8587030708789826, | |
| "num_tokens": 16179057.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 0.5465094238519669, | |
| "epoch": 2.066565809379728, | |
| "grad_norm": 0.5402827262878418, | |
| "learning_rate": 3.11491935483871e-05, | |
| "loss": 0.5304507255554199, | |
| "mean_token_accuracy": 0.8647589266300202, | |
| "num_tokens": 16258484.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 0.5264578998088837, | |
| "epoch": 2.0766515380736257, | |
| "grad_norm": 0.4704038202762604, | |
| "learning_rate": 3.081317204301075e-05, | |
| "loss": 0.5128489971160889, | |
| "mean_token_accuracy": 0.8706033259630204, | |
| "num_tokens": 16338768.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 0.5451709255576134, | |
| "epoch": 2.086737266767524, | |
| "grad_norm": 0.4614444673061371, | |
| "learning_rate": 3.0477150537634407e-05, | |
| "loss": 0.5359940528869629, | |
| "mean_token_accuracy": 0.8661996811628342, | |
| "num_tokens": 16418643.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 0.5472053721547127, | |
| "epoch": 2.096822995461422, | |
| "grad_norm": 0.632550060749054, | |
| "learning_rate": 3.0141129032258065e-05, | |
| "loss": 0.5351024627685547, | |
| "mean_token_accuracy": 0.8644415885210037, | |
| "num_tokens": 16498263.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 0.548878462612629, | |
| "epoch": 2.1069087241553204, | |
| "grad_norm": 0.5025933980941772, | |
| "learning_rate": 2.980510752688172e-05, | |
| "loss": 0.5379784584045411, | |
| "mean_token_accuracy": 0.8660365819931031, | |
| "num_tokens": 16577565.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 0.5425203040242195, | |
| "epoch": 2.116994452849218, | |
| "grad_norm": 0.4774039685726166, | |
| "learning_rate": 2.9469086021505378e-05, | |
| "loss": 0.5364133358001709, | |
| "mean_token_accuracy": 0.8674946367740631, | |
| "num_tokens": 16656311.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 0.5235720470547676, | |
| "epoch": 2.1270801815431164, | |
| "grad_norm": 0.5193483829498291, | |
| "learning_rate": 2.9133064516129032e-05, | |
| "loss": 0.5130849838256836, | |
| "mean_token_accuracy": 0.8696544647216797, | |
| "num_tokens": 16733102.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 0.5605258494615555, | |
| "epoch": 2.1371659102370146, | |
| "grad_norm": 0.4725455939769745, | |
| "learning_rate": 2.879704301075269e-05, | |
| "loss": 0.540586280822754, | |
| "mean_token_accuracy": 0.8627595365047455, | |
| "num_tokens": 16812449.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 0.5359290465712547, | |
| "epoch": 2.147251638930913, | |
| "grad_norm": 0.5029664039611816, | |
| "learning_rate": 2.8461021505376345e-05, | |
| "loss": 0.5248902320861817, | |
| "mean_token_accuracy": 0.8702762573957443, | |
| "num_tokens": 16890210.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 0.5447442144155502, | |
| "epoch": 2.157337367624811, | |
| "grad_norm": 0.5254132747650146, | |
| "learning_rate": 2.8125000000000003e-05, | |
| "loss": 0.5334976196289063, | |
| "mean_token_accuracy": 0.8659275323152542, | |
| "num_tokens": 16969724.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 0.5429217413067817, | |
| "epoch": 2.167423096318709, | |
| "grad_norm": 0.5342961549758911, | |
| "learning_rate": 2.7788978494623657e-05, | |
| "loss": 0.5368762969970703, | |
| "mean_token_accuracy": 0.8634399026632309, | |
| "num_tokens": 17049580.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 0.5661292850971222, | |
| "epoch": 2.177508825012607, | |
| "grad_norm": 0.5178996324539185, | |
| "learning_rate": 2.7452956989247315e-05, | |
| "loss": 0.5408023357391357, | |
| "mean_token_accuracy": 0.8626035422086715, | |
| "num_tokens": 17129600.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 0.5486285850405693, | |
| "epoch": 2.1875945537065054, | |
| "grad_norm": 0.5601539015769958, | |
| "learning_rate": 2.711693548387097e-05, | |
| "loss": 0.5464762210845947, | |
| "mean_token_accuracy": 0.8629148125648498, | |
| "num_tokens": 17208660.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 0.539339479804039, | |
| "epoch": 2.1976802824004036, | |
| "grad_norm": 0.5032673478126526, | |
| "learning_rate": 2.6780913978494628e-05, | |
| "loss": 0.5286684036254883, | |
| "mean_token_accuracy": 0.86694795191288, | |
| "num_tokens": 17288203.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 0.5645471304655075, | |
| "epoch": 2.2077660110943014, | |
| "grad_norm": 0.5230391025543213, | |
| "learning_rate": 2.6444892473118282e-05, | |
| "loss": 0.5560014724731446, | |
| "mean_token_accuracy": 0.8597795188426971, | |
| "num_tokens": 17367801.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 0.5548521086573601, | |
| "epoch": 2.2178517397881996, | |
| "grad_norm": 0.49602022767066956, | |
| "learning_rate": 2.610887096774194e-05, | |
| "loss": 0.5350295066833496, | |
| "mean_token_accuracy": 0.8652581185102463, | |
| "num_tokens": 17446189.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 0.514088487625122, | |
| "epoch": 2.227937468482098, | |
| "grad_norm": 0.4804084002971649, | |
| "learning_rate": 2.5772849462365595e-05, | |
| "loss": 0.5078618049621582, | |
| "mean_token_accuracy": 0.87323999106884, | |
| "num_tokens": 17525566.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 0.5376028656959534, | |
| "epoch": 2.238023197175996, | |
| "grad_norm": 0.5058464407920837, | |
| "learning_rate": 2.543682795698925e-05, | |
| "loss": 0.5364038944244385, | |
| "mean_token_accuracy": 0.8645770877599717, | |
| "num_tokens": 17604827.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 0.5462548270821571, | |
| "epoch": 2.2481089258698943, | |
| "grad_norm": 0.490461140871048, | |
| "learning_rate": 2.5100806451612907e-05, | |
| "loss": 0.5294418811798096, | |
| "mean_token_accuracy": 0.8681913077831268, | |
| "num_tokens": 17683861.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 0.5528038665652275, | |
| "epoch": 2.258194654563792, | |
| "grad_norm": 0.4974213242530823, | |
| "learning_rate": 2.4764784946236562e-05, | |
| "loss": 0.5406534194946289, | |
| "mean_token_accuracy": 0.8653462111949921, | |
| "num_tokens": 17762980.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 0.5535038366913796, | |
| "epoch": 2.2682803832576903, | |
| "grad_norm": 0.5496407151222229, | |
| "learning_rate": 2.4428763440860216e-05, | |
| "loss": 0.537155294418335, | |
| "mean_token_accuracy": 0.8642148166894913, | |
| "num_tokens": 17842556.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 0.5539382755756378, | |
| "epoch": 2.2783661119515886, | |
| "grad_norm": 0.525561511516571, | |
| "learning_rate": 2.4092741935483874e-05, | |
| "loss": 0.5407976150512696, | |
| "mean_token_accuracy": 0.8630766361951828, | |
| "num_tokens": 17922301.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 0.5272150099277496, | |
| "epoch": 2.288451840645487, | |
| "grad_norm": 0.5721139907836914, | |
| "learning_rate": 2.375672043010753e-05, | |
| "loss": 0.5236873626708984, | |
| "mean_token_accuracy": 0.8669533491134643, | |
| "num_tokens": 18001885.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 0.5631722688674927, | |
| "epoch": 2.2985375693393846, | |
| "grad_norm": 0.5678048133850098, | |
| "learning_rate": 2.3420698924731183e-05, | |
| "loss": 0.5523369312286377, | |
| "mean_token_accuracy": 0.8623350352048874, | |
| "num_tokens": 18081479.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 0.5382361978292465, | |
| "epoch": 2.308623298033283, | |
| "grad_norm": 0.5157824754714966, | |
| "learning_rate": 2.3084677419354838e-05, | |
| "loss": 0.5226727485656738, | |
| "mean_token_accuracy": 0.8679136961698533, | |
| "num_tokens": 18161203.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 0.533910921216011, | |
| "epoch": 2.318709026727181, | |
| "grad_norm": 0.47971630096435547, | |
| "learning_rate": 2.2748655913978496e-05, | |
| "loss": 0.5226436614990234, | |
| "mean_token_accuracy": 0.8696143090724945, | |
| "num_tokens": 18241262.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 0.5458772480487823, | |
| "epoch": 2.3287947554210793, | |
| "grad_norm": 0.45692282915115356, | |
| "learning_rate": 2.241263440860215e-05, | |
| "loss": 0.5294504165649414, | |
| "mean_token_accuracy": 0.8642321765422821, | |
| "num_tokens": 18320784.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 0.5594018489122391, | |
| "epoch": 2.338880484114977, | |
| "grad_norm": 0.4903578758239746, | |
| "learning_rate": 2.207661290322581e-05, | |
| "loss": 0.5604379177093506, | |
| "mean_token_accuracy": 0.860828360915184, | |
| "num_tokens": 18400852.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 0.5689606159925461, | |
| "epoch": 2.3489662128088753, | |
| "grad_norm": 0.5537696480751038, | |
| "learning_rate": 2.1740591397849463e-05, | |
| "loss": 0.5594550609588623, | |
| "mean_token_accuracy": 0.8629016607999802, | |
| "num_tokens": 18479779.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 0.5599432498216629, | |
| "epoch": 2.3590519415027735, | |
| "grad_norm": 0.5466564297676086, | |
| "learning_rate": 2.140456989247312e-05, | |
| "loss": 0.5437151908874511, | |
| "mean_token_accuracy": 0.8626207202672959, | |
| "num_tokens": 18558073.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 0.5474510326981544, | |
| "epoch": 2.3691376701966718, | |
| "grad_norm": 0.4898226857185364, | |
| "learning_rate": 2.1068548387096775e-05, | |
| "loss": 0.5327883720397949, | |
| "mean_token_accuracy": 0.8675543367862701, | |
| "num_tokens": 18637992.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 0.5352361142635346, | |
| "epoch": 2.37922339889057, | |
| "grad_norm": 0.49341657757759094, | |
| "learning_rate": 2.0732526881720433e-05, | |
| "loss": 0.5276922225952149, | |
| "mean_token_accuracy": 0.8687323063611985, | |
| "num_tokens": 18717199.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 0.5448679953813553, | |
| "epoch": 2.389309127584468, | |
| "grad_norm": 0.5279788374900818, | |
| "learning_rate": 2.0396505376344088e-05, | |
| "loss": 0.5373146057128906, | |
| "mean_token_accuracy": 0.8635420203208923, | |
| "num_tokens": 18795882.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 0.5282470986247063, | |
| "epoch": 2.399394856278366, | |
| "grad_norm": 0.5115689039230347, | |
| "learning_rate": 2.0060483870967743e-05, | |
| "loss": 0.5187318325042725, | |
| "mean_token_accuracy": 0.8699030309915543, | |
| "num_tokens": 18875539.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 0.5575937613844871, | |
| "epoch": 2.4094805849722642, | |
| "grad_norm": 0.5467925071716309, | |
| "learning_rate": 1.9724462365591397e-05, | |
| "loss": 0.5434219837188721, | |
| "mean_token_accuracy": 0.8646806567907334, | |
| "num_tokens": 18953688.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 0.5321239963173866, | |
| "epoch": 2.4195663136661625, | |
| "grad_norm": 0.5000545978546143, | |
| "learning_rate": 1.9388440860215055e-05, | |
| "loss": 0.5234639644622803, | |
| "mean_token_accuracy": 0.8677684217691422, | |
| "num_tokens": 19032209.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 0.5813943535089493, | |
| "epoch": 2.4296520423600603, | |
| "grad_norm": 0.516925573348999, | |
| "learning_rate": 1.905241935483871e-05, | |
| "loss": 0.5684566497802734, | |
| "mean_token_accuracy": 0.8597011536359787, | |
| "num_tokens": 19111890.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 0.5533119216561317, | |
| "epoch": 2.4397377710539585, | |
| "grad_norm": 0.4740159511566162, | |
| "learning_rate": 1.8716397849462368e-05, | |
| "loss": 0.5415266513824463, | |
| "mean_token_accuracy": 0.8660802483558655, | |
| "num_tokens": 19191883.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 0.5496593981981277, | |
| "epoch": 2.4498234997478567, | |
| "grad_norm": 0.5012199878692627, | |
| "learning_rate": 1.8380376344086022e-05, | |
| "loss": 0.5444561004638672, | |
| "mean_token_accuracy": 0.8652342647314072, | |
| "num_tokens": 19271352.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 0.5558317363262176, | |
| "epoch": 2.459909228441755, | |
| "grad_norm": 0.5741304755210876, | |
| "learning_rate": 1.804435483870968e-05, | |
| "loss": 0.5420098781585694, | |
| "mean_token_accuracy": 0.864546662569046, | |
| "num_tokens": 19351160.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 0.5458673521876335, | |
| "epoch": 2.469994957135653, | |
| "grad_norm": 0.5522996783256531, | |
| "learning_rate": 1.7708333333333335e-05, | |
| "loss": 0.5378719329833984, | |
| "mean_token_accuracy": 0.8654713213443757, | |
| "num_tokens": 19430996.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 0.5559975445270539, | |
| "epoch": 2.4800806858295514, | |
| "grad_norm": 0.5336911678314209, | |
| "learning_rate": 1.7372311827956993e-05, | |
| "loss": 0.5409592151641845, | |
| "mean_token_accuracy": 0.8620710968971252, | |
| "num_tokens": 19510210.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 0.5456252574920655, | |
| "epoch": 2.4901664145234492, | |
| "grad_norm": 0.5605066418647766, | |
| "learning_rate": 1.7036290322580644e-05, | |
| "loss": 0.5332871913909912, | |
| "mean_token_accuracy": 0.8647909879684448, | |
| "num_tokens": 19589727.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 0.5535303637385368, | |
| "epoch": 2.5002521432173475, | |
| "grad_norm": 0.4991672933101654, | |
| "learning_rate": 1.67002688172043e-05, | |
| "loss": 0.5402321815490723, | |
| "mean_token_accuracy": 0.8653812408447266, | |
| "num_tokens": 19668443.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 0.5551770642399788, | |
| "epoch": 2.5103378719112457, | |
| "grad_norm": 0.5773875713348389, | |
| "learning_rate": 1.6364247311827956e-05, | |
| "loss": 0.5489557266235352, | |
| "mean_token_accuracy": 0.8608813732862473, | |
| "num_tokens": 19747352.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 0.5320880457758903, | |
| "epoch": 2.5204236006051435, | |
| "grad_norm": 0.5162405371665955, | |
| "learning_rate": 1.6028225806451614e-05, | |
| "loss": 0.5143797397613525, | |
| "mean_token_accuracy": 0.8693823754787445, | |
| "num_tokens": 19825761.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 0.5509802043437958, | |
| "epoch": 2.5305093292990417, | |
| "grad_norm": 0.49250203371047974, | |
| "learning_rate": 1.569220430107527e-05, | |
| "loss": 0.5484753608703613, | |
| "mean_token_accuracy": 0.8615890771150589, | |
| "num_tokens": 19905522.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 0.5509913951158524, | |
| "epoch": 2.54059505799294, | |
| "grad_norm": 0.4801005423069, | |
| "learning_rate": 1.5356182795698927e-05, | |
| "loss": 0.534857177734375, | |
| "mean_token_accuracy": 0.8665878713130951, | |
| "num_tokens": 19985423.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 0.5512269869446754, | |
| "epoch": 2.550680786686838, | |
| "grad_norm": 0.5222068428993225, | |
| "learning_rate": 1.5020161290322581e-05, | |
| "loss": 0.5318729400634765, | |
| "mean_token_accuracy": 0.867360520362854, | |
| "num_tokens": 20064943.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 0.5388212829828263, | |
| "epoch": 2.5607665153807364, | |
| "grad_norm": 0.5755501985549927, | |
| "learning_rate": 1.4684139784946237e-05, | |
| "loss": 0.5273076057434082, | |
| "mean_token_accuracy": 0.8683293461799622, | |
| "num_tokens": 20144394.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 0.5427288740873337, | |
| "epoch": 2.5708522440746346, | |
| "grad_norm": 0.5304813385009766, | |
| "learning_rate": 1.4348118279569894e-05, | |
| "loss": 0.5372978687286377, | |
| "mean_token_accuracy": 0.8653906404972076, | |
| "num_tokens": 20224155.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 0.537303113937378, | |
| "epoch": 2.5809379727685324, | |
| "grad_norm": 0.5612549781799316, | |
| "learning_rate": 1.4012096774193548e-05, | |
| "loss": 0.5201327323913574, | |
| "mean_token_accuracy": 0.8662876456975936, | |
| "num_tokens": 20303359.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 0.5369555190205574, | |
| "epoch": 2.5910237014624307, | |
| "grad_norm": 0.5071592330932617, | |
| "learning_rate": 1.3676075268817205e-05, | |
| "loss": 0.5304999828338623, | |
| "mean_token_accuracy": 0.8670349299907685, | |
| "num_tokens": 20382903.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 0.5491381287574768, | |
| "epoch": 2.601109430156329, | |
| "grad_norm": 0.5084213614463806, | |
| "learning_rate": 1.334005376344086e-05, | |
| "loss": 0.5327461242675782, | |
| "mean_token_accuracy": 0.8662136912345886, | |
| "num_tokens": 20462155.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 0.5416491359472275, | |
| "epoch": 2.6111951588502267, | |
| "grad_norm": 0.5257861614227295, | |
| "learning_rate": 1.3004032258064517e-05, | |
| "loss": 0.528349494934082, | |
| "mean_token_accuracy": 0.8684215098619461, | |
| "num_tokens": 20541984.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 0.566520756483078, | |
| "epoch": 2.621280887544125, | |
| "grad_norm": 0.5360490679740906, | |
| "learning_rate": 1.2668010752688173e-05, | |
| "loss": 0.5587567806243896, | |
| "mean_token_accuracy": 0.8621705800294877, | |
| "num_tokens": 20621627.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 0.5417982503771782, | |
| "epoch": 2.631366616238023, | |
| "grad_norm": 0.6282044649124146, | |
| "learning_rate": 1.2331989247311828e-05, | |
| "loss": 0.5330332756042481, | |
| "mean_token_accuracy": 0.8673626929521561, | |
| "num_tokens": 20700444.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 0.5525400832295417, | |
| "epoch": 2.6414523449319214, | |
| "grad_norm": 0.46920013427734375, | |
| "learning_rate": 1.1995967741935484e-05, | |
| "loss": 0.5474446773529053, | |
| "mean_token_accuracy": 0.8630323052406311, | |
| "num_tokens": 20779575.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 0.5558207243680954, | |
| "epoch": 2.6515380736258196, | |
| "grad_norm": 0.5772764086723328, | |
| "learning_rate": 1.165994623655914e-05, | |
| "loss": 0.5425600528717041, | |
| "mean_token_accuracy": 0.8641434967517853, | |
| "num_tokens": 20859435.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 0.5576843723654747, | |
| "epoch": 2.661623802319718, | |
| "grad_norm": 0.4919654428958893, | |
| "learning_rate": 1.1323924731182797e-05, | |
| "loss": 0.5311962127685547, | |
| "mean_token_accuracy": 0.8672047317028045, | |
| "num_tokens": 20938905.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 0.54314656406641, | |
| "epoch": 2.6717095310136156, | |
| "grad_norm": 0.5382912158966064, | |
| "learning_rate": 1.0987903225806453e-05, | |
| "loss": 0.5263168811798096, | |
| "mean_token_accuracy": 0.8669156759977341, | |
| "num_tokens": 21019238.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 0.5516531556844712, | |
| "epoch": 2.681795259707514, | |
| "grad_norm": 0.5050802826881409, | |
| "learning_rate": 1.0651881720430107e-05, | |
| "loss": 0.5398415565490723, | |
| "mean_token_accuracy": 0.8650593370199203, | |
| "num_tokens": 21098899.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 0.5546103894710541, | |
| "epoch": 2.691880988401412, | |
| "grad_norm": 0.5349447727203369, | |
| "learning_rate": 1.0315860215053764e-05, | |
| "loss": 0.5495382308959961, | |
| "mean_token_accuracy": 0.8624561607837677, | |
| "num_tokens": 21177880.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 0.5512343898415566, | |
| "epoch": 2.70196671709531, | |
| "grad_norm": 0.5208629965782166, | |
| "learning_rate": 9.97983870967742e-06, | |
| "loss": 0.5331855773925781, | |
| "mean_token_accuracy": 0.8639995604753494, | |
| "num_tokens": 21257999.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 0.5312772765755653, | |
| "epoch": 2.712052445789208, | |
| "grad_norm": 0.4953898787498474, | |
| "learning_rate": 9.643817204301076e-06, | |
| "loss": 0.5195374965667725, | |
| "mean_token_accuracy": 0.869972151517868, | |
| "num_tokens": 21337317.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 0.5500992730259895, | |
| "epoch": 2.7221381744831064, | |
| "grad_norm": 0.5650175213813782, | |
| "learning_rate": 9.307795698924732e-06, | |
| "loss": 0.5417905330657959, | |
| "mean_token_accuracy": 0.8655608594417572, | |
| "num_tokens": 21417337.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 0.5753470867872238, | |
| "epoch": 2.7322239031770046, | |
| "grad_norm": 0.5138351917266846, | |
| "learning_rate": 8.971774193548389e-06, | |
| "loss": 0.566002368927002, | |
| "mean_token_accuracy": 0.8588992148637772, | |
| "num_tokens": 21495441.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 0.5489386066794395, | |
| "epoch": 2.742309631870903, | |
| "grad_norm": 0.6205029487609863, | |
| "learning_rate": 8.635752688172043e-06, | |
| "loss": 0.5376901626586914, | |
| "mean_token_accuracy": 0.8655065208673477, | |
| "num_tokens": 21575122.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 0.5537219062447548, | |
| "epoch": 2.752395360564801, | |
| "grad_norm": 0.49632322788238525, | |
| "learning_rate": 8.2997311827957e-06, | |
| "loss": 0.5360848426818847, | |
| "mean_token_accuracy": 0.8659580051898956, | |
| "num_tokens": 21654430.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 0.5487209603190422, | |
| "epoch": 2.762481089258699, | |
| "grad_norm": 0.5572301745414734, | |
| "learning_rate": 7.963709677419356e-06, | |
| "loss": 0.5442662715911866, | |
| "mean_token_accuracy": 0.8630106240510941, | |
| "num_tokens": 21733148.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 0.5612985536456108, | |
| "epoch": 2.772566817952597, | |
| "grad_norm": 0.6422117352485657, | |
| "learning_rate": 7.627688172043011e-06, | |
| "loss": 0.5526007175445556, | |
| "mean_token_accuracy": 0.860730430483818, | |
| "num_tokens": 21812607.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 0.5400200679898262, | |
| "epoch": 2.7826525466464953, | |
| "grad_norm": 0.8637318015098572, | |
| "learning_rate": 7.2916666666666674e-06, | |
| "loss": 0.5166098594665527, | |
| "mean_token_accuracy": 0.8686787247657776, | |
| "num_tokens": 21892036.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 0.5612641841173172, | |
| "epoch": 2.792738275340393, | |
| "grad_norm": 0.48974496126174927, | |
| "learning_rate": 6.955645161290322e-06, | |
| "loss": 0.5449564933776856, | |
| "mean_token_accuracy": 0.8627958416938781, | |
| "num_tokens": 21972109.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 0.5385331958532333, | |
| "epoch": 2.8028240040342913, | |
| "grad_norm": 0.5558703541755676, | |
| "learning_rate": 6.619623655913978e-06, | |
| "loss": 0.5277342796325684, | |
| "mean_token_accuracy": 0.868207824230194, | |
| "num_tokens": 22051892.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 0.5366700455546379, | |
| "epoch": 2.8129097327281896, | |
| "grad_norm": 0.5184351205825806, | |
| "learning_rate": 6.2836021505376345e-06, | |
| "loss": 0.5244134426116943, | |
| "mean_token_accuracy": 0.8669192433357239, | |
| "num_tokens": 22131511.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 0.5393238887190819, | |
| "epoch": 2.822995461422088, | |
| "grad_norm": 0.5058059096336365, | |
| "learning_rate": 5.947580645161291e-06, | |
| "loss": 0.5251157760620118, | |
| "mean_token_accuracy": 0.868171575665474, | |
| "num_tokens": 22211311.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 0.5239570930600166, | |
| "epoch": 2.833081190115986, | |
| "grad_norm": 0.49244430661201477, | |
| "learning_rate": 5.611559139784946e-06, | |
| "loss": 0.5180220603942871, | |
| "mean_token_accuracy": 0.8699818342924118, | |
| "num_tokens": 22291200.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 0.5237270832061768, | |
| "epoch": 2.8431669188098843, | |
| "grad_norm": 0.5526524782180786, | |
| "learning_rate": 5.275537634408602e-06, | |
| "loss": 0.5160961627960206, | |
| "mean_token_accuracy": 0.8717655450105667, | |
| "num_tokens": 22371402.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 0.5550815775990486, | |
| "epoch": 2.853252647503782, | |
| "grad_norm": 0.5555030107498169, | |
| "learning_rate": 4.939516129032258e-06, | |
| "loss": 0.5493992328643799, | |
| "mean_token_accuracy": 0.8630385160446167, | |
| "num_tokens": 22450991.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 0.5413601607084274, | |
| "epoch": 2.8633383761976803, | |
| "grad_norm": 0.5296768546104431, | |
| "learning_rate": 4.603494623655914e-06, | |
| "loss": 0.529835557937622, | |
| "mean_token_accuracy": 0.8655640929937363, | |
| "num_tokens": 22529941.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 0.5400006249547005, | |
| "epoch": 2.8734241048915785, | |
| "grad_norm": 0.5396979451179504, | |
| "learning_rate": 4.2674731182795695e-06, | |
| "loss": 0.5320997714996338, | |
| "mean_token_accuracy": 0.8670689195394516, | |
| "num_tokens": 22610031.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 0.5488270223140717, | |
| "epoch": 2.8835098335854763, | |
| "grad_norm": 0.5153380632400513, | |
| "learning_rate": 3.931451612903226e-06, | |
| "loss": 0.5233009338378907, | |
| "mean_token_accuracy": 0.8684332311153412, | |
| "num_tokens": 22689444.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 0.5396442547440529, | |
| "epoch": 2.8935955622793745, | |
| "grad_norm": 0.5235704183578491, | |
| "learning_rate": 3.595430107526882e-06, | |
| "loss": 0.5307882308959961, | |
| "mean_token_accuracy": 0.8669263809919358, | |
| "num_tokens": 22767585.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 0.5299616396427155, | |
| "epoch": 2.9036812909732728, | |
| "grad_norm": 0.5741503238677979, | |
| "learning_rate": 3.259408602150538e-06, | |
| "loss": 0.5177013874053955, | |
| "mean_token_accuracy": 0.8693442493677139, | |
| "num_tokens": 22847128.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 0.5234180510044097, | |
| "epoch": 2.913767019667171, | |
| "grad_norm": 0.48757055401802063, | |
| "learning_rate": 2.9233870967741936e-06, | |
| "loss": 0.5175334930419921, | |
| "mean_token_accuracy": 0.8709781676530838, | |
| "num_tokens": 22926087.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 0.5525398343801499, | |
| "epoch": 2.9238527483610692, | |
| "grad_norm": 0.5371067523956299, | |
| "learning_rate": 2.58736559139785e-06, | |
| "loss": 0.5446056365966797, | |
| "mean_token_accuracy": 0.8640182733535766, | |
| "num_tokens": 23005902.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 0.5530654519796372, | |
| "epoch": 2.9339384770549675, | |
| "grad_norm": 0.5097183585166931, | |
| "learning_rate": 2.2513440860215057e-06, | |
| "loss": 0.539762306213379, | |
| "mean_token_accuracy": 0.864575845003128, | |
| "num_tokens": 23084236.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 0.5282490402460098, | |
| "epoch": 2.9440242057488653, | |
| "grad_norm": 0.5585159659385681, | |
| "learning_rate": 1.9153225806451616e-06, | |
| "loss": 0.5186759471893311, | |
| "mean_token_accuracy": 0.8688343107700348, | |
| "num_tokens": 23163376.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 0.5502773314714432, | |
| "epoch": 2.9541099344427635, | |
| "grad_norm": 0.5116755962371826, | |
| "learning_rate": 1.5793010752688172e-06, | |
| "loss": 0.5362959861755371, | |
| "mean_token_accuracy": 0.8632151573896408, | |
| "num_tokens": 23243461.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 0.5681858882308006, | |
| "epoch": 2.9641956631366617, | |
| "grad_norm": 0.5849228501319885, | |
| "learning_rate": 1.2432795698924732e-06, | |
| "loss": 0.546544361114502, | |
| "mean_token_accuracy": 0.8613691359758378, | |
| "num_tokens": 23322907.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 0.5488282263278961, | |
| "epoch": 2.9742813918305595, | |
| "grad_norm": 0.539885938167572, | |
| "learning_rate": 9.072580645161292e-07, | |
| "loss": 0.5370998859405518, | |
| "mean_token_accuracy": 0.8640505552291871, | |
| "num_tokens": 23402756.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 0.5358055055141449, | |
| "epoch": 2.9843671205244577, | |
| "grad_norm": 0.5179461240768433, | |
| "learning_rate": 5.71236559139785e-07, | |
| "loss": 0.5123616695404053, | |
| "mean_token_accuracy": 0.8696857988834381, | |
| "num_tokens": 23482539.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 0.5303657278418541, | |
| "epoch": 2.994452849218356, | |
| "grad_norm": 0.6051850318908691, | |
| "learning_rate": 2.3521505376344087e-07, | |
| "loss": 0.508097505569458, | |
| "mean_token_accuracy": 0.8716978818178177, | |
| "num_tokens": 23560646.0, | |
| "step": 2970 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 2976, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.192985776961024e+16, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |