{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 60, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.3058870881795883, "epoch": 0.05063291139240506, "grad_norm": 1.2109375, "learning_rate": 0.0, "loss": 0.8967164754867554, "mean_token_accuracy": 0.7853250801563263, "num_tokens": 4094.0, "step": 1 }, { "entropy": 0.2770821340382099, "epoch": 0.10126582278481013, "grad_norm": 1.1953125, "learning_rate": 4e-05, "loss": 0.8378055095672607, "mean_token_accuracy": 0.8762781769037247, "num_tokens": 8270.0, "step": 2 }, { "entropy": 0.33289381861686707, "epoch": 0.1518987341772152, "grad_norm": 2.28125, "learning_rate": 8e-05, "loss": 1.3381309509277344, "mean_token_accuracy": 0.8489641100168228, "num_tokens": 12538.0, "step": 3 }, { "entropy": 0.2396358586847782, "epoch": 0.20253164556962025, "grad_norm": 0.8125, "learning_rate": 0.00012, "loss": 0.4996604919433594, "mean_token_accuracy": 0.9098183065652847, "num_tokens": 16803.0, "step": 4 }, { "entropy": 0.3024279847741127, "epoch": 0.25316455696202533, "grad_norm": 1.015625, "learning_rate": 0.00016, "loss": 0.57768714427948, "mean_token_accuracy": 0.8811647891998291, "num_tokens": 21541.0, "step": 5 }, { "entropy": 0.2746536508202553, "epoch": 0.3037974683544304, "grad_norm": 0.84375, "learning_rate": 0.0002, "loss": 0.2727876305580139, "mean_token_accuracy": 0.925768256187439, "num_tokens": 25660.0, "step": 6 }, { "entropy": 0.21791627258062363, "epoch": 0.35443037974683544, "grad_norm": 0.515625, "learning_rate": 0.00019636363636363636, "loss": 0.13589006662368774, "mean_token_accuracy": 0.9386249780654907, "num_tokens": 29675.0, "step": 7 }, { "entropy": 0.23072286322712898, "epoch": 0.4050632911392405, "grad_norm": 0.66796875, "learning_rate": 0.00019272727272727274, "loss": 0.22619852423667908, "mean_token_accuracy": 0.9601024985313416, "num_tokens": 33786.0, "step": 8 }, { "entropy": 0.12776251882314682, "epoch": 0.45569620253164556, "grad_norm": 0.3359375, "learning_rate": 0.0001890909090909091, "loss": 0.12999381124973297, "mean_token_accuracy": 0.964403823018074, "num_tokens": 38029.0, "step": 9 }, { "entropy": 0.15997863747179508, "epoch": 0.5063291139240507, "grad_norm": 0.380859375, "learning_rate": 0.00018545454545454545, "loss": 0.1289505809545517, "mean_token_accuracy": 0.9806439429521561, "num_tokens": 41940.0, "step": 10 }, { "entropy": 0.17812986858189106, "epoch": 0.5569620253164557, "grad_norm": 0.6328125, "learning_rate": 0.00018181818181818183, "loss": 0.09373250603675842, "mean_token_accuracy": 0.9405141770839691, "num_tokens": 45774.0, "step": 11 }, { "entropy": 0.12172849662601948, "epoch": 0.6075949367088608, "grad_norm": 0.2177734375, "learning_rate": 0.0001781818181818182, "loss": 0.03453471511602402, "mean_token_accuracy": 1.0, "num_tokens": 49748.0, "step": 12 }, { "entropy": 0.18016426265239716, "epoch": 0.6582278481012658, "grad_norm": 0.28125, "learning_rate": 0.00017454545454545454, "loss": 0.156061589717865, "mean_token_accuracy": 0.9543326944112778, "num_tokens": 54197.0, "step": 13 }, { "entropy": 0.13954658806324005, "epoch": 0.7088607594936709, "grad_norm": 0.296875, "learning_rate": 0.0001709090909090909, "loss": 0.10283268988132477, "mean_token_accuracy": 0.9802946299314499, "num_tokens": 58556.0, "step": 14 }, { "entropy": 0.08406208734959364, "epoch": 0.759493670886076, "grad_norm": 0.5234375, "learning_rate": 0.00016727272727272728, "loss": 0.057560667395591736, "mean_token_accuracy": 0.9583040475845337, "num_tokens": 62314.0, "step": 15 }, { "entropy": 0.14593530632555485, "epoch": 0.810126582278481, "grad_norm": 0.2890625, "learning_rate": 0.00016363636363636366, "loss": 0.13262268900871277, "mean_token_accuracy": 0.9821915328502655, "num_tokens": 66709.0, "step": 16 }, { "entropy": 0.12713714689016342, "epoch": 0.8607594936708861, "grad_norm": 0.232421875, "learning_rate": 0.00016, "loss": 0.098836250603199, "mean_token_accuracy": 0.9742450714111328, "num_tokens": 71033.0, "step": 17 }, { "entropy": 0.07605009153485298, "epoch": 0.9113924050632911, "grad_norm": 0.275390625, "learning_rate": 0.00015636363636363637, "loss": 0.06675960123538971, "mean_token_accuracy": 0.9730987101793289, "num_tokens": 75240.0, "step": 18 }, { "entropy": 0.08511319197714329, "epoch": 0.9620253164556962, "grad_norm": 0.251953125, "learning_rate": 0.00015272727272727275, "loss": 0.06137944757938385, "mean_token_accuracy": 0.9560078978538513, "num_tokens": 79484.0, "step": 19 }, { "entropy": 0.09591637427608173, "epoch": 1.0, "grad_norm": 0.1982421875, "learning_rate": 0.0001490909090909091, "loss": 0.09518605470657349, "mean_token_accuracy": 0.9860279361406962, "num_tokens": 82572.0, "step": 20 }, { "entropy": 0.09083444299176335, "epoch": 1.0506329113924051, "grad_norm": 0.2294921875, "learning_rate": 0.00014545454545454546, "loss": 0.06781512498855591, "mean_token_accuracy": 0.9847126454114914, "num_tokens": 87051.0, "step": 21 }, { "entropy": 0.07092627324163914, "epoch": 1.1012658227848102, "grad_norm": 0.1875, "learning_rate": 0.00014181818181818184, "loss": 0.051979709416627884, "mean_token_accuracy": 0.9823355972766876, "num_tokens": 91753.0, "step": 22 }, { "entropy": 0.05573681928217411, "epoch": 1.1518987341772151, "grad_norm": 0.373046875, "learning_rate": 0.0001381818181818182, "loss": 0.04127391055226326, "mean_token_accuracy": 0.9915009140968323, "num_tokens": 95997.0, "step": 23 }, { "entropy": 0.06601053988561034, "epoch": 1.2025316455696202, "grad_norm": 0.1669921875, "learning_rate": 0.00013454545454545455, "loss": 0.029800206422805786, "mean_token_accuracy": 0.99110147356987, "num_tokens": 100340.0, "step": 24 }, { "entropy": 0.06689108535647392, "epoch": 1.2531645569620253, "grad_norm": 0.1572265625, "learning_rate": 0.00013090909090909093, "loss": 0.03818785399198532, "mean_token_accuracy": 0.98154416680336, "num_tokens": 104255.0, "step": 25 }, { "entropy": 0.11440154490992427, "epoch": 1.3037974683544304, "grad_norm": 0.197265625, "learning_rate": 0.00012727272727272728, "loss": 0.07071410864591599, "mean_token_accuracy": 0.9655913859605789, "num_tokens": 108510.0, "step": 26 }, { "entropy": 0.05173112731426954, "epoch": 1.3544303797468356, "grad_norm": 0.181640625, "learning_rate": 0.00012363636363636364, "loss": 0.04332485422492027, "mean_token_accuracy": 0.9889708757400513, "num_tokens": 112648.0, "step": 27 }, { "entropy": 0.11879035737365484, "epoch": 1.4050632911392404, "grad_norm": 0.2890625, "learning_rate": 0.00012, "loss": 0.030448323115706444, "mean_token_accuracy": 0.9249999970197678, "num_tokens": 116428.0, "step": 28 }, { "entropy": 0.04456495773047209, "epoch": 1.4556962025316456, "grad_norm": 0.263671875, "learning_rate": 0.00011636363636363636, "loss": 0.026923775672912598, "mean_token_accuracy": 0.9970930218696594, "num_tokens": 120223.0, "step": 29 }, { "entropy": 0.05467428918927908, "epoch": 1.5063291139240507, "grad_norm": 0.30078125, "learning_rate": 0.00011272727272727272, "loss": 0.05243736505508423, "mean_token_accuracy": 0.9819361567497253, "num_tokens": 124463.0, "step": 30 }, { "entropy": 0.12604457885026932, "epoch": 1.5569620253164556, "grad_norm": 0.232421875, "learning_rate": 0.00010909090909090909, "loss": 0.09929254651069641, "mean_token_accuracy": 0.9316810220479965, "num_tokens": 128541.0, "step": 31 }, { "entropy": 0.05706793861463666, "epoch": 1.6075949367088609, "grad_norm": 0.1513671875, "learning_rate": 0.00010545454545454545, "loss": 0.06422308087348938, "mean_token_accuracy": 0.986874520778656, "num_tokens": 133117.0, "step": 32 }, { "entropy": 0.07498226407915354, "epoch": 1.6582278481012658, "grad_norm": 0.21484375, "learning_rate": 0.00010181818181818181, "loss": 0.0917193740606308, "mean_token_accuracy": 0.9649497419595718, "num_tokens": 137164.0, "step": 33 }, { "entropy": 0.04969165986403823, "epoch": 1.7088607594936709, "grad_norm": 0.1845703125, "learning_rate": 9.818181818181818e-05, "loss": 0.03874623030424118, "mean_token_accuracy": 0.9855220764875412, "num_tokens": 141297.0, "step": 34 }, { "entropy": 0.059562995098531246, "epoch": 1.759493670886076, "grad_norm": 0.234375, "learning_rate": 9.454545454545455e-05, "loss": 0.07269799709320068, "mean_token_accuracy": 0.9904753267765045, "num_tokens": 145157.0, "step": 35 }, { "entropy": 0.06618588929995894, "epoch": 1.810126582278481, "grad_norm": 0.154296875, "learning_rate": 9.090909090909092e-05, "loss": 0.05096203833818436, "mean_token_accuracy": 0.9642254859209061, "num_tokens": 149499.0, "step": 36 }, { "entropy": 0.06980292382650077, "epoch": 1.8607594936708862, "grad_norm": 0.2080078125, "learning_rate": 8.727272727272727e-05, "loss": 0.015605948865413666, "mean_token_accuracy": 0.9749999940395355, "num_tokens": 153413.0, "step": 37 }, { "entropy": 0.0673763882368803, "epoch": 1.9113924050632911, "grad_norm": 0.56640625, "learning_rate": 8.363636363636364e-05, "loss": 0.12869100272655487, "mean_token_accuracy": 0.9618695080280304, "num_tokens": 157547.0, "step": 38 }, { "entropy": 0.04205051809549332, "epoch": 1.9620253164556962, "grad_norm": 0.1533203125, "learning_rate": 8e-05, "loss": 0.051324643194675446, "mean_token_accuracy": 0.9915735274553299, "num_tokens": 161912.0, "step": 39 }, { "entropy": 0.03731320612132549, "epoch": 2.0, "grad_norm": 0.15234375, "learning_rate": 7.636363636363637e-05, "loss": 0.03378448635339737, "mean_token_accuracy": 0.9946303764979044, "num_tokens": 165144.0, "step": 40 }, { "entropy": 0.07533124275505543, "epoch": 2.050632911392405, "grad_norm": 0.216796875, "learning_rate": 7.272727272727273e-05, "loss": 0.04694521799683571, "mean_token_accuracy": 0.9949748814105988, "num_tokens": 169344.0, "step": 41 }, { "entropy": 0.045258086174726486, "epoch": 2.1012658227848102, "grad_norm": 0.158203125, "learning_rate": 6.90909090909091e-05, "loss": 0.03484552353620529, "mean_token_accuracy": 0.9914986789226532, "num_tokens": 173572.0, "step": 42 }, { "entropy": 0.05962226795963943, "epoch": 2.151898734177215, "grad_norm": 0.15234375, "learning_rate": 6.545454545454546e-05, "loss": 0.05552398040890694, "mean_token_accuracy": 0.9867942631244659, "num_tokens": 178049.0, "step": 43 }, { "entropy": 0.04453732492402196, "epoch": 2.2025316455696204, "grad_norm": 0.25, "learning_rate": 6.181818181818182e-05, "loss": 0.07184948027133942, "mean_token_accuracy": 0.9885145127773285, "num_tokens": 182147.0, "step": 44 }, { "entropy": 0.036392109002918005, "epoch": 2.2531645569620253, "grad_norm": 0.26953125, "learning_rate": 5.818181818181818e-05, "loss": 0.028611719608306885, "mean_token_accuracy": 0.9898450970649719, "num_tokens": 186075.0, "step": 45 }, { "entropy": 0.046361514599993825, "epoch": 2.3037974683544302, "grad_norm": 0.1630859375, "learning_rate": 5.4545454545454546e-05, "loss": 0.02000986412167549, "mean_token_accuracy": 0.9895833283662796, "num_tokens": 189736.0, "step": 46 }, { "entropy": 0.059202448232099414, "epoch": 2.3544303797468356, "grad_norm": 0.2216796875, "learning_rate": 5.090909090909091e-05, "loss": 0.03575129061937332, "mean_token_accuracy": 0.9949752688407898, "num_tokens": 194069.0, "step": 47 }, { "entropy": 0.0532573452219367, "epoch": 2.4050632911392404, "grad_norm": 0.13671875, "learning_rate": 4.7272727272727275e-05, "loss": 0.037198036909103394, "mean_token_accuracy": 0.9947335422039032, "num_tokens": 198435.0, "step": 48 }, { "entropy": 0.046060606604442, "epoch": 2.4556962025316453, "grad_norm": 0.171875, "learning_rate": 4.3636363636363636e-05, "loss": 0.0407770499587059, "mean_token_accuracy": 0.9934192597866058, "num_tokens": 202365.0, "step": 49 }, { "entropy": 0.051424249075353146, "epoch": 2.5063291139240507, "grad_norm": 0.2353515625, "learning_rate": 4e-05, "loss": 0.04629915952682495, "mean_token_accuracy": 0.9804457575082779, "num_tokens": 206300.0, "step": 50 }, { "entropy": 0.05351645685732365, "epoch": 2.5569620253164556, "grad_norm": 0.1474609375, "learning_rate": 3.6363636363636364e-05, "loss": 0.03186073899269104, "mean_token_accuracy": 0.9686382859945297, "num_tokens": 210440.0, "step": 51 }, { "entropy": 0.0505744197871536, "epoch": 2.607594936708861, "grad_norm": 0.1328125, "learning_rate": 3.272727272727273e-05, "loss": 0.034618668258190155, "mean_token_accuracy": 0.9690476208925247, "num_tokens": 214755.0, "step": 52 }, { "entropy": 0.09076045430265367, "epoch": 2.6582278481012658, "grad_norm": 0.1123046875, "learning_rate": 2.909090909090909e-05, "loss": 0.03738842159509659, "mean_token_accuracy": 0.9946236610412598, "num_tokens": 219052.0, "step": 53 }, { "entropy": 0.03509035054594278, "epoch": 2.708860759493671, "grad_norm": 0.09716796875, "learning_rate": 2.5454545454545454e-05, "loss": 0.017466925084590912, "mean_token_accuracy": 0.9951923042535782, "num_tokens": 223211.0, "step": 54 }, { "entropy": 0.03864420251920819, "epoch": 2.759493670886076, "grad_norm": 0.10595703125, "learning_rate": 2.1818181818181818e-05, "loss": 0.023350555449724197, "mean_token_accuracy": 0.9902347922325134, "num_tokens": 227258.0, "step": 55 }, { "entropy": 0.06260875472798944, "epoch": 2.810126582278481, "grad_norm": 0.2333984375, "learning_rate": 1.8181818181818182e-05, "loss": 0.06964948028326035, "mean_token_accuracy": 0.9637512564659119, "num_tokens": 231368.0, "step": 56 }, { "entropy": 0.03902584942989051, "epoch": 2.8607594936708862, "grad_norm": 0.08447265625, "learning_rate": 1.4545454545454545e-05, "loss": 0.026787985116243362, "mean_token_accuracy": 0.9909819066524506, "num_tokens": 235881.0, "step": 57 }, { "entropy": 0.026682122610509396, "epoch": 2.911392405063291, "grad_norm": 0.1455078125, "learning_rate": 1.0909090909090909e-05, "loss": 0.017513107508420944, "mean_token_accuracy": 0.9918909966945648, "num_tokens": 240330.0, "step": 58 }, { "entropy": 0.02819057530723512, "epoch": 2.962025316455696, "grad_norm": 0.126953125, "learning_rate": 7.272727272727272e-06, "loss": 0.016973333433270454, "mean_token_accuracy": 0.9969512224197388, "num_tokens": 244397.0, "step": 59 }, { "entropy": 0.09315565973520279, "epoch": 3.0, "grad_norm": 0.1376953125, "learning_rate": 3.636363636363636e-06, "loss": 0.037921059876680374, "mean_token_accuracy": 0.9591470758120219, "num_tokens": 247716.0, "step": 60 } ], "logging_steps": 1, "max_steps": 60, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4269851314864128.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }