{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.46222735808175647, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.11948550771921873, "epoch": 0.023111367904087823, "grad_norm": 0.26614415645599365, "learning_rate": 6.923076923076924e-05, "loss": 0.27834961414337156, "mean_token_accuracy": 0.9158459510654211, "num_tokens": 91409.0, "step": 10 }, { "entropy": 0.14536615274846554, "epoch": 0.046222735808175645, "grad_norm": 0.28414708375930786, "learning_rate": 9.994965332706573e-05, "loss": 0.13056882619857788, "mean_token_accuracy": 0.9612345997244119, "num_tokens": 186627.0, "step": 20 }, { "entropy": 0.11003581081749872, "epoch": 0.06933410371226346, "grad_norm": 0.2106354683637619, "learning_rate": 9.964234631709187e-05, "loss": 0.09309924244880677, "mean_token_accuracy": 0.9709797658026218, "num_tokens": 276604.0, "step": 30 }, { "entropy": 0.0915378995705396, "epoch": 0.09244547161635129, "grad_norm": 0.2663438022136688, "learning_rate": 9.905741916970864e-05, "loss": 0.10451314449310303, "mean_token_accuracy": 0.9715173915028572, "num_tokens": 368108.0, "step": 40 }, { "entropy": 0.10749789654510096, "epoch": 0.11555683952043912, "grad_norm": 0.17998279631137848, "learning_rate": 9.819814303479267e-05, "loss": 0.10180811882019043, "mean_token_accuracy": 0.9665989849716425, "num_tokens": 457334.0, "step": 50 }, { "entropy": 0.08793499013991095, "epoch": 0.13866820742452693, "grad_norm": 0.18421846628189087, "learning_rate": 9.706932333304517e-05, "loss": 0.10302398204803467, "mean_token_accuracy": 0.9739916753023863, "num_tokens": 547458.0, "step": 60 }, { "entropy": 0.10031854717526585, "epoch": 0.16177957532861476, "grad_norm": 0.1583297848701477, "learning_rate": 9.567727288213005e-05, "loss": 0.09594225287437438, "mean_token_accuracy": 0.9684251010417938, "num_tokens": 633576.0, "step": 70 }, { "entropy": 0.10018112544203177, "epoch": 0.18489094323270258, "grad_norm": 0.17029769718647003, "learning_rate": 9.40297765928369e-05, "loss": 0.08666939735412597, "mean_token_accuracy": 0.9722081393003463, "num_tokens": 725021.0, "step": 80 }, { "entropy": 0.08978840237832628, "epoch": 0.2080023111367904, "grad_norm": 0.21113114058971405, "learning_rate": 9.213604793270196e-05, "loss": 0.10337703227996826, "mean_token_accuracy": 0.9718282397836446, "num_tokens": 809468.0, "step": 90 }, { "entropy": 0.08143368383025518, "epoch": 0.23111367904087823, "grad_norm": 0.2660817801952362, "learning_rate": 9.000667740056032e-05, "loss": 0.07579125165939331, "mean_token_accuracy": 0.9780994143337012, "num_tokens": 898185.0, "step": 100 }, { "entropy": 0.07822052207193338, "epoch": 0.25422504694496606, "grad_norm": 0.25105559825897217, "learning_rate": 8.765357330018056e-05, "loss": 0.0827728271484375, "mean_token_accuracy": 0.9731388352811337, "num_tokens": 988490.0, "step": 110 }, { "entropy": 0.0850134992855601, "epoch": 0.27733641484905386, "grad_norm": 0.15802568197250366, "learning_rate": 8.508989514419958e-05, "loss": 0.07012671828269959, "mean_token_accuracy": 0.9775275759398937, "num_tokens": 1078890.0, "step": 120 }, { "entropy": 0.07775390069000424, "epoch": 0.3004477827531417, "grad_norm": 0.3077862858772278, "learning_rate": 8.232998006078997e-05, "loss": 0.07896218299865723, "mean_token_accuracy": 0.9768860664218664, "num_tokens": 1171456.0, "step": 130 }, { "entropy": 0.06990418929490261, "epoch": 0.3235591506572295, "grad_norm": 0.20379361510276794, "learning_rate": 7.938926261462366e-05, "loss": 0.0791102945804596, "mean_token_accuracy": 0.9748555511236191, "num_tokens": 1267191.0, "step": 140 }, { "entropy": 0.07729233189020306, "epoch": 0.34667051856131736, "grad_norm": 0.2790727913379669, "learning_rate": 7.628418849052523e-05, "loss": 0.07758013606071472, "mean_token_accuracy": 0.9756737377494573, "num_tokens": 1354080.0, "step": 150 }, { "entropy": 0.08708043664228171, "epoch": 0.36978188646540516, "grad_norm": 0.269930899143219, "learning_rate": 7.303212252253162e-05, "loss": 0.08181141018867492, "mean_token_accuracy": 0.9762891136109829, "num_tokens": 1442199.0, "step": 160 }, { "entropy": 0.081081559494487, "epoch": 0.392893254369493, "grad_norm": 0.1513710916042328, "learning_rate": 6.965125158269619e-05, "loss": 0.0810213029384613, "mean_token_accuracy": 0.9729760400950909, "num_tokens": 1537565.0, "step": 170 }, { "entropy": 0.07967969757737592, "epoch": 0.4160046222735808, "grad_norm": 0.26842933893203735, "learning_rate": 6.616048287272301e-05, "loss": 0.0828117549419403, "mean_token_accuracy": 0.9750622134655714, "num_tokens": 1631534.0, "step": 180 }, { "entropy": 0.08117348714149557, "epoch": 0.4391159901776686, "grad_norm": 1.2517547607421875, "learning_rate": 6.257933818722543e-05, "loss": 0.07101889252662659, "mean_token_accuracy": 0.9764051765203476, "num_tokens": 1718429.0, "step": 190 }, { "entropy": 0.0724065299378708, "epoch": 0.46222735808175647, "grad_norm": 0.3557807505130768, "learning_rate": 5.8927844739931834e-05, "loss": 0.07825151681900025, "mean_token_accuracy": 0.9812528945505619, "num_tokens": 1804347.0, "step": 200 } ], "logging_steps": 10, "max_steps": 433, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7.742120422856602e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }