{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.987452948557089, "eval_steps": 500, "global_step": 198, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.1, "grad_norm": 0.13307033479213715, "learning_rate": 0.0002, "loss": 1.3135, "step": 10 }, { "epoch": 0.2, "grad_norm": 0.25080665946006775, "learning_rate": 0.0002, "loss": 0.8903, "step": 20 }, { "epoch": 0.3, "grad_norm": 0.22090280055999756, "learning_rate": 0.0002, "loss": 1.0646, "step": 30 }, { "epoch": 0.4, "grad_norm": 0.14331598579883575, "learning_rate": 0.0002, "loss": 1.0373, "step": 40 }, { "epoch": 0.5, "grad_norm": 0.4005136489868164, "learning_rate": 0.0002, "loss": 0.8402, "step": 50 }, { "epoch": 0.6, "grad_norm": 0.14100393652915955, "learning_rate": 0.0002, "loss": 1.1971, "step": 60 }, { "epoch": 0.7, "grad_norm": 0.17817306518554688, "learning_rate": 0.0002, "loss": 0.8422, "step": 70 }, { "epoch": 0.8, "grad_norm": 0.15485863387584686, "learning_rate": 0.0002, "loss": 1.0806, "step": 80 }, { "epoch": 0.9, "grad_norm": 0.13957808911800385, "learning_rate": 0.0002, "loss": 0.9923, "step": 90 }, { "epoch": 0.99, "eval_loss": 1.075861930847168, "eval_runtime": 15.627, "eval_samples_per_second": 6.399, "eval_steps_per_second": 0.256, "step": 99 }, { "epoch": 1.0, "grad_norm": 0.17686176300048828, "learning_rate": 0.0002, "loss": 0.8183, "step": 100 }, { "epoch": 1.1, "grad_norm": 0.13432720303535461, "learning_rate": 0.0002, "loss": 1.1495, "step": 110 }, { "epoch": 1.2, "grad_norm": 0.16776545345783234, "learning_rate": 0.0002, "loss": 0.7245, "step": 120 }, { "epoch": 1.3, "grad_norm": 0.12988704442977905, "learning_rate": 0.0002, "loss": 0.9554, "step": 130 }, { "epoch": 1.41, "grad_norm": 0.1477508395910263, "learning_rate": 0.0002, "loss": 0.9577, "step": 140 }, { "epoch": 1.51, "grad_norm": 0.2590917944908142, "learning_rate": 0.0002, "loss": 0.6792, "step": 150 }, { "epoch": 1.61, "grad_norm": 0.13945309817790985, "learning_rate": 0.0002, "loss": 1.121, "step": 160 }, { "epoch": 1.71, "grad_norm": 0.19059790670871735, "learning_rate": 0.0002, "loss": 0.6953, "step": 170 }, { "epoch": 1.81, "grad_norm": 0.09515325725078583, "learning_rate": 0.0002, "loss": 0.9976, "step": 180 }, { "epoch": 1.91, "grad_norm": 0.1453874409198761, "learning_rate": 0.0002, "loss": 0.8999, "step": 190 }, { "epoch": 1.99, "eval_loss": 1.0925697088241577, "eval_runtime": 4.0721, "eval_samples_per_second": 24.557, "eval_steps_per_second": 0.982, "step": 198 }, { "epoch": 1.99, "step": 198, "total_flos": 7.115900132922491e+17, "train_loss": 0.9474106412945371, "train_runtime": 6013.7693, "train_samples_per_second": 16.962, "train_steps_per_second": 0.033 } ], "logging_steps": 10, "max_steps": 198, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 250, "total_flos": 7.115900132922491e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }