{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 3796, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.026343519494204427, "grad_norm": 0.25060537457466125, "learning_rate": 0.003, "loss": 6.455713500976563, "step": 100 }, { "epoch": 0.05268703898840885, "grad_norm": 0.4601215124130249, "learning_rate": 0.003, "loss": 5.242710571289063, "step": 200 }, { "epoch": 0.07903055848261328, "grad_norm": 0.8276243805885315, "learning_rate": 0.003, "loss": 4.580478210449218, "step": 300 }, { "epoch": 0.1053740779768177, "grad_norm": 0.5789214372634888, "learning_rate": 0.003, "loss": 4.156412353515625, "step": 400 }, { "epoch": 0.13171759747102213, "grad_norm": 0.4085150361061096, "learning_rate": 0.003, "loss": 3.9434808349609374, "step": 500 }, { "epoch": 0.13171759747102213, "eval_loss": 3.8796331882476807, "eval_runtime": 5.3536, "eval_samples_per_second": 363.308, "eval_steps_per_second": 45.577, "step": 500 }, { "epoch": 0.15806111696522657, "grad_norm": 0.3597581684589386, "learning_rate": 0.003, "loss": 3.82419189453125, "step": 600 }, { "epoch": 0.18440463645943098, "grad_norm": 0.34120166301727295, "learning_rate": 0.003, "loss": 3.7427273559570313, "step": 700 }, { "epoch": 0.2107481559536354, "grad_norm": 0.28499704599380493, "learning_rate": 0.003, "loss": 3.679521484375, "step": 800 }, { "epoch": 0.23709167544783982, "grad_norm": 0.2465476095676422, "learning_rate": 0.003, "loss": 3.6226321411132814, "step": 900 }, { "epoch": 0.26343519494204426, "grad_norm": 0.22941064834594727, "learning_rate": 0.003, "loss": 3.5675198364257814, "step": 1000 }, { "epoch": 0.26343519494204426, "eval_loss": 3.5459935665130615, "eval_runtime": 5.0816, "eval_samples_per_second": 382.75, "eval_steps_per_second": 48.016, "step": 1000 }, { "epoch": 0.2897787144362487, "grad_norm": 0.25667181611061096, "learning_rate": 0.003, "loss": 3.5283328247070314, "step": 1100 }, { "epoch": 0.31612223393045313, "grad_norm": 0.2258286029100418, "learning_rate": 0.003, "loss": 3.491883544921875, "step": 1200 }, { "epoch": 0.3424657534246575, "grad_norm": 0.21453158557415009, "learning_rate": 0.003, "loss": 3.461572265625, "step": 1300 }, { "epoch": 0.36880927291886195, "grad_norm": 0.1976873278617859, "learning_rate": 0.003, "loss": 3.4373324584960936, "step": 1400 }, { "epoch": 0.3951527924130664, "grad_norm": 0.1984185427427292, "learning_rate": 0.003, "loss": 3.4184698486328124, "step": 1500 }, { "epoch": 0.3951527924130664, "eval_loss": 3.406769037246704, "eval_runtime": 5.4292, "eval_samples_per_second": 358.251, "eval_steps_per_second": 44.942, "step": 1500 }, { "epoch": 0.4214963119072708, "grad_norm": 0.18770232796669006, "learning_rate": 0.003, "loss": 3.3980938720703127, "step": 1600 }, { "epoch": 0.44783983140147526, "grad_norm": 0.1807233989238739, "learning_rate": 0.003, "loss": 3.3868283081054686, "step": 1700 }, { "epoch": 0.47418335089567965, "grad_norm": 0.18816792964935303, "learning_rate": 0.003, "loss": 3.3717727661132812, "step": 1800 }, { "epoch": 0.5005268703898841, "grad_norm": 0.16948869824409485, "learning_rate": 0.003, "loss": 3.35481201171875, "step": 1900 }, { "epoch": 0.5268703898840885, "grad_norm": 0.1610724776983261, "learning_rate": 0.003, "loss": 3.3426513671875, "step": 2000 }, { "epoch": 0.5268703898840885, "eval_loss": 3.335824966430664, "eval_runtime": 5.1676, "eval_samples_per_second": 376.38, "eval_steps_per_second": 47.217, "step": 2000 }, { "epoch": 0.553213909378293, "grad_norm": 0.17394305765628815, "learning_rate": 0.003, "loss": 3.3357525634765626, "step": 2100 }, { "epoch": 0.5795574288724974, "grad_norm": 0.17073123157024384, "learning_rate": 0.003, "loss": 3.3254248046875, "step": 2200 }, { "epoch": 0.6059009483667018, "grad_norm": 0.16089457273483276, "learning_rate": 0.003, "loss": 3.315399169921875, "step": 2300 }, { "epoch": 0.6322444678609063, "grad_norm": 0.18953143060207367, "learning_rate": 0.003, "loss": 3.305037536621094, "step": 2400 }, { "epoch": 0.6585879873551106, "grad_norm": 0.17774879932403564, "learning_rate": 0.003, "loss": 3.2955453491210935, "step": 2500 }, { "epoch": 0.6585879873551106, "eval_loss": 3.291829824447632, "eval_runtime": 5.1763, "eval_samples_per_second": 375.751, "eval_steps_per_second": 47.138, "step": 2500 }, { "epoch": 0.684931506849315, "grad_norm": 0.15615127980709076, "learning_rate": 0.003, "loss": 3.291881408691406, "step": 2600 }, { "epoch": 0.7112750263435195, "grad_norm": 0.14877459406852722, "learning_rate": 0.003, "loss": 3.28682861328125, "step": 2700 }, { "epoch": 0.7376185458377239, "grad_norm": 0.1652265042066574, "learning_rate": 0.003, "loss": 3.2773147583007813, "step": 2800 }, { "epoch": 0.7639620653319283, "grad_norm": 0.15335354208946228, "learning_rate": 0.003, "loss": 3.272921142578125, "step": 2900 }, { "epoch": 0.7903055848261328, "grad_norm": 0.15235580503940582, "learning_rate": 0.003, "loss": 3.2669085693359374, "step": 3000 }, { "epoch": 0.7903055848261328, "eval_loss": 3.2598516941070557, "eval_runtime": 5.2882, "eval_samples_per_second": 367.801, "eval_steps_per_second": 46.141, "step": 3000 }, { "epoch": 0.8166491043203372, "grad_norm": 0.1472020000219345, "learning_rate": 0.0029508779938349373, "loss": 3.2607357788085936, "step": 3100 }, { "epoch": 0.8429926238145417, "grad_norm": 0.14368093013763428, "learning_rate": 0.002675231600866892, "loss": 3.2511105346679687, "step": 3200 }, { "epoch": 0.8693361433087461, "grad_norm": 0.13688847422599792, "learning_rate": 0.002201098977270783, "loss": 3.2377633666992187, "step": 3300 }, { "epoch": 0.8956796628029505, "grad_norm": 0.12832748889923096, "learning_rate": 0.0016085569327630683, "loss": 3.2152593994140624, "step": 3400 }, { "epoch": 0.9220231822971549, "grad_norm": 0.12625813484191895, "learning_rate": 0.0009976805817435207, "loss": 3.195493469238281, "step": 3500 }, { "epoch": 0.9220231822971549, "eval_loss": 3.182077646255493, "eval_runtime": 5.1942, "eval_samples_per_second": 374.458, "eval_steps_per_second": 46.976, "step": 3500 }, { "epoch": 0.9483667017913593, "grad_norm": 0.12080375850200653, "learning_rate": 0.00047164154094220246, "loss": 3.1744677734375, "step": 3600 }, { "epoch": 0.9747102212855637, "grad_norm": 0.10628718882799149, "learning_rate": 0.00011928315518990008, "loss": 3.1650640869140627, "step": 3700 }, { "epoch": 1.0, "eval_loss": 3.149350166320801, "eval_runtime": 6.4517, "eval_samples_per_second": 301.472, "eval_steps_per_second": 37.82, "step": 3796 } ], "logging_steps": 100, "max_steps": 3796, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9923983243739136.0, "train_batch_size": 256, "trial_name": null, "trial_params": null }