| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 500, |
| "global_step": 3796, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.026343519494204427, |
| "grad_norm": 0.25060537457466125, |
| "learning_rate": 0.003, |
| "loss": 6.455713500976563, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.05268703898840885, |
| "grad_norm": 0.4601215124130249, |
| "learning_rate": 0.003, |
| "loss": 5.242710571289063, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.07903055848261328, |
| "grad_norm": 0.8276243805885315, |
| "learning_rate": 0.003, |
| "loss": 4.580478210449218, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.1053740779768177, |
| "grad_norm": 0.5789214372634888, |
| "learning_rate": 0.003, |
| "loss": 4.156412353515625, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.13171759747102213, |
| "grad_norm": 0.4085150361061096, |
| "learning_rate": 0.003, |
| "loss": 3.9434808349609374, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.13171759747102213, |
| "eval_loss": 3.8796331882476807, |
| "eval_runtime": 5.3536, |
| "eval_samples_per_second": 363.308, |
| "eval_steps_per_second": 45.577, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.15806111696522657, |
| "grad_norm": 0.3597581684589386, |
| "learning_rate": 0.003, |
| "loss": 3.82419189453125, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.18440463645943098, |
| "grad_norm": 0.34120166301727295, |
| "learning_rate": 0.003, |
| "loss": 3.7427273559570313, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.2107481559536354, |
| "grad_norm": 0.28499704599380493, |
| "learning_rate": 0.003, |
| "loss": 3.679521484375, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.23709167544783982, |
| "grad_norm": 0.2465476095676422, |
| "learning_rate": 0.003, |
| "loss": 3.6226321411132814, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.26343519494204426, |
| "grad_norm": 0.22941064834594727, |
| "learning_rate": 0.003, |
| "loss": 3.5675198364257814, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.26343519494204426, |
| "eval_loss": 3.5459935665130615, |
| "eval_runtime": 5.0816, |
| "eval_samples_per_second": 382.75, |
| "eval_steps_per_second": 48.016, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.2897787144362487, |
| "grad_norm": 0.25667181611061096, |
| "learning_rate": 0.003, |
| "loss": 3.5283328247070314, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.31612223393045313, |
| "grad_norm": 0.2258286029100418, |
| "learning_rate": 0.003, |
| "loss": 3.491883544921875, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.3424657534246575, |
| "grad_norm": 0.21453158557415009, |
| "learning_rate": 0.003, |
| "loss": 3.461572265625, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.36880927291886195, |
| "grad_norm": 0.1976873278617859, |
| "learning_rate": 0.003, |
| "loss": 3.4373324584960936, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.3951527924130664, |
| "grad_norm": 0.1984185427427292, |
| "learning_rate": 0.003, |
| "loss": 3.4184698486328124, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.3951527924130664, |
| "eval_loss": 3.406769037246704, |
| "eval_runtime": 5.4292, |
| "eval_samples_per_second": 358.251, |
| "eval_steps_per_second": 44.942, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.4214963119072708, |
| "grad_norm": 0.18770232796669006, |
| "learning_rate": 0.003, |
| "loss": 3.3980938720703127, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.44783983140147526, |
| "grad_norm": 0.1807233989238739, |
| "learning_rate": 0.003, |
| "loss": 3.3868283081054686, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.47418335089567965, |
| "grad_norm": 0.18816792964935303, |
| "learning_rate": 0.003, |
| "loss": 3.3717727661132812, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.5005268703898841, |
| "grad_norm": 0.16948869824409485, |
| "learning_rate": 0.003, |
| "loss": 3.35481201171875, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.5268703898840885, |
| "grad_norm": 0.1610724776983261, |
| "learning_rate": 0.003, |
| "loss": 3.3426513671875, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.5268703898840885, |
| "eval_loss": 3.335824966430664, |
| "eval_runtime": 5.1676, |
| "eval_samples_per_second": 376.38, |
| "eval_steps_per_second": 47.217, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.553213909378293, |
| "grad_norm": 0.17394305765628815, |
| "learning_rate": 0.003, |
| "loss": 3.3357525634765626, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.5795574288724974, |
| "grad_norm": 0.17073123157024384, |
| "learning_rate": 0.003, |
| "loss": 3.3254248046875, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.6059009483667018, |
| "grad_norm": 0.16089457273483276, |
| "learning_rate": 0.003, |
| "loss": 3.315399169921875, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.6322444678609063, |
| "grad_norm": 0.18953143060207367, |
| "learning_rate": 0.003, |
| "loss": 3.305037536621094, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.6585879873551106, |
| "grad_norm": 0.17774879932403564, |
| "learning_rate": 0.003, |
| "loss": 3.2955453491210935, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.6585879873551106, |
| "eval_loss": 3.291829824447632, |
| "eval_runtime": 5.1763, |
| "eval_samples_per_second": 375.751, |
| "eval_steps_per_second": 47.138, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.684931506849315, |
| "grad_norm": 0.15615127980709076, |
| "learning_rate": 0.003, |
| "loss": 3.291881408691406, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.7112750263435195, |
| "grad_norm": 0.14877459406852722, |
| "learning_rate": 0.003, |
| "loss": 3.28682861328125, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.7376185458377239, |
| "grad_norm": 0.1652265042066574, |
| "learning_rate": 0.003, |
| "loss": 3.2773147583007813, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.7639620653319283, |
| "grad_norm": 0.15335354208946228, |
| "learning_rate": 0.003, |
| "loss": 3.272921142578125, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.7903055848261328, |
| "grad_norm": 0.15235580503940582, |
| "learning_rate": 0.003, |
| "loss": 3.2669085693359374, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.7903055848261328, |
| "eval_loss": 3.2598516941070557, |
| "eval_runtime": 5.2882, |
| "eval_samples_per_second": 367.801, |
| "eval_steps_per_second": 46.141, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.8166491043203372, |
| "grad_norm": 0.1472020000219345, |
| "learning_rate": 0.0029508779938349373, |
| "loss": 3.2607357788085936, |
| "step": 3100 |
| }, |
| { |
| "epoch": 0.8429926238145417, |
| "grad_norm": 0.14368093013763428, |
| "learning_rate": 0.002675231600866892, |
| "loss": 3.2511105346679687, |
| "step": 3200 |
| }, |
| { |
| "epoch": 0.8693361433087461, |
| "grad_norm": 0.13688847422599792, |
| "learning_rate": 0.002201098977270783, |
| "loss": 3.2377633666992187, |
| "step": 3300 |
| }, |
| { |
| "epoch": 0.8956796628029505, |
| "grad_norm": 0.12832748889923096, |
| "learning_rate": 0.0016085569327630683, |
| "loss": 3.2152593994140624, |
| "step": 3400 |
| }, |
| { |
| "epoch": 0.9220231822971549, |
| "grad_norm": 0.12625813484191895, |
| "learning_rate": 0.0009976805817435207, |
| "loss": 3.195493469238281, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.9220231822971549, |
| "eval_loss": 3.182077646255493, |
| "eval_runtime": 5.1942, |
| "eval_samples_per_second": 374.458, |
| "eval_steps_per_second": 46.976, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.9483667017913593, |
| "grad_norm": 0.12080375850200653, |
| "learning_rate": 0.00047164154094220246, |
| "loss": 3.1744677734375, |
| "step": 3600 |
| }, |
| { |
| "epoch": 0.9747102212855637, |
| "grad_norm": 0.10628718882799149, |
| "learning_rate": 0.00011928315518990008, |
| "loss": 3.1650640869140627, |
| "step": 3700 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_loss": 3.149350166320801, |
| "eval_runtime": 6.4517, |
| "eval_samples_per_second": 301.472, |
| "eval_steps_per_second": 37.82, |
| "step": 3796 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 3796, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 9923983243739136.0, |
| "train_batch_size": 256, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|