{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 100, "global_step": 1875, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3540814772248269, "epoch": 0.16, "grad_norm": 0.29296875, "learning_rate": 0.00019973673694024, "loss": 1.4633206176757811, "mean_token_accuracy": 0.6500224708765745, "num_tokens": 1238177.0, "step": 100 }, { "epoch": 0.16, "eval_entropy": 1.0408895498230344, "eval_loss": 1.0171571969985962, "eval_mean_token_accuracy": 0.7146944498258924, "eval_num_tokens": 1238177.0, "eval_runtime": 78.8867, "eval_samples_per_second": 6.338, "eval_steps_per_second": 0.799, "step": 100 }, { "entropy": 0.9953572849929333, "epoch": 0.32, "grad_norm": 0.283203125, "learning_rate": 0.00019700443730801413, "loss": 0.9830435943603516, "mean_token_accuracy": 0.7228847779333591, "num_tokens": 2525507.0, "step": 200 }, { "epoch": 0.32, "eval_entropy": 1.0137588391228327, "eval_loss": 0.9846630692481995, "eval_mean_token_accuracy": 0.7225528132347834, "eval_num_tokens": 2525507.0, "eval_runtime": 78.7428, "eval_samples_per_second": 6.35, "eval_steps_per_second": 0.8, "step": 200 }, { "entropy": 0.998912007957697, "epoch": 0.48, "grad_norm": 0.392578125, "learning_rate": 0.00019138263836827288, "loss": 0.9803644561767578, "mean_token_accuracy": 0.7225449255108833, "num_tokens": 3772872.0, "step": 300 }, { "epoch": 0.48, "eval_entropy": 0.9792825617487468, "eval_loss": 0.9684324860572815, "eval_mean_token_accuracy": 0.7254447255815778, "eval_num_tokens": 3772872.0, "eval_runtime": 78.7266, "eval_samples_per_second": 6.351, "eval_steps_per_second": 0.8, "step": 300 }, { "entropy": 0.9658883933722973, "epoch": 0.64, "grad_norm": 0.314453125, "learning_rate": 0.00018303879827647975, "loss": 0.9450923919677734, "mean_token_accuracy": 0.7311204792559147, "num_tokens": 4984433.0, "step": 400 }, { "epoch": 0.64, "eval_entropy": 0.9519493419026571, "eval_loss": 0.9587358832359314, "eval_mean_token_accuracy": 0.7281927579925174, "eval_num_tokens": 4984433.0, "eval_runtime": 78.7548, "eval_samples_per_second": 6.349, "eval_steps_per_second": 0.8, "step": 400 }, { "entropy": 0.9506746862828731, "epoch": 0.8, "grad_norm": 0.287109375, "learning_rate": 0.00017222145741734626, "loss": 0.9352159118652343, "mean_token_accuracy": 0.7334290930628776, "num_tokens": 6278212.0, "step": 500 }, { "epoch": 0.8, "eval_entropy": 0.9630418930734906, "eval_loss": 0.9499430060386658, "eval_mean_token_accuracy": 0.7301400247074309, "eval_num_tokens": 6278212.0, "eval_runtime": 78.8947, "eval_samples_per_second": 6.338, "eval_steps_per_second": 0.799, "step": 500 }, { "entropy": 0.9404085071384907, "epoch": 0.96, "grad_norm": 0.36328125, "learning_rate": 0.0001592528350603103, "loss": 0.9235909271240235, "mean_token_accuracy": 0.7360797208547593, "num_tokens": 7515414.0, "step": 600 }, { "epoch": 0.96, "eval_entropy": 0.9610084844014001, "eval_loss": 0.9445458054542542, "eval_mean_token_accuracy": 0.7312900613224695, "eval_num_tokens": 7515414.0, "eval_runtime": 78.809, "eval_samples_per_second": 6.344, "eval_steps_per_second": 0.799, "step": 600 }, { "entropy": 0.8863665771484375, "epoch": 1.12, "grad_norm": 0.33984375, "learning_rate": 0.0001445192313207067, "loss": 0.8664443969726563, "mean_token_accuracy": 0.751860016733408, "num_tokens": 8791049.0, "step": 700 }, { "epoch": 1.12, "eval_entropy": 0.8678532384690785, "eval_loss": 0.9490408897399902, "eval_mean_token_accuracy": 0.7310751146740384, "eval_num_tokens": 8791049.0, "eval_runtime": 78.889, "eval_samples_per_second": 6.338, "eval_steps_per_second": 0.799, "step": 700 }, { "entropy": 0.8653571680933237, "epoch": 1.28, "grad_norm": 0.341796875, "learning_rate": 0.0001284595203261965, "loss": 0.8425308227539062, "mean_token_accuracy": 0.7570811548829078, "num_tokens": 10023730.0, "step": 800 }, { "epoch": 1.28, "eval_entropy": 0.8799236341128274, "eval_loss": 0.9464381337165833, "eval_mean_token_accuracy": 0.731743007425278, "eval_num_tokens": 10023730.0, "eval_runtime": 78.7704, "eval_samples_per_second": 6.348, "eval_steps_per_second": 0.8, "step": 800 }, { "entropy": 0.8525189873576164, "epoch": 1.44, "grad_norm": 0.326171875, "learning_rate": 0.00011155207734584263, "loss": 0.8311178588867187, "mean_token_accuracy": 0.758762137889862, "num_tokens": 11272481.0, "step": 900 }, { "epoch": 1.44, "eval_entropy": 0.8737099454516456, "eval_loss": 0.9428508281707764, "eval_mean_token_accuracy": 0.7328412476040068, "eval_num_tokens": 11272481.0, "eval_runtime": 78.9808, "eval_samples_per_second": 6.331, "eval_steps_per_second": 0.798, "step": 900 }, { "entropy": 0.8523794415593148, "epoch": 1.6, "grad_norm": 0.322265625, "learning_rate": 9.430052928723153e-05, "loss": 0.8334156799316407, "mean_token_accuracy": 0.7607765494287014, "num_tokens": 12541228.0, "step": 1000 }, { "epoch": 1.6, "eval_entropy": 0.8634761429968334, "eval_loss": 0.939626932144165, "eval_mean_token_accuracy": 0.7337213830342368, "eval_num_tokens": 12541228.0, "eval_runtime": 78.7473, "eval_samples_per_second": 6.349, "eval_steps_per_second": 0.8, "step": 1000 }, { "entropy": 0.848904173374176, "epoch": 1.76, "grad_norm": 0.296875, "learning_rate": 7.721875301571359e-05, "loss": 0.8279781341552734, "mean_token_accuracy": 0.761102753430605, "num_tokens": 13787594.0, "step": 1100 }, { "epoch": 1.76, "eval_entropy": 0.8816202557276166, "eval_loss": 0.9332679510116577, "eval_mean_token_accuracy": 0.7345179215310111, "eval_num_tokens": 13787594.0, "eval_runtime": 78.8468, "eval_samples_per_second": 6.341, "eval_steps_per_second": 0.799, "step": 1100 }, { "entropy": 0.8487374657392501, "epoch": 1.92, "grad_norm": 0.361328125, "learning_rate": 6.0815568355179556e-05, "loss": 0.8284202575683594, "mean_token_accuracy": 0.7601838798820972, "num_tokens": 15024952.0, "step": 1200 }, { "epoch": 1.92, "eval_entropy": 0.8655259221319168, "eval_loss": 0.9299662113189697, "eval_mean_token_accuracy": 0.7359667079789298, "eval_num_tokens": 15024952.0, "eval_runtime": 78.81, "eval_samples_per_second": 6.344, "eval_steps_per_second": 0.799, "step": 1200 }, { "entropy": 0.7959265542775392, "epoch": 2.08, "grad_norm": 0.39453125, "learning_rate": 4.5579581724397255e-05, "loss": 0.765469741821289, "mean_token_accuracy": 0.7783753572404385, "num_tokens": 16289561.0, "step": 1300 }, { "epoch": 2.08, "eval_entropy": 0.7987193597687615, "eval_loss": 0.9503117799758911, "eval_mean_token_accuracy": 0.73391526464432, "eval_num_tokens": 16289561.0, "eval_runtime": 78.8942, "eval_samples_per_second": 6.338, "eval_steps_per_second": 0.799, "step": 1300 }, { "entropy": 0.7321610506623983, "epoch": 2.24, "grad_norm": 0.392578125, "learning_rate": 3.196463187590929e-05, "loss": 0.6977394866943359, "mean_token_accuracy": 0.7958511321246624, "num_tokens": 17566179.0, "step": 1400 }, { "epoch": 2.24, "eval_entropy": 0.7957971247415694, "eval_loss": 0.9516386985778809, "eval_mean_token_accuracy": 0.7339397157941546, "eval_num_tokens": 17566179.0, "eval_runtime": 78.9187, "eval_samples_per_second": 6.336, "eval_steps_per_second": 0.798, "step": 1400 }, { "entropy": 0.7484312203526496, "epoch": 2.4, "grad_norm": 0.36328125, "learning_rate": 2.0376271269487514e-05, "loss": 0.7148262023925781, "mean_token_accuracy": 0.7925588050484658, "num_tokens": 18823409.0, "step": 1500 }, { "epoch": 2.4, "eval_entropy": 0.7901531098380922, "eval_loss": 0.952657163143158, "eval_mean_token_accuracy": 0.7342138498548477, "eval_num_tokens": 18823409.0, "eval_runtime": 78.7246, "eval_samples_per_second": 6.351, "eval_steps_per_second": 0.8, "step": 1500 }, { "entropy": 0.7353997033834457, "epoch": 2.56, "grad_norm": 0.404296875, "learning_rate": 1.1159685763395111e-05, "loss": 0.6989010620117188, "mean_token_accuracy": 0.7955636675655842, "num_tokens": 20029991.0, "step": 1600 }, { "epoch": 2.56, "eval_entropy": 0.7921941649346125, "eval_loss": 0.9510936141014099, "eval_mean_token_accuracy": 0.7344856574421837, "eval_num_tokens": 20029991.0, "eval_runtime": 78.6039, "eval_samples_per_second": 6.361, "eval_steps_per_second": 0.801, "step": 1600 }, { "entropy": 0.7453224293142557, "epoch": 2.7199999999999998, "grad_norm": 0.376953125, "learning_rate": 4.58941246311464e-06, "loss": 0.712043685913086, "mean_token_accuracy": 0.7924758359789849, "num_tokens": 21285971.0, "step": 1700 }, { "epoch": 2.7199999999999998, "eval_entropy": 0.7924881426114885, "eval_loss": 0.9510090351104736, "eval_mean_token_accuracy": 0.7344099529205806, "eval_num_tokens": 21285971.0, "eval_runtime": 78.7793, "eval_samples_per_second": 6.347, "eval_steps_per_second": 0.8, "step": 1700 }, { "entropy": 0.7430764560401439, "epoch": 2.88, "grad_norm": 0.404296875, "learning_rate": 8.611620049653879e-07, "loss": 0.7093801879882813, "mean_token_accuracy": 0.7932735744118691, "num_tokens": 22529694.0, "step": 1800 }, { "epoch": 2.88, "eval_entropy": 0.7928767279973106, "eval_loss": 0.9508963823318481, "eval_mean_token_accuracy": 0.7343375957201398, "eval_num_tokens": 22529694.0, "eval_runtime": 78.867, "eval_samples_per_second": 6.34, "eval_steps_per_second": 0.799, "step": 1800 }, { "epoch": 3.0, "eval_entropy": 0.7928942896070934, "eval_loss": 0.9508863687515259, "eval_mean_token_accuracy": 0.734485215610928, "eval_num_tokens": 23462628.0, "eval_runtime": 78.8215, "eval_samples_per_second": 6.343, "eval_steps_per_second": 0.799, "step": 1875 } ], "logging_steps": 100, "max_steps": 1875, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.6703999720219935e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }