examp-r2-4env / trainer_state.json
Jordansky's picture
Upload task output examp_r2_4env
667e81e verified
Raw
History Blame Contribute Delete
6.97 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.9867841409691631,
"eval_steps": 500,
"global_step": 226,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.9361699424684048,
"epoch": 0.0881057268722467,
"grad_norm": 0.80078125,
"learning_rate": 6e-05,
"loss": 0.1638,
"mean_token_accuracy": 0.9636025600135326,
"num_tokens": 941939.0,
"step": 10
},
{
"entropy": 1.2769331455230712,
"epoch": 0.1762114537444934,
"grad_norm": 0.640625,
"learning_rate": 9.993475671485666e-05,
"loss": 0.0768,
"mean_token_accuracy": 0.9733339473605156,
"num_tokens": 1897260.0,
"step": 20
},
{
"entropy": 1.3240129783749581,
"epoch": 0.2643171806167401,
"grad_norm": 2.578125,
"learning_rate": 9.920337448297678e-05,
"loss": 0.0922,
"mean_token_accuracy": 0.9707472532987594,
"num_tokens": 2850735.0,
"step": 30
},
{
"entropy": 1.4359926223754882,
"epoch": 0.3524229074889868,
"grad_norm": 0.44921875,
"learning_rate": 9.767499085071128e-05,
"loss": 0.1235,
"mean_token_accuracy": 0.9620010450482368,
"num_tokens": 3801040.0,
"step": 40
},
{
"entropy": 1.2460978001356124,
"epoch": 0.44052863436123346,
"grad_norm": 0.337890625,
"learning_rate": 9.538279415325828e-05,
"loss": 0.0623,
"mean_token_accuracy": 0.9752302221953869,
"num_tokens": 4743189.0,
"step": 50
},
{
"entropy": 1.181038823723793,
"epoch": 0.5286343612334802,
"grad_norm": 0.3984375,
"learning_rate": 9.237655866896586e-05,
"loss": 0.0585,
"mean_token_accuracy": 0.9763436049222947,
"num_tokens": 5688120.0,
"step": 60
},
{
"entropy": 1.1543719470500946,
"epoch": 0.6167400881057269,
"grad_norm": 0.34375,
"learning_rate": 8.872156378766179e-05,
"loss": 0.0568,
"mean_token_accuracy": 0.9767736874520778,
"num_tokens": 6633142.0,
"step": 70
},
{
"entropy": 1.1321007892489434,
"epoch": 0.7048458149779736,
"grad_norm": 0.31640625,
"learning_rate": 8.449717649071594e-05,
"loss": 0.0569,
"mean_token_accuracy": 0.9765677087008953,
"num_tokens": 7577006.0,
"step": 80
},
{
"entropy": 1.0975897915661335,
"epoch": 0.7929515418502202,
"grad_norm": 0.21484375,
"learning_rate": 7.979512792380263e-05,
"loss": 0.0507,
"mean_token_accuracy": 0.9798766911029816,
"num_tokens": 8526339.0,
"step": 90
},
{
"entropy": 1.0926882281899453,
"epoch": 0.8810572687224669,
"grad_norm": 0.28515625,
"learning_rate": 7.471752148600441e-05,
"loss": 0.0538,
"mean_token_accuracy": 0.9775132387876511,
"num_tokens": 9479754.0,
"step": 100
},
{
"entropy": 1.101259708404541,
"epoch": 0.9691629955947136,
"grad_norm": 0.306640625,
"learning_rate": 6.937461568893057e-05,
"loss": 0.0522,
"mean_token_accuracy": 0.9783625587821007,
"num_tokens": 10425857.0,
"step": 110
},
{
"entropy": 1.1054948803625608,
"epoch": 1.052863436123348,
"grad_norm": 0.275390625,
"learning_rate": 6.388242993031719e-05,
"loss": 0.0511,
"mean_token_accuracy": 0.9776703919235029,
"num_tokens": 11318715.0,
"step": 120
},
{
"entropy": 1.0859883286058902,
"epoch": 1.1409691629955947,
"grad_norm": 0.2734375,
"learning_rate": 5.8360225171927386e-05,
"loss": 0.051,
"mean_token_accuracy": 0.9791761793196201,
"num_tokens": 12265510.0,
"step": 130
},
{
"entropy": 1.085260946303606,
"epoch": 1.2290748898678414,
"grad_norm": 0.2431640625,
"learning_rate": 5.292791422798197e-05,
"loss": 0.0417,
"mean_token_accuracy": 0.9830566577613353,
"num_tokens": 13205143.0,
"step": 140
},
{
"entropy": 1.0741271749138832,
"epoch": 1.3171806167400881,
"grad_norm": 0.3671875,
"learning_rate": 4.7703457898833556e-05,
"loss": 0.0455,
"mean_token_accuracy": 0.9809500627219677,
"num_tokens": 14155920.0,
"step": 150
},
{
"entropy": 1.074209114164114,
"epoch": 1.4052863436123348,
"grad_norm": 0.412109375,
"learning_rate": 4.28003034919638e-05,
"loss": 0.0481,
"mean_token_accuracy": 0.9798587031662465,
"num_tokens": 15116850.0,
"step": 160
},
{
"entropy": 1.0775911159813405,
"epoch": 1.4933920704845816,
"grad_norm": 0.28125,
"learning_rate": 3.832492135195628e-05,
"loss": 0.0467,
"mean_token_accuracy": 0.9791537664830685,
"num_tokens": 16066781.0,
"step": 170
},
{
"entropy": 1.0590569734573365,
"epoch": 1.5814977973568283,
"grad_norm": 0.2578125,
"learning_rate": 3.437449289286601e-05,
"loss": 0.0476,
"mean_token_accuracy": 0.9791436046361923,
"num_tokens": 17008134.0,
"step": 180
},
{
"entropy": 1.0643939599394798,
"epoch": 1.6696035242290748,
"grad_norm": 0.275390625,
"learning_rate": 3.103480033658318e-05,
"loss": 0.0448,
"mean_token_accuracy": 0.980703292787075,
"num_tokens": 17955287.0,
"step": 190
},
{
"entropy": 1.0558478556573392,
"epoch": 1.7577092511013217,
"grad_norm": 0.2490234375,
"learning_rate": 2.8378363980810934e-05,
"loss": 0.0432,
"mean_token_accuracy": 0.9812683060765266,
"num_tokens": 18917353.0,
"step": 200
},
{
"entropy": 1.0567112952470779,
"epoch": 1.8458149779735682,
"grad_norm": 0.267578125,
"learning_rate": 2.646286744525481e-05,
"loss": 0.047,
"mean_token_accuracy": 0.9798793807625771,
"num_tokens": 19860980.0,
"step": 210
},
{
"entropy": 1.0524355478584766,
"epoch": 1.9339207048458151,
"grad_norm": 0.306640625,
"learning_rate": 2.5329905091271954e-05,
"loss": 0.0466,
"mean_token_accuracy": 0.9801529116928578,
"num_tokens": 20809310.0,
"step": 220
}
],
"logging_steps": 10,
"max_steps": 228,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.0935136308374528e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}