Qwen3-0.6B-JSON-SFT / train_meta.json
NotoriousH2's picture
실험 산출물 업로드
a3e3fa3 verified
Raw
History Blame Contribute Delete
2.56 kB
{
"train_sec": 927.9,
"max_length": 2816,
"think": false,
"epochs": 3,
"lr": 5e-06,
"log_history": [
{
"eval_loss": 0.33602747321128845,
"eval_runtime": 8.8236,
"eval_samples_per_second": 12.127,
"eval_steps_per_second": 12.127,
"eval_entropy": 0.3295369472737624,
"eval_num_tokens": 4799219.0,
"eval_mean_token_accuracy": 0.9163304918280272,
"epoch": 2.625514403292181,
"step": 160
},
{
"loss": 0.34753003120422366,
"grad_norm": 2.71875,
"learning_rate": 1.4733707847247814e-07,
"entropy": 0.33421541005373,
"num_tokens": 4950630.0,
"mean_token_accuracy": 0.9143238365650177,
"epoch": 2.707818930041152,
"step": 165
},
{
"loss": 0.36279208660125734,
"grad_norm": 2.65625,
"learning_rate": 8.035874876982957e-08,
"entropy": 0.35163953751325605,
"num_tokens": 5099094.0,
"mean_token_accuracy": 0.9107247442007065,
"epoch": 2.7901234567901234,
"step": 170
},
{
"loss": 0.3491449594497681,
"grad_norm": 2.65625,
"learning_rate": 3.331468007589489e-08,
"entropy": 0.3429010361433029,
"num_tokens": 5250072.0,
"mean_token_accuracy": 0.9129759073257446,
"epoch": 2.8724279835390947,
"step": 175
},
{
"loss": 0.3632668018341064,
"grad_norm": 2.828125,
"learning_rate": 6.592445855863883e-09,
"entropy": 0.35197630524635315,
"num_tokens": 5402349.0,
"mean_token_accuracy": 0.9110080420970916,
"epoch": 2.954732510288066,
"step": 180
},
{
"eval_loss": 0.3358902931213379,
"eval_runtime": 8.9103,
"eval_samples_per_second": 12.009,
"eval_steps_per_second": 12.009,
"eval_entropy": 0.3294877093807559,
"eval_num_tokens": 5402349.0,
"eval_mean_token_accuracy": 0.9162927815847308,
"epoch": 2.954732510288066,
"step": 180
},
{
"eval_loss": 0.3358490765094757,
"eval_runtime": 9.0019,
"eval_samples_per_second": 11.886,
"eval_steps_per_second": 11.886,
"eval_entropy": 0.3295578314600704,
"eval_num_tokens": 5483673.0,
"eval_mean_token_accuracy": 0.9165575621284057,
"epoch": 3.0,
"step": 183
},
{
"train_runtime": 925.9091,
"train_samples_per_second": 3.146,
"train_steps_per_second": 0.198,
"total_flos": 1.4492276975075328e+16,
"train_loss": 0.38517201207374613,
"epoch": 3.0,
"step": 183
}
]
}