qwen3-8b-thinking / trainer_state.json
williamium's picture
Add u-OPSD Qwen3-8B thinking LoRA adapter (thresh 0.3, checkpoint-75)
a07dc7f verified
Raw
History Blame Contribute Delete
8.34 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.020380434782608696,
"eval_steps": 500,
"global_step": 75,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0005434782608695652,
"grad_norm": 0.03744836896657944,
"learning_rate": 4.966666666666667e-06,
"loss": 0.0091,
"on_policy_loss": 0.0091,
"step": 2
},
{
"epoch": 0.0010869565217391304,
"grad_norm": 0.029108790680766106,
"learning_rate": 4.9000000000000005e-06,
"loss": 0.0097,
"on_policy_loss": 0.0097,
"step": 4
},
{
"epoch": 0.0016304347826086956,
"grad_norm": 0.02633393555879593,
"learning_rate": 4.833333333333333e-06,
"loss": 0.013,
"on_policy_loss": 0.013,
"step": 6
},
{
"epoch": 0.002173913043478261,
"grad_norm": 0.018148666247725487,
"learning_rate": 4.766666666666667e-06,
"loss": 0.0099,
"on_policy_loss": 0.0099,
"step": 8
},
{
"epoch": 0.002717391304347826,
"grad_norm": 0.02139461226761341,
"learning_rate": 4.7e-06,
"loss": 0.0118,
"on_policy_loss": 0.0118,
"step": 10
},
{
"epoch": 0.003260869565217391,
"grad_norm": 0.028195466846227646,
"learning_rate": 4.633333333333334e-06,
"loss": 0.0112,
"on_policy_loss": 0.0112,
"step": 12
},
{
"epoch": 0.0038043478260869567,
"grad_norm": 0.0212844368070364,
"learning_rate": 4.566666666666667e-06,
"loss": 0.0114,
"on_policy_loss": 0.0114,
"step": 14
},
{
"epoch": 0.004347826086956522,
"grad_norm": 0.03395017609000206,
"learning_rate": 4.5e-06,
"loss": 0.0109,
"on_policy_loss": 0.0109,
"step": 16
},
{
"epoch": 0.004891304347826087,
"grad_norm": 0.03911148011684418,
"learning_rate": 4.433333333333334e-06,
"loss": 0.009,
"on_policy_loss": 0.009,
"step": 18
},
{
"epoch": 0.005434782608695652,
"grad_norm": 0.01619447022676468,
"learning_rate": 4.366666666666667e-06,
"loss": 0.0133,
"on_policy_loss": 0.0133,
"step": 20
},
{
"epoch": 0.005978260869565218,
"grad_norm": 0.02550458535552025,
"learning_rate": 4.3e-06,
"loss": 0.0104,
"on_policy_loss": 0.0104,
"step": 22
},
{
"epoch": 0.006521739130434782,
"grad_norm": 0.03460410609841347,
"learning_rate": 4.233333333333334e-06,
"loss": 0.0099,
"on_policy_loss": 0.0099,
"step": 24
},
{
"epoch": 0.007065217391304348,
"grad_norm": 0.031486913561820984,
"learning_rate": 4.166666666666667e-06,
"loss": 0.0128,
"on_policy_loss": 0.0128,
"step": 26
},
{
"epoch": 0.007608695652173913,
"grad_norm": 0.022056138142943382,
"learning_rate": 4.1e-06,
"loss": 0.0063,
"on_policy_loss": 0.0063,
"step": 28
},
{
"epoch": 0.008152173913043478,
"grad_norm": 0.016603024676442146,
"learning_rate": 4.033333333333333e-06,
"loss": 0.0074,
"on_policy_loss": 0.0074,
"step": 30
},
{
"epoch": 0.008695652173913044,
"grad_norm": 0.017155027016997337,
"learning_rate": 3.966666666666667e-06,
"loss": 0.0125,
"on_policy_loss": 0.0125,
"step": 32
},
{
"epoch": 0.00923913043478261,
"grad_norm": 0.022139370441436768,
"learning_rate": 3.900000000000001e-06,
"loss": 0.0091,
"on_policy_loss": 0.0091,
"step": 34
},
{
"epoch": 0.009782608695652175,
"grad_norm": 0.019025282934308052,
"learning_rate": 3.833333333333334e-06,
"loss": 0.0088,
"on_policy_loss": 0.0088,
"step": 36
},
{
"epoch": 0.010326086956521738,
"grad_norm": 0.018911313265562057,
"learning_rate": 3.766666666666667e-06,
"loss": 0.0088,
"on_policy_loss": 0.0088,
"step": 38
},
{
"epoch": 0.010869565217391304,
"grad_norm": 0.021639954298734665,
"learning_rate": 3.7e-06,
"loss": 0.0058,
"on_policy_loss": 0.0058,
"step": 40
},
{
"epoch": 0.01141304347826087,
"grad_norm": 0.01750766858458519,
"learning_rate": 3.633333333333334e-06,
"loss": 0.0101,
"on_policy_loss": 0.0101,
"step": 42
},
{
"epoch": 0.011956521739130435,
"grad_norm": 0.018655167892575264,
"learning_rate": 3.566666666666667e-06,
"loss": 0.0057,
"on_policy_loss": 0.0057,
"step": 44
},
{
"epoch": 0.0125,
"grad_norm": 0.017098240554332733,
"learning_rate": 3.5e-06,
"loss": 0.0051,
"on_policy_loss": 0.0051,
"step": 46
},
{
"epoch": 0.013043478260869565,
"grad_norm": 0.01902070641517639,
"learning_rate": 3.4333333333333336e-06,
"loss": 0.0066,
"on_policy_loss": 0.0066,
"step": 48
},
{
"epoch": 0.01358695652173913,
"grad_norm": 0.018735554069280624,
"learning_rate": 3.366666666666667e-06,
"loss": 0.0102,
"on_policy_loss": 0.0102,
"step": 50
},
{
"epoch": 0.014130434782608696,
"grad_norm": 0.01960255578160286,
"learning_rate": 3.3000000000000006e-06,
"loss": 0.0091,
"on_policy_loss": 0.0091,
"step": 52
},
{
"epoch": 0.014673913043478261,
"grad_norm": 0.017713133245706558,
"learning_rate": 3.2333333333333334e-06,
"loss": 0.0099,
"on_policy_loss": 0.0099,
"step": 54
},
{
"epoch": 0.015217391304347827,
"grad_norm": 0.017586251720786095,
"learning_rate": 3.1666666666666667e-06,
"loss": 0.0068,
"on_policy_loss": 0.0068,
"step": 56
},
{
"epoch": 0.01576086956521739,
"grad_norm": 0.018474629148840904,
"learning_rate": 3.1000000000000004e-06,
"loss": 0.0114,
"on_policy_loss": 0.0114,
"step": 58
},
{
"epoch": 0.016304347826086956,
"grad_norm": 0.01840766705572605,
"learning_rate": 3.0333333333333337e-06,
"loss": 0.0056,
"on_policy_loss": 0.0056,
"step": 60
},
{
"epoch": 0.01684782608695652,
"grad_norm": 0.017008541151881218,
"learning_rate": 2.9666666666666673e-06,
"loss": 0.0068,
"on_policy_loss": 0.0068,
"step": 62
},
{
"epoch": 0.017391304347826087,
"grad_norm": 0.017770633101463318,
"learning_rate": 2.9e-06,
"loss": 0.0083,
"on_policy_loss": 0.0083,
"step": 64
},
{
"epoch": 0.017934782608695653,
"grad_norm": 0.017109453678131104,
"learning_rate": 2.8333333333333335e-06,
"loss": 0.0071,
"on_policy_loss": 0.0071,
"step": 66
},
{
"epoch": 0.01847826086956522,
"grad_norm": 0.01635884866118431,
"learning_rate": 2.766666666666667e-06,
"loss": 0.0087,
"on_policy_loss": 0.0087,
"step": 68
},
{
"epoch": 0.019021739130434784,
"grad_norm": 0.01571054942905903,
"learning_rate": 2.7000000000000004e-06,
"loss": 0.0085,
"on_policy_loss": 0.0085,
"step": 70
},
{
"epoch": 0.01956521739130435,
"grad_norm": 0.01731751672923565,
"learning_rate": 2.6333333333333332e-06,
"loss": 0.0065,
"on_policy_loss": 0.0065,
"step": 72
},
{
"epoch": 0.02010869565217391,
"grad_norm": 0.015707146376371384,
"learning_rate": 2.566666666666667e-06,
"loss": 0.0085,
"on_policy_loss": 0.0085,
"step": 74
}
],
"logging_steps": 2,
"max_steps": 150,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}