Supernova-1.7B / trainer_state.json
Ashima's picture
Upload checkpoint-300
a5dbd61 verified
Raw
History Blame Contribute Delete
21.9 kB
{
"best_global_step": 300,
"best_metric": 0.13333333333333333,
"best_model_checkpoint": "/local2/asuvarna31/distractors/Qwen3-1.7B_Mar25-0950_qwen3_0.6b_micro_top2_Mar18-0250_10000/checkpoint-300",
"epoch": 0.12,
"eval_steps": 100,
"global_step": 300,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025,
"completions/max_length": 2162.52,
"completions/max_terminated_length": 1872.8,
"completions/mean_length": 773.9575,
"completions/mean_terminated_length": 689.7016723632812,
"completions/min_length": 228.04,
"completions/min_terminated_length": 228.04,
"entropy": 0.13874716758728028,
"epoch": 0.01,
"frac_reward_zero_std": 0.7,
"grad_norm": 3.0590252022682956,
"learning_rate": 4.952e-06,
"loss": -0.0206,
"num_tokens": 362415.0,
"reward": 0.6125,
"reward_std": 0.3983015561103821,
"rewards/combined_reward/mean": 0.6125,
"rewards/combined_reward/std": 0.3983015727996826,
"sampling/importance_sampling_ratio/max": 1.8317672908306122,
"sampling/importance_sampling_ratio/mean": 0.48074495911598203,
"sampling/importance_sampling_ratio/min": 0.0045582325871396275,
"sampling/sampling_logp_difference/max": 1.3460673189163208,
"sampling/sampling_logp_difference/mean": 0.019111527167260646,
"step": 25,
"step_time": 10.766132144235307
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.045,
"completions/max_length": 2697.8,
"completions/max_terminated_length": 2434.96,
"completions/mean_length": 1066.4775,
"completions/mean_terminated_length": 922.5773754882813,
"completions/min_length": 221.4,
"completions/min_terminated_length": 221.4,
"entropy": 0.11148266345262528,
"epoch": 0.02,
"frac_reward_zero_std": 0.83,
"grad_norm": 0.12825042088739647,
"learning_rate": 4.902000000000001e-06,
"loss": -0.0055,
"num_tokens": 844186.0,
"reward": 0.7275,
"reward_std": 0.3752095079421997,
"rewards/combined_reward/mean": 0.7275,
"rewards/combined_reward/std": 0.37520951986312867,
"sampling/importance_sampling_ratio/max": 1.9092405343055725,
"sampling/importance_sampling_ratio/mean": 0.39522121667861937,
"sampling/importance_sampling_ratio/min": 0.0015749186025379913,
"sampling/sampling_logp_difference/max": 2.5645344924926756,
"sampling/sampling_logp_difference/mean": 0.018453369028866292,
"step": 50,
"step_time": 12.97097958703991
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.06,
"completions/max_length": 3219.6,
"completions/max_terminated_length": 2764.32,
"completions/mean_length": 1319.6225,
"completions/mean_terminated_length": 1149.2359936523437,
"completions/min_length": 302.64,
"completions/min_terminated_length": 302.64,
"entropy": 0.11579328149557114,
"epoch": 0.03,
"frac_reward_zero_std": 0.74,
"grad_norm": 0.024401731480704746,
"learning_rate": 4.852e-06,
"loss": 0.0148,
"num_tokens": 1425675.0,
"reward": 0.6675,
"reward_std": 0.41027594327926636,
"rewards/combined_reward/mean": 0.6675,
"rewards/combined_reward/std": 0.41027595520019533,
"sampling/importance_sampling_ratio/max": 1.7265777337551116,
"sampling/importance_sampling_ratio/mean": 0.3491537272930145,
"sampling/importance_sampling_ratio/min": 0.00037046234127728893,
"sampling/sampling_logp_difference/max": 1.6775047159194947,
"sampling/sampling_logp_difference/mean": 0.01777696244418621,
"step": 75,
"step_time": 15.33587351476075
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.1125,
"completions/max_length": 3506.36,
"completions/max_terminated_length": 3002.44,
"completions/mean_length": 1729.6625,
"completions/mean_terminated_length": 1449.84732421875,
"completions/min_length": 491.68,
"completions/min_terminated_length": 491.68,
"entropy": 0.1540939062833786,
"epoch": 0.04,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.08228206305537464,
"learning_rate": 4.802000000000001e-06,
"loss": -0.0105,
"num_tokens": 2169952.0,
"reward": 0.6775,
"reward_std": 0.4352877688407898,
"rewards/combined_reward/mean": 0.6775,
"rewards/combined_reward/std": 0.4352877867221832,
"sampling/importance_sampling_ratio/max": 1.56971524477005,
"sampling/importance_sampling_ratio/mean": 0.2744499149173498,
"sampling/importance_sampling_ratio/min": 0.0005504332532569833,
"sampling/sampling_logp_difference/max": 1.4530884885787965,
"sampling/sampling_logp_difference/mean": 0.0194063538312912,
"step": 100,
"step_time": 16.7000939743605
},
{
"epoch": 0.04,
"eval_bbeh_mini_clip_ratio/high_max": 0.0,
"eval_bbeh_mini_clip_ratio/high_mean": 0.0,
"eval_bbeh_mini_clip_ratio/low_mean": 0.0,
"eval_bbeh_mini_clip_ratio/low_min": 0.0,
"eval_bbeh_mini_clip_ratio/region_mean": 0.0,
"eval_bbeh_mini_completions/clipped_ratio": 0.7395833333333334,
"eval_bbeh_mini_completions/max_length": 4096.0,
"eval_bbeh_mini_completions/max_terminated_length": 3763.3333333333335,
"eval_bbeh_mini_completions/mean_length": 3705.025,
"eval_bbeh_mini_completions/mean_terminated_length": 2606.099161783854,
"eval_bbeh_mini_completions/min_length": 1289.8666666666666,
"eval_bbeh_mini_completions/min_terminated_length": 1289.8666666666666,
"eval_bbeh_mini_entropy": 0.1524992863337199,
"eval_bbeh_mini_frac_reward_zero_std": 1.0,
"eval_bbeh_mini_loss": 0.0,
"eval_bbeh_mini_num_tokens": 2169952.0,
"eval_bbeh_mini_reward": 0.05416666666666667,
"eval_bbeh_mini_reward_std": 0.21779155731201172,
"eval_bbeh_mini_rewards/combined_reward/mean": 0.05416666666666667,
"eval_bbeh_mini_rewards/combined_reward/std": 0.21779155731201172,
"eval_bbeh_mini_runtime": 596.1354,
"eval_bbeh_mini_samples_per_second": 0.772,
"eval_bbeh_mini_sampling/importance_sampling_ratio/max": 0.8687558025121689,
"eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.06784403653194507,
"eval_bbeh_mini_sampling/importance_sampling_ratio/min": 8.061984779939653e-08,
"eval_bbeh_mini_sampling/sampling_logp_difference/max": 8.711139980951945,
"eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.017877593512336414,
"eval_bbeh_mini_steps_per_second": 0.025,
"step": 100
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0775,
"completions/max_length": 2879.52,
"completions/max_terminated_length": 2611.76,
"completions/mean_length": 1327.9475,
"completions/mean_terminated_length": 1132.0394360351563,
"completions/min_length": 399.84,
"completions/min_terminated_length": 399.84,
"entropy": 0.14349204391241074,
"epoch": 0.05,
"frac_reward_zero_std": 0.83,
"grad_norm": 0.0,
"learning_rate": 4.752e-06,
"loss": -0.005,
"num_tokens": 2753323.0,
"reward": 0.6925,
"reward_std": 0.4231112098693848,
"rewards/combined_reward/mean": 0.6925,
"rewards/combined_reward/std": 0.4231112253665924,
"sampling/importance_sampling_ratio/max": 1.7390555197000503,
"sampling/importance_sampling_ratio/mean": 0.36329600095748904,
"sampling/importance_sampling_ratio/min": 0.00048197544169198636,
"sampling/sampling_logp_difference/max": 1.7171998643875122,
"sampling/sampling_logp_difference/mean": 0.018923953399062155,
"step": 125,
"step_time": 13.94366284076823
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0775,
"completions/max_length": 3160.4,
"completions/max_terminated_length": 2977.04,
"completions/mean_length": 1392.4725,
"completions/mean_terminated_length": 1181.5446044921875,
"completions/min_length": 301.28,
"completions/min_terminated_length": 301.28,
"entropy": 0.12247561484575271,
"epoch": 0.06,
"frac_reward_zero_std": 0.78,
"grad_norm": 0.0,
"learning_rate": 4.702e-06,
"loss": 0.0017,
"num_tokens": 3363864.0,
"reward": 0.68,
"reward_std": 0.3949478316307068,
"rewards/combined_reward/mean": 0.68,
"rewards/combined_reward/std": 0.39494784593582155,
"sampling/importance_sampling_ratio/max": 1.7060644900798798,
"sampling/importance_sampling_ratio/mean": 0.3686066856980324,
"sampling/importance_sampling_ratio/min": 0.0008563839933964346,
"sampling/sampling_logp_difference/max": 1.8964796733856202,
"sampling/sampling_logp_difference/mean": 0.01836306780576706,
"step": 150,
"step_time": 15.306864518483636
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.2725,
"completions/max_length": 3987.92,
"completions/max_terminated_length": 3347.12,
"completions/mean_length": 2243.0825,
"completions/mean_terminated_length": 1530.6420288085938,
"completions/min_length": 497.16,
"completions/min_terminated_length": 497.16,
"entropy": 0.1512809532880783,
"epoch": 0.07,
"frac_reward_zero_std": 0.83,
"grad_norm": 0.045936406952480385,
"learning_rate": 4.6520000000000005e-06,
"loss": 0.0011,
"num_tokens": 4313477.0,
"reward": 0.555,
"reward_std": 0.47118185997009276,
"rewards/combined_reward/mean": 0.555,
"rewards/combined_reward/std": 0.4711818790435791,
"sampling/importance_sampling_ratio/max": 1.6039721596240997,
"sampling/importance_sampling_ratio/mean": 0.24182027772068979,
"sampling/importance_sampling_ratio/min": 1.4114104745956979e-05,
"sampling/sampling_logp_difference/max": 1.867432246208191,
"sampling/sampling_logp_difference/mean": 0.01894252996891737,
"step": 175,
"step_time": 19.262136509235717
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.2025,
"completions/max_length": 3906.24,
"completions/max_terminated_length": 3193.44,
"completions/mean_length": 1929.675,
"completions/mean_terminated_length": 1359.7752429199218,
"completions/min_length": 465.56,
"completions/min_terminated_length": 465.56,
"entropy": 0.14882746517658232,
"epoch": 0.08,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 4.602e-06,
"loss": -0.0122,
"num_tokens": 5136739.0,
"reward": 0.5175,
"reward_std": 0.4535848546028137,
"rewards/combined_reward/mean": 0.5175,
"rewards/combined_reward/std": 0.45358487248420715,
"sampling/importance_sampling_ratio/max": 1.4915108323097228,
"sampling/importance_sampling_ratio/mean": 0.2906982895731926,
"sampling/importance_sampling_ratio/min": 3.519004383520041e-05,
"sampling/sampling_logp_difference/max": 1.5955763387680053,
"sampling/sampling_logp_difference/mean": 0.018773170486092568,
"step": 200,
"step_time": 18.719789853200783
},
{
"epoch": 0.08,
"eval_bbeh_mini_clip_ratio/high_max": 0.0,
"eval_bbeh_mini_clip_ratio/high_mean": 0.0,
"eval_bbeh_mini_clip_ratio/low_mean": 0.0,
"eval_bbeh_mini_clip_ratio/low_min": 0.0,
"eval_bbeh_mini_clip_ratio/region_mean": 0.0,
"eval_bbeh_mini_completions/clipped_ratio": 0.6270833333333333,
"eval_bbeh_mini_completions/max_length": 4096.0,
"eval_bbeh_mini_completions/max_terminated_length": 3887.733333333333,
"eval_bbeh_mini_completions/mean_length": 3548.6833333333334,
"eval_bbeh_mini_completions/mean_terminated_length": 2656.084822591146,
"eval_bbeh_mini_completions/min_length": 913.6666666666666,
"eval_bbeh_mini_completions/min_terminated_length": 913.6666666666666,
"eval_bbeh_mini_entropy": 0.15292017062505087,
"eval_bbeh_mini_frac_reward_zero_std": 1.0,
"eval_bbeh_mini_loss": 0.0,
"eval_bbeh_mini_num_tokens": 5136739.0,
"eval_bbeh_mini_reward": 0.07708333333333334,
"eval_bbeh_mini_reward_std": 0.2598266154527664,
"eval_bbeh_mini_rewards/combined_reward/mean": 0.07708333333333334,
"eval_bbeh_mini_rewards/combined_reward/std": 0.2598266154527664,
"eval_bbeh_mini_runtime": 591.7141,
"eval_bbeh_mini_samples_per_second": 0.777,
"eval_bbeh_mini_sampling/importance_sampling_ratio/max": 0.852098998427391,
"eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.05244890290002028,
"eval_bbeh_mini_sampling/importance_sampling_ratio/min": 7.981859031252172e-08,
"eval_bbeh_mini_sampling/sampling_logp_difference/max": 11.834616295496623,
"eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.01872136120994886,
"eval_bbeh_mini_steps_per_second": 0.025,
"step": 200
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.135,
"completions/max_length": 3525.44,
"completions/max_terminated_length": 3045.72,
"completions/mean_length": 1643.7375,
"completions/mean_terminated_length": 1264.1704541015624,
"completions/min_length": 371.4,
"completions/min_terminated_length": 371.4,
"entropy": 0.1282264119386673,
"epoch": 0.09,
"frac_reward_zero_std": 0.84,
"grad_norm": 0.1124547393454232,
"learning_rate": 4.552000000000001e-06,
"loss": 0.0014,
"num_tokens": 5845702.0,
"reward": 0.6075,
"reward_std": 0.43211185932159424,
"rewards/combined_reward/mean": 0.6075,
"rewards/combined_reward/std": 0.43211187958717345,
"sampling/importance_sampling_ratio/max": 1.658061490058899,
"sampling/importance_sampling_ratio/mean": 0.3288004392385483,
"sampling/importance_sampling_ratio/min": 4.2134360328986985e-05,
"sampling/sampling_logp_difference/max": 1.9848644018173218,
"sampling/sampling_logp_difference/mean": 0.01779163155704737,
"step": 225,
"step_time": 16.881787369804226
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2305.72,
"completions/max_terminated_length": 2012.0,
"completions/mean_length": 924.5325,
"completions/mean_terminated_length": 733.4018725585937,
"completions/min_length": 207.84,
"completions/min_terminated_length": 207.84,
"entropy": 0.10919148057699203,
"epoch": 0.1,
"frac_reward_zero_std": 0.84,
"grad_norm": 0.0,
"learning_rate": 4.502e-06,
"loss": -0.007,
"num_tokens": 6264623.0,
"reward": 0.6575,
"reward_std": 0.4052075219154358,
"rewards/combined_reward/mean": 0.6575,
"rewards/combined_reward/std": 0.4052075397968292,
"sampling/importance_sampling_ratio/max": 1.6363923168182373,
"sampling/importance_sampling_ratio/mean": 0.4022238349914551,
"sampling/importance_sampling_ratio/min": 0.0022062478293512554,
"sampling/sampling_logp_difference/max": 1.6151433634757995,
"sampling/sampling_logp_difference/mean": 0.018232530616223812,
"step": 250,
"step_time": 11.461080919522793
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.05,
"completions/max_length": 2949.48,
"completions/max_terminated_length": 2563.92,
"completions/mean_length": 970.1825,
"completions/mean_terminated_length": 806.3617028808594,
"completions/min_length": 156.76,
"completions/min_terminated_length": 156.76,
"entropy": 0.11048085868358612,
"epoch": 0.11,
"frac_reward_zero_std": 0.83,
"grad_norm": 3.6386375264247395,
"learning_rate": 4.452e-06,
"loss": 0.016,
"num_tokens": 6704088.0,
"reward": 0.6,
"reward_std": 0.46177455902099607,
"rewards/combined_reward/mean": 0.6,
"rewards/combined_reward/std": 0.46177458167076113,
"sampling/importance_sampling_ratio/max": 1.8420022463798522,
"sampling/importance_sampling_ratio/mean": 0.43595110774040224,
"sampling/importance_sampling_ratio/min": 0.009071319757722449,
"sampling/sampling_logp_difference/max": 1.796406216621399,
"sampling/sampling_logp_difference/mean": 0.01782512180507183,
"step": 275,
"step_time": 14.068046440040925
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.065,
"completions/max_length": 1638.0,
"completions/max_terminated_length": 831.84,
"completions/mean_length": 545.8975,
"completions/mean_terminated_length": 305.88154296875,
"completions/min_length": 114.76,
"completions/min_terminated_length": 114.76,
"entropy": 0.09797917470335961,
"epoch": 0.12,
"frac_reward_zero_std": 0.75,
"grad_norm": 4.025023044693862,
"learning_rate": 4.402e-06,
"loss": 0.0096,
"num_tokens": 6972795.0,
"reward": 0.61,
"reward_std": 0.4501744627952576,
"rewards/combined_reward/mean": 0.61,
"rewards/combined_reward/std": 0.4501744878292084,
"sampling/importance_sampling_ratio/max": 2.163278422355652,
"sampling/importance_sampling_ratio/mean": 0.6990827405452729,
"sampling/importance_sampling_ratio/min": 0.0394745109800715,
"sampling/sampling_logp_difference/max": 1.8717621159553528,
"sampling/sampling_logp_difference/mean": 0.01609978877007961,
"step": 300,
"step_time": 8.448729626161512
},
{
"epoch": 0.12,
"eval_bbeh_mini_clip_ratio/high_max": 0.0,
"eval_bbeh_mini_clip_ratio/high_mean": 0.0,
"eval_bbeh_mini_clip_ratio/low_mean": 0.0,
"eval_bbeh_mini_clip_ratio/low_min": 0.0,
"eval_bbeh_mini_clip_ratio/region_mean": 0.0,
"eval_bbeh_mini_completions/clipped_ratio": 0.04791666666666667,
"eval_bbeh_mini_completions/max_length": 3786.5333333333333,
"eval_bbeh_mini_completions/max_terminated_length": 2642.9333333333334,
"eval_bbeh_mini_completions/mean_length": 1121.0229166666666,
"eval_bbeh_mini_completions/mean_terminated_length": 970.7762817382812,
"eval_bbeh_mini_completions/min_length": 183.2,
"eval_bbeh_mini_completions/min_terminated_length": 183.2,
"eval_bbeh_mini_entropy": 0.13576203087965646,
"eval_bbeh_mini_frac_reward_zero_std": 1.0,
"eval_bbeh_mini_loss": 0.0,
"eval_bbeh_mini_num_tokens": 6972795.0,
"eval_bbeh_mini_reward": 0.13333333333333333,
"eval_bbeh_mini_reward_std": 0.32803594271341957,
"eval_bbeh_mini_rewards/combined_reward/mean": 0.13333333333333333,
"eval_bbeh_mini_rewards/combined_reward/std": 0.32803594271341957,
"eval_bbeh_mini_runtime": 322.2651,
"eval_bbeh_mini_samples_per_second": 1.427,
"eval_bbeh_mini_sampling/importance_sampling_ratio/max": 2.0537617444992065,
"eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.2999363958835602,
"eval_bbeh_mini_sampling/importance_sampling_ratio/min": 0.0,
"eval_bbeh_mini_sampling/sampling_logp_difference/max": 5.164472190539042,
"eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.019927356950938703,
"eval_bbeh_mini_steps_per_second": 0.047,
"step": 300
}
],
"logging_steps": 25,
"max_steps": 2500,
"num_input_tokens_seen": 6972795,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}