penfever's picture
Add parsed metric surface and redacted trainer log for run 1ae770
b713018 verified
|
Raw
History Blame Contribute Delete
10.3 kB

SkyRL Standard-GRPO Training Metrics Analysis

Generated from 1 log file(s) (--format standard)

Overview

Log File Max Step Train Steps Final Reward Max Reward Final Entropy
finelog 21 11 0.4062 0.5684 0.7739

Async Metrics

Mean Std Min Max Count
async/discard_rate 0 0 0 0 11
async/discarded_count 0 0 0 0 11
async/effective_batch_groups 64 0 64 64 11
async/effective_batch_samples 512 0 512 512 11
async/staleness_max 3 1.78885 1 7 11
async/staleness_mean 0.919034 0.514099 0.03125 1.82812 11
async/staleness_min 0.272727 0.467099 0 1 11
async/staleness_ratio 0.721591 0.300863 0.03125 1 11

Generate Metrics

Mean Std Min Max Count
generate/avg_num_tokens 2902.98 599.241 2234.61 3771.75 11
generate/avg_tokens_non_zero_rewards 2580.54 627.47 1941.57 3374.06 11
generate/avg_tokens_zero_rewards 3138.75 579.896 2427.73 4067.32 11
generate/max_num_tokens 23268.2 2191.1 20143 26854 11
generate/min_num_tokens 379.636 115.639 247 651 11
generate/std_num_tokens 2697.28 365.539 2265.94 3377.54 11
generate/tis/aligned_tokens 713531 149297 566081 955649 11
generate/tis/alignment_fail_count 0.0909091 0.301511 0 1 11
generate/tis/exact_match_fraction 0.999999 1.6768e-06 0.999994 1 11
generate/tis/lcs_fallback_alert 0 0 0 0 11
generate/tis/lcs_fallback_fraction 0 0 0 0 11
generate/tis/lcs_fallback_messages 0 0 0 0 11
generate/tis/unaligned_fraction 5.05574e-07 1.6768e-06 0 5.56131e-06 11

Loss Metrics

Mean Std Min Max Count
loss/avg_final_rewards 0.407138 0.0823485 0.257812 0.568359 11
loss/avg_raw_advantages -0.0153546 0.0118293 -0.0296332 0.00130317 11
loss/avg_raw_advantages_abs 0.117088 0.0249498 0.0684489 0.153624 11

Policy Metrics

Mean Std Min Max Count
policy/final_loss -9.3325e-05 0.000147465 -0.000340611 0.000204686 11
policy/policy_entropy 0.907788 0.0857953 0.773902 1.01393 11
policy/policy_loss -9.3325e-05 0.000147465 -0.000340611 0.000204686 11
policy/policy_lr 8e-06 0 8e-06 8e-06 11
policy/policy_update_steps 1 0 1 1 11
policy/ppo_clip_ratio 0 0 0 0 11
policy/raw_grad_norm 0.0641336 0.00992899 0.0436851 0.0750673 11
policy/rollout_train_prob_diff_mean 497.177 1578.13 1.0394 5253.32 11
policy/rollout_train_prob_diff_std 455497 1.46949e+06 0.722785 4.88546e+06 11

Reward Metrics

Mean Std Min Max Count
reward/avg_pass_at_8 0.53267 0.055663 0.453125 0.625 11
reward/avg_raw_reward 0.407138 0.0823485 0.257812 0.568359 11

System Metrics

Mean Std Min Max Count
system/process_rss_gb 20.8444 1.41878 17.5353 22.0891 11
system/process_vms_gb 138.577 9.70567 120.923 149.985 11
system/ram_available_gb 1865.23 3.1764 1862.12 1872.6 11
system/ram_percent 7.4 0.173205 7 7.6 11
system/ram_total_gb 2014.43 0 2014.43 2014.43 11
system/ram_used_gb 149.202 3.1764 141.826 152.307 11

Timing Metrics

Mean Std Min Max Count
timing/cleanup_old_checkpoints 0.518482 1.69636 0.00617218 5.63319 11
timing/compute_advantages_and_returns 0.0781249 0.00819244 0.0662737 0.0914588 11
timing/convert_to_training_input 3.14866 0.373154 2.52558 3.63984 11
timing/fwd_logprobs_values_reward 46.9547 7.59618 41.8199 69.1615 11
timing/policy_train 148.799 13.4953 135.556 183.641 11
timing/run_training 195.926 20.8822 177.516 253.015 11
timing/save_checkpoints 464.877 6.8193 455.88 479.929 11
timing/step 789.831 479.948 293.359 1965.64 11
timing/sync_weights 123.259 67.5995 81.1427 264.975 11
timing/train_critic_and_policy 148.872 13.5064 135.61 183.741 11
timing/wait_for_generation_buffer 467.458 507.172 0.000506878 1703.85 11
timing/save_hf_model 37.1397 2.46155 35.3991 38.8803 2

Tis Metrics

Mean Std Min Max Count
tis/batch_skipped_no_logprobs 0 0 0 0 11
tis/skipped_fraction 0 0 0 0 11

Trainer Metrics

Mean Std Min Max Count
trainer/epoch 0 0 0 0 11
trainer/global_step 16 3.31662 11 21 11

Training Progression (collapse signals)

finelog

Step Epoch Reward avg_pass_at_8 Entropy GradNorm PPOClip PolicyLoss logRatio_mean Step Time (s)
11 0 0.4492 0.5156 0.9170 0.0738 0.00000 -0.00011 nan 877.4
12 0 0.2578 0.4531 0.9270 0.0723 0.00000 -0.00001 nan 462.7
13 0 0.3828 0.5000 0.9662 0.0748 0.00000 0.00020 nan 293.4
14 0 0.3965 0.5312 1.0139 0.0654 0.00000 0.00004 nan 312.2
15 0 0.3730 0.5312 1.0018 0.0640 0.00000 -0.00017 nan 672.2
16 0 0.4941 0.6250 1.0002 0.0586 0.00000 -0.00034 nan 985.8
17 0 0.3184 0.4688 0.9017 0.0541 0.00000 -0.00023 nan 428.3
18 0 0.4043 0.5625 0.8676 0.0751 0.00000 -0.00001 nan 693.6
19 0 0.4277 0.5469 0.8370 0.0580 0.00000 -0.00007 nan 836.6
20 0 0.5684 0.6250 0.7793 0.0437 0.00000 -0.00018 nan 1160.3
21 0 0.4062 0.5000 0.7739 0.0657 0.00000 -0.00015 nan 1965.6

vLLM Inference Engine Analysis (per-engine)

Log Avg Running/Engine Avg Gen Throughput/Engine Avg KV Cache % Avg Prefix Hit %
finelog 2.0 232.1 tok/s 0.7% 90.2%

Best Checkpoint (trailing-5 EMA of reward/avg_raw_reward)

No step chosen: No saved-aligned checkpoint eligible (after cap + exports intersection). available_exports=[], cap_step=None, save_every=20

  • available exports: []
  • cap (latest_ckpt_global_step.txt): None
Step Reward EMA Eligible
11 0.4492 0.4492
12 0.2578 0.3854
13 0.3828 0.3845
14 0.3965 0.3885
15 0.3730 0.3834
16 0.4941 0.4203
17 0.3184 0.3863
18 0.4043 0.3923
19 0.4277 0.4041
20 0.5684 0.4589
21 0.4062 0.4413