Pm-ops / training /pm_ops_trainer.py

Commit History

fix(grpo): eliminate zero-advantage collapse from stale rewards
38457df

SavK1 Claude Sonnet 4.6 commited on

fix(grpo): harden rollout reward injection on cloud runtime
962ea9c

SavK1 commited on

fix(pm_ops_trainer): use direct closure capture instead of _self_ref
0ddcea5

SavK1 Claude Sonnet 4.6 commited on

fix(pm_ops_trainer): use direct closure capture instead of _self_ref
8d3837e

SavK1 Claude Sonnet 4.6 commited on

fix(pm_ops_trainer): capture rewards via rollout_func wrapper, not inputs
dc36ffd

SavK1 Claude Sonnet 4.6 commited on

feat(training): PMOpsGRPOTrainer — override _calculate_rewards to inject rollout rewards directly
29d6757

Aditya Guntur commited on