Pm-ops / training /rollout.py

Commit History

fix(grpo): fresh reward design — runbook-compliance scoring
1c6aad2

SavK1 Claude Sonnet 4.6 commited on

fix(grpo): eliminate zero-advantage collapse from stale rewards
38457df

SavK1 Claude Sonnet 4.6 commited on

Merge remote-tracking branch 'hf/main' into train/v1
1b68f93

SavK1 commited on

fix(training): fix GRPO reward bugs + add v3 notebook with SFT warmup
703b668

SavK1 Claude Sonnet 4.6 commited on

fix(reward): harsh -1.0 for zero JSON output, -0.30 for zero task completion
5bcbe7f

Aditya Guntur commited on

fix(rollout): safe model unwrapping for accelerate/PEFT/DDP in _generate_no_vllm
606e517

Aditya Guntur commited on

fix(rollout): replace generate_rollout_completions (vLLM-only) with direct model.generate()
5d330b7

Aditya Guntur commited on

fix(training): reward signal flow + new v2 notebook
5e6d53a

SavK1 Claude Sonnet 4.6 commited on

modifying the training script to be more memory efficient: Unsloth, also reduced the number of steps to 15 instead of 40
860d7e4

SavK1 commited on

writing the GRPO script to train qwen1.7 on A100 GRPO
5bce7ac

SavK1 commited on