Pm-ops / training

Commit History

fix(v4): increase T4 SFT to 50 eps, add action trace to eval output
16705aa

SavK1 Claude Sonnet 4.6 commited on

fix(v4): reduce MAX_COMP_LEN 384β†’192, fix eval hanging with for_inference
2f02c01

SavK1 Claude Sonnet 4.6 commited on

feat(training): add clean v4 notebook with all reward fixes
4b0fc8a

SavK1 Claude Sonnet 4.6 commited on

fix(notebook): rewrite run_grpo_episode with runbook-compliance reward
094fade

SavK1 Claude Sonnet 4.6 commited on

fix(grpo): fresh reward design β€” runbook-compliance scoring
1c6aad2

SavK1 Claude Sonnet 4.6 commited on

fix(grpo): eliminate zero-advantage collapse from stale rewards
38457df

SavK1 Claude Sonnet 4.6 commited on

fix: format runbook as readable key-value pairs for model
fff1405

SavK1 commited on

fix: increase runbook truncation limit 800->2000 chars
b9588df

SavK1 commited on

fix(grpo): harden rollout reward injection on cloud runtime
962ea9c

SavK1 commited on

fix(pm_ops_trainer): use direct closure capture instead of _self_ref
0ddcea5

SavK1 Claude Sonnet 4.6 commited on

fix(pm_ops_trainer): use direct closure capture instead of _self_ref
8d3837e

SavK1 Claude Sonnet 4.6 commited on

fix(pm_ops_trainer): capture rewards via rollout_func wrapper, not inputs
dc36ffd

SavK1 Claude Sonnet 4.6 commited on

fix(train_v3): use PMOpsGRPOTrainer to fix reward kwarg plumbing
22d40fb

SavK1 Claude Sonnet 4.6 commited on

Merge remote-tracking branch 'hf/main' into train/v1
1b68f93

SavK1 commited on

fix(training): fix GRPO reward bugs + add v3 notebook with SFT warmup
703b668

SavK1 Claude Sonnet 4.6 commited on

fix(reward): harsh -1.0 for zero JSON output, -0.30 for zero task completion
5bcbe7f

Aditya Guntur commited on

fix(rollout): safe model unwrapping for accelerate/PEFT/DDP in _generate_no_vllm
606e517

Aditya Guntur commited on

fix(rollout): replace generate_rollout_completions (vLLM-only) with direct model.generate()
5d330b7

Aditya Guntur commited on

feat(training): PMOpsGRPOTrainer β€” override _calculate_rewards to inject rollout rewards directly
29d6757

Aditya Guntur commited on

fix(train_v2): drop Unsloth, use bitsandbytes+PEFT to fix dep conflicts
14d4979

SavK1 Claude Sonnet 4.6 commited on

fix(training): reward signal flow + new v2 notebook
5e6d53a

SavK1 Claude Sonnet 4.6 commited on

modifying the training script to be more memory efficient: Unsloth, also reduced the number of steps to 15 instead of 40
860d7e4

SavK1 commited on

writing the GRPO script to train qwen1.7 on A100 GRPO
5bce7ac

SavK1 commited on