Spaces:
Sleeping
Sleeping
Commit History
fix(v4): reduce MAX_COMP_LEN 384β192, fix eval hanging with for_inference 2f02c01
feat(training): add clean v4 notebook with all reward fixes 4b0fc8a
fix(notebook): rewrite run_grpo_episode with runbook-compliance reward 094fade
fix(grpo): fresh reward design β runbook-compliance scoring 1c6aad2
fix(grpo): eliminate zero-advantage collapse from stale rewards 38457df
fix: format runbook as readable key-value pairs for model fff1405
fix: increase runbook truncation limit 800->2000 chars b9588df
fix(grpo): harden rollout reward injection on cloud runtime 962ea9c
fix(pm_ops_trainer): use direct closure capture instead of _self_ref 0ddcea5
fix(pm_ops_trainer): use direct closure capture instead of _self_ref 8d3837e
fix(pm_ops_trainer): capture rewards via rollout_func wrapper, not inputs dc36ffd
fix(train_v3): use PMOpsGRPOTrainer to fix reward kwarg plumbing 22d40fb
Merge remote-tracking branch 'hf/main' into train/v1 1b68f93
fix(training): fix GRPO reward bugs + add v3 notebook with SFT warmup 703b668
fix(reward): harsh -1.0 for zero JSON output, -0.30 for zero task completion 5bcbe7f
Aditya Guntur commited on
fix(rollout): safe model unwrapping for accelerate/PEFT/DDP in _generate_no_vllm 606e517
Aditya Guntur commited on
fix(rollout): replace generate_rollout_completions (vLLM-only) with direct model.generate() 5d330b7
Aditya Guntur commited on
feat(training): PMOpsGRPOTrainer β override _calculate_rewards to inject rollout rewards directly 29d6757
Aditya Guntur commited on