Pm-ops / training /dataset.py

Commit History

fix(grpo): fresh reward design — runbook-compliance scoring
1c6aad2

SavK1 Claude Sonnet 4.6 commited on

writing the GRPO script to train qwen1.7 on A100 GRPO
5bce7ac

SavK1 commited on