Spaces:
Sleeping
fix(notebook): rewrite run_grpo_episode with runbook-compliance reward
Browse files- Fix gen_slot=0 hardcoded override β now correctly offsets env seed per
GRPO generation so parallel rollouts explore different episodes
- Fix double env.step bug (was called twice per step in try/except)
- Add full runbook-compliance tracking: ticket_label, ticket_priority,
assigned_team, posted_channels, valid_labels, valid_priorities,
valid_teams, oncall_channels extracted from meta.read_runbook response
- Replace old reward formula (env*0.70 + json*0.10 + diversity) with
compute_rollout_reward from training/rewards.py β reward now varies
per org config so GRPO gets non-zero advantage signal
- Raise temperature 0.85β1.1, add top_k=50 for generation diversity
- Track prompt_seen in grpo_rollout_func to pass correct gen_offset
- Update log format to show label=β/β priority=β/β team=β/β channel=β/β
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
|
The diff for this file is too large to render.
See raw diff
|
|
|