SavK1 Claude Sonnet 4.6 commited on
Commit
094fade
Β·
1 Parent(s): 1c6aad2

fix(notebook): rewrite run_grpo_episode with runbook-compliance reward

Browse files

- Fix gen_slot=0 hardcoded override β€” now correctly offsets env seed per
GRPO generation so parallel rollouts explore different episodes
- Fix double env.step bug (was called twice per step in try/except)
- Add full runbook-compliance tracking: ticket_label, ticket_priority,
assigned_team, posted_channels, valid_labels, valid_priorities,
valid_teams, oncall_channels extracted from meta.read_runbook response
- Replace old reward formula (env*0.70 + json*0.10 + diversity) with
compute_rollout_reward from training/rewards.py β€” reward now varies
per org config so GRPO gets non-zero advantage signal
- Raise temperature 0.85β†’1.1, add top_k=50 for generation diversity
- Track prompt_seen in grpo_rollout_func to pass correct gen_offset
- Update log format to show label=βœ“/βœ— priority=βœ“/βœ— team=βœ“/βœ— channel=βœ“/βœ—

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>

training/Competent Pink Train (1).ipynb ADDED
The diff for this file is too large to render. See raw diff