File size: 659 Bytes
e9ce6e9 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 | from graders import heuristic_policy, _run_episodes, EasyGrader
from unified_gateway import UnifiedFintechEnv
env = UnifiedFintechEnv()
obs, _ = env.reset(seed=42, options={"task": "easy"})
rewards = []
done = False
while not done and len(rewards) < 100:
action = heuristic_policy(obs.normalized())
obs, r, done, info = env.step(action)
rewards.append(r.value)
if len(rewards) <= 3:
bd = info["reward_breakdown"]
print(f"step={len(rewards)} reward={r.value:.3f} breakdown={bd}")
print(f"Episode mean: {sum(rewards)/len(rewards):.4f} steps={len(rewards)} done={done}")
print(f"Termination: {info.get('termination_reason')}")
|