arxiv:2608.12764
Haoze Wu
WaitHZ
AI & ML interests
RL, LLM, Agent
Recent Activity
updated a dataset 5 days ago
WaitHZ/SSPO-data authored a paper about 1 month ago
Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents upvoted a paper about 1 month ago
Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents