Hammington/verl_agent_sokoban_grpo_qwen3_1.7b_subgoalver3_rollout Viewer • Updated 3 days ago • 792 • 6
Hammington/verl_agent_sokoban_grpo_qwen3_1.7b_subgoalver3_rollout Viewer • Updated 3 days ago • 792 • 6
Hammington/verl_agent_sokoban_dapo_qwen3_1.7b_noentropy_rollout Viewer • Updated 3 days ago • 512 • 13
Hammington/verl_agent_sokoban_dapo_qwen3_1.7b_noentropy_rollout Viewer • Updated 3 days ago • 512 • 13
SIRI: Scaling Iterative Reinforcement Learning with Interleaved Compression Paper • 2509.25176 • Published Sep 29, 2025 • 14
Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks Paper • 2606.07970 • Published Jun 6