HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 1 day ago • 18
Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance Paper • 2608.00782 • Published 7 days ago • 14
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Paper • 2608.03457 • Published 4 days ago • 28
DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents Paper • 2608.01827 • Published 5 days ago • 16