Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading Paper • 2607.08964 • Published 13 days ago • 74
Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding Paper • 2606.18101 • Published Jun 16 • 15 • 2
Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding Paper • 2606.18101 • Published Jun 16 • 15
VLMs as GeoGuessr Masters: Exceptional Performance, Hidden Biases, and Privacy Risks Paper • 2502.11163 • Published Feb 16, 2025
TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL Paper • 2606.01599 • Published Jun 1 • 17
Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval Paper • 2606.04391 • Published Jun 3 • 11
Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding Paper • 2606.18101 • Published Jun 16 • 15
Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding Paper • 2606.18101 • Published Jun 16 • 15
Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval Paper • 2606.04391 • Published Jun 3 • 11
TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL Paper • 2606.01599 • Published Jun 1 • 17
Less is Enough: Synthesizing Diverse Data in Feature Space of LLMs Paper • 2602.10388 • Published Feb 11 • 246
MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information Paper • 2510.03632 • Published Oct 4, 2025 • 42