From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 14 days ago • 102
PrivAct: Internalizing Contextual Privacy Preservation via Multi-Agent Preference Training Paper • 2602.13840 • Published Feb 14 • 1
PrivAct: Internalizing Contextual Privacy Preservation via Multi-Agent Preference Training Paper • 2602.13840 • Published Feb 14 • 1
T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning Paper • 2603.03790 • Published Mar 4 • 122