Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 14 days ago • 21
From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation Paper • 2610.02179 • Published 7 days ago • 17
Can Computation from Earlier Problems Help LLMs Solve New Ones? Paper • 2609.39394 • Published 8 days ago • 9
RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 7 days ago • 275
Learning from Runtime Feedback through Failure-Bank Self-Evolution for Vision-Language-Action Models Paper • 2609.39820 • Published 8 days ago • 28
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research Paper • 2610.02202 • Published 7 days ago • 13
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 10 days ago • 197