Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History Paper • 2602.17003 • Published Feb 19 • 1
SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization Paper • 2602.12187 • Published Feb 12 • 1
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems Paper • 2605.04018 • Published May 5 • 29
Beyond Hard Negatives: The Importance of Score Distribution in Knowledge Distillation for Dense Retrieval Paper • 2604.04734 • Published Apr 6 • 14
BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback Paper • 2509.21106 • Published Sep 25, 2025 • 8
BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback Paper • 2509.21106 • Published Sep 25, 2025 • 8 • 2
BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback Paper • 2509.21106 • Published Sep 25, 2025 • 8
Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code Paper • 2409.19715 • Published Sep 29, 2024 • 10
THEANINE: Revisiting Memory Management in Long-term Conversations with Timeline-augmented Response Generation Paper • 2406.10996 • Published Jun 16, 2024 • 35
Embodied Agents Meet Personalization: Exploring Memory Utilization for Personalized Assistance Paper • 2505.16348 • Published May 22, 2025 • 52