MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing Paper • 2601.17814 • Published Jan 25
When Routing Collapses: On the Degenerate Convergence of LLM Routers Paper • 2602.03478 • Published Feb 3
From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing Paper • 2606.06924 • Published Jun 5
RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing Paper • 2606.18774 • Published Jun 19
Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing Paper • 2609.37362 • Published 3 days ago • 1
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published Aug 4 • 9
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing Paper • 2601.17814 • Published Jan 25
Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs Paper • 2404.10160 • Published Apr 15, 2024
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment Paper • 2503.18991 • Published Mar 23, 2025