LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models Paper • 2609.39071 • Published 8 days ago • 57
Revealing the Attention Floating Mechanism in Masked Diffusion Models Paper • 2601.07894 • Published Jan 12 • 1
SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning Paper • 2601.01392 • Published Jan 4
Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain Paper • 2508.12281 • Published Feb 9
LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models Paper • 2609.39071 • Published 8 days ago • 57
Agent Lightning: Train ANY AI Agents with Reinforcement Learning Paper • 2508.03680 • Published Aug 5, 2025 • 142