Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms Paper • 2609.27321 • Published 7 days ago • 22
RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling Paper • 2609.22947 • Published 11 days ago • 41
ALPINE: Adaptive Localization for Parameter- and Sample-Efficient Few-Shot Learning Paper • 2609.22323 • Published 14 days ago • 10
LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay Paper • 2609.25053 • Published 23 days ago • 17