Srishti280992/repro-exact-unlearning-in-reinforcement-learning-traces Traces • Updated Aug 3 • 77 • 4
JonusNattapong/Reinforcement-Learning-for-Gold-Trading-Model Reinforcement Learning • Updated Dec 23, 2025 • 104 • 16
LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay Paper • 2609.25053 • Published 21 days ago • 15
sanjaydoss/Multi-Agent_Reinforcement_Learning_Trading_System_Data Viewer • Updated 24 days ago • 5.28k • 175 • 10
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 11 days ago • 57
Region-Level Policy Optimization for Fine-grained MLLM Perception Paper • 2609.19745 • Published 11 days ago • 41
PACT: Can Enterprise AI Assistants Be Trusted Under Pressure? Paper • 2609.18605 • Published 12 days ago • 40
Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening Paper • 2609.18708 • Published 12 days ago • 82
SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization Paper • 2609.14320 • Published 15 days ago • 34