M2RL Collection The SFT+RL+OPD model weights of paper "To mix or to merge: Toward multi-domain reinforcement learning for large language models" • 8 items • Updated 12 days ago • 2
MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling Paper • 2602.03359 • Published Feb 3 • 10
From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs Paper • 2512.06776 • Published Dec 7, 2025 • 26