ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment Paper • 2608.05102 • Published 3 days ago • 62
Lossless Tensor Compression as Program Synthesis Paper • 2608.02162 • Published 5 days ago • 11
MameLoshnLM: Yiddish Language Model and Evaluation Benchmark Paper • 2608.05850 • Published 2 days ago • 14
On-Policy Delta Distillation for Multilingual Math Reasoning Paper • 2608.05802 • Published 2 days ago • 23
CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks Paper • 2608.06352 • Published 2 days ago • 15
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published 2 days ago • 74
SKILL-KD: Contrastive Skill Distillation for LLM Agents Paper • 2607.28048 • Published 4 days ago • 10
Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking Paper • 2607.00482 • Published 4 days ago • 7
ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads Paper • 2608.02703 • Published 5 days ago • 6
Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance Paper • 2608.00782 • Published 7 days ago • 15
Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning Paper • 2608.05139 • Published 3 days ago • 25
When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation Paper • 2608.03632 • Published 4 days ago • 21
RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction Paper • 2608.01247 • Published 6 days ago • 11
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models Paper • 2608.03457 • Published 4 days ago • 30
MemSFT: Mitigating Alignment Tax with an External Parametric Memory Paper • 2607.25614 • Published 11 days ago • 23
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning Paper • 2608.01837 • Published 5 days ago • 38
TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning Paper • 2608.04007 • Published 4 days ago • 18
Zero-Mem: Zero-Token Memory Operations for LLM Agents Paper • 2607.29377 • Published 8 days ago • 11
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation Paper • 2608.02287 • Published 5 days ago • 30
GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning Paper • 2608.02585 • Published 5 days ago • 24