Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments Paper • 2609.04148 • Published 2 days ago • 212
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 2 days ago • 64
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 2 days ago • 64
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments Paper • 2608.14441 • Published 22 days ago • 29
NVIDIA Nemotron v3 Collection Open, Production-ready Enterprise Models • 33 items • Updated 21 days ago • 366
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design Paper • 2608.10299 • Published 26 days ago • 136
Qwen-AgentWorld: Language World Models for General Agents Paper • 2606.24597 • Published Jun 23 • 160
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses Paper • 2608.12307 • Published 24 days ago • 114
Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization Paper • 2607.10169 • Published Jul 11 • 14
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published Jul 8 • 150
ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration Paper • 2605.03042 • Published May 4 • 150
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic Paper • 2511.12159 • Published Nov 15, 2025
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes Paper • 2603.25562 • Published Mar 26 • 19
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes Paper • 2603.25562 • Published Mar 26 • 19
nvidia/Nemotron-Research-Reasoning-Qwen-1.5B Text Generation • 2B • Updated Nov 21, 2025 • 1.18k • 244