How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining Paper • 2511.18903 • Published Nov 24, 2025 • 2
A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules Paper • 2503.12811 • Published Mar 17, 2025 • 2
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 Paper • 2608.27370 • Published 7 days ago • 33
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 Paper • 2608.27370 • Published 7 days ago • 33
MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling Paper • 2606.13473 • Published Jun 11 • 96
MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling Paper • 2606.13473 • Published Jun 11 • 96