Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models Paper • 2605.07721 • Published May 8 • 31
Running on CPU Upgrade Featured 3.32k The Smol Training Playbook 📚 3.32k The secrets to building world-class LLMs