Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift Paper • 2607.17524 • Published 16 days ago • 6
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift Paper • 2607.17524 • Published 16 days ago • 6
Value-Aware Stochastic KV Cache Eviction for Reasoning Models Paper • 2606.03928 • Published Jun 2 • 8
Value-Aware Stochastic KV Cache Eviction for Reasoning Models Paper • 2606.03928 • Published Jun 2 • 8
Convergent Evolution: How Different Language Models Learn Similar Number Representations Paper • 2604.20817 • Published Apr 22 • 8
Convergent Evolution: How Different Language Models Learn Similar Number Representations Paper • 2604.20817 • Published Apr 22 • 8
FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization Paper • 2603.19835 • Published Mar 20 • 353
Qwen3 Cross-layer Transcoders Collection Cross-layer transcoders for models from the Qwen3 family. • 2 items • Updated Dec 1, 2025 • 1
When Do Transformers Learn Heuristics for Graph Connectivity? Paper • 2510.19753 • Published Oct 22, 2025 • 4