Leo PRO
leideng
AI & ML interests
Efficient AI, Sparse Attention
Recent Activity
liked a model 5 days ago
Wan-AI/Wan2.2-Animate-2-14B liked a model 5 days ago
inclusionAI/Ling-3.0-flash liked a model 5 days ago
LiquidAI/LFM2.5-2.6BOrganizations
None yet
Optimizer
RL
-
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Paper • 2503.14476 • Published • 147 -
Proximal Policy Optimization Algorithms
Paper • 1707.06347 • Published • 11 -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Paper • 2305.18290 • Published • 68 -
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Paper • 2402.03300 • Published • 148
Tokenization
SFT
-
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
Paper • 2508.05629 • Published • 191 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25 -
LIMA: Less Is More for Alignment
Paper • 2305.11206 • Published • 27 -
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
Paper • 2408.16673 • Published
Non-prefix KV Reuse
-
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
Paper • 2604.13226 • Published • 11 -
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
Paper • 2502.16002 • Published -
ProphetKV: User-Query-Driven Selective Recomputation for Efficient KV Cache Reuse in Retrieval-Augmented Generation
Paper • 2602.02579 • Published -
From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation
Paper • 2601.12904 • Published
DiT
Efficient AI
-
LFM2 Technical Report
Paper • 2511.23404 • Published • 67 -
MiniMax Sparse Attention
Paper • 2606.13392 • Published • 156 -
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
Paper • 2603.12201 • Published • 65 -
FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention
Paper • 2606.09079 • Published • 68
Pretrain
Reasoning
Memory
Non-prefix KV Reuse
-
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
Paper • 2604.13226 • Published • 11 -
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
Paper • 2502.16002 • Published -
ProphetKV: User-Query-Driven Selective Recomputation for Efficient KV Cache Reuse in Retrieval-Augmented Generation
Paper • 2602.02579 • Published -
From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation
Paper • 2601.12904 • Published
Optimizer
DiT
RL
-
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Paper • 2503.14476 • Published • 147 -
Proximal Policy Optimization Algorithms
Paper • 1707.06347 • Published • 11 -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Paper • 2305.18290 • Published • 68 -
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Paper • 2402.03300 • Published • 148
Efficient AI
-
LFM2 Technical Report
Paper • 2511.23404 • Published • 67 -
MiniMax Sparse Attention
Paper • 2606.13392 • Published • 156 -
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
Paper • 2603.12201 • Published • 65 -
FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention
Paper • 2606.09079 • Published • 68
Tokenization
Pretrain
SFT
-
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
Paper • 2508.05629 • Published • 191 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25 -
LIMA: Less Is More for Alignment
Paper • 2305.11206 • Published • 27 -
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
Paper • 2408.16673 • Published
Reasoning