-
ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
Paper • 2403.03853 • Published • 66 -
Revisiting In-Context Learning with Long Context Language Models
Paper • 2412.16926 • Published • 32 -
Rethinking Addressing in Language Models via Contexualized Equivariant Positional Encoding
Paper • 2501.00712 • Published • 6
Collections
Discover the best community collections!
Collections trending this week
-
Yi: Open Foundation Models by 01.AI
Paper • 2403.04652 • Published • 66 -
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
Paper • 2401.02954 • Published • 56 -
Qwen Technical Report
Paper • 2309.16609 • Published • 39 -
Gemma: Open Models Based on Gemini Research and Technology
Paper • 2403.08295 • Published • 52
-
Video as the New Language for Real-World Decision Making
Paper • 2402.17139 • Published • 22 -
VideoPrism: A Foundational Visual Encoder for Video Understanding
Paper • 2402.13217 • Published • 41 -
World Model on Million-Length Video And Language With RingAttention
Paper • 2402.08268 • Published • 41 -
microsoft/xclip-base-patch16-zero-shot
Video Classification • 0.2B • Updated • 6.85k • 27
-
ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
Paper • 2403.03853 • Published • 66 -
Revisiting In-Context Learning with Long Context Language Models
Paper • 2412.16926 • Published • 32 -
Rethinking Addressing in Language Models via Contexualized Equivariant Positional Encoding
Paper • 2501.00712 • Published • 6
-
Yi: Open Foundation Models by 01.AI
Paper • 2403.04652 • Published • 66 -
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
Paper • 2401.02954 • Published • 56 -
Qwen Technical Report
Paper • 2309.16609 • Published • 39 -
Gemma: Open Models Based on Gemini Research and Technology
Paper • 2403.08295 • Published • 52
-
Video as the New Language for Real-World Decision Making
Paper • 2402.17139 • Published • 22 -
VideoPrism: A Foundational Visual Encoder for Video Understanding
Paper • 2402.13217 • Published • 41 -
World Model on Million-Length Video And Language With RingAttention
Paper • 2402.08268 • Published • 41 -
microsoft/xclip-base-patch16-zero-shot
Video Classification • 0.2B • Updated • 6.85k • 27