-
Nemotron-4 15B Technical Report
Paper • 2402.16819 • Published • 48 -
InternLM2 Technical Report
Paper • 2403.17297 • Published • 35 -
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
Paper • 2404.04167 • Published • 13 -
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
Paper • 2402.14905 • Published • 135
Collections
Discover the best community collections!
Collections trending this week
-
MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
Paper • 2402.15627 • Published • 36 -
Beyond Language Models: Byte Models are Digital World Simulators
Paper • 2402.19155 • Published • 53 -
VisionLLaMA: A Unified LLaMA Interface for Vision Tasks
Paper • 2403.00522 • Published • 47 -
Stealing Part of a Production Language Model
Paper • 2403.06634 • Published • 90
-
Nemotron-4 15B Technical Report
Paper • 2402.16819 • Published • 48 -
InternLM2 Technical Report
Paper • 2403.17297 • Published • 35 -
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
Paper • 2404.04167 • Published • 13 -
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
Paper • 2402.14905 • Published • 135
-
MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
Paper • 2402.15627 • Published • 36 -
Beyond Language Models: Byte Models are Digital World Simulators
Paper • 2402.19155 • Published • 53 -
VisionLLaMA: A Unified LLaMA Interface for Vision Tasks
Paper • 2403.00522 • Published • 47 -
Stealing Part of a Production Language Model
Paper • 2403.06634 • Published • 90