-
DataDecide: How to Predict Best Pretraining Data with Small Experiments
Paper • 2504.11393 • Published • 20 -
Rethinking Multilingual Continual Pretraining: Data Mixing for Adapting LLMs Across Languages and Resources
Paper • 2504.04152 • Published • 1 -
BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining
Paper • 2508.10975 • Published • 60 -
Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
Paper • 2412.02595 • Published • 8
Avinash Benki
AvinashBenkiGnani
AI & ML interests
NLP
Recent Activity
new activity 25 days ago
gnani/gnani-evon-v3.3-30B-A3B:Updated max_model_length in .json File. updated a model about 2 months ago
gnani/gnani-evon-v3.3-30B-A3B updated a model about 2 months ago
gnani/gnani-evon-v3.3-30B-A3B