Mobile-O-Datasets Collection This collection includes the pre-training, sft, and post-training data of Mobile-O • 3 items • Updated Feb 14 • 5
Benchmarks4textgen Collection Benchmarks for text generation capabilities of language models. • 9 items • Updated 19 days ago • 1
BVD: Big Video Dataset Collection A 10-Million-Hour Open Video Dataset for Multimodal Pre-training • 11 items • Updated 27 days ago • 8
MobileCLIP Models + DataCompDR Data Collection MobileCLIP: Mobile-friendly image-text models with SOTA zero-shot capabilities. DataCompDR: Improved datasets for training image-text SOTA models. • 22 items • Updated Mar 2 • 40
From screenshots to HTML Collection WebSight is a dataset of 823,000 HTML/CSS codes representing synthetically generated English websites, each accompanied by a corresponding screenshot. • 4 items • Updated Apr 15, 2024 • 23
SmolDocling datasets Collection Datasets used to train SmolDocling • 6 items • Updated Jul 31, 2025 • 32
Fine Text: Post training Corpus Collection High-quality text training corpus for post training process • 4 items • Updated 19 days ago • 1
Fine Text: Pretrain Corpus Collection Large-scale high-quality text training corpus for pretrain process • 8 items • Updated 2 days ago • 1
UltraData Collection Ultra Scale, Ultra Quality, Ultra Coverage • 19 items • Updated 7 days ago • 111