Create README.md
Browse files
README.md
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
---
|
| 2 |
+
language:
|
| 3 |
+
- en
|
| 4 |
+
---
|
| 5 |
+
A tiny 55 million parameter trained on 1.3 billion tokens on a custom dataset mixture.
|
| 6 |
+
HuggingFaceFW/fineweb-edu 50%
|
| 7 |
+
epfml/FineWeb-HQ 30%
|
| 8 |
+
HuggingFaceTB/cosmopedia (stories split) 20%
|
| 9 |
+
The tokenizer is a basic bpe tokenizer that was trained on a smaller subset of 80_000 samples of this same data mixture with a vocab size of 8000.
|