FST_code / config /dataset /slimpajama_60b.yaml
jasonfan's picture
2026-03-19
3b2d368 verified
Raw
History Blame Contribute Delete
705 Bytes
defaults:
- _base
- _self_
# Dataset Identity
dataset_name: slimpajama_60b
init_fn: lmr.data.slimpajama.initialize_dataset
# Token Limits
max_tokens_train: 60b # Determines the number of tokens SAVED, not necessarily the total training tokens.
max_tokens_validation: 60m
max_tokens_test: 60m
tokens_buffer: 100k # Saves additional tokens (per component) to prevent batch/sequence level inconsistencies.
# Proportional Sampling (Keeping default proportions)
sampling_type: proportional
proportions:
RedPajamaCommonCrawl: 0.522
RedPajamaC4: 0.267
RedPajamaGithub: 0.052
RedPajamaBook: 0.042
RedPajamaArXiv: 0.046
RedPajamaWikipedia: 0.038
RedPajamaStackExchange: 0.033