Safetensors
distilbert
ll24 / preprocess_data.py
chaosbringerc's picture
Create preprocess_data.py
2c81ba8 verified
Raw
History Blame Contribute Delete
288 Bytes
from transformers import AutoTokenizer
model_checkpoint = "distilbert-base-uncased"
tokenizer = AutoTokenizer.from_pretrained(model_checkpoint)
def tokenize(batch):
return tokenizer(batch["text"], truncation=True, padding="max_length")
tokenized = data.map(tokenize, batched=True)