from datasets import load_dataset data = load_dataset("csv", data_files={"train": "train.csv"}) data = data["train"].train_test_split(test_size=0.1) # 90/10 split