TilQazyna/Til-Corpus
Updated • 31 • 1
Core datasets for pretraining, instruction tuning, speech and language tasks. Основные датасеты для предобучения, инструкций, речи и языковых задач.
Note Start here for pretraining text.
Note Training data behind every GEC model in this collection.