3.03 GB
19 files
Updated 11 days ago
Name
Size
data
.gitattributes2.31 kB
xet
README.md2.35 kB
xet
README.md

This is a filtered version of the C4 dataset only containing samples of Kannada language. The dataset contains total of 1056849 training and 1039 validation samples.

Data Sample:

{'text': 'ಹಳ್ಳಿಯ ‘ಬೋಲ್ಟ್\u200c’ಗಳನ್ನು ಗುರುತಿಸಿ | Prajavani\nಪ್ರಜಾವಾಣಿ ವಾರ್ತೆ Updated: 18 ಫೆಬ್ರವರಿ 2020, 01:30 IST\nಉಡುಪಿಯ ಐಕಳದಲ್ಲಿ ಇತ್ತೀಚೆಗೆ ನಡೆದ ಕಂಬಳದ ಓಟದಲ್ಲಿ ಶ್ರೀನಿವಾಸ ಗೌಡ ಎಂಬುವರು ವಿಶ್ವದ ವೇಗದ ಓಟಗಾರ ಉಸೇನ್ ಬೋಲ್ಟ್ ಅವರಿಗಿಂತಲೂ ವೇಗವಾಗಿ ಓಡಿ ಗುರಿ ತಲುಪಿದ್ದು, ಸಾರ್ವಜನಿಕರ ಮೆಚ್ಚುಗೆಗೆ ಪಾತ್ರರಾಗಿದ್ದಾರೆ. ಗ್ರಾಮೀಣ ಪ್ರದೇಶ\nಗಳಲ್ಲಿ ಇರುವ ಇಂತಹ ಓಟಗಾರರು ಮತ್ತು ಆಟಗಾರರು ಎಲೆಮರೆಯ ಕಾಯಿಯಂತೆ ತಮ್ಮ ಪಾಡಿಗೆ ತಾವು ಬೆಳೆಯುತ್ತಿರುತ್ತಾರೆ. ಶಾಲಾ- ಕಾಲೇಜುಗಳಲ್ಲಿ ಓದುತ್ತಿರುವವರಿಗೆ ಮುಂದೆ ಬರಲು ಸ್ವಲ್ಪಮಟ್ಟಿಗಾದರೂ ಅವಕಾಶ ಇರುತ್ತದೆ. ಅವಿದ್ಯಾವಂತರಿಗೆ ಅದೂ ಇಲ್ಲ.\nಇನ್ನು ಕ್ರೀಡಾಕೂಟಗಳಿಗೆ.......',
 'timestamp': datetime.datetime(2020, 4, 1, 16, 50, 10),
 'url': 'https://www.prajavani.net/op-ed/readers-letter/need-more-publicity-to-kambala-sports-706114.html'}

Use with Datasets:

from datasets import load_dataset

ds = load_dataset("Kannada-LLM-Labs/C4-Kn")
Total size
3.03 GB
Files
19
Last updated
Aug 6
Pre-warmed CDN
US EU US EU

Contributors