Buckets:
3.03 GB
19 files
Updated 11 days ago
Ctrl+K
| Name | Size | Uploaded | Xet hash |
|---|---|---|---|
| data | 17 items | ||
| .gitattributes | 2.31 kB xet | b6a9e0dd | |
| README.md | 2.35 kB xet | db5a0513 |
This is a filtered version of the C4 dataset only containing samples of Kannada language. The dataset contains total of 1056849 training and 1039 validation samples.
Data Sample:
{'text': 'ಹಳ್ಳಿಯ ‘ಬೋಲ್ಟ್\u200c’ಗಳನ್ನು ಗುರುತಿಸಿ | Prajavani\nಪ್ರಜಾವಾಣಿ ವಾರ್ತೆ Updated: 18 ಫೆಬ್ರವರಿ 2020, 01:30 IST\nಉಡುಪಿಯ ಐಕಳದಲ್ಲಿ ಇತ್ತೀಚೆಗೆ ನಡೆದ ಕಂಬಳದ ಓಟದಲ್ಲಿ ಶ್ರೀನಿವಾಸ ಗೌಡ ಎಂಬುವರು ವಿಶ್ವದ ವೇಗದ ಓಟಗಾರ ಉಸೇನ್ ಬೋಲ್ಟ್ ಅವರಿಗಿಂತಲೂ ವೇಗವಾಗಿ ಓಡಿ ಗುರಿ ತಲುಪಿದ್ದು, ಸಾರ್ವಜನಿಕರ ಮೆಚ್ಚುಗೆಗೆ ಪಾತ್ರರಾಗಿದ್ದಾರೆ. ಗ್ರಾಮೀಣ ಪ್ರದೇಶ\nಗಳಲ್ಲಿ ಇರುವ ಇಂತಹ ಓಟಗಾರರು ಮತ್ತು ಆಟಗಾರರು ಎಲೆಮರೆಯ ಕಾಯಿಯಂತೆ ತಮ್ಮ ಪಾಡಿಗೆ ತಾವು ಬೆಳೆಯುತ್ತಿರುತ್ತಾರೆ. ಶಾಲಾ- ಕಾಲೇಜುಗಳಲ್ಲಿ ಓದುತ್ತಿರುವವರಿಗೆ ಮುಂದೆ ಬರಲು ಸ್ವಲ್ಪಮಟ್ಟಿಗಾದರೂ ಅವಕಾಶ ಇರುತ್ತದೆ. ಅವಿದ್ಯಾವಂತರಿಗೆ ಅದೂ ಇಲ್ಲ.\nಇನ್ನು ಕ್ರೀಡಾಕೂಟಗಳಿಗೆ.......',
'timestamp': datetime.datetime(2020, 4, 1, 16, 50, 10),
'url': 'https://www.prajavani.net/op-ed/readers-letter/need-more-publicity-to-kambala-sports-706114.html'}
Use with Datasets:
from datasets import load_dataset
ds = load_dataset("Kannada-LLM-Labs/C4-Kn")
- Total size
- 3.03 GB
- Files
- 19
- Last updated
- Aug 6
- Pre-warmed CDN
- US EU US EU