Buckets:
762 kB
3 files
Updated 19 days ago
Ctrl+K
| Name | Size | Uploaded | Xet hash |
|---|---|---|---|
| data | 1 items | ||
| .gitattributes | 2.5 kB xet | 738f1125 | |
| README.md | 1.49 kB xet | 40650e08 |
WikipediaPTCategoriesClusteringP2P
Cluster the first paragraph of Brazilian Portuguese Wikipedia articles into 15 broad subject categories (História, Geografia, Política, Esporte, Música, Cinema, Literatura, Religião, Ciência, Tecnologia, Animais, Plantas, Medicina, Filosofia, Astronomia). Articles sampled via MediaWiki API category traversal (depth 2) of curated root categories; first paragraph from the extracts API.
Part of MTEB(por) — the native Brazilian-Portuguese MTEB sub-benchmark. Task type: Clustering · Language: Brazilian Portuguese (mined from real-world sources) · Domains: Encyclopaedic, Written.
Dataset structure
default— columns:label,title,sentences
Source
https://huggingface.co/datasets/mteb-pt/wikipedia-categories
License
cc-by-sa-3.0
Citation
@misc{mtebpt2026wikicat,
title = {Wikipedia-PT Categories: a clustering benchmark for Brazilian Portuguese},
author = {Stekel, Tardelli Ronan Coelho},
year = {2026},
howpublished = {HuggingFace Dataset},
note = {Available at \url{https://huggingface.co/datasets/mteb-pt/wikipedia-categories}},
}
Repackaged for MTEB(por); pinned by commit SHA in the task for reproducibility.
- Total size
- 762 kB
- Files
- 3
- Last updated
- Jul 14
- Pre-warmed CDN
- US EU US EU