rayssaSNT's picture
|
download
raw
1.49 kB
---
language:
- pt
license: cc-by-sa-3.0
task_categories:
- text-classification
tags:
- mteb
- portuguese
- brazilian-portuguese
- clustering
pretty_name: WikipediaPTCategoriesClusteringP2P
---
# WikipediaPTCategoriesClusteringP2P
Cluster the first paragraph of Brazilian Portuguese Wikipedia articles into 15 broad subject categories (História, Geografia, Política, Esporte, Música, Cinema, Literatura, Religião, Ciência, Tecnologia, Animais, Plantas, Medicina, Filosofia, Astronomia). Articles sampled via MediaWiki API category traversal (depth 2) of curated root categories; first paragraph from the `extracts` API.
Part of **[MTEB(por)](https://huggingface.co/mteb-pt)** — the native Brazilian-Portuguese MTEB sub-benchmark. **Task type:** Clustering · **Language:** Brazilian Portuguese (mined from real-world sources) · **Domains:** Encyclopaedic, Written.
## Dataset structure
- **`default`** — columns: `label`, `title`, `sentences`
## Source
https://huggingface.co/datasets/mteb-pt/wikipedia-categories
## License
`cc-by-sa-3.0`
## Citation
```bibtex
@misc{mtebpt2026wikicat,
title = {Wikipedia-PT Categories: a clustering benchmark for Brazilian Portuguese},
author = {Stekel, Tardelli Ronan Coelho},
year = {2026},
howpublished = {HuggingFace Dataset},
note = {Available at \url{https://huggingface.co/datasets/mteb-pt/wikipedia-categories}},
}
```
---
*Repackaged for MTEB(por); pinned by commit SHA in the task for reproducibility.*

Xet Storage Details

Size:
1.49 kB
·
Xet hash:
40650e080a82f5bca0f11daa2f95c2fe179107c1922c814e376e9264cff60e0e

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.