Buckets:
language:
- pt
license: cc-by-sa-3.0
task_categories:
- text-classification
tags:
- mteb
- portuguese
- brazilian-portuguese
- clustering
pretty_name: WikipediaPTCategoriesClusteringP2P
WikipediaPTCategoriesClusteringP2P
Cluster the first paragraph of Brazilian Portuguese Wikipedia articles into 15 broad subject categories (História, Geografia, Política, Esporte, Música, Cinema, Literatura, Religião, Ciência, Tecnologia, Animais, Plantas, Medicina, Filosofia, Astronomia). Articles sampled via MediaWiki API category traversal (depth 2) of curated root categories; first paragraph from the extracts API.
Part of MTEB(por) — the native Brazilian-Portuguese MTEB sub-benchmark. Task type: Clustering · Language: Brazilian Portuguese (mined from real-world sources) · Domains: Encyclopaedic, Written.
Dataset structure
default— columns:label,title,sentences
Source
https://huggingface.co/datasets/mteb-pt/wikipedia-categories
License
cc-by-sa-3.0
Citation
@misc{mtebpt2026wikicat,
title = {Wikipedia-PT Categories: a clustering benchmark for Brazilian Portuguese},
author = {Stekel, Tardelli Ronan Coelho},
year = {2026},
howpublished = {HuggingFace Dataset},
note = {Available at \url{https://huggingface.co/datasets/mteb-pt/wikipedia-categories}},
}
Repackaged for MTEB(por); pinned by commit SHA in the task for reproducibility.
Xet Storage Details
- Size:
- 1.49 kB
- Xet hash:
- 40650e080a82f5bca0f11daa2f95c2fe179107c1922c814e376e9264cff60e0e
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.