The MTEB(por) benchmark for Brazilian Portuguese (leaderboard + task datasets) and the Colibri embedding model that tops it among small models.
Tardelli Stekel
tardellirs
·
AI & ML interests
None yet
Recent Activity
liked a model about 19 hours ago
hotchpotch/bekko-embedding-v1-a25m liked a model about 19 hours ago
hotchpotch/bekko-embedding-v1-a8m updated a Space 3 days ago
MTEB-BR/leaderboardOrganizations
BrazEmbed-PT-BR
Contamination-clean ~110M Brazilian-Portuguese embeddings (BERTimbau). #1 in the ~100M class on MTEB(por).
-
tardellirs/brazembed-pt-br
Sentence Similarity • 0.1B • Updated • 182 • 1 -
tardellirs/brazembed-pt-br-clfclu
Sentence Similarity • 0.1B • Updated • 123 -
tardellirs/brazembed-pt-br-pairclf
Sentence Similarity • 0.1B • Updated • 119 -
tardellirs/brazembed-pt-br-sts
Sentence Similarity • 0.1B • Updated • 105
Colibri — Brazilian-Portuguese Embeddings
Compact pt-br text-embedding model (~157M) that beats far larger models on MTEB(por): vocabulary trim -> Qwen3-4B distillation -> model soup.
EmbeddingGemma PT-BR (vocabulary-trimmed)
Portuguese EmbeddingGemma-300M, vocab-trimmed 16k–128k. Training-free; 64k ≈ full quality at half the params.
-
tardellirs/embeddinggemma-pt-br
Sentence Similarity • 0.2B • Updated • 688 • 1 -
tardellirs/embeddinggemma-pt-br-128k
Sentence Similarity • 0.2B • Updated • 116 • 1 -
tardellirs/embeddinggemma-pt-br-48k
Sentence Similarity • 0.1B • Updated • 117 • 1 -
tardellirs/embeddinggemma-pt-br-32k
Sentence Similarity • 0.1B • Updated • 129 • 2
MTEB(por) — Brazilian-Portuguese Embeddings
The MTEB(por) benchmark for Brazilian Portuguese (leaderboard + task datasets) and the Colibri embedding model that tops it among small models.
Colibri — Brazilian-Portuguese Embeddings
Compact pt-br text-embedding model (~157M) that beats far larger models on MTEB(por): vocabulary trim -> Qwen3-4B distillation -> model soup.
BrazEmbed-PT-BR
Contamination-clean ~110M Brazilian-Portuguese embeddings (BERTimbau). #1 in the ~100M class on MTEB(por).
-
tardellirs/brazembed-pt-br
Sentence Similarity • 0.1B • Updated • 182 • 1 -
tardellirs/brazembed-pt-br-clfclu
Sentence Similarity • 0.1B • Updated • 123 -
tardellirs/brazembed-pt-br-pairclf
Sentence Similarity • 0.1B • Updated • 119 -
tardellirs/brazembed-pt-br-sts
Sentence Similarity • 0.1B • Updated • 105
EmbeddingGemma PT-BR (vocabulary-trimmed)
Portuguese EmbeddingGemma-300M, vocab-trimmed 16k–128k. Training-free; 64k ≈ full quality at half the params.
-
tardellirs/embeddinggemma-pt-br
Sentence Similarity • 0.2B • Updated • 688 • 1 -
tardellirs/embeddinggemma-pt-br-128k
Sentence Similarity • 0.2B • Updated • 116 • 1 -
tardellirs/embeddinggemma-pt-br-48k
Sentence Similarity • 0.1B • Updated • 117 • 1 -
tardellirs/embeddinggemma-pt-br-32k
Sentence Similarity • 0.1B • Updated • 129 • 2