flexitok
/

bpe_ell_Grek_128000

Modern Greek (1453-)

Model card Files Files and versions

bpe_ell_Grek_128000 / README.md

gsaltintas's picture

Upload folder using huggingface_hub

3f1bb9e verified 2 months ago

|

history blame contribute delete

813 Bytes

license: mit
language:
  - ell
tags:
  - tokenizer
  - bpe
  - flexitok
  - fineweb2

Byte-Level BPE Tokenizer: ell_Grek (128K)

A Byte-Level BPE tokenizer trained on ell_Grek data from Fineweb-2-HQ.

Training Details

Parameter	Value
Algorithm	Byte-Level BPE
Language	`ell_Grek`
Target Vocab Size	128,000
Final Vocab Size	0
Pre-tokenizer	ByteLevel
Normalizer	NFC
Special Tokens	`<s>`, `</s>`, `<pad>`, `<unk>`
Training Shards	2

Usage

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("<repo_id>")
tokens = tokenizer.encode("Hello, world!")

Files

tokenizer.json — Full HuggingFace tokenizer
vocab.json — Vocabulary mapping
merges.txt — BPE merge rules