flexitok
/

bpe_arb_Arab_128000

Standard Arabic

Model card Files Files and versions

bpe_arb_Arab_128000 / README.md

gsaltintas's picture

Upload folder using huggingface_hub

3a50b5a verified about 2 months ago

|

history blame contribute delete

813 Bytes

license: mit
language:
  - arb
tags:
  - tokenizer
  - bpe
  - flexitok
  - fineweb2

Byte-Level BPE Tokenizer: arb_Arab (128K)

A Byte-Level BPE tokenizer trained on arb_Arab data from Fineweb-2-HQ.

Training Details

Parameter	Value
Algorithm	Byte-Level BPE
Language	`arb_Arab`
Target Vocab Size	128,000
Final Vocab Size	0
Pre-tokenizer	ByteLevel
Normalizer	NFC
Special Tokens	`<s>`, `</s>`, `<pad>`, `<unk>`
Training Shards	2

Usage

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("<repo_id>")
tokens = tokenizer.encode("Hello, world!")

Files

tokenizer.json — Full HuggingFace tokenizer
vocab.json — Vocabulary mapping
merges.txt — BPE merge rules