NyayaLM Tokenizer
SentencePiece-BPE tokenizer (64,000 vocab) for NyayaLM-200M, bilingual (Nepali/English) legal-domain model with Qwen3-style ChatML special tokens.
- BPE + byte_fallback
- Character coverage: 0.9995
- Curated specials at high ids (not colliding with BPE pieces)
Usage
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("REPO_ID")
print(tok.apply_chat_template(
[{"role": "user", "content": "नमस्ते"}],
tokenize=False, add_generation_prompt=True,
))
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support