{ "what": "Three natural sentences from the strict test split (held out from tokenizer training), segmented by each tokenizer's own encoder, no special tokens. '▁' = space carried by the token; '▯' = one byte of a letter split across tokens (byte-level BPE). Source: sota/robustness/robustness.json -> examples.", "sentences": [ "ایہہ بہت کہٹ لوک جانڑدین کہ ڈرامے دی پیدائش کسراں تے کتھے ہوئی آئی۔", "اج اساں اگر آپڑیں بزرگاں دی انہاں گلاں تے غور نہ کیتا تے پچھتاوے دے سوا کج ہتھ نہ آسی۔", "اسی طراں خیبر پختونخوا اچ بولی جانڑیں ولی دیگر زباناں دے ادب و ثقافت دی بی نمائندگی کیتی گئی اَئی۔" ], "tokenizers": { "released": "Hindko SP-32k (released)", "mingram48k": "MinGram-48k (runner-up)", "gpt-4o": "GPT-4o (o200k)", "gemma-3": "Gemma 3", "llama-3": "Llama 3", "llama-4": "Llama 4", "qwen-3.5": "Qwen 3.5", "deepseek-v3": "DeepSeek-V3", "bloom": "BLOOM", "roberta-urdu": "RoBERTa-Urdu", "mt5": "mT5" }, "segmentations": { "released": [ { "n": 14, "tokens": [ "▁ایہہ", "▁بہت", "▁کہٹ", "▁لوک", "▁جانڑدین", "▁کہ", "▁ڈرامے", "▁دی", "▁پیدائش", "▁کسراں", "▁تے", "▁کتھے", "▁ہوئی", "▁آئی۔" ] }, { "n": 20, "tokens": [ "▁اج", "▁اساں", "▁اگر", "▁آپڑیں", "▁بزرگاں", "▁دی", "▁انہاں", "▁گلاں", "▁تے", "▁غور", "▁نہ", "▁کیتا", "▁تے", "▁پچھتاوے", "▁دے", "▁سوا", "▁کج", "▁ہتھ", "▁نہ", "▁آسی۔" ] }, { "n": 20, "tokens": [ "▁اسی", "▁طراں", "▁خیبر", "▁پختونخوا", "▁اچ", "▁بولی", "▁جانڑیں", "▁ولی", "▁دیگر", "▁زباناں", "▁دے", "▁ادب", "▁و", "▁ثقافت", "▁دی", "▁بی", "▁نمائندگی", "▁کیتی", "▁گئی", "▁اَئی۔" ] } ], "mingram48k": [ { "n": 15, "tokens": [ "ایہہ", "▁بہت", "▁کہٹ", "▁لوک", "▁جانڑدین", "▁کہ", "▁ڈرامے", "▁دی", "▁پیدائش", "▁کسراں", "▁تے", "▁کتھے", "▁ہوئی", "▁آئی", "۔" ] }, { "n": 21, "tokens": [ "اج", "▁اساں", "▁اگر", "▁آپڑیں", "▁بزرگاں", "▁دی", "▁انہاں", "▁گلاں", "▁تے", "▁غور", "▁نہ", "▁کیتا", "▁تے", "▁پچھتاوے", "▁دے", "▁سوا", "▁کج", "▁ہتھ", "▁نہ", "▁آسی", "۔" ] }, { "n": 21, "tokens": [ "اسی", "▁طراں", "▁خیبر", "▁پختونخوا", "▁اچ", "▁بولی", "▁جانڑیں", "▁ولی", "▁دیگر", "▁زباناں", "▁دے", "▁ادب", "▁و", "▁ثقافت", "▁دی", "▁بی", "▁نمائندگی", "▁کیتی", "▁گئی", "▁اَئی", "۔" ] } ], "gpt-4o": [ { "n": 29, "tokens": [ "ای", "ہ", "ہ", "▁بہت", "▁کہ", "ٹ", "▁لو", "ک", "▁جان", "ڑ", "د", "ین", "▁کہ", "▁ڈ", "رام", "ے", "▁دی", "▁پید", "ائش", "▁کس", "را", "ں", "▁ت", "ے", "▁کت", "ھے", "▁ہوئی", "▁آئی", "۔" ] }, { "n": 39, "tokens": [ "اج", "▁اس", "اں", "▁اگر", "▁آپ", "ڑ", "یں", "▁بزرگ", "اں", "▁دی", "▁انہ", "اں", "▁گ", "لا", "ں", "▁ت", "ے", "▁غور", "▁نہ", "▁کی", "تا", "▁ت", "ے", "▁پ", "چھ", "تا", "و", "ے", "▁دے", "▁س", "وا", "▁ک", "ج", "▁ہ", "ت", "ھ", "▁نہ", "▁آسی", "۔" ] }, { "n": 38, "tokens": [ "اسی", "▁ط", "را", "ں", "▁خی", "بر", "▁پ", "خت", "ون", "خوا", "▁اچ", "▁بول", "ی", "▁جان", "ڑ", "یں", "▁ولی", "▁دیگر", "▁ز", "ب", "انا", "ں", "▁دے", "▁ادب", "▁و", "▁ثق", "افت", "▁دی", "▁بی", "▁نمائ", "ندگی", "▁کی", "تی", "▁گئی", "▁ا", "َ", "ئی", "۔" ] } ], "gemma-3": [ { "n": 27, "tokens": [ "ایہ", "ہ", "▁بہت", "▁کہ", "ٹ", "▁لو", "ک", "▁جان", "ڑ", "د", "ین", "▁کہ", "▁ڈ", "رام", "ے", "▁دی", "▁پید", "ائش", "▁کس", "را", "ں", "▁تے", "▁کت", "ھے", "▁ہوئی", "▁آئی", "۔" ] }, { "n": 36, "tokens": [ "اج", "▁اس", "اں", "▁اگر", "▁آپ", "ڑ", "یں", "▁بزرگ", "اں", "▁دی", "▁انہ", "اں", "▁گ", "لا", "ں", "▁تے", "▁غور", "▁نہ", "▁کی", "تا", "▁تے", "▁پ", "چھ", "تا", "و", "ے", "▁دے", "▁سوا", "▁ک", "ج", "▁ہ", "ت", "ھ", "▁نہ", "▁آسی", "۔" ] }, { "n": 35, "tokens": [ "اسی", "▁ط", "را", "ں", "▁خی", "بر", "▁پ", "خت", "ون", "خوا", "▁اچ", "▁بولی", "▁جان", "ڑ", "یں", "▁ولی", "▁دیگر", "▁زبان", "اں", "▁دے", "▁ادب", "▁و", "▁ثقاف", "ت", "▁دی", "▁بی", "▁نمائ", "ندگی", "▁کی", "تی", "▁گئی", "▁ا", "َ", "ئی", "۔" ] } ], "llama-3": [ { "n": 58, "tokens": [ "ای", "▯", "▯", "▯", "▯", "▁ب", "▯", "▯", "ت", "▁ک", "▯", "▯", "ٹ", "▁لو", "ک", "▁جان", "▯", "▯", "د", "ین", "▁ک", "▯", "▯", "▁", "▯", "▯", "ر", "ام", "▯", "▯", "▁دی", "▁پ", "ید", "ائ", "ش", "▁ک", "سر", "ا", "▯", "▯", "▁ت", "▯", "▯", "▁ک", "ت", "ھ", "▯", "▯", "▁", "▯", "▯", "وئ", "ی", "▁آ", "ئ", "ی", "▯", "▯" ] }, { "n": 66, "tokens": [ "اج", "▁اس", "ا", "▯", "▯", "▁اگر", "▁آپ", "▯", "▯", "ی", "▯", "▯", "▁بزرگ", "ا", "▯", "▯", "▁دی", "▁ان", "▯", "▯", "ا", "▯", "▯", "▁گ", "لا", "▯", "▯", "▁ت", "▯", "▯", "▁غ", "ور", "▁ن", "▯", "▯", "▁ک", "یت", "ا", "▁ت", "▯", "▯", "▁پ", "چ", "ھ", "ت", "او", "▯", "▯", "▁د", "▯", "▯", "▁س", "وا", "▁ک", "ج", "▁", "▯", "▯", "ت", "ھ", "▁ن", "▯", "▯", "▁آسی", "▯", "▯" ] }, { "n": 53, "tokens": [ "اسی", "▁طر", "ا", "▯", "▯", "▁خی", "بر", "▁پ", "خت", "ون", "خ", "وا", "▁ا", "چ", "▁ب", "ولی", "▁جان", "▯", "▯", "ی", "▯", "▯", "▁ولی", "▁دیگر", "▁زبان", "ا", "▯", "▯", "▁د", "▯", "▯", "▁اد", "ب", "▁و", "▁ث", "ق", "افت", "▁دی", "▁بی", "▁نم", "ائ", "ندگی", "▁ک", "یتی", "▁گ", "ئ", "ی", "▁ا", "َ", "ئ", "ی", "▯", "▯" ] } ], "llama-4": [ { "n": 35, "tokens": [ "ای", "ہ", "ہ", "▁بہت", "▁کہ", "ٹ", "▁لو", "ک", "▁جان", "ڑ", "د", "ین", "▁کہ", "▁ڈ", "ر", "ام", "ے", "▁دی", "▁پید", "ائ", "ش", "▁ک", "سر", "اں", "▁ت", "ے", "▁ک", "ت", "ھ", "ے", "▁ہو", "ئی", "▁آ", "ئی", "۔" ] }, { "n": 42, "tokens": [ "اج", "▁اس", "اں", "▁اگر", "▁آپ", "ڑ", "یں", "▁بزرگ", "اں", "▁دی", "▁انہ", "اں", "▁گ", "لا", "ں", "▁ت", "ے", "▁غ", "ور", "▁نہ", "▁ک", "یت", "ا", "▁ت", "ے", "▁پ", "چھ", "ت", "او", "ے", "▁د", "ے", "▁س", "وا", "▁ک", "ج", "▁ہ", "ت", "ھ", "▁نہ", "▁آسی", "۔" ] }, { "n": 42, "tokens": [ "اسی", "▁ط", "را", "ں", "▁خی", "بر", "▁پ", "خت", "ون", "خ", "وا", "▁ا", "چ", "▁ب", "ولی", "▁جان", "ڑ", "یں", "▁ولی", "▁دیگر", "▁زبان", "اں", "▁د", "ے", "▁اد", "ب", "▁و", "▁ث", "ق", "افت", "▁دی", "▁بی", "▁نم", "ائ", "ندگی", "▁کی", "تی", "▁گئی", "▁ا▯", "▯", "ئی", "۔" ] } ], "qwen-3.5": [ { "n": 36, "tokens": [ "ای", "ہ", "ہ", "▁بہ", "ت", "▁کہ", "ٹ", "▁لو", "ک", "▁جان", "ڑ", "د", "ین", "▁کہ", "▁ڈ", "رام", "ے", "▁دی", "▁پ", "ید", "ائ", "ش", "▁ک", "س", "را", "ں", "▁ت", "ے", "▁ک", "ت", "ھے", "▁ہو", "ئی", "▁آ", "ئی", "۔" ] }, { "n": 47, "tokens": [ "اج", "▁اسا", "ں", "▁اگر", "▁آپ", "ڑ", "یں", "▁ب", "زر", "گا", "ں", "▁دی", "▁ان", "ہ", "ا", "ں", "▁گ", "لا", "ں", "▁ت", "ے", "▁غ", "ور", "▁نہ", "▁ک", "یت", "ا", "▁ت", "ے", "▁پ", "چ", "ھ", "تا", "و", "ے", "▁د", "ے", "▁س", "وا", "▁ک", "ج", "▁ہ", "ت", "ھ", "▁نہ", "▁آسی", "۔" ] }, { "n": 45, "tokens": [ "اس", "ی", "▁ط", "را", "ں", "▁خی", "بر", "▁پ", "خت", "ون", "خوا", "▁ا", "چ", "▁ب", "ولی", "▁جان", "ڑ", "یں", "▁ولی", "▁دیگر", "▁ز", "ب", "انا", "ں", "▁د", "ے", "▁اد", "ب", "▁و", "▁ثق", "افت", "▁دی", "▁بی", "▁نم", "ائ", "ند", "گی", "▁ک", "یتی", "▁گ", "ئی", "▁ا", "َ", "ئی", "۔" ] } ], "deepseek-v3": [ { "n": 41, "tokens": [ "ای", "ہ", "ہ", "▁ب", "ہ", "ت", "▁ک", "ہ", "ٹ", "▁لو", "ک", "▁جان", "ڑ", "د", "ین", "▁ک", "ہ", "▁", "ڈ", "ر", "ام", "ے", "▁دی", "▁پید", "ائ", "ش", "▁ک", "سر", "اں", "▁ت", "ے", "▁ک", "ت", "ھ", "ے", "▁ہ", "وئ", "ی", "▁آ", "ئی", "۔" ] }, { "n": 47, "tokens": [ "اج", "▁اس", "اں", "▁اگر", "▁آ", "پ", "ڑ", "ی", "ں", "▁بزرگ", "اں", "▁دی", "▁ان", "ہ", "اں", "▁گ", "لا", "ں", "▁ت", "ے", "▁غ", "ور", "▁ن", "ہ", "▁ک", "یت", "ا", "▁ت", "ے", "▁پ", "چ", "ھ", "ت", "او", "ے", "▁دے", "▁س", "وا", "▁ک", "ج", "▁ہ", "ت", "ھ", "▁ن", "ہ", "▁آسی", "۔" ] }, { "n": 43, "tokens": [ "اسی", "▁طر", "اں", "▁خ", "ی", "بر", "▁پ", "خت", "ون", "خ", "وا", "▁ا", "چ", "▁ب", "ولی", "▁جان", "ڑ", "ی", "ں", "▁ولی", "▁دیگر", "▁زبان", "اں", "▁دے", "▁اد", "ب", "▁و", "▁ث", "ق", "افت", "▁دی", "▁بی", "▁نم", "ائ", "ندگی", "▁ک", "یتی", "▁گ", "ئی", "▁ا", "َ", "ئی", "۔" ] } ], "bloom": [ { "n": 25, "tokens": [ "ا", "یہ", "ہ", "▁بہت", "▁کہ", "ٹ", "▁لوک", "▁جان", "ڑ", "د", "ین", "▁کہ", "▁ڈرام", "ے", "▁دی", "▁پیدائش", "▁ک", "سر", "اں", "▁تے", "▁کت", "ھے", "▁ہوئی", "▁آئی", "۔" ] }, { "n": 34, "tokens": [ "اج", "▁اس", "اں", "▁اگر", "▁آپ", "ڑ", "یں", "▁بزرگ", "اں", "▁دی", "▁انہ", "اں", "▁گ", "لا", "ں", "▁تے", "▁غور", "▁نہ", "▁کی", "تا", "▁تے", "▁پچھ", "تا", "وے", "▁دے", "▁سوا", "▁ک", "ج", "▁ہ", "تھ", "▁نہ", "▁آ", "سی", "۔" ] }, { "n": 27, "tokens": [ "اسی", "▁طر", "اں", "▁خیبر", "▁پختونخوا", "▁اچ", "▁بولی", "▁جان", "ڑ", "یں", "▁ولی", "▁دیگر", "▁زبان", "اں", "▁دے", "▁ادب", "▁و", "▁ثقافت", "▁دی", "▁بی", "▁نمائندگی", "▁کی", "تی", "▁گئی", "▁اَ", "ئی", "۔" ] } ], "roberta-urdu": [ { "n": 21, "tokens": [ "ایہ", "ہ", "▁بہت", "▁کہ", "ٹ", "▁لوک", "▁جان", "ڑ", "دین", "▁کہ", "▁ڈرامے", "▁دی", "▁پیدائش", "▁کسر", "اں", "▁تے", "▁کت", "ھے", "▁ہوئی", "▁آئی", "۔" ] }, { "n": 26, "tokens": [ "اج", "▁اساں", "▁اگر", "▁آپ", "ڑیں", "▁بزرگ", "اں", "▁دی", "▁انہ", "اں", "▁گلا", "ں", "▁تے", "▁غور", "▁نہ", "▁کی", "تا", "▁تے", "▁پچھتاوے", "▁دے", "▁سوا", "▁کج", "▁ہتھ", "▁نہ", "▁آسی", "۔" ] }, { "n": 28, "tokens": [ "اسی", "▁طر", "اں", "▁خیبر", "▁پختونخوا", "▁اچ", "▁بولی", "▁جان", "ڑیں", "▁ولی", "▁دیگر", "▁زبان", "اں", "▁دے", "▁ادب", "▁و", "▁ثقافت", "▁دی", "▁بی", "▁نمائندگی", "▁کی", "تی", "▁گئی", "▁ا", "▯", "▯", "ئی", "۔" ] } ], "mt5": [ { "n": 31, "tokens": [ "▁ای", "ہ", "ہ", "▁ب", "ہت", "▁کہ", "ٹ", "▁", "لوک", "▁جان", "ڑ", "دین", "▁کہ", "▁ڈ", "رام", "ے", "▁دی", "▁پی", "دائ", "ش", "▁کس", "ر", "اں", "▁", "تے", "▁کت", "ھے", "▁ہوئ", "ی", "▁آئی", "۔" ] }, { "n": 40, "tokens": [ "▁اج", "▁اس", "اں", "▁", "اگر", "▁آپ", "ڑ", "یں", "▁بزرگ", "اں", "▁دی", "▁ان", "ہاں", "▁گل", "اں", "▁", "تے", "▁", "غور", "▁نہ", "▁کی", "تا", "▁", "تے", "▁پ", "چھ", "تا", "و", "ے", "▁", "دے", "▁سوا", "▁ک", "ج", "▁", "ہ", "تھ", "▁نہ", "▁آس", "ی۔" ] }, { "n": 42, "tokens": [ "▁", "اسی", "▁طر", "اں", "▁خی", "بر", "▁پ", "خت", "و", "نخوا", "▁", "اچ", "▁ب", "ولی", "▁جان", "ڑ", "یں", "▁", "ولی", "▁دیگر", "▁", "زبان", "اں", "▁", "دے", "▁", "ادب", "▁و", "▁", "ثقاف", "ت", "▁دی", "▁بی", "▁نما", "ئ", "ندگی", "▁کی", "تی", "▁گئی", "▁ا", "َ", "ئی۔" ] } ] } }