{ "tokenizer_name": "sudanizer-72k", "tokenizer_version": "1.0.0", "corpus_domain": "social+stories+youtube+qa", "vocab_size": 72000, "min_frequency": 3, "pre_tokenizer_mode": "whitespace", "dialect_normalization": false, "special_tokens": [ "", "", "", "", "", "" ], "additional_special_tokens": [ "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "", "" ], "corpus_stats": { "total_lines": 609024, "total_characters": 126490282, "total_words": 24414457, "files_processed": 2, "total_files": 2, "avg_line_length": 207.69342751681378, "avg_words_per_line": 40.087840544871796, "min_line_length": 10, "max_line_length": 26332 }, "training_stats": { "training_time_seconds": 24.370618104934692, "final_vocab_size": 72000, "training_files": [ "./output/sudanizer/training_corpus.txt" ] }, "evaluation_metrics": { "total_samples": 500, "total_characters": 86872, "total_tokens": 19153, "total_words": 16772, "avg_chars_per_token": 4.536, "compression_ratio": 0.2205, "unk_count": 0, "unk_rate_percent": 0.0, "avg_subwords_per_word": 1.159, "vocab_size": 72000, "max_tokens_in_sample": 868, "min_tokens_in_sample": 2, "avg_tokens_per_sample": 38.31 } }