File size: 2,407 Bytes
3d25c99
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
{
 "split_H_bits": 3.0,
 "corpus_bytes": 8192000,
 "rows": [
  {
   "tokenizer": "bert-wordpiece",
   "tokens": 30517,
   "word_frac": 0.469,
   "divides_frac": 0.27,
   "cohesive_frac": 0.73,
   "mean_internal_Hmax_bits": 2.587,
   "secs": 1.3
  },
  {
   "tokenizer": "byt5-control",
   "tokens": 256,
   "word_frac": 0.301,
   "divides_frac": 0.0,
   "cohesive_frac": 0.0,
   "mean_internal_Hmax_bits": 0.0,
   "secs": 0.0
  },
  {
   "tokenizer": "cl100k_base",
   "tokens": 100256,
   "word_frac": 0.32,
   "divides_frac": 0.287,
   "cohesive_frac": 0.713,
   "mean_internal_Hmax_bits": 2.544,
   "secs": 3.0
  },
  {
   "tokenizer": "deepseek-v3",
   "tokens": 127997,
   "word_frac": 0.216,
   "divides_frac": 0.317,
   "cohesive_frac": 0.683,
   "mean_internal_Hmax_bits": 2.606,
   "secs": 2.7
  },
  {
   "tokenizer": "gpt2",
   "tokens": 50256,
   "word_frac": 0.479,
   "divides_frac": 0.343,
   "cohesive_frac": 0.657,
   "mean_internal_Hmax_bits": 2.67,
   "secs": 0.9
  },
  {
   "tokenizer": "llama3",
   "tokens": 128000,
   "word_frac": 0.251,
   "divides_frac": 0.283,
   "cohesive_frac": 0.717,
   "mean_internal_Hmax_bits": 2.528,
   "secs": 2.6
  },
  {
   "tokenizer": "mistral-v03",
   "tokens": 31997,
   "word_frac": 0.413,
   "divides_frac": 0.292,
   "cohesive_frac": 0.708,
   "mean_internal_Hmax_bits": 2.577,
   "secs": 0.6
  },
  {
   "tokenizer": "o200k_base",
   "tokens": 199998,
   "word_frac": 0.167,
   "divides_frac": 0.288,
   "cohesive_frac": 0.712,
   "mean_internal_Hmax_bits": 2.522,
   "secs": 4.0
  },
  {
   "tokenizer": "qwen3-newest",
   "tokens": 248044,
   "word_frac": 0.128,
   "divides_frac": 0.299,
   "cohesive_frac": 0.701,
   "mean_internal_Hmax_bits": 2.557,
   "secs": 4.7
  },
  {
   "tokenizer": "smollm2",
   "tokens": 49135,
   "word_frac": 0.502,
   "divides_frac": 0.356,
   "cohesive_frac": 0.644,
   "mean_internal_Hmax_bits": 2.703,
   "secs": 0.8
  },
  {
   "tokenizer": "t5-unigram",
   "tokens": 31997,
   "word_frac": 0.482,
   "divides_frac": 0.348,
   "cohesive_frac": 0.652,
   "mean_internal_Hmax_bits": 2.695,
   "secs": 0.6
  },
  {
   "tokenizer": "xlmr",
   "tokens": 249997,
   "word_frac": 0.047,
   "divides_frac": 0.282,
   "cohesive_frac": 0.718,
   "mean_internal_Hmax_bits": 2.489,
   "secs": 4.8
  }
 ]
}