File size: 6,933 Bytes
4276ff5
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
{
  "tokenizer_config": {
    "name": "sudanizer-72k",
    "version": "1.0.0",
    "vocab_size": 72000,
    "min_frequency": 3,
    "limit_alphabet": 5000,
    "pre_tokenizer": "whitespace",
    "dialect_normalization": false,
    "hamza_normalization": true
  },
  "training_metrics": {
    "total_samples": 500,
    "total_characters": 86872,
    "total_tokens": 19153,
    "total_words": 16772,
    "avg_chars_per_token": 4.536,
    "compression_ratio": 0.2205,
    "unk_count": 0,
    "unk_rate_percent": 0.0,
    "avg_subwords_per_word": 1.159,
    "vocab_size": 72000,
    "max_tokens_in_sample": 868,
    "min_tokens_in_sample": 2,
    "avg_tokens_per_sample": 38.31
  },
  "comprehensive_evaluation": {
    "by_category": {
      "pure_dialect": {
        "total_samples": 10,
        "total_characters": 311,
        "total_tokens": 66,
        "total_words": 62,
        "avg_chars_per_token": 4.712,
        "compression_ratio": 0.2122,
        "unk_count": 0,
        "unk_rate_percent": 0.0,
        "avg_subwords_per_word": 1.064,
        "vocab_size": 72000,
        "max_tokens_in_sample": 8,
        "min_tokens_in_sample": 5,
        "avg_tokens_per_sample": 6.6
      },
      "code_switching": {
        "total_samples": 8,
        "total_characters": 349,
        "total_tokens": 156,
        "total_words": 53,
        "avg_chars_per_token": 2.237,
        "compression_ratio": 0.447,
        "unk_count": 0,
        "unk_rate_percent": 0.0,
        "avg_subwords_per_word": 2.984,
        "vocab_size": 72000,
        "max_tokens_in_sample": 27,
        "min_tokens_in_sample": 13,
        "avg_tokens_per_sample": 19.5
      },
      "social_media": {
        "total_samples": 10,
        "total_characters": 378,
        "total_tokens": 129,
        "total_words": 72,
        "avg_chars_per_token": 2.93,
        "compression_ratio": 0.3413,
        "unk_count": 29,
        "unk_rate_percent": 22.4806,
        "avg_subwords_per_word": 1.853,
        "vocab_size": 72000,
        "max_tokens_in_sample": 25,
        "min_tokens_in_sample": 10,
        "avg_tokens_per_sample": 12.9
      },
      "formal": {
        "total_samples": 5,
        "total_characters": 356,
        "total_tokens": 68,
        "total_words": 51,
        "avg_chars_per_token": 5.235,
        "compression_ratio": 0.191,
        "unk_count": 1,
        "unk_rate_percent": 1.4706,
        "avg_subwords_per_word": 1.315,
        "vocab_size": 72000,
        "max_tokens_in_sample": 19,
        "min_tokens_in_sample": 9,
        "avg_tokens_per_sample": 13.6
      },
      "edge_case": {
        "total_samples": 8,
        "total_characters": 355,
        "total_tokens": 76,
        "total_words": 50,
        "avg_chars_per_token": 4.671,
        "compression_ratio": 0.2141,
        "unk_count": 1,
        "unk_rate_percent": 1.3158,
        "avg_subwords_per_word": 1.525,
        "vocab_size": 72000,
        "max_tokens_in_sample": 13,
        "min_tokens_in_sample": 8,
        "avg_tokens_per_sample": 9.5
      },
      "morphology": {
        "total_samples": 8,
        "total_characters": 216,
        "total_tokens": 48,
        "total_words": 40,
        "avg_chars_per_token": 4.5,
        "compression_ratio": 0.2222,
        "unk_count": 0,
        "unk_rate_percent": 0.0,
        "avg_subwords_per_word": 1.205,
        "vocab_size": 72000,
        "max_tokens_in_sample": 8,
        "min_tokens_in_sample": 4,
        "avg_tokens_per_sample": 6.0
      },
      "cultural": {
        "total_samples": 8,
        "total_characters": 267,
        "total_tokens": 59,
        "total_words": 49,
        "avg_chars_per_token": 4.525,
        "compression_ratio": 0.221,
        "unk_count": 0,
        "unk_rate_percent": 0.0,
        "avg_subwords_per_word": 1.187,
        "vocab_size": 72000,
        "max_tokens_in_sample": 12,
        "min_tokens_in_sample": 5,
        "avg_tokens_per_sample": 7.38
      },
      "mixed_content": {
        "total_samples": 8,
        "total_characters": 224,
        "total_tokens": 81,
        "total_words": 33,
        "avg_chars_per_token": 2.765,
        "compression_ratio": 0.3616,
        "unk_count": 1,
        "unk_rate_percent": 1.2346,
        "avg_subwords_per_word": 3.017,
        "vocab_size": 72000,
        "max_tokens_in_sample": 18,
        "min_tokens_in_sample": 5,
        "avg_tokens_per_sample": 10.12
      }
    },
    "by_difficulty": {
      "easy": {
        "total_samples": 4,
        "total_characters": 157,
        "total_tokens": 28,
        "total_words": 28,
        "avg_chars_per_token": 5.607,
        "compression_ratio": 0.1783,
        "unk_count": 0,
        "unk_rate_percent": 0.0,
        "avg_subwords_per_word": 1.0,
        "vocab_size": 72000,
        "max_tokens_in_sample": 9,
        "min_tokens_in_sample": 5,
        "avg_tokens_per_sample": 7.0
      },
      "medium": {
        "total_samples": 22,
        "total_characters": 721,
        "total_tokens": 167,
        "total_words": 129,
        "avg_chars_per_token": 4.317,
        "compression_ratio": 0.2316,
        "unk_count": 4,
        "unk_rate_percent": 2.3952,
        "avg_subwords_per_word": 1.349,
        "vocab_size": 72000,
        "max_tokens_in_sample": 16,
        "min_tokens_in_sample": 4,
        "avg_tokens_per_sample": 7.59
      },
      "hard": {
        "total_samples": 27,
        "total_characters": 1073,
        "total_tokens": 315,
        "total_words": 180,
        "avg_chars_per_token": 3.406,
        "compression_ratio": 0.2936,
        "unk_count": 21,
        "unk_rate_percent": 6.6667,
        "avg_subwords_per_word": 1.794,
        "vocab_size": 72000,
        "max_tokens_in_sample": 27,
        "min_tokens_in_sample": 5,
        "avg_tokens_per_sample": 11.67
      },
      "extreme": {
        "total_samples": 12,
        "total_characters": 505,
        "total_tokens": 173,
        "total_words": 73,
        "avg_chars_per_token": 2.919,
        "compression_ratio": 0.3426,
        "unk_count": 7,
        "unk_rate_percent": 4.0462,
        "avg_subwords_per_word": 2.748,
        "vocab_size": 72000,
        "max_tokens_in_sample": 27,
        "min_tokens_in_sample": 6,
        "avg_tokens_per_sample": 14.42
      }
    },
    "overall": {
      "total_samples": 65,
      "total_characters": 2456,
      "total_tokens": 683,
      "total_words": 410,
      "avg_chars_per_token": 3.596,
      "compression_ratio": 0.2781,
      "unk_count": 32,
      "unk_rate_percent": 4.6852,
      "avg_subwords_per_word": 1.771,
      "vocab_size": 72000,
      "max_tokens_in_sample": 27,
      "min_tokens_in_sample": 4,
      "avg_tokens_per_sample": 10.51
    },
    "problematic_samples_count": 18
  },
  "benchmark_results": {
    "Sudanizer-72K-v2": {
      "avg_chars_per_token": 3.596,
      "unk_rate_percent": 4.6852,
      "avg_subwords_per_word": 1.771,
      "total_tokens": 683
    }
  }
}