ljcamargo commited on
Commit
eb1db11
·
verified ·
1 Parent(s): f377ec8

Upload recipe/train_config.yaml with huggingface_hub

Browse files
Files changed (1) hide show
  1. recipe/train_config.yaml +129 -0
recipe/train_config.yaml ADDED
@@ -0,0 +1,129 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ recipe_version: hf-bytelevel-bpe-v1
2
+ algorithm:
3
+ model: BPE
4
+ pre_tokenizer: ByteLevel
5
+ byte_level_use_regex: false
6
+ byte_level_add_prefix_space: false
7
+ normalizer: null
8
+ decoder: ByteLevel
9
+ post_processor: ByteLevel
10
+ trainer:
11
+ vocab_size: 256000
12
+ min_frequency: 2
13
+ initial_alphabet: ByteLevel.alphabet()
14
+ special_tokens:
15
+ - <|pad|>
16
+ - <|startoftext|>
17
+ - <|endoftext|>
18
+ - <|unk|>
19
+ - <|im_start|>
20
+ - <|im_end|>
21
+ - <|tool_call_start|>
22
+ - <|tool_call_end|>
23
+ - <|tool_response_start|>
24
+ - <|tool_response_end|>
25
+ - <|reasoning_start|>
26
+ - <|reasoning_end|>
27
+ - <|fim_prefix|>
28
+ - <|fim_middle|>
29
+ - <|fim_suffix|>
30
+ - <|fim_pad|>
31
+ - <|repo_name|>
32
+ - <|file_sep|>
33
+ - <|lang:all|>
34
+ - <|lang:amu|>
35
+ - <|lang:amu0|>
36
+ - <|lang:azg|>
37
+ - <|lang:azn0|>
38
+ - <|lang:azz|>
39
+ - <|lang:cco|>
40
+ - <|lang:cco0|>
41
+ - <|lang:chd|>
42
+ - <|lang:chf|>
43
+ - <|lang:chq|>
44
+ - <|lang:ctp0|>
45
+ - <|lang:ctu|>
46
+ - <|lang:cux|>
47
+ - <|lang:de|>
48
+ - <|lang:en-US|>
49
+ - <|lang:eng|>
50
+ - <|lang:es-MX|>
51
+ - <|lang:fr|>
52
+ - <|lang:hch|>
53
+ - <|lang:hus|>
54
+ - <|lang:huv|>
55
+ - <|lang:lac|>
56
+ - <|lang:mam|>
57
+ - <|lang:mau|>
58
+ - <|lang:maz|>
59
+ - <|lang:meh|>
60
+ - <|lang:mfy|>
61
+ - <|lang:mix|>
62
+ - <|lang:mmc|>
63
+ - <|lang:nch|>
64
+ - <|lang:ntp|>
65
+ - <|lang:ocu|>
66
+ - <|lang:ots|>
67
+ - <|lang:pei|>
68
+ - <|lang:pia|>
69
+ - <|lang:pmq|>
70
+ - <|lang:poi|>
71
+ - <|lang:pt-BR|>
72
+ - <|lang:pua|>
73
+ - <|lang:quc|>
74
+ - <|lang:sei|>
75
+ - <|lang:spa|>
76
+ - <|lang:tar0|>
77
+ - <|lang:toj|>
78
+ - <|lang:top|>
79
+ - <|lang:tpp|>
80
+ - <|lang:tpx|>
81
+ - <|lang:trs|>
82
+ - <|lang:tsz|>
83
+ - <|lang:tzh|>
84
+ - <|lang:tzo|>
85
+ - <|lang:unk|>
86
+ - <|lang:var|>
87
+ - <|lang:yaq|>
88
+ - <|lang:yua|>
89
+ - <|lang:zai|>
90
+ - <|lang:zam|>
91
+ - <|lang:zoc|>
92
+ - <|lang:zoq|>
93
+ - <|reserved_0|>
94
+ - <|reserved_1|>
95
+ - <|reserved_2|>
96
+ - <|reserved_3|>
97
+ - <|reserved_4|>
98
+ - <|reserved_5|>
99
+ - <|reserved_6|>
100
+ - <|reserved_7|>
101
+ - <|reserved_8|>
102
+ - <|reserved_9|>
103
+ - <|reserved_10|>
104
+ - <|reserved_11|>
105
+ - <|reserved_12|>
106
+ - <|reserved_13|>
107
+ - <|reserved_14|>
108
+ - <|reserved_15|>
109
+ corpus_weights:
110
+ exotic: 0.7
111
+ english: 0.1
112
+ spanish: 0.1
113
+ code: 0.1
114
+ corpus_bytes:
115
+ modern: 24824308
116
+ old: 10197249
117
+ eng: 5002329
118
+ spa: 5000693
119
+ code: 5002607
120
+ exotic: 35021557
121
+ sources:
122
+ exotic: tachiwin/tokenizer_train
123
+ english: uonlp/CulturaX:en
124
+ spanish: uonlp/CulturaX:es
125
+ code: bigcode/the-stack-smol
126
+ checkpoint_strategy:
127
+ type: completed-artifact-resume
128
+ description: Corpus preparation and final tokenizer are resumable via Hub. HF BpeTrainer
129
+ does not expose an internal merge-state checkpoint.