HDTenEightyP commited on
Commit
563852d
·
verified ·
1 Parent(s): 2bab8d6

Upload 2 files

Browse files
Files changed (2) hide show
  1. maketoken1.py +19 -0
  2. maketoken2.py +25 -0
maketoken1.py ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ from pathlib import Path
2
+
3
+ import tiktoken
4
+ from transformers.integrations.tiktoken import convert_tiktoken_to_fast
5
+
6
+ # Load the tiktoken encoding
7
+ encoding = tiktoken.get_encoding("cl100k_base")
8
+
9
+ # Output directory
10
+ out_dir = Path("hf_tokenizer")
11
+ out_dir.mkdir(exist_ok=True)
12
+
13
+ # Generate tokenizer.json
14
+ convert_tiktoken_to_fast(
15
+ encoding,
16
+ str(out_dir),
17
+ )
18
+
19
+ print(f"Saved {out_dir / 'tokenizer.json'}")
maketoken2.py ADDED
@@ -0,0 +1,25 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ from pathlib import Path
2
+
3
+ import tiktoken
4
+ from transformers.integrations.tiktoken import convert_tiktoken_to_fast
5
+ from transformers import PreTrainedTokenizerFast
6
+
7
+ out_dir = Path("hf_tokenizer")
8
+ out_dir.mkdir(exist_ok=True)
9
+
10
+ # Convert
11
+ encoding = tiktoken.get_encoding("cl100k_base")
12
+ convert_tiktoken_to_fast(encoding, str(out_dir))
13
+
14
+ # Load the generated tokenizer
15
+ tokenizer = PreTrainedTokenizerFast(
16
+ tokenizer_file=str(out_dir / "tokenizer.json"),
17
+ bos_token="<|endoftext|>",
18
+ eos_token="<|endoftext|>",
19
+ unk_token="<|endoftext|>",
20
+ )
21
+
22
+ # Save all Hugging Face tokenizer files
23
+ tokenizer.save_pretrained(out_dir)
24
+
25
+ print(f"Saved tokenizer to {out_dir}")