File size: 664 Bytes
563852d
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
from pathlib import Path

import tiktoken
from transformers.integrations.tiktoken import convert_tiktoken_to_fast
from transformers import PreTrainedTokenizerFast

out_dir = Path("hf_tokenizer")
out_dir.mkdir(exist_ok=True)

# Convert
encoding = tiktoken.get_encoding("cl100k_base")
convert_tiktoken_to_fast(encoding, str(out_dir))

# Load the generated tokenizer
tokenizer = PreTrainedTokenizerFast(
    tokenizer_file=str(out_dir / "tokenizer.json"),
    bos_token="<|endoftext|>",
    eos_token="<|endoftext|>",
    unk_token="<|endoftext|>",
)

# Save all Hugging Face tokenizer files
tokenizer.save_pretrained(out_dir)

print(f"Saved tokenizer to {out_dir}")