LLM0to1 Tokenizer

ν•œ/영 이쀑언어 LLM LLM0to1-10b λ₯Ό λ°”λ‹₯λΆ€ν„° ν•™μŠ΅ν•  λ•Œ μ“΄ ν† ν¬λ‚˜μ΄μ €.

ν•­λͺ© κ°’
방식 byte-level BPE
vocab 160,000
νŠΉμˆ˜ν† ν° ChatML (`<
ν•™μŠ΅ μ½”νΌμŠ€ ν•œκ΅­μ–΄Β·μ˜μ–΄Β·μ½”λ“œΒ·μˆ˜ν•™ ν˜Όν•©(ν•œκ΅­μ–΄ 비쀑 상ν–₯)

μ™œ vocab 160k 인가

ν•œκ΅­μ–΄λŠ” ꡐ착어라 ν˜•νƒœμ†Œ 경계가 λ§Žμ•„ μ˜μ–΄κΆŒ ν† ν¬λ‚˜μ΄μ €(32k~50k)λ₯Ό μ“°λ©΄ ν•œ μ–΄μ ˆμ΄ μ—¬λŸ¬ ν† ν°μœΌλ‘œ μͺΌκ°œμ§„λ‹€. 같은 λ¬Έμž₯을 ν‘œν˜„ν•˜λŠ” 토큰 μˆ˜κ°€ 늘면 (a) 유효 μ»¨ν…μŠ€νŠΈκ°€ 쀄고 (b) ν•™μŠ΅ 효율이 λ–¨μ–΄μ§„λ‹€. vocab 을 160k 둜 ν‚€μ›Œ ν•œκ΅­μ–΄ 토큰 νš¨μœ¨μ„ ν™•λ³΄ν–ˆλ‹€.

μ‚¬μš©

from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("izlley2/llm0to1-tokenizer")
print(tok("μ•ˆλ…•ν•˜μ„Έμš”, λ°˜κ°‘μŠ΅λ‹ˆλ‹€.")["input_ids"])

곡개된 토큰화 μ½”νΌμŠ€(llm0to1-pt-tokenized-*)의 .ds νŒŒμΌμ€ 이 ν† ν¬λ‚˜μ΄μ €μ˜ ID 열이닀. λ³΅ν˜Έν™” 방법은 각 데이터셋 μΉ΄λ“œλ₯Ό μ°Έμ‘°.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support