LLM0to1 Tokenizer
ν/μ μ΄μ€μΈμ΄ LLM LLM0to1-10b λ₯Ό λ°λ₯λΆν° νμ΅ν λ μ΄ ν ν¬λμ΄μ .
| νλͺ© | κ° |
|---|---|
| λ°©μ | byte-level BPE |
| vocab | 160,000 |
| νΉμν ν° | ChatML (`< |
| νμ΅ μ½νΌμ€ | νκ΅μ΄Β·μμ΄Β·μ½λΒ·μν νΌν©(νκ΅μ΄ λΉμ€ μν₯) |
μ vocab 160k μΈκ°
νκ΅μ΄λ κ΅μ°©μ΄λΌ ννμ κ²½κ³κ° λ§μ μμ΄κΆ ν ν¬λμ΄μ (32k~50k)λ₯Ό μ°λ©΄ ν μ΄μ μ΄ μ¬λ¬ ν ν°μΌλ‘ μͺΌκ°μ§λ€. κ°μ λ¬Έμ₯μ νννλ ν ν° μκ° λλ©΄ (a) μ ν¨ μ»¨ν μ€νΈκ° μ€κ³ (b) νμ΅ ν¨μ¨μ΄ λ¨μ΄μ§λ€. vocab μ 160k λ‘ ν€μ νκ΅μ΄ ν ν° ν¨μ¨μ ν보νλ€.
μ¬μ©
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("izlley2/llm0to1-tokenizer")
print(tok("μλ
νμΈμ, λ°κ°μ΅λλ€.")["input_ids"])
곡κ°λ ν ν°ν μ½νΌμ€(llm0to1-pt-tokenized-*)μ .ds νμΌμ μ΄ ν ν¬λμ΄μ μ ID μ΄μ΄λ€.
볡νΈν λ°©λ²μ κ° λ°μ΄ν°μ
μΉ΄λλ₯Ό μ°Έμ‘°.
Inference Providers NEW
This model isn't deployed by any Inference Provider. π Ask for provider support