LLM0to1-10b โ€” step 83000

๋ฐ”๋‹ฅ๋ถ€ํ„ฐ ํ•™์Šตํ•œ ~10B ํ•œ/์˜ ์ด์ค‘์–ธ์–ด LLM์˜ ์‚ฌ์ „ํ•™์Šต ์ค‘๊ฐ„ ์ฒดํฌํฌ์ธํŠธ์ž…๋‹ˆ๋‹ค.

โš ๏ธ base ๋ชจ๋ธ โ€” instruction/chat ํŠœ๋‹์ด ๋˜์–ด ์žˆ์ง€ ์•Š์Šต๋‹ˆ๋‹ค. โš ๏ธ LR ๊ฐ์‡ (anneal) ์ด์ „ ์ฒดํฌํฌ์ธํŠธ๋กœ ์ƒ์„ฑ ํ’ˆ์งˆ์ด ๋‚ฎ์Šต๋‹ˆ๋‹ค. ์—ฐ๊ตฌ ๋ชฉ์  ์•„์นด์ด๋ธŒ์ž…๋‹ˆ๋‹ค.

์ŠคํŽ™

ํ•ญ๋ชฉ ๊ฐ’
์•„ํ‚คํ…์ฒ˜ SmolLM3ForCausalLM
ํŒŒ๋ผ๋ฏธํ„ฐ ์•ฝ 10B (dense)
hidden / layers 4096 / 44
heads 32 Q / 8 KV (GQA), head_dim 128
intermediate 13312
vocab 160,000 (์ž์ฒด ํ•™์Šต ํ† ํฌ๋‚˜์ด์ €)
์ปจํ…์ŠคํŠธ 4096
dtype bfloat16
๊ธฐํƒ€ qk_norm, z-loss, partial RoPE(4๋ ˆ์ด์–ด๋งˆ๋‹ค ์ƒ๋žต)

ํ•™์Šต

  • ํ”„๋ ˆ์ž„์›Œํฌ: nanotron
  • ์˜ตํ‹ฐ๋งˆ์ด์ €: ํ•˜์ด๋ธŒ๋ฆฌ๋“œ Muon(2D ํ–‰๋ ฌ) + AdamW(์ž„๋ฒ ๋”ฉ/norm)
  • LR: WSD ์Šค์ผ€์ค„, stable 2e-4 (์ด ์ฒดํฌํฌ์ธํŠธ๋Š” stable ๊ตฌ๊ฐ„)
  • global batch: 2.1M ํ† ํฐ (512 ร— 4096)
  • ํ•™์Šต๋Ÿ‰: ์•ฝ 175B ํ† ํฐ

์‚ฌ์šฉ๋ฒ•

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
m = "izlley2/LLM0to1-10b-step83000"
tok = AutoTokenizer.from_pretrained(m)
model = AutoModelForCausalLM.from_pretrained(m, dtype=torch.bfloat16, device_map="auto")
ids = tok("๋Œ€ํ•œ๋ฏผ๊ตญ์˜ ์ˆ˜๋„๋Š”", return_tensors="pt").to(model.device)
print(tok.decode(model.generate(**ids, max_new_tokens=32)[0], skip_special_tokens=True))

์ด์–ด์„œ ์‚ฌ์ „ํ•™์Šตํ•˜๋ ค๋ฉด ์›๋ณธ nanotron ์ฒดํฌํฌ์ธํŠธ(์˜ตํ‹ฐ๋งˆ์ด์ € ์ƒํƒœ ํฌํ•จ)๋ฅผ ์‚ฌ์šฉํ•˜์„ธ์š”: izlley2/LLM0to1-10b-step83000-nanotron

์ฃผ์˜

  • ์•ˆ์ „์„ฑ ์ •๋ ฌ(alignment)์ด ๋˜์–ด ์žˆ์ง€ ์•Š์Šต๋‹ˆ๋‹ค.
  • ํ•™์Šต ๋ฐ์ดํ„ฐ์— ์ด์šฉ์•ฝ๊ด€์ด ์žˆ๋Š” ๊ตญ๋‚ด ์ฝ”ํผ์Šค๊ฐ€ ํฌํ•จ๋˜์–ด ์žˆ์–ด ์—ฐ๊ตฌ ๋ชฉ์ ์œผ๋กœ ์ œํ•œํ•ฉ๋‹ˆ๋‹ค. ์ƒ์—…์  ์ด์šฉ ์ „ ํ™•์ธ์ด ํ•„์š”ํ•ฉ๋‹ˆ๋‹ค.
Downloads last month
100
Safetensors
Model size
10B params
Tensor type
BF16
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support