nano-case / config.json
vukrosic's picture
nano-case 1M-param identifier case model: weights, inference, benchmark, tests, report
e243b41 verified
Raw
History Blame Contribute Delete
1.01 kB
{
"model_type": "nano-case",
"architecture": "decoder-only transformer (pre-norm)",
"vocab_size": 256,
"tokenizer": "byte (raw UTF-8 bytes, no vocab file)",
"dim": 128,
"n_layers": 4,
"n_heads": 4,
"n_kv_heads": 2,
"head_dim": 32,
"ffn": "swiglu",
"ffn_mult": 4,
"norm": "rmsnorm",
"norm_eps": 1e-05,
"positional": "rope",
"rope_theta": 10000.0,
"max_seq_len": 64,
"tie_word_embeddings": true,
"params": 1016960,
"training": {
"task": "messy identifier -> target case style (snake/kebab/camel/pascal/const)",
"data": "100% code-generated (sample words from a fixed ~120-token vocab, render gold canonically, corrupt a copy into a messy input; ~45% boundary-destroyed)",
"objective": "SFT, prompt-masked cross-entropy (only the target identifier + newline EOS supervised)",
"steps": 12000,
"batch_size": 64,
"seq_len": 64,
"optimizer": "adamw",
"lr": 0.003,
"schedule": "cosine",
"warmup_steps": 200,
"final_val_loss": 0.0013
}
}