SIL-v01 / config.json
Brich627's picture
Upload folder using huggingface_hub
50aa7f9 verified
Raw
History Blame Contribute Delete
650 Bytes
{
"architecture": "BigramLanguageModel",
"architecture_description": "Token + position embeddings -> n_layer stacked transformer blocks (pre-norm multi-head causal self-attention + feedforward, residual connections) -> final LayerNorm -> linear head to vocab logits.",
"vocab_size": 65,
"n_embd": 128,
"n_head": 4,
"n_layer": 4,
"block_size": 32,
"tokenizer_type": "char",
"tokenizer_file": "tokenizer_char.json",
"weights_file": "model.safetensors",
"training": {
"dataset": "tinyshakespeare.txt",
"batch_size": 32,
"learning_rate": 0.001,
"max_iters": 8000,
"seed": 1337
},
"parameter_count": 812609
}