| { |
| "model_type": "dgpt", |
| "model_name": "DGPT v1-base", |
| "architectures": ["DGPT"], |
| "vocab_size": 6000, |
| "block_size": 256, |
| "d_model": 384, |
| "n_layer": 6, |
| "n_head": 6, |
| "head_dim": 64, |
| "d_ff": 1536, |
| "activation": "gelu_tanh", |
| "norm": "pre_ln", |
| "positional_embedding": "learned", |
| "tie_word_embeddings": true, |
| "lm_head_bias": false, |
| "parameter_count": 13049856, |
| "final_checkpoint_step": 5000, |
| "tokenizer": { |
| "file": "bpe_6000.json", |
| "type": "byte_level_bpe", |
| "vocab_size": 6000, |
| "schema": "bpt_v1" |
| }, |
| "generation_defaults": { |
| "temperature": 0.8, |
| "top_k": 40, |
| "max_new_tokens": 200 |
| } |
| } |
|
|