Transformers
Safetensors
English
mla
deepseek-moe
mtp
custom-code
tinystories
from-scratch
Eval Results (legacy)
Instructions to use nowordsxiaomu/DeepSeek-Flash-Mini with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use nowordsxiaomu/DeepSeek-Flash-Mini with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("nowordsxiaomu/DeepSeek-Flash-Mini", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "vocab_size": 8192, | |
| "dim": 256, | |
| "n_layers": 6, | |
| "max_seq_len": 512, | |
| "norm_eps": 1e-05, | |
| "dropout": 0.0, | |
| "tie_embeddings": true, | |
| "n_heads": 8, | |
| "q_lora_rank": 0, | |
| "kv_lora_rank": 64, | |
| "qk_nope_head_dim": 32, | |
| "qk_rope_head_dim": 16, | |
| "v_head_dim": 32, | |
| "attn_impl": "naive", | |
| "rope_theta": 10000.0, | |
| "rope_scaling": 1.0, | |
| "n_dense_layers": 1, | |
| "dense_inter_dim": 704, | |
| "moe_inter_dim": 256, | |
| "n_routed_experts": 8, | |
| "n_shared_experts": 1, | |
| "n_activated_experts": 2, | |
| "n_expert_groups": 1, | |
| "n_limited_groups": 1, | |
| "score_func": "sigmoid", | |
| "route_scale": 1.0, | |
| "bias_update_speed": 0.001, | |
| "aux_loss_alpha": 0.001, | |
| "n_mtp": 1, | |
| "mtp_loss_weight": 0.3 | |
| } |