Text Generation
Transformers
Safetensors
Chinese
English
ynet31
custom_code
ymodel
ymodel31
conversational
Instructions to use SnifferCaptain/YModel3.1-200M with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use SnifferCaptain/YModel3.1-200M with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="SnifferCaptain/YModel3.1-200M", trust_remote_code=True) messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("SnifferCaptain/YModel3.1-200M", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use SnifferCaptain/YModel3.1-200M with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "SnifferCaptain/YModel3.1-200M" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SnifferCaptain/YModel3.1-200M", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/SnifferCaptain/YModel3.1-200M
- SGLang
How to use SnifferCaptain/YModel3.1-200M with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "SnifferCaptain/YModel3.1-200M" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SnifferCaptain/YModel3.1-200M", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "SnifferCaptain/YModel3.1-200M" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SnifferCaptain/YModel3.1-200M", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use SnifferCaptain/YModel3.1-200M with Docker Model Runner:
docker model run hf.co/SnifferCaptain/YModel3.1-200M
File size: 2,082 Bytes
e5e01a9 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 | from transformers import PretrainedConfig
class YConfig31(PretrainedConfig):
model_type = "ynet31"
def __init__(self, **kwargs):
self.dropout = kwargs.pop("dropout", 0.0)
self.bos_token_id = kwargs.pop("bos_token_id", 151644)
self.eos_token_id = kwargs.pop("eos_token_id", 151645)
self.pad_token_id = kwargs.pop("pad_token_id", 151643)
self.hidden_act = kwargs.pop("hidden_act", "silu")
self.hidden_size = kwargs.pop("hidden_size", 768)
self.num_hidden_layers = kwargs.pop("num_hidden_layers", 8)
self.max_position_embeddings = kwargs.pop("max_position_embeddings", 8192)
self.vocab_size = kwargs.pop("vocab_size", 6400)
self.rms_norm_eps = kwargs.pop("rms_norm_eps", 1e-6)
self.rope_theta = kwargs.pop("rope_theta", 5e4)
self.rope_scaling = kwargs.pop("rope_scaling", None)
self.dtype = kwargs.pop("dtype", "float32")
self.self_distill = kwargs.pop("self_distill", True)
self.intermediate_size = kwargs.pop("intermediate_size", 1536)
self.num_heads = kwargs.pop("num_heads", 12)
self.mla_kv_lora_rank = kwargs.pop("mla_kv_lora_rank", 64)
self.mla_qk_nope_head_dim = kwargs.pop("mla_qk_nope_head_dim", 64)
self.mla_qk_rope_head_dim = kwargs.pop("mla_qk_rope_head_dim", 32)
self.mla_attn_impl = kwargs.pop("mla_attn_impl", "absorb")
self.qkv_lora = kwargs.pop("qkv_lora", False)
self.gradient_checkpointing = kwargs.pop("gradient_checkpointing", 0)
self.use_sengram = kwargs.pop("use_sengram", True)
self.sengram_bucket_size = kwargs.pop("sengram_bucket_size", 4096)
self.sengram_topk = kwargs.pop("sengram_topk", 2)
self.engram_bucket_size = kwargs.pop("engram_bucket_size", self.sengram_bucket_size)
self.engram_topk = kwargs.pop("engram_topk", self.sengram_topk)
super().__init__(
bos_token_id=self.bos_token_id,
eos_token_id=self.eos_token_id,
pad_token_id=self.pad_token_id,
**kwargs,
)
|