Wald-4B / serving.json
Harry19081's picture
Serving default: effort none (one pass); Auto 0.7 stays available with "effort": "auto"
4127efd verified
Raw History Blame Contribute Delete
1.17 kB
{
"engine": "native-v2-vision",
"checkpoint": "056A0-c31",
"variant": "vision: 056A0-c31 language model (426 tensors, byte-identical) + Qwen/Qwen3.5-4B@851bf6e8 chat vision tower (297) + chat MTP head (15) = 738 keys; Qwen3_5ForConditionalGeneration",
"model_sha256": "5a8553b9452e8a655774ef449bad20f79d02783ed258b65068a230db0e07da4c",
"effort": "none",
"prompt_format": "repeat_state_plain",
"max_model_len": 131072,
"thought_budget": 512,
"temperature": "temperature.json",
"temperature_sha256": "a0f72cd2d0a653e81051e5a0c77fc1a69131552a8102b580a93a6dbe7908b2da",
"vision": {
"server": "wald-serve-native-vision",
"image_prompt_format": "plain",
"max_images": 16,
"vllm_args": [
"--limit-mm-per-prompt",
"{\"image\": 16, \"video\": 0}",
"--mm-processor-kwargs",
"{\"size\": {\"shortest_edge\": 65536, \"longest_edge\": 1048576}}",
"--trust-request-chat-template"
]
},
"vllm": {
"version": "0.30.0",
"transformers": "5.17.0",
"args": [
"--max-model-len",
"131072",
"--gpu-memory-utilization",
"0.85",
"--max-num-seqs",
"128",
"--seed",
"0"
],
"env": {
"VLLM_USE_FLASHINFER_SAMPLER": "0"
}
}
}