# Timestamp: 2026-07-08T13:58:11.876820+00:00 # Git SHA: unknown # World size: 20 # speculators: 0.6.0.dev0 # vllm: 0.1.dev1+gee53abf1a.precompiled # transformers: 5.12.1 # torch: 2.11.0+cu129 # compressed-tensors: 0.17.0 scripts/train.py --verifier-name-or-path /scratch/model-cache/models--nvidia--GLM-5.2-NVFP4/snapshots/aec724e8c7b8ee9db3b48c01c320f63f9cdaf8aa --trust-remote-code --speculator-type dspark --num-layers 5 --block-size 16 --draft-arch qwen3 --draft-hidden-act silu --target-layer-ids 8 23 39 55 70 --max-anchors 1024 --markov-rank 256 --enable-confidence-head --confidence-head-with-markov --loss-fn '{"ce": 0.1, "tv": 0.9}' --confidence-head-alpha 1.0 --data-path /work/output-regen --vllm-endpoint http://172.16.1.4:8000/v1,http://172.16.1.6:8000/v1,http://172.16.1.3:8000/v1,http://172.16.1.11:8000/v1,http://172.16.1.10:8000/v1,http://172.16.1.12:8000/v1,http://172.16.1.9:8000/v1,http://172.16.1.2:8000/v1,http://172.16.1.1:8000/v1,http://172.16.1.5:8000/v1 --hidden-states-backend mooncake --mooncake-master 10.100.1.1:50051 --mooncake-metadata-server P2PHANDSHAKE --mooncake-protocol tcp --on-missing generate --on-generate delete --save-path /work/checkpoints --epochs 10 --lr 6e-4 --scheduler-type cosine --total-seq-len 4096 --checkpoint-freq 0.2 --seed 42 --log-freq 10 --prefetch-factor 2 --num-workers 8 --logger wandb --log-dir /work/logs