Nanbeige4.2-3B-EAGLE3 / train_command.txt
NullSense's picture
Thinking-aware retrain: 4 epochs on 28.6k corpus (45% thinking traces); val cond_acc 0.622 -> 0.685/0.697/0.715. Thinking-mode acceptance 0.33->0.41 (+23%), thinking throughput 244->272 tok/s. Card, chart, val_metrics, train_command updated.
0a266f9 verified
Raw
History Blame Contribute Delete
793 Bytes
# Timestamp: 2026-07-24T01:32:00.798123+00:00
# Git SHA: a9bc1194176fecf33c2feafd91f42f0ea466c313
# World size: 1
# speculators: 0.6.0.dev0
# vllm: not installed
# transformers: 5.14.1
# torch: 2.12.1
# compressed-tensors: not installed
scripts/train.py --verifier-name-or-path /home/nullsense/.lmstudio/models/local/Nanbeige4.2-3B-FP8-Dynamic --trust-remote-code --data-path /home/nullsense/Programming/llm-stack/bench/data/eagle-prepared-thinking --vllm-endpoint http://127.0.0.1:8005/v1 --hidden-states-path /home/nullsense/Programming/llm-stack/bench/data/hidden_states --save-path /home/nullsense/Programming/llm-stack/bench/data/eagle-ckpts-thinking --draft-vocab-size 32000 --target-layer-ids 3 23 41 --epochs 4 --lr 1e-4 --total-seq-len 4096 --on-missing generate --on-generate delete