mpashkovskii commited on
Commit
5d73a80
·
verified ·
1 Parent(s): 3c2de64

v6: DSpark speculator for Qwen/Qwen3-8B

Browse files
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:906bc669040eae2937761b4bc49445e0d391aecb6a568455f92af919ced01899
3
  size 3698655482
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b20e89945730a7ca568a8ca2c1972cfd080a8b65167cfe8d5e78e594d877dec6
3
  size 3698655482
optimizer_state_dict.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fa22a25f89be1098338a3e10e262d085e655a69af14f2007a8161dc31349cde4
3
  size 4382932183
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:818fe93e6c1cdff9e4309078807135242c72f23d34959cf785ce6d472936ddfc
3
  size 4382932183
scheduler_state_dict.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ae8bdb5b1082458b73bb100f9bbe2a2ed964e2deb07f25139d6f3f391c73e32b
3
  size 1531
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:391a8af730e464ea274b496f17a92a956edec037ab0a897a8548d5f88dc80d66
3
  size 1531
train_command.txt CHANGED
@@ -1,4 +1,4 @@
1
- # Timestamp: 2026-07-05T19:51:36.400742+00:00
2
  # Git SHA: unknown
3
  # World size: 7
4
  # speculators: 0.7.0.dev67
@@ -6,4 +6,4 @@
6
  # transformers: 5.12.1
7
  # torch: 2.11.0+gitd0c8b1f
8
  # compressed-tensors: 0.17.0
9
- /opt/speculators/scripts/train.py --verifier-name-or-path Qwen/Qwen3-8B --data-path /root/checkpoints/dspark-qwen3-8b --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-qwen3-8b/checkpoints --draft-vocab-size 32000 --epochs 3 --lr 6e-4 --total-seq-len 8192 --speculator-type dspark --block-size 3 --max-anchors 3072 --num-layers 5 --target-layer-ids 2 10 18 26 34 --markov-rank 256 --markov-head-type vanilla --enable-confidence-head --confidence-head-with-markov --loss-fn '{"ce": 0.1, "tv": 0.9}' --confidence-head-alpha 1.0 --on-missing generate --on-generate delete
 
1
+ # Timestamp: 2026-07-08T00:13:19.465780+00:00
2
  # Git SHA: unknown
3
  # World size: 7
4
  # speculators: 0.7.0.dev67
 
6
  # transformers: 5.12.1
7
  # torch: 2.11.0+gitd0c8b1f
8
  # compressed-tensors: 0.17.0
9
+ /opt/speculators/scripts/train.py --verifier-name-or-path Qwen/Qwen3-8B --data-path /root/checkpoints/dspark-qwen3-8b --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-qwen3-8b/checkpoints --draft-vocab-size 32000 --epochs 5 --lr 3e-4 --total-seq-len 8192 --speculator-type dspark --block-size 3 --max-anchors 3072 --num-layers 5 --target-layer-ids 2 10 18 26 34 --markov-rank 256 --markov-head-type vanilla --enable-confidence-head --confidence-head-with-markov --loss-fn '{"ce": 0.1, "tv": 0.9}' --confidence-head-alpha 1.0 --on-missing generate --on-generate delete
training_state.json CHANGED
@@ -1 +1 @@
1
- {"epoch": 2, "local_step": 0, "global_step": 587}
 
1
+ {"epoch": 2, "local_step": 0, "global_step": 10733}
val_metrics.json CHANGED
@@ -1 +1 @@
1
- {"confidence_loss_epoch": 0.25086241883116883, "confidence_abs_error_epoch": 0.013971688660649219, "confidence_pred_mean_epoch": 0.014361865892396556, "confidence_cumprod_bias_epoch": -0.004484090220730676, "loss_epoch": 0.03129141266896369, "ce_loss_epoch": 0.11486217863768884, "tv_loss_epoch": 0.01632073283858998, "accept_rate_epoch": 0.10017822537685692, "accept_len_epoch": 1.1141400127519911, "full_acc_epoch": 0.133498061819924, "position_1_acc_epoch": 0.13688798396589572, "position_2_acc_epoch": 0.13009628563888204}
 
1
+ {"confidence_loss_epoch": 0.3996266642677222, "confidence_abs_error_epoch": 0.02379905994113253, "confidence_pred_mean_epoch": 0.09513526574331277, "confidence_cumprod_bias_epoch": 0.00793046181361493, "loss_epoch": 0.016264476283496487, "ce_loss_epoch": 0.026335223726050332, "tv_loss_epoch": 0.006086843472545549, "accept_rate_epoch": 0.6540066899581706, "accept_len_epoch": 2.2047277528849136, "full_acc_epoch": 0.6681219985246512, "position_1_acc_epoch": 0.744284980053469, "position_2_acc_epoch": 0.5918931619895018}