v6: DSpark speculator for Qwen/Qwen3-8B
Browse files- model.safetensors +1 -1
- optimizer_state_dict.pt +1 -1
- scheduler_state_dict.pt +1 -1
- train_command.txt +2 -2
- training_state.json +1 -1
- val_metrics.json +1 -1
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 3698655482
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b20e89945730a7ca568a8ca2c1972cfd080a8b65167cfe8d5e78e594d877dec6
|
| 3 |
size 3698655482
|
optimizer_state_dict.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 4382932183
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:818fe93e6c1cdff9e4309078807135242c72f23d34959cf785ce6d472936ddfc
|
| 3 |
size 4382932183
|
scheduler_state_dict.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1531
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:391a8af730e464ea274b496f17a92a956edec037ab0a897a8548d5f88dc80d66
|
| 3 |
size 1531
|
train_command.txt
CHANGED
|
@@ -1,4 +1,4 @@
|
|
| 1 |
-
# Timestamp: 2026-07-
|
| 2 |
# Git SHA: unknown
|
| 3 |
# World size: 7
|
| 4 |
# speculators: 0.7.0.dev67
|
|
@@ -6,4 +6,4 @@
|
|
| 6 |
# transformers: 5.12.1
|
| 7 |
# torch: 2.11.0+gitd0c8b1f
|
| 8 |
# compressed-tensors: 0.17.0
|
| 9 |
-
/opt/speculators/scripts/train.py --verifier-name-or-path Qwen/Qwen3-8B --data-path /root/checkpoints/dspark-qwen3-8b --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-qwen3-8b/checkpoints --draft-vocab-size 32000 --epochs
|
|
|
|
| 1 |
+
# Timestamp: 2026-07-08T00:13:19.465780+00:00
|
| 2 |
# Git SHA: unknown
|
| 3 |
# World size: 7
|
| 4 |
# speculators: 0.7.0.dev67
|
|
|
|
| 6 |
# transformers: 5.12.1
|
| 7 |
# torch: 2.11.0+gitd0c8b1f
|
| 8 |
# compressed-tensors: 0.17.0
|
| 9 |
+
/opt/speculators/scripts/train.py --verifier-name-or-path Qwen/Qwen3-8B --data-path /root/checkpoints/dspark-qwen3-8b --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-qwen3-8b/checkpoints --draft-vocab-size 32000 --epochs 5 --lr 3e-4 --total-seq-len 8192 --speculator-type dspark --block-size 3 --max-anchors 3072 --num-layers 5 --target-layer-ids 2 10 18 26 34 --markov-rank 256 --markov-head-type vanilla --enable-confidence-head --confidence-head-with-markov --loss-fn '{"ce": 0.1, "tv": 0.9}' --confidence-head-alpha 1.0 --on-missing generate --on-generate delete
|
training_state.json
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
{"epoch": 2, "local_step": 0, "global_step":
|
|
|
|
| 1 |
+
{"epoch": 2, "local_step": 0, "global_step": 10733}
|
val_metrics.json
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
{"confidence_loss_epoch": 0.
|
|
|
|
| 1 |
+
{"confidence_loss_epoch": 0.3996266642677222, "confidence_abs_error_epoch": 0.02379905994113253, "confidence_pred_mean_epoch": 0.09513526574331277, "confidence_cumprod_bias_epoch": 0.00793046181361493, "loss_epoch": 0.016264476283496487, "ce_loss_epoch": 0.026335223726050332, "tv_loss_epoch": 0.006086843472545549, "accept_rate_epoch": 0.6540066899581706, "accept_len_epoch": 2.2047277528849136, "full_acc_epoch": 0.6681219985246512, "position_1_acc_epoch": 0.744284980053469, "position_2_acc_epoch": 0.5918931619895018}
|