Upload folder using huggingface_hub
Browse files- config.json +4 -4
- model.safetensors +1 -1
- optimizer_state_dict.pt +2 -2
- scheduler_state_dict.pt +1 -1
- train_command.txt +5 -5
- training_state.json +1 -1
- val_metrics.json +1 -1
config.json
CHANGED
|
@@ -12,7 +12,7 @@
|
|
| 12 |
44,
|
| 13 |
58
|
| 14 |
],
|
| 15 |
-
"block_size":
|
| 16 |
"confidence_head_with_markov": true,
|
| 17 |
"draft_vocab_size": 32000,
|
| 18 |
"dtype": "bfloat16",
|
|
@@ -29,7 +29,7 @@
|
|
| 29 |
{
|
| 30 |
"accept_tolerance": 0.0,
|
| 31 |
"proposal_type": "greedy",
|
| 32 |
-
"speculative_tokens":
|
| 33 |
"verifier_accept_k": 1
|
| 34 |
}
|
| 35 |
],
|
|
@@ -41,7 +41,7 @@
|
|
| 41 |
}
|
| 42 |
},
|
| 43 |
"speculators_model_type": "dspark",
|
| 44 |
-
"speculators_version": "0.7.0.
|
| 45 |
"target_hidden_size": null,
|
| 46 |
"tie_word_embeddings": false,
|
| 47 |
"transformer_layer_config": {
|
|
@@ -79,5 +79,5 @@
|
|
| 79 |
"use_sliding_window": true,
|
| 80 |
"vocab_size": 262144
|
| 81 |
},
|
| 82 |
-
"transformers_version": "5.
|
| 83 |
}
|
|
|
|
| 12 |
44,
|
| 13 |
58
|
| 14 |
],
|
| 15 |
+
"block_size": 7,
|
| 16 |
"confidence_head_with_markov": true,
|
| 17 |
"draft_vocab_size": 32000,
|
| 18 |
"dtype": "bfloat16",
|
|
|
|
| 29 |
{
|
| 30 |
"accept_tolerance": 0.0,
|
| 31 |
"proposal_type": "greedy",
|
| 32 |
+
"speculative_tokens": 7,
|
| 33 |
"verifier_accept_k": 1
|
| 34 |
}
|
| 35 |
],
|
|
|
|
| 41 |
}
|
| 42 |
},
|
| 43 |
"speculators_model_type": "dspark",
|
| 44 |
+
"speculators_version": "0.7.0.dev139",
|
| 45 |
"target_hidden_size": null,
|
| 46 |
"tie_word_embeddings": false,
|
| 47 |
"transformer_layer_config": {
|
|
|
|
| 79 |
"use_sliding_window": true,
|
| 80 |
"vocab_size": 262144
|
| 81 |
},
|
| 82 |
+
"transformers_version": "5.14.1"
|
| 83 |
}
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 8392293242
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4bfcff067cc3161dae8aa9bb5536ef88d021507e3a0176b894f863db5636e150
|
| 3 |
size 8392293242
|
optimizer_state_dict.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d43b48404c128a19c80cbaab229eff3ef888ba73a9c9bacc9c9ce1c05f031647
|
| 3 |
+
size 5229315395
|
scheduler_state_dict.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1595
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ba34cc46f2e30d70885b68bdc60861da6e3dce0de34b982f0a07e116293a9763
|
| 3 |
size 1595
|
train_command.txt
CHANGED
|
@@ -1,9 +1,9 @@
|
|
| 1 |
-
# Timestamp: 2026-
|
| 2 |
# Git SHA: unknown
|
| 3 |
# World size: 4
|
| 4 |
-
# speculators: 0.7.0.
|
| 5 |
-
# vllm: 0.
|
| 6 |
-
# transformers: 5.
|
| 7 |
# torch: 2.11.0+gitd0c8b1f
|
| 8 |
# compressed-tensors: 0.17.0
|
| 9 |
-
/opt/speculators/scripts/train.py --verifier-name-or-path google/gemma-4-31B-it --data-path /root/checkpoints/dspark-gemma-4-31b-it --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-gemma-4-31b-it/checkpoints --draft-vocab-size 32000 --epochs
|
|
|
|
| 1 |
+
# Timestamp: 2026-08-02T20:53:02.741808+00:00
|
| 2 |
# Git SHA: unknown
|
| 3 |
# World size: 4
|
| 4 |
+
# speculators: 0.7.0.dev139
|
| 5 |
+
# vllm: 0.26.1rc1.dev124+gb88916617.rocm723
|
| 6 |
+
# transformers: 5.14.1
|
| 7 |
# torch: 2.11.0+gitd0c8b1f
|
| 8 |
# compressed-tensors: 0.17.0
|
| 9 |
+
/opt/speculators/scripts/train.py --verifier-name-or-path google/gemma-4-31B-it --data-path /root/checkpoints/dspark-gemma-4-31b-it --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-gemma-4-31b-it/checkpoints --draft-vocab-size 32000 --epochs 8 --lr 3e-4 --total-seq-len 16192 --speculator-type dspark --block-size 7 --max-anchors 3072 --num-layers 5 --target-layer-ids 2 16 30 44 58 --markov-rank 256 --markov-head-type vanilla --enable-confidence-head --confidence-head-with-markov --loss-fn '{"ce": 0.1, "tv": 0.9}' --confidence-head-alpha 1.0 --on-missing generate --on-generate delete
|
training_state.json
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
{"epoch":
|
|
|
|
| 1 |
+
{"epoch": 6, "local_step": 0, "global_step": 26248}
|
val_metrics.json
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
{"confidence_loss_epoch": 0.
|
|
|
|
| 1 |
+
{"confidence_loss_epoch": 0.22941962631334836, "confidence_abs_error_epoch": 0.23409851500112305, "confidence_pred_mean_epoch": 0.714368267090698, "confidence_cumprod_bias_epoch": 0.027661999249851795, "loss_epoch": 0.4403597301401216, "ce_loss_epoch": 0.7203570891678476, "tv_loss_epoch": 0.15433813563963678, "accept_rate_epoch": 0.6662950701215066, "accept_len_epoch": 4.377738570256564, "full_acc_epoch": 0.6933521783475963, "position_0_acc_epoch": 0.8375186844296937, "position_1_acc_epoch": 0.7722282128821543, "position_2_acc_epoch": 0.7215868290785079, "position_3_acc_epoch": 0.6797965955808237, "position_4_acc_epoch": 0.6437401483464871, "position_5_acc_epoch": 0.6128903746150118, "position_6_acc_epoch": 0.5836444158271235}
|