olka-amd commited on
Commit
f9be1e1
·
verified ·
1 Parent(s): 5e5e8a7

Upload folder using huggingface_hub

Browse files
config.json CHANGED
@@ -12,7 +12,7 @@
12
  44,
13
  58
14
  ],
15
- "block_size": 5,
16
  "confidence_head_with_markov": true,
17
  "draft_vocab_size": 32000,
18
  "dtype": "bfloat16",
@@ -29,7 +29,7 @@
29
  {
30
  "accept_tolerance": 0.0,
31
  "proposal_type": "greedy",
32
- "speculative_tokens": 5,
33
  "verifier_accept_k": 1
34
  }
35
  ],
@@ -41,7 +41,7 @@
41
  }
42
  },
43
  "speculators_model_type": "dspark",
44
- "speculators_version": "0.7.0.dev109",
45
  "target_hidden_size": null,
46
  "tie_word_embeddings": false,
47
  "transformer_layer_config": {
@@ -79,5 +79,5 @@
79
  "use_sliding_window": true,
80
  "vocab_size": 262144
81
  },
82
- "transformers_version": "5.13.1"
83
  }
 
12
  44,
13
  58
14
  ],
15
+ "block_size": 7,
16
  "confidence_head_with_markov": true,
17
  "draft_vocab_size": 32000,
18
  "dtype": "bfloat16",
 
29
  {
30
  "accept_tolerance": 0.0,
31
  "proposal_type": "greedy",
32
+ "speculative_tokens": 7,
33
  "verifier_accept_k": 1
34
  }
35
  ],
 
41
  }
42
  },
43
  "speculators_model_type": "dspark",
44
+ "speculators_version": "0.7.0.dev139",
45
  "target_hidden_size": null,
46
  "tie_word_embeddings": false,
47
  "transformer_layer_config": {
 
79
  "use_sliding_window": true,
80
  "vocab_size": 262144
81
  },
82
+ "transformers_version": "5.14.1"
83
  }
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f2d96c525d0fdc72e05ec8d7af817d309b34bbcf9a5ccadf7c7f18a4c5107361
3
  size 8392293242
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4bfcff067cc3161dae8aa9bb5536ef88d021507e3a0176b894f863db5636e150
3
  size 8392293242
optimizer_state_dict.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8efa8e8f70b3c2a74d35e4d68f49a45df93746d6df9c0d59ddd53196dcf45572
3
- size 5229303253
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d43b48404c128a19c80cbaab229eff3ef888ba73a9c9bacc9c9ce1c05f031647
3
+ size 5229315395
scheduler_state_dict.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aeb1e1dea72cfda534f8a12670cab6c5cc0ecfa278c5fb06dd7c11e50066cf29
3
  size 1595
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ba34cc46f2e30d70885b68bdc60861da6e3dce0de34b982f0a07e116293a9763
3
  size 1595
train_command.txt CHANGED
@@ -1,9 +1,9 @@
1
- # Timestamp: 2026-07-22T10:47:07.508299+00:00
2
  # Git SHA: unknown
3
  # World size: 4
4
- # speculators: 0.7.0.dev109
5
- # vllm: 0.23.1rc1.dev1373+g387189c42.rocm723
6
- # transformers: 5.13.1
7
  # torch: 2.11.0+gitd0c8b1f
8
  # compressed-tensors: 0.17.0
9
- /opt/speculators/scripts/train.py --verifier-name-or-path google/gemma-4-31B-it --data-path /root/checkpoints/dspark-gemma-4-31b-it --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-gemma-4-31b-it/checkpoints --draft-vocab-size 32000 --epochs 5 --lr 3e-4 --total-seq-len 16384 --speculator-type dspark --block-size 5 --max-anchors 3072 --num-layers 5 --target-layer-ids 2 16 30 44 58 --markov-rank 256 --markov-head-type vanilla --enable-confidence-head --confidence-head-with-markov --loss-fn '{"ce": 0.1, "tv": 0.9}' --confidence-head-alpha 1.0 --on-missing generate --on-generate delete
 
1
+ # Timestamp: 2026-08-02T20:53:02.741808+00:00
2
  # Git SHA: unknown
3
  # World size: 4
4
+ # speculators: 0.7.0.dev139
5
+ # vllm: 0.26.1rc1.dev124+gb88916617.rocm723
6
+ # transformers: 5.14.1
7
  # torch: 2.11.0+gitd0c8b1f
8
  # compressed-tensors: 0.17.0
9
+ /opt/speculators/scripts/train.py --verifier-name-or-path google/gemma-4-31B-it --data-path /root/checkpoints/dspark-gemma-4-31b-it --vllm-endpoint http://localhost:8000/v1 --save-path /root/checkpoints/dspark-gemma-4-31b-it/checkpoints --draft-vocab-size 32000 --epochs 8 --lr 3e-4 --total-seq-len 16192 --speculator-type dspark --block-size 7 --max-anchors 3072 --num-layers 5 --target-layer-ids 2 16 30 44 58 --markov-rank 256 --markov-head-type vanilla --enable-confidence-head --confidence-head-with-markov --loss-fn '{"ce": 0.1, "tv": 0.9}' --confidence-head-alpha 1.0 --on-missing generate --on-generate delete
training_state.json CHANGED
@@ -1 +1 @@
1
- {"epoch": 3, "local_step": 0, "global_step": 2945}
 
1
+ {"epoch": 6, "local_step": 0, "global_step": 26248}
val_metrics.json CHANGED
@@ -1 +1 @@
1
- {"confidence_loss_epoch": 0.2491363363340497, "confidence_abs_error_epoch": 0.1984864820561744, "confidence_pred_mean_epoch": 0.6748715574353612, "confidence_cumprod_bias_epoch": 0.03222104390558387, "loss_epoch": 0.545694263651967, "ce_loss_epoch": 1.0459719762206077, "tv_loss_epoch": 0.2132897051051259, "accept_rate_epoch": 0.6381456377519457, "accept_len_epoch": 2.8701543960892795, "full_acc_epoch": 0.6693012452416284, "position_0_acc_epoch": 0.7981486002604167, "position_1_acc_epoch": 0.7166242885314065, "position_2_acc_epoch": 0.6573011225585679, "position_3_acc_epoch": 0.6084938223120844, "position_4_acc_epoch": 0.5649162242407726}
 
1
+ {"confidence_loss_epoch": 0.22941962631334836, "confidence_abs_error_epoch": 0.23409851500112305, "confidence_pred_mean_epoch": 0.714368267090698, "confidence_cumprod_bias_epoch": 0.027661999249851795, "loss_epoch": 0.4403597301401216, "ce_loss_epoch": 0.7203570891678476, "tv_loss_epoch": 0.15433813563963678, "accept_rate_epoch": 0.6662950701215066, "accept_len_epoch": 4.377738570256564, "full_acc_epoch": 0.6933521783475963, "position_0_acc_epoch": 0.8375186844296937, "position_1_acc_epoch": 0.7722282128821543, "position_2_acc_epoch": 0.7215868290785079, "position_3_acc_epoch": 0.6797965955808237, "position_4_acc_epoch": 0.6437401483464871, "position_5_acc_epoch": 0.6128903746150118, "position_6_acc_epoch": 0.5836444158271235}