patrickbdevaney's picture
Upload folder using huggingface_hub
2c11bfb verified
Raw
History Blame Contribute Delete
3.59 kB
{
"name": "s3",
"promoted_utc": "2026-08-12T00:15:33Z",
"engine_git_rev": "85dbea6cfcd0e15651177135dc60b7b273c41445",
"engine_tree_dirty": true,
"base_model": "0xSero/DeepSeek-V4-Flash-0731-REAP",
"base_source_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
"base_source_revision": "9e165c30e2704aec5d9d593cce3eebd58bbef1cb",
"reap": {
"original_experts_per_layer": 256,
"kept_experts_per_layer": 160
},
"measurement": {
"protocol": "8-prompt suite (scripts/prompt_suite.json, one per category), NGEN0>=200 so tau is past the drafter's 128-token sliding window (F92); block 6, adaptK 1.50; clean run; canonical 6-token prompt is a CONTROL, excluded from the mean (F96).",
"suite_mean_tau": 3.8438,
"suite_mean_tok_s": 25.5312,
"base_ar_tok_s": 13.8,
"n_suite_prompts": 8,
"per_prompt": [
{
"block": 6,
"prompt": 0,
"tau": 2.87,
"ms_tok": 46.9,
"tok_s": 21.33
},
{
"block": 6,
"prompt": 1,
"tau": 3.64,
"ms_tok": 40.7,
"tok_s": 24.55
},
{
"block": 6,
"prompt": 2,
"tau": 4.2,
"ms_tok": 36.8,
"tok_s": 27.16
},
{
"block": 6,
"prompt": 3,
"tau": 2.49,
"ms_tok": 53.1,
"tok_s": 18.83
},
{
"block": 6,
"prompt": 4,
"tau": 3.06,
"ms_tok": 43.9,
"tok_s": 22.8
},
{
"block": 6,
"prompt": 5,
"tau": 3.94,
"ms_tok": 41.0,
"tok_s": 24.39
},
{
"block": 6,
"prompt": 6,
"tau": 6.09,
"ms_tok": 28.5,
"tok_s": 35.08
},
{
"block": 6,
"prompt": 7,
"tau": 3.85,
"ms_tok": 37.5,
"tok_s": 26.7
},
{
"block": 6,
"prompt": 8,
"tau": 3.48,
"ms_tok": 40.4,
"tok_s": 24.74
}
],
"lossless_gate": "PASS"
},
"incumbent_at_promotion": {
"name": "s1",
"suite_tau": 3.5762,
"suite_tok_s": 24.515
},
"notes": "",
"files": [
{
"file": "config.json",
"bytes": 3602,
"sha256": "de9ea59b8bba4cc49f67b4d6a30cebb148ab465aebc57225b355158477a56c8e"
},
{
"file": "model-00046-of-00048.safetensors",
"bytes": 2326148920,
"sha256": "83b75bc919c160062ae09c7a4d24ed1646d4b1ee074d07484f5fc4b3d20047c8"
},
{
"file": "model-00047-of-00048.safetensors",
"bytes": 2275805696,
"sha256": "8d44875f651e1b4f29748d8da7e853592dc139e6e122a34e5ca68e8f6021d7fd"
},
{
"file": "model-00048-of-00048.safetensors",
"bytes": 2408468996,
"sha256": "938d6f17100a1ea766528f66c7d952004342a8b00ca2be956f75299e25ca7df2"
},
{
"file": "model.safetensors.index.json",
"bytes": 213205,
"sha256": "3c6ca0116218bd358ad3b8ca8ab067194585edb187d594aef9f42986ec5fe50f"
},
{
"file": "mtp_trained.safetensors",
"bytes": 1034643326,
"sha256": "5dd3ae629d3d504f80ab9de23e47db54a475bd162f93188277b3832efd507038"
}
],
"promoted": true,
"trained_tensors_present": true,
"rebuild": "Loadable head regenerated from mtp_trained.safetensors with tools/build_trained_head.py --base <checkpoint> --trained mtp_trained.safetensors --out <dir>; deterministic, self-checked.",
"training": {
"sessions": 3,
"corpus": "1536 prompts balanced 8 ways (1472 train / 64 hold-out)",
"chunks": 3,
"steps": 1472,
"loss": "0.9736 -> 0.0405 (tail mean 0.4446)"
}
}