File size: 3,592 Bytes
2c11bfb
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
{
  "name": "s3",
  "promoted_utc": "2026-08-12T00:15:33Z",
  "engine_git_rev": "85dbea6cfcd0e15651177135dc60b7b273c41445",
  "engine_tree_dirty": true,
  "base_model": "0xSero/DeepSeek-V4-Flash-0731-REAP",
  "base_source_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
  "base_source_revision": "9e165c30e2704aec5d9d593cce3eebd58bbef1cb",
  "reap": {
    "original_experts_per_layer": 256,
    "kept_experts_per_layer": 160
  },
  "measurement": {
    "protocol": "8-prompt suite (scripts/prompt_suite.json, one per category), NGEN0>=200 so tau is past the drafter's 128-token sliding window (F92); block 6, adaptK 1.50; clean run; canonical 6-token prompt is a CONTROL, excluded from the mean (F96).",
    "suite_mean_tau": 3.8438,
    "suite_mean_tok_s": 25.5312,
    "base_ar_tok_s": 13.8,
    "n_suite_prompts": 8,
    "per_prompt": [
      {
        "block": 6,
        "prompt": 0,
        "tau": 2.87,
        "ms_tok": 46.9,
        "tok_s": 21.33
      },
      {
        "block": 6,
        "prompt": 1,
        "tau": 3.64,
        "ms_tok": 40.7,
        "tok_s": 24.55
      },
      {
        "block": 6,
        "prompt": 2,
        "tau": 4.2,
        "ms_tok": 36.8,
        "tok_s": 27.16
      },
      {
        "block": 6,
        "prompt": 3,
        "tau": 2.49,
        "ms_tok": 53.1,
        "tok_s": 18.83
      },
      {
        "block": 6,
        "prompt": 4,
        "tau": 3.06,
        "ms_tok": 43.9,
        "tok_s": 22.8
      },
      {
        "block": 6,
        "prompt": 5,
        "tau": 3.94,
        "ms_tok": 41.0,
        "tok_s": 24.39
      },
      {
        "block": 6,
        "prompt": 6,
        "tau": 6.09,
        "ms_tok": 28.5,
        "tok_s": 35.08
      },
      {
        "block": 6,
        "prompt": 7,
        "tau": 3.85,
        "ms_tok": 37.5,
        "tok_s": 26.7
      },
      {
        "block": 6,
        "prompt": 8,
        "tau": 3.48,
        "ms_tok": 40.4,
        "tok_s": 24.74
      }
    ],
    "lossless_gate": "PASS"
  },
  "incumbent_at_promotion": {
    "name": "s1",
    "suite_tau": 3.5762,
    "suite_tok_s": 24.515
  },
  "notes": "",
  "files": [
    {
      "file": "config.json",
      "bytes": 3602,
      "sha256": "de9ea59b8bba4cc49f67b4d6a30cebb148ab465aebc57225b355158477a56c8e"
    },
    {
      "file": "model-00046-of-00048.safetensors",
      "bytes": 2326148920,
      "sha256": "83b75bc919c160062ae09c7a4d24ed1646d4b1ee074d07484f5fc4b3d20047c8"
    },
    {
      "file": "model-00047-of-00048.safetensors",
      "bytes": 2275805696,
      "sha256": "8d44875f651e1b4f29748d8da7e853592dc139e6e122a34e5ca68e8f6021d7fd"
    },
    {
      "file": "model-00048-of-00048.safetensors",
      "bytes": 2408468996,
      "sha256": "938d6f17100a1ea766528f66c7d952004342a8b00ca2be956f75299e25ca7df2"
    },
    {
      "file": "model.safetensors.index.json",
      "bytes": 213205,
      "sha256": "3c6ca0116218bd358ad3b8ca8ab067194585edb187d594aef9f42986ec5fe50f"
    },
    {
      "file": "mtp_trained.safetensors",
      "bytes": 1034643326,
      "sha256": "5dd3ae629d3d504f80ab9de23e47db54a475bd162f93188277b3832efd507038"
    }
  ],
  "promoted": true,
  "trained_tensors_present": true,
  "rebuild": "Loadable head regenerated from mtp_trained.safetensors with tools/build_trained_head.py --base <checkpoint> --trained mtp_trained.safetensors --out <dir>; deterministic, self-checked.",
  "training": {
    "sessions": 3,
    "corpus": "1536 prompts balanced 8 ways (1472 train / 64 hold-out)",
    "chunks": 3,
    "steps": 1472,
    "loss": "0.9736 -> 0.0405 (tail mean 0.4446)"
  }
}