File size: 4,049 Bytes
81d15d7
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
{
  "source": "/home/admin/LLaDA-Image-Multi-step/text_encoder",
  "output": "/home/admin/LLaDA-Image-Multi-step-text-encoder-fp8-block128-dynamic",
  "format": "float8_e4m3fn",
  "weight_quantization": "symmetric absmax RTN per expert 2-D block",
  "weight_block_size": [
    128,
    128
  ],
  "weight_scale_shape": "[experts, ceil(N/block_n), ceil(K/block_k)]",
  "activation_quantization": "dynamic symmetric absmax RTN per token",
  "quantized_tensors": [
    "model.language_model.layers.1.mlp.experts.down_proj",
    "model.language_model.layers.1.mlp.experts.gate_proj",
    "model.language_model.layers.1.mlp.experts.up_proj",
    "model.language_model.layers.2.mlp.experts.down_proj",
    "model.language_model.layers.2.mlp.experts.gate_proj",
    "model.language_model.layers.2.mlp.experts.up_proj",
    "model.language_model.layers.3.mlp.experts.down_proj",
    "model.language_model.layers.3.mlp.experts.gate_proj",
    "model.language_model.layers.3.mlp.experts.up_proj",
    "model.language_model.layers.4.mlp.experts.down_proj",
    "model.language_model.layers.4.mlp.experts.gate_proj",
    "model.language_model.layers.4.mlp.experts.up_proj",
    "model.language_model.layers.5.mlp.experts.gate_proj",
    "model.language_model.layers.5.mlp.experts.up_proj",
    "model.language_model.layers.10.mlp.experts.down_proj",
    "model.language_model.layers.10.mlp.experts.gate_proj",
    "model.language_model.layers.10.mlp.experts.up_proj",
    "model.language_model.layers.11.mlp.experts.gate_proj",
    "model.language_model.layers.11.mlp.experts.up_proj",
    "model.language_model.layers.5.mlp.experts.down_proj",
    "model.language_model.layers.6.mlp.experts.down_proj",
    "model.language_model.layers.6.mlp.experts.gate_proj",
    "model.language_model.layers.6.mlp.experts.up_proj",
    "model.language_model.layers.7.mlp.experts.down_proj",
    "model.language_model.layers.7.mlp.experts.gate_proj",
    "model.language_model.layers.7.mlp.experts.up_proj",
    "model.language_model.layers.8.mlp.experts.down_proj",
    "model.language_model.layers.8.mlp.experts.gate_proj",
    "model.language_model.layers.8.mlp.experts.up_proj",
    "model.language_model.layers.9.mlp.experts.down_proj",
    "model.language_model.layers.9.mlp.experts.gate_proj",
    "model.language_model.layers.9.mlp.experts.up_proj",
    "model.language_model.layers.11.mlp.experts.down_proj",
    "model.language_model.layers.12.mlp.experts.down_proj",
    "model.language_model.layers.12.mlp.experts.gate_proj",
    "model.language_model.layers.12.mlp.experts.up_proj",
    "model.language_model.layers.13.mlp.experts.down_proj",
    "model.language_model.layers.13.mlp.experts.gate_proj",
    "model.language_model.layers.13.mlp.experts.up_proj",
    "model.language_model.layers.14.mlp.experts.down_proj",
    "model.language_model.layers.14.mlp.experts.gate_proj",
    "model.language_model.layers.14.mlp.experts.up_proj",
    "model.language_model.layers.15.mlp.experts.down_proj",
    "model.language_model.layers.15.mlp.experts.gate_proj",
    "model.language_model.layers.15.mlp.experts.up_proj",
    "model.language_model.layers.16.mlp.experts.down_proj",
    "model.language_model.layers.16.mlp.experts.gate_proj",
    "model.language_model.layers.16.mlp.experts.up_proj",
    "model.language_model.layers.17.mlp.experts.down_proj",
    "model.language_model.layers.17.mlp.experts.gate_proj",
    "model.language_model.layers.17.mlp.experts.up_proj",
    "model.language_model.layers.18.mlp.experts.down_proj",
    "model.language_model.layers.18.mlp.experts.gate_proj",
    "model.language_model.layers.18.mlp.experts.up_proj",
    "model.language_model.layers.19.mlp.experts.down_proj",
    "model.language_model.layers.19.mlp.experts.gate_proj",
    "model.language_model.layers.19.mlp.experts.up_proj"
  ],
  "quantized_tensor_count": 57,
  "tensor_bytes": 17348419072,
  "elapsed_seconds": 43.155,
  "runtime_note": "Real FP8 torch._scaled_mm reference path on CUDA; custom grouped FP8 MoE kernel needed for production throughput."
}