README.md CHANGED
@@ -115,7 +115,7 @@ pip install lm-eval[api]
115
  ```
116
  VLLM_ROCM_USE_AITER=1 \
117
  VLLM_ROCM_USE_AITER_MOE=1 \
118
- vllm serve amd/DeepSeek-V4-Pro-NVFP4 \
119
  --host localhost \
120
  --port 8001 \
121
  --dtype auto \
 
115
  ```
116
  VLLM_ROCM_USE_AITER=1 \
117
  VLLM_ROCM_USE_AITER_MOE=1 \
118
+ vllm amd/DeepSeek-V4-Pro-NVFP4 \
119
  --host localhost \
120
  --port 8001 \
121
  --dtype auto \
assets/dsv4_performance.png ADDED

Git LFS Details

  • SHA256: 8fd472981a4c8d40c1845c51c5e8961fc4ef3ac22e7ec77801f534c239c1b30f
  • Pointer size: 132 Bytes
  • Size of remote file: 1 MB
config.json CHANGED
The diff for this file is too large to render. See raw diff
 
inference/__pycache__/model.cpython-312.pyc CHANGED
Binary files a/inference/__pycache__/model.cpython-312.pyc and b/inference/__pycache__/model.cpython-312.pyc differ
 
inference/kernel.py CHANGED
@@ -85,7 +85,7 @@ def act_quant_kernel(
85
  for i, j in T.Parallel(blk_m, group_size):
86
  y_local[i, j] = T.Cast(
87
  out_dtype,
88
- T.Cast(compute_dtype, T.Cast(out_dtype, T.clamp(
89
  x_local[i, j] / s_local[i], fp8_min, fp8_max
90
  ))) * s_local[i],
91
  )
 
85
  for i, j in T.Parallel(blk_m, group_size):
86
  y_local[i, j] = T.Cast(
87
  out_dtype,
88
+ T.Cast(compute_dtype, T.Cast(FP8, T.clamp(
89
  x_local[i, j] / s_local[i], fp8_min, fp8_max
90
  ))) * s_local[i],
91
  )
inference/model.py CHANGED
@@ -624,8 +624,7 @@ class MoE(nn.Module):
624
  self.experts = nn.ModuleList([Expert(args.dim, args.moe_inter_dim, dtype=expert_dtype, swiglu_limit=args.swiglu_limit) if self.experts_start_idx <= i < self.experts_end_idx else None
625
  for i in range(self.n_routed_experts)])
626
  assert args.n_shared_experts == 1
627
- # no swiglu_limit
628
- self.shared_experts = Expert(args.dim, args.moe_inter_dim)
629
 
630
  def forward(self, x: torch.Tensor, input_ids: torch.Tensor) -> torch.Tensor:
631
  shape = x.size()
 
624
  self.experts = nn.ModuleList([Expert(args.dim, args.moe_inter_dim, dtype=expert_dtype, swiglu_limit=args.swiglu_limit) if self.experts_start_idx <= i < self.experts_end_idx else None
625
  for i in range(self.n_routed_experts)])
626
  assert args.n_shared_experts == 1
627
+ self.shared_experts = Expert(args.dim, args.moe_inter_dim, swiglu_limit=args.swiglu_limit)
 
628
 
629
  def forward(self, x: torch.Tensor, input_ids: torch.Tensor) -> torch.Tensor:
630
  shape = x.size()
input_scale.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1df615aed5669b3bde5a8766298f12df4669a3a3baa883dda05fb0fc25a0eca9
3
+ size 7311108
model-00064-of-00064.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a144e2c5c67ea788d78e7e4df84f82740dbd859711cdde5bed084048f3bbbd33
3
- size 13956848916
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:46fa7b6b16fc1f56b28be0424a34cc6f06ca2c4a550d2741c5efdd28e623bbb1
3
+ size 13964140292
model.safetensors.index.json CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aff908e93ceb3a22e4229cef498716ecaeb698e2d6defd1bc4d83f835c479e58
3
- size 23130112
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6c3658a0ac088136056edb8652e9c53aa4e76d0e0b808e10806a72c2cf4dfad2
3
+ size 23762560