#pragma once #include #include torch::Tensor smallm_nvfp4_linear_cuda( const torch::Tensor& input, const torch::Tensor& packed_weight, const torch::Tensor& weight_block_scales, const torch::Tensor& weight_tensor_scale, const std::optional& bias);