// Copyright (c) OpenMMLab. All rights reserved. #include "src/turbomind/kernels/gemm/types.h" #include #include #pragma once namespace turbomind::gemm { template void Quantize(const thrust::universal_vector& x, int m, int k, Order order, int group_size, thrust::universal_vector& x_p, // pseudo-quantized thrust::universal_vector& x_q, // quantized ushort thrust::universal_vector& x_u, // scales & zeros (always m-major) cudaStream_t stream); }