pub fn q4k_mmq_gemm(
gpu: &dyn GpuBackend,
kernel_nc: KernelHandle,
kernel_wc: KernelHandle,
a_q8: DevicePtr,
w_q4k: DevicePtr,
out_bf16: DevicePtr,
m: u32,
n: u32,
k: u32,
stream: u64,
) -> Result<()>Expand description
Q4_K MMQ GEMM: C[m,n] (bf16) = A_q8[m,k] x W_q4k[n,k]. Fused bf16 store.