pub fn moe_w4a16_grouped_gemm(
gpu: &dyn GpuBackend,
kernel: KernelHandle,
a: DevicePtr,
b_packed: DevicePtr,
b_scale: DevicePtr,
scale2: f32,
c: DevicePtr,
expert_offsets: DevicePtr,
num_experts: u32,
n: u32,
k: u32,
stream: u64,
) -> Result<()>Expand description
MoE grouped GEMM: per-expert W4A16 matrix multiply.