pub fn moe_transpose_u8_batched( gpu: &dyn GpuBackend, kernel: KernelHandle, src_ptrs: DevicePtr, dst_ptrs: DevicePtr, rows: u32, cols: u32, num_experts: u32, stream: u64, ) -> Result<()>