pub fn scaled_add(
gpu: &dyn GpuBackend,
kernel: KernelHandle,
output: DevicePtr,
src: DevicePtr,
scale: f32,
num_elements: u32,
stream: u64,
) -> Result<()>Expand description
BF16 scaled accumulate: output[i] += scale * src[i].
Kernel: bf16_scaled_add(output, src, scale, n)
Grid: (ceil(n/256), 1, 1) Block: (256, 1, 1)