pub fn paged_decode_attn_reduce_fp8(
gpu: &dyn GpuBackend,
kernel: KernelHandle,
workspace: DevicePtr,
output: DevicePtr,
seq_lens: DevicePtr,
num_q_heads: u32,
head_dim: u32,
num_splits: u32,
num_seqs: u32,
stream: u64,
) -> Result<()>Expand description
Reduce split-K partials into final BF16 output (FP8 variant).
Grid: (num_q_heads, num_seqs, 1) Block: (32, 1, 1)