pub fn mla_q_final_assemble_batched(
gpu: &dyn GpuBackend,
kernel: KernelHandle,
q_absorbed: DevicePtr,
q_rope: DevicePtr,
q_final: DevicePtr,
num_tokens: u32,
nq: u32,
kv_lora: u32,
rope: u32,
mla_cache_dim: u32,
stream: u64,
) -> Result<()>Expand description
Assemble Q_final from Q_absorbed + Q_rope: [absorbed|rope] per head per token.