mla_q_final_assemble_batched

Function mla_q_final_assemble_batched 

Source
pub fn mla_q_final_assemble_batched(
    gpu: &dyn GpuBackend,
    kernel: KernelHandle,
    q_absorbed: DevicePtr,
    q_rope: DevicePtr,
    q_final: DevicePtr,
    num_tokens: u32,
    nq: u32,
    kv_lora: u32,
    rope: u32,
    mla_cache_dim: u32,
    stream: u64,
) -> Result<()>
Expand description

Assemble Q_final from Q_absorbed + Q_rope: [absorbed|rope] per head per token.