pub fn deinterleave_qg_split_qnorm_mrope(
gpu: &dyn GpuBackend,
kernel: KernelHandle,
data: DevicePtr,
q_out: DevicePtr,
q_norm_weight: DevicePtr,
pos_t: DevicePtr,
pos_h: DevicePtr,
pos_w: DevicePtr,
num_tokens: u32,
num_heads: u32,
head_dim: u32,
stride: u32,
rotary_dim: u32,
eps: f32,
theta: f32,
stream: u64,
) -> Result<()>Expand description
Fused deinterleave Q/Gate + per-head Q RMS norm + MRoPE.
Holo/Qwen3.6 MRoPE prefill fast path. Gate is deinterleaved to
data[q_total..]; Q is deinterleaved, normalized, MRoPE-rotated, then
written to q_out.