moe_weighted_sum_blend_batch2

Function moe_weighted_sum_blend_batch2 

Source
pub fn moe_weighted_sum_blend_batch2(
    gpu: &dyn GpuBackend,
    kernel: KernelHandle,
    output: DevicePtr,
    expert_out: DevicePtr,
    expert_weights: DevicePtr,
    shared_out: DevicePtr,
    input: DevicePtr,
    gate_weight: DevicePtr,
    hidden: u32,
    top_k: u32,
    k: u32,
    stream: u64,
) -> Result<()>
Expand description

Fused weighted sum + sigmoid blend for K=2 tokens.

blockIdx.y = token index (0 or 1). Each block computes gate scalar independently from per-token input and shared gate weight.

Grid: (ceil(hidden/256), 2, 1) Block: (256, 1, 1)