pub fn hc_head(
gpu: &dyn GpuBackend,
kernel: KernelHandle,
streams: DevicePtr,
head_fn: DevicePtr,
head_scale: DevicePtr,
head_base: DevicePtr,
y_out: DevicePtr,
num_tokens: u32,
hidden_size: u32,
hc_mult: u32,
norm_eps: f32,
hc_eps: f32,
stream: u64,
) -> Result<()>Expand description
Final collapse before the LM head: a single learned sigmoid-weighted sum
over the hc_mult streams. One block per token.