List of all items
Structs
- engine::GenerateResult
- factory::DflashBuildArgs
- factory::LoraBuildArgs
- forward::qwen3_5::FullAttentionLayer
- forward::qwen3_5::FullAttentionScratch
- forward::qwen3_5::LayerKvCache
- forward::qwen3_5::LinearAttentionLayer
- forward::qwen3_5::LinearAttentionScratch
- forward::qwen3_5::LinearAttentionState
- forward::qwen3_5::Qwen35ForwardConfig
- forward::qwen3_5::Qwen35Kernels
- layer::AttnLayerState
- layer::AttnMetadataDev
- layer::BatchedAttnMetadata
- layer::EmptyLayerState
- layer::ForwardContext
- layer::GdnPrefillBuffers
- layer::MidchunkCapture
- layer::SsmLayerState
- layers::deepseek_v4_mtp::DeepseekV4MtpHead
- layers::deepseek_v4_mtp::DeepseekV4MtpProposerState
- layers::dense_ffn::DenseFfnLayer
- layers::dense_ffn::DenseFfnWeights
- layers::dense_ffn::DenseFfnWeightsBf16
- layers::dense_ffn::DenseFfnWeightsFp8
- layers::dense_ffn::DenseFfnWeightsQ2
- layers::dflash_head::BlockDiffusionDraftHead
- layers::dflash_head::DflashKernels
- layers::dflash_head::DflashLayer
- layers::dflash_head::DflashProposerState
- layers::dflash_head::DflashScratch
- layers::ep_dispatch::EpRoutingTable
- layers::fp8_calibration::Fp8KvCalibration
- layers::glm5next_dsa::Glm5NextDsaConfig
- layers::glm5next_dsa::Glm5NextDsaKernels
- layers::glm5next_dsa::attend::DsaDecodeInputs
- layers::glm5next_dsa::attend::DsaDecodePaging
- layers::glm5next_dsa::attend::Glm5NextDsaDecodeKernel
- layers::glm5next_dsa::binding::DsaBindReport
- layers::glm5next_dsa::binding::DsaSpec
- layers::glm5next_dsa::layer::Glm5NextDsaLayer
- layers::glm5next_dsa::layer::Glm5NextDsaLayerKernels
- layers::glm5next_dsa::layer::Glm5NextDsaWeights
- layers::glm5next_dsa::layer::Glm5NextDsaWorkspace
- layers::glm5next_dsa::select::DsaSelectGeometry
- layers::glm5next_dsa::select::DsaSelectInputs
- layers::glm5next_dsa::select::DsaSelectScratch
- layers::glm5next_dsa::state::Glm5NextDsaState
- layers::glm5next_dsa::tp::DsaTensorPlan
- layers::glm5next_dsa::tp::DsaTpPlan
- layers::glm5next_dsa_ref::DsaDims
- layers::glm5next_dsa_ref::Pools
- layers::glm5next_kda::Glm5NextKdaConfig
- layers::glm5next_kda::Glm5NextKdaKernels
- layers::glm5next_kda::Glm5NextKdaLayer
- layers::glm5next_kda::Glm5NextKdaWeights
- layers::glm5next_kda::Glm5NextKdaWorkspace
- layers::glm5next_kda::KdaSeqState
- layers::glm5next_kda::binding::KdaBindReport
- layers::glm5next_kda::binding::RawTensor
- layers::glm5next_kda::binding::TensorSpec
- layers::glm5next_kda::tp::KdaTensorPlan
- layers::glm5next_kda::tp::KdaTpPlan
- layers::glm5next_kda::tp_bind::KdaShardedSource
- layers::glm5next_kda_ref::KdaDims
- layers::glm5next_kda_ref::KdaWeights
- layers::glm5next_layer::Glm5NextLayer
- layers::glm5next_layer::Glm5NextMhc
- layers::glm5next_mlp::Glm5NextMlpConfig
- layers::glm5next_mlp::Glm5NextMlpKernels
- layers::glm5next_mlp::forward::Glm5NextMlpWorkspace
- layers::glm5next_mlp::weights::Glm5NextDenseMlpWeights
- layers::glm5next_mlp::weights::Glm5NextExpertPtrTable
- layers::glm5next_mlp::weights::Glm5NextExpertWeights
- layers::glm5next_mlp::weights::Glm5NextMoePtrTables
- layers::glm5next_mlp::weights::Glm5NextMoeWeights
- layers::glm5next_mlp::weights::Nvfp4Proj
- layers::glm5next_mtp_head::Glm5NextMtpHead
- layers::glm5next_mtp_head::Glm5NextMtpProposerState
- layers::glm5next_skeleton::Glm5NextTextSkeleton
- layers::glm5next_skeleton::SkeletonLayer
- layers::glm5next_skeleton::StateBudget
- layers::glm5next_skeleton::StructuralAccounting
- layers::moe::MoeLayer
- layers::mtp_head::MtpHead
- layers::mtp_head::MtpProposerState
- layers::mtp_multi::MultiModuleMtpHead
- layers::mtp_multi::MultiModuleMtpState
- layers::nemotron_mamba2::NemotronMamba2Layer
- layers::nemotron_moe::NemotronMoeLayer
- layers::ngram_embed::NgramDims
- layers::ngram_embed::NgramEmbedding
- layers::ops::DenseMmKernels
- layers::ops::DerivedWeights
- layers::ops::GemmDispatch
- layers::ops::Glm5NextMhcKernels
- layers::ops::Glm5NextMhcSiteWeights
- layers::ops::ModelLevers
- layers::ops::MoeCutlassDownHostTables
- layers::ops::MoeCutlassHostTables
- layers::ops::lora_delta::LoraAttnWeights
- layers::ops::lora_delta::LoraFfnWeights
- layers::ops::lora_delta::LoraKernels
- layers::ops::lora_delta::LoraPair
- layers::ops::lora_delta::LoraRoute
- layers::ops::model_stats::DumpLatches
- layers::ops::model_stats::ModelStats
- layers::ops::model_stats::MoeUnionStats
- layers::ops::moe_lora_grouped::ExpertTables
- layers::ops::moe_lora_grouped::MoeExpertRoute
- layers::ops::token_overlay::OverlayKernels
- layers::ple::PleLayer
- layers::ple::PleSeqState
- layers::ple::PleWeights
- layers::ple::ids::PleIdDims
- layers::qsa::QsaIndexer
- layers::qsa::QsaSelection
- layers::qsa::QsaSeqState
- layers::qwen3_attention::CompressorWeights
- layers::qwen3_attention::HcHeadWeights
- layers::qwen3_attention::HcLowRank
- layers::qwen3_attention::HcSiteWeights
- layers::qwen3_attention::HcWeights
- layers::qwen3_attention::MlaWeights
- layers::qwen3_attention::Qwen3AttentionLayer
- layers::qwen3_attention::innerq_driver::InnerQDriver
- layers::qwen3_ssm::Qwen3SsmLayer
- layers::qwen3_ssm::gdn_flags::GdnFlags
- layers::vision_encoder::MergerLayer
- layers::vision_encoder::ViTBlock
- layers::vision_encoder::VisionEncoder
- layers::vision_encoder::VisionScratch
- layers::w4a16_gemv_tiers::W4a16BatchmTiers
- lora::AdapterSlot
- lora::EmbedOverlay
- lora::ExpertLoraLayer
- lora::ExpertWork
- lora::LmHeadOverlay
- lora::LoraAdapterInput
- lora::LoraLayerWeights
- lora::LoraWeights
- lora::OverlayRaw
- lora::OverlayRawSlot
- lora::OverlayTensor
- lora::OverlayTensors
- lora::SlotView
- lora::TokenOverlaySet
- mistral_loader::MistralWeightLoader
- model::TransformerModel
- model::nllb::NllbGpuModel
- model::nllb::NllbLang
- precision_schedule::PrecisionSchedule
- quant_format::CompressedTensorsFormat
- quant_format::Fp8BlockScaledFormat
- quant_format::ModeloptFormat
- seq_state_reserve::PerSequenceState
- speculative::tree_shape::HedgeNode
- speculative::tree_shape::TreeDraft
- speculative::tree_shape::TreeRow
- speculative::tree_shape::TreeShape
- ssm_reserve::DecodeRingDecision
- ssm_reserve::MarconiSlotDecision
- tp_shard::TpAttentionDims
- tp_shard::TpGdnDims
- tp_shard::TpMoeDims
- traits::BeamReq
- traits::ChunkedPrefillPageMetadata
- traits::EpCommandFailed
- traits::MixedBatchResult
- traits::MixedForwardResult
- traits::PrefillSlice
- traits::PromptTokenLogprob
- traits::SequenceState
- video_decode_ffmpeg::FfmpegPolicy
- video_preprocess::PreprocessedVideo
- vision_item::VisionItem
- weight_loader::DeepSeekV4WeightLoader
- weight_loader::Gemma4WeightLoader
- weight_loader::LagunaWeightLoader
- weight_loader::LongcatWeightLoader
- weight_loader::MinimaxM2WeightLoader
- weight_loader::NemotronHWeightLoader
- weight_loader::NllbWeightLoader
- weight_loader::Qwen35DenseWeightLoader
- weight_loader::Qwen35WeightLoader
- weight_loader::Qwen3VLWeightLoader
- weight_loader::Qwen3WeightLoader
- weight_loader::Qwen4ExpWeightLoader
- weight_loader::Step3p7WeightLoader
- weight_loader::dflash_loader::DflashConfig
- weight_loader::dflash_loader::DflashLayerWeights
- weight_loader::dflash_loader::DflashRopeScaling
- weight_loader::dflash_loader::DflashSubConfig
- weight_loader::dflash_loader::DflashWeights
- weight_loader::glm5_next::Accounting
- weight_loader::glm5_next_load::Glm5NextWeightLoader
- weight_map::AttentionWeights
- weight_map::DenseExpertWeight
- weight_map::DenseWeight
- weight_map::ExpertWeight
- weight_map::Fp8DenseWeight
- weight_map::Fp8ExpertWeight
- weight_map::Fp8Weight
- weight_map::Fp8WeightTransposed
- weight_map::ModelWeights
- weight_map::MoeWeights
- weight_map::MtpWeights
- weight_map::NemotronExpertWeight
- weight_map::NemotronMoeWeights
- weight_map::NemotronSsmWeights
- weight_map::PackedQ2Weight
- weight_map::QuantExpertWeight
- weight_map::QuantizedWeight
- weight_map::SsmWeights
- weight_map::SsmWeightsQwen35
Enums
- forward::qwen3_5::MetalKvDtype
- layer::MoeLoraRoute
- layers::FfnComponent
- layers::dense_ffn::FfnActivation
- layers::dflash_head::DflashQuantization
- layers::glm5next_dsa::select::DsaSelectLaunch
- layers::glm5next_dsa::tp::DsaShard
- layers::glm5next_kda::binding::AttnBlockKind
- layers::glm5next_kda::binding::KdaDtype
- layers::glm5next_kda::tp::KdaShard
- layers::glm5next_layer::Glm5NextMixer
- layers::glm5next_layer::Glm5NextMlpSite
- layers::glm5next_mlp::Glm5NextMlpKind
- layers::glm5next_skeleton::FinalStep
- layers::glm5next_skeleton::Mixer
- layers::glm5next_skeleton::Mlp
- layers::glm5next_skeleton::ResidualStep
- layers::glm5next_skeleton::Site
- layers::glm5next_skeleton::StateKind
- layers::mtp_head::MtpQuantization
- layers::ngram_embed::NgramTable
- layers::ops::Derivation
- layers::ops::HcVariant
- lora::AdapterAb
- lora::ExpertProj
- lora::LoraModule
- lora::LoraTarget
- lora::OverlayModule
- lora::OverlayTensorKind
- lora::VictimError
- mtp_layout::MtpLayout
- precision_schedule::Dtype
- precision_schedule::Role
- ssm_reserve::SsmRollbackMode
- tp_shard::TpShardKind
- video_decode_ffmpeg::Availability
- weight_loader::QuantFormat
- weight_loader::WeightFormat
- weight_loader::glm5_next::TensorRole
- weight_map::LayerWeights
- weight_map::NemotronSsmQuant
- weight_map::Nvfp4Variant
- weight_map::QuantWeight
- weight_map::WeightQuantFormat
Traits
- forward::quant_weights::QuantWeights
- layer::LayerState
- layer::TransformerLayer
- layers::glm5next_kda::binding::KdaTensorSource
- quant_format::QuantFormat
- speculative::DraftProposer
- speculative::ProposerState
- traits::Model
- weight_loader::ModelWeightLoader
Functions
- engine::generate
- engine::generate_speculative
- engine::generate_streaming
- factory::build_model
- factory::loader_for_config
- forward::qwen3_5::forward_full_attention
- forward::qwen3_5::forward_linear_attention
- layers::dflash_head::dflash_ctx_cap
- layers::ep_dispatch::build_ep_routing_table
- layers::fp8_calibration::dtype_runs_online_fp8_kv_calibration
- layers::fp8_calibration::graphs_ready_after_fp8_kv_cal
- layers::glm5next_dsa::attend::decode_attention
- layers::glm5next_dsa::binding::dsa_tensor_specs
- layers::glm5next_dsa::binding::verify_dsa_block
- layers::glm5next_dsa::build::absorb_o
- layers::glm5next_dsa::build::absorb_q
- layers::glm5next_dsa::build::build_dsa_weights
- layers::glm5next_dsa::build::shard_host
- layers::glm5next_dsa::select::contiguous_pool_count
- layers::glm5next_dsa::select::select_tokens
- layers::glm5next_dsa::select::topk_smem_for_tile
- layers::glm5next_dsa::select::topk_tile
- layers::glm5next_dsa::state::dsa_capacity
- layers::glm5next_dsa::state::indexer_state_bytes
- layers::glm5next_dsa::state::max_dsa_context
- layers::glm5next_dsa_ref::expand_kv
- layers::glm5next_dsa_ref::expand_selection
- layers::glm5next_dsa_ref::index_scores
- layers::glm5next_dsa_ref::kept_pools
- layers::glm5next_dsa_ref::layer_norm
- layers::glm5next_dsa_ref::linear
- layers::glm5next_dsa_ref::mla_masked_attention
- layers::glm5next_dsa_ref::pool_states
- layers::glm5next_dsa_ref::rms_norm
- layers::glm5next_dsa_ref::sigmoid_f32
- layers::glm5next_dsa_ref::topk_pools
- layers::glm5next_dsa_ref::topk_to_mask
- layers::glm5next_dsa_ref::visible
- layers::glm5next_kda::binding::bind_kda_weights
- layers::glm5next_kda::binding::classify_attn_block
- layers::glm5next_kda::tp_bind::shard_bytes
- layers::glm5next_kda_ref::bounded_gate
- layers::glm5next_kda_ref::kda_chunked
- layers::glm5next_kda_ref::kda_chunked_prenorm
- layers::glm5next_kda_ref::kda_recurrent
- layers::glm5next_kda_ref::kda_recurrent_prenorm
- layers::glm5next_kda_ref::kda_reference_layer
- layers::glm5next_kda_ref::l2norm_rows
- layers::glm5next_kda_ref::linear
- layers::glm5next_kda_ref::rms_norm_gated
- layers::glm5next_kda_ref::unbounded_gdn_gate
- layers::glm5next_layer::profile::end
- layers::glm5next_layer::profile::end_nosync
- layers::glm5next_layer::profile::end_us
- layers::glm5next_layer::profile::full
- layers::glm5next_layer::profile::on
- layers::glm5next_layer::profile::probe_buf
- layers::glm5next_layer::profile::start
- layers::glm5next_layer::profile::start_hot
- layers::glm5next_layer::profile::stash_route
- layers::glm5next_layer::profile::step
- layers::glm5next_layer::profile::trace_bar
- layers::glm5next_layer::profile::trace_on
- layers::glm5next_layer::state::alloc_kda_ssm_state
- layers::glm5next_mlp::build::build_dense_mlp
- layers::glm5next_mlp::build::build_moe
- layers::glm5next_mlp::forward::forward_dense
- layers::glm5next_mlp::forward::forward_moe
- layers::k64_kernel
- layers::k64_n64_kernel
- layers::k64_n64_wins
- layers::moe_grouped_decode_decide
- layers::moe_grouped_decode_enabled
- layers::moe_grouped_decode_for
- layers::moe_grouped_decode_forced
- layers::moe_grouped_decode_min_rows
- layers::mtp_head::mtp_drafter_prefill_enabled
- layers::ngram_embed::ngram_ids
- layers::ops::argmax_bf16
- layers::ops::argmax_bf16_batch
- layers::ops::argmax_bf16_batch_lp
- layers::ops::batched_embed
- layers::ops::batched_embed_fp8
- layers::ops::bf16_absmax
- layers::ops::bf16_concat
- layers::ops::bf16_to_fp8
- layers::ops::compute_gdn_gates
- layers::ops::conv1d_fwd
- layers::ops::conv1d_update
- layers::ops::conv1d_update_chunk2
- layers::ops::conv1d_update_l2norm
- layers::ops::conv1d_update_l2norm_strided
- layers::ops::conv1d_update_prefill
- layers::ops::cublas_bf16_proj
- layers::ops::cublas_bf16_proj_dense
- layers::ops::cublas_fp8_proj
- layers::ops::cublas_fp8_rowwise_proj
- layers::ops::cutlass_bf16_proj
- layers::ops::cutlass_nvfp4_proj
- layers::ops::cutlass_nvfp4_proj_from_fp8
- layers::ops::deinterleave_qg
- layers::ops::deinterleave_qg_split
- layers::ops::deinterleave_qg_split_qnorm
- layers::ops::deinterleave_qg_split_qnorm_mrope
- layers::ops::deinterleave_qkvz
- layers::ops::dense_gemm
- layers::ops::dense_gemm_ba_gates_prefill
- layers::ops::dense_gemm_bf16_pipelined
- layers::ops::dense_gemm_prefill
- layers::ops::dense_gemm_router
- layers::ops::dense_gemm_splitk
- layers::ops::dense_gemm_tc
- layers::ops::dense_gemm_tc_scaled_acc
- layers::ops::dense_gemv
- layers::ops::dense_gemv_ba_gates
- layers::ops::dense_gemv_batch2
- layers::ops::dense_gemv_batchm
- layers::ops::dense_gemv_fp8w
- layers::ops::dense_gemv_fp8w_batch2
- layers::ops::dense_mm_bf16
- layers::ops::dequant_nvfp4_to_bf16
- layers::ops::dequant_q2_0_gn_to_bf16
- layers::ops::embed_from_argmax
- layers::ops::fill_slots_from_block_table
- layers::ops::fp4_act_scratch_bytes
- layers::ops::fp8_fp8_gemm_m128_mfast
- layers::ops::fp8_fp8_gemm_n128
- layers::ops::fp8_fp8_gemm_n128_m128
- layers::ops::fp8_gemm_m128_mfast
- layers::ops::fp8_gemm_n128
- layers::ops::fp8_gemm_n128_m128
- layers::ops::fp8_gemm_n128_mfast
- layers::ops::fp8_gemm_n128_row_scaled
- layers::ops::fp8_gemm_n128_row_scaled_m16
- layers::ops::fp8_gemm_t_blockscaled
- layers::ops::fp8_gemv_rowscale_batch16_rt2
- layers::ops::fp8_gemv_rowscale_batch8_rt2
- layers::ops::fused_k_norm_rope_cache_write_bf16
- layers::ops::fused_k_norm_rope_cache_write_bf16_mrope
- layers::ops::fused_k_norm_rope_cache_write_fp8
- layers::ops::gated_rms_norm
- layers::ops::gated_rms_norm_prefill
- layers::ops::gdn_decode
- layers::ops::gdn_decode_chunk2
- layers::ops::gdn_decode_chunk3
- layers::ops::gdn_decode_f16_strided_norm
- layers::ops::gdn_decode_f32_conv_norm
- layers::ops::gdn_decode_f32_norm
- layers::ops::gdn_decode_f32_norm_snap
- layers::ops::gdn_decode_f32_strided
- layers::ops::gdn_decode_f32_strided_norm
- layers::ops::gdn_decode_f32_strided_norm_snap
- layers::ops::gdn_decode_wy2
- layers::ops::gdn_decode_wy3
- layers::ops::gdn_decode_wy4
- layers::ops::gdn_decode_wyn
- layers::ops::gdn_flashinfer::available
- layers::ops::gdn_flashinfer::flashinfer_gdn_prefill
- layers::ops::gdn_prefill
- layers::ops::gdn_prefill_fla
- layers::ops::gdn_prefill_persistent
- layers::ops::gdn_prefill_persistent_batched
- layers::ops::gdn_prefill_persistent_smem
- layers::ops::gdn_prefill_persistent_smem_batched
- layers::ops::gdn_prefill_regresident
- layers::ops::gdn_prefill_split
- layers::ops::gdn_prefill_split4
- layers::ops::gdn_prefill_split4_batched
- layers::ops::gdn_verify_fused_conv_k2
- layers::ops::gdn_verify_fused_conv_kn
- layers::ops::gdn_verify_fused_conv_kn_batched
- layers::ops::gdn_verify_fused_conv_kn_f32
- layers::ops::gdn_verify_fused_norm_k2
- layers::ops::gemv_sw_from
- layers::ops::glm_hc_expand
- layers::ops::glm_hc_post
- layers::ops::glm_hc_pre
- layers::ops::grouped_gemm_mla
- layers::ops::hc_expand
- layers::ops::hc_head
- layers::ops::hc_head_lowrank
- layers::ops::hc_head_mean
- layers::ops::hc_head_site
- layers::ops::hc_post
- layers::ops::hc_post_lowrank
- layers::ops::hc_post_site
- layers::ops::hc_pre
- layers::ops::hc_pre_lowrank
- layers::ops::hc_pre_site
- layers::ops::int8_gemm_faith2_prefill
- layers::ops::l2_norm
- layers::ops::log_cutlass_nvfp4_route
- layers::ops::log_gemm_shape
- layers::ops::lora_delta::apply_lora_bgmv
- layers::ops::lora_delta::apply_lora_delta
- layers::ops::lora_delta::lora_gemv_max_m
- layers::ops::lora_delta::lora_no_apply
- layers::ops::lora_delta::lora_no_ffn
- layers::ops::mamba2_ssd_bmm
- layers::ops::mamba2_ssd_cumsum
- layers::ops::mamba2_ssd_scan
- layers::ops::mamba2_ssm_prefill
- layers::ops::mamba2_ssm_prefill_persistent
- layers::ops::mix_hc
- layers::ops::mla_batched_gemv
- layers::ops::mla_cache_assemble
- layers::ops::mla_cache_assemble_batched
- layers::ops::mla_fused_prefill
- layers::ops::mla_kv_assemble_batched
- layers::ops::mla_paged_decode_fp8
- layers::ops::mla_paged_decode_nvfp4
- layers::ops::mla_prefill_attention_320
- layers::ops::mla_q_final_assemble_batched
- layers::ops::mla_q_rope_extract_batched
- layers::ops::mla_q_rope_scatter
- layers::ops::mla_q_rope_writeback
- layers::ops::mla_q_rope_writeback_batched
- layers::ops::moe_batched_blend
- layers::ops::moe_bf16_grouped_gemm
- layers::ops::moe_build_tile_worklist
- layers::ops::moe_decode_atomic_c4_finalize
- layers::ops::moe_decode_atomic_c4_silu_down_accum
- layers::ops::moe_expert_gate_up_shared
- layers::ops::moe_expert_gate_up_shared_batch2
- layers::ops::moe_expert_gate_up_shared_batch2_t
- layers::ops::moe_expert_gate_up_shared_batch3
- layers::ops::moe_expert_gate_up_shared_batch3_t
- layers::ops::moe_expert_gate_up_shared_bf16
- layers::ops::moe_expert_gate_up_shared_bf16_batch2
- layers::ops::moe_expert_gate_up_shared_fp8
- layers::ops::moe_expert_gate_up_shared_fp8_batch2
- layers::ops::moe_expert_gate_up_shared_fp8_batch2_t
- layers::ops::moe_expert_gate_up_shared_fp8_batch3
- layers::ops::moe_expert_gate_up_shared_fp8_batch3_t
- layers::ops::moe_expert_gate_up_shared_fp8_t
- layers::ops::moe_expert_gate_up_shared_prefill
- layers::ops::moe_expert_gate_up_shared_t
- layers::ops::moe_expert_gemv
- layers::ops::moe_expert_gemv_gate_up
- layers::ops::moe_expert_gemv_gate_up_2x
- layers::ops::moe_expert_gemv_silu_down
- layers::ops::moe_expert_gemv_silu_down_2x
- layers::ops::moe_expert_silu_down_shared
- layers::ops::moe_expert_silu_down_shared_batch2
- layers::ops::moe_expert_silu_down_shared_batch2_t
- layers::ops::moe_expert_silu_down_shared_batch3
- layers::ops::moe_expert_silu_down_shared_batch3_t
- layers::ops::moe_expert_silu_down_shared_bf16
- layers::ops::moe_expert_silu_down_shared_bf16_batch2
- layers::ops::moe_expert_silu_down_shared_fp8
- layers::ops::moe_expert_silu_down_shared_fp8_batch2
- layers::ops::moe_expert_silu_down_shared_fp8_batch2_t
- layers::ops::moe_expert_silu_down_shared_fp8_batch3
- layers::ops::moe_expert_silu_down_shared_fp8_batch3_t
- layers::ops::moe_expert_silu_down_shared_fp8_t
- layers::ops::moe_expert_silu_down_shared_prefill
- layers::ops::moe_expert_silu_down_shared_t
- layers::ops::moe_fp8_grouped_gemm
- layers::ops::moe_fp8_grouped_gemm_ptrtable_n128
- layers::ops::moe_gate_topk_fused
- layers::ops::moe_grouped_down_cutlass
- layers::ops::moe_grouped_gate_up_cutlass
- layers::ops::moe_hash_route
- layers::ops::moe_hash_route_batched
- layers::ops::moe_lora_grouped::gather_bgmv_grids
- layers::ops::moe_lora_grouped::gather_row_token
- layers::ops::moe_lora_grouped::grouped_down_wc
- layers::ops::moe_lora_grouped::grouped_down_windows
- layers::ops::moe_lora_grouped::moe_lora_gather_bgmv
- layers::ops::moe_lora_grouped::moe_lora_grouped_down
- layers::ops::moe_lora_grouped::pack_expert_tables
- layers::ops::moe_permute_tokens
- layers::ops::moe_silu_mul
- layers::ops::moe_sort_by_expert
- layers::ops::moe_topk_sigmoid
- layers::ops::moe_topk_sigmoid_batched
- layers::ops::moe_topk_softmax
- layers::ops::moe_topk_softmax_batched
- layers::ops::moe_topk_softmax_bias
- layers::ops::moe_topk_softmax_bias_batched
- layers::ops::moe_topk_sqrtsoftplus
- layers::ops::moe_topk_sqrtsoftplus_batched
- layers::ops::moe_transpose_u8_batched
- layers::ops::moe_unpermute_reduce_indexed
- layers::ops::moe_w4a16_fused_gate_up_k64_m128
- layers::ops::moe_w4a16_fused_gate_up_k64_n128
- layers::ops::moe_w4a16_fused_gate_up_n128
- layers::ops::moe_w4a16_grouped_gemm
- layers::ops::moe_w4a16_grouped_gemm_ptrtable
- layers::ops::moe_w4a16_grouped_gemm_ptrtable_k64_n128
- layers::ops::moe_w4a16_grouped_gemm_ptrtable_m256
- layers::ops::moe_w4a16_grouped_gemm_ptrtable_n128
- layers::ops::moe_w4a4_grouped_gemm_relu2
- layers::ops::moe_w8a8_grouped_gemm
- layers::ops::moe_w8a8_grouped_gemm_pm4
- layers::ops::moe_weighted_sum_blend
- layers::ops::moe_weighted_sum_blend_batch2
- layers::ops::moe_weighted_sum_blend_batch3
- layers::ops::moe_weighted_sum_blend_prefill
- layers::ops::moe_zero_expert_add
- layers::ops::native_q2_mmq_enabled
- layers::ops::nvfp4_mmq_gemm
- layers::ops::nvfp4_mmq_gemm_tiled
- layers::ops::nvfp4_mmq_quantize_act
- layers::ops::nvfp4_mmq_repack
- layers::ops::nvfp4_mmq_smem
- layers::ops::nvfp4_mmq_weight_bytes
- layers::ops::nvfp4_scale_bf16
- layers::ops::nvfp4_silu_mul_quant
- layers::ops::nvfp4_silu_mul_scaled
- layers::ops::paged_decode_attn_bf16
- layers::ops::paged_decode_attn_bf16k_turbo2v
- layers::ops::paged_decode_attn_bf16k_turbo3v
- layers::ops::paged_decode_attn_bf16k_turbo4v
- layers::ops::paged_decode_attn_fp8
- layers::ops::paged_decode_attn_fp8k_turbo2v
- layers::ops::paged_decode_attn_fp8k_turbo3v
- layers::ops::paged_decode_attn_fp8k_turbo4v
- layers::ops::paged_decode_attn_nvfp4
- layers::ops::paged_decode_attn_reduce_fp8
- layers::ops::paged_decode_attn_reduce_nvfp4
- layers::ops::paged_decode_attn_splitk_fp8
- layers::ops::paged_decode_attn_splitk_nvfp4
- layers::ops::paged_decode_attn_turbo3k_turbo8v
- layers::ops::paged_decode_attn_turbo4k_turbo3v
- layers::ops::paged_decode_attn_turbo4k_turbo8v
- layers::ops::per_token_group_quant_fp8
- layers::ops::ple_add_highway
- layers::ops::ple_conv
- layers::ops::ple_gate
- layers::ops::predequant_nvfp4_to_fp8
- layers::ops::prefill_attention
- layers::ops::prefill_attention_512_sink
- layers::ops::prefill_attention_64
- layers::ops::prefill_attention_fp8kv
- layers::ops::prefill_attention_paged
- layers::ops::prefill_attention_paged_512
- layers::ops::prefill_attention_paged_64
- layers::ops::prefill_attention_paged_batched
- layers::ops::prefill_attention_paged_batched_64
- layers::ops::prefill_attention_paged_bf16k_turbo2v_64
- layers::ops::prefill_attention_paged_bf16k_turbo3v_64
- layers::ops::prefill_attention_paged_bf16k_turbo4v_64
- layers::ops::prefill_attention_paged_dflash
- layers::ops::prefill_attention_paged_dflash_bf16_indirect
- layers::ops::prefill_attention_paged_fp8
- layers::ops::prefill_attention_paged_fp8_64
- layers::ops::prefill_attention_paged_fp8_batched
- layers::ops::prefill_attention_paged_fp8_batched_64
- layers::ops::prefill_attention_paged_fp8_dflash
- layers::ops::prefill_attention_paged_fp8k_turbo2v_64
- layers::ops::prefill_attention_paged_fp8k_turbo3v_64
- layers::ops::prefill_attention_paged_fp8k_turbo4v_64
- layers::ops::prefill_attention_paged_nvfp4
- layers::ops::prefill_attention_paged_nvfp4_64
- layers::ops::prefill_attention_paged_nvfp4_batched
- layers::ops::prefill_attention_paged_nvfp4_batched_64
- layers::ops::prefill_attention_paged_turbo2_64
- layers::ops::prefill_attention_paged_turbo3k_turbo8v_64
- layers::ops::prefill_attention_paged_turbo4k_turbo3v_64
- layers::ops::prefill_attention_paged_turbo4k_turbo8v_64
- layers::ops::prefill_attention_paged_turbo_64
- layers::ops::prefill_batched_first_chunk_enabled
- layers::ops::prefill_varlen_enabled
- layers::ops::q2_0_gemv
- layers::ops::q2_0_gemv_batchm
- layers::ops::q2_0_gemv_vec
- layers::ops::q2_0_gemv_vec_batchm
- layers::ops::q2_0_mmq_gemm
- layers::ops::q2_0_mmq_gemm_packed
- layers::ops::q2_0_weight_bytes
- layers::ops::q4k_mmq_gemm
- layers::ops::q4k_weight_bytes
- layers::ops::q8_1_scratch_bytes
- layers::ops::qsa_block_pool
- layers::ops::qsa_gather
- layers::ops::qsa_prefill_attn
- layers::ops::qsa_qprep
- layers::ops::qsa_qprep_rows
- layers::ops::qsa_score
- layers::ops::qsa_score_rows
- layers::ops::qsa_score_rows_tc
- layers::ops::quant_gemm
- layers::ops::quant_gemv
- layers::ops::quantize_act_q8_1
- layers::ops::quantize_bf16_to_fp8
- layers::ops::quantize_bf16_to_nvfp4
- layers::ops::quantize_weight_q4k
- layers::ops::read_expert_ptrs_u64
- layers::ops::read_expert_scales_f32
- layers::ops::requant_w_nvfp4_int8
- layers::ops::reshape_and_cache
- layers::ops::reshape_and_cache_bf16k_turbo2v
- layers::ops::reshape_and_cache_bf16k_turbo3v
- layers::ops::reshape_and_cache_bf16k_turbo4v
- layers::ops::reshape_and_cache_flash_v_only
- layers::ops::reshape_and_cache_fp8
- layers::ops::reshape_and_cache_fp8k_turbo2v
- layers::ops::reshape_and_cache_fp8k_turbo3v
- layers::ops::reshape_and_cache_fp8k_turbo4v
- layers::ops::reshape_and_cache_nvfp4
- layers::ops::reshape_and_cache_turbo3k_turbo8v
- layers::ops::reshape_and_cache_turbo4k_turbo3v
- layers::ops::reshape_and_cache_turbo4k_turbo8v
- layers::ops::residual_add
- layers::ops::residual_add_rms_norm
- layers::ops::residual_add_rms_norm_gatef32
- layers::ops::rms_norm
- layers::ops::rms_norm_residual
- layers::ops::rms_norm_short_row_eligible
- layers::ops::rms_norm_strided
- layers::ops::rms_norm_warp_row
- layers::ops::rope
- layers::ops::rope_mrope_interleaved
- layers::ops::rope_mrope_interleaved_k_only
- layers::ops::rope_proportional
- layers::ops::rope_strided
- layers::ops::rope_yarn
- layers::ops::rope_yarn_scaled
- layers::ops::scaled_add
- layers::ops::set_prefill_varlen_from_cli
- layers::ops::sigmoid_blend
- layers::ops::sigmoid_blend_device
- layers::ops::sigmoid_gate_mul
- layers::ops::sigmoid_gate_mul_batched
- layers::ops::sigmoid_gate_mul_head_broadcast
- layers::ops::silu_mul
- layers::ops::silu_mul_quant_fp8
- layers::ops::softplus_gate_mul_head_broadcast
- layers::ops::ssd_scan_fits
- layers::ops::ssd_scan_smem
- layers::ops::ssm_h_state_f16_to_f32
- layers::ops::ssm_h_state_f32_to_f16
- layers::ops::token_overlay::embed_overlay_routed
- layers::ops::token_overlay::embed_rowdiff
- layers::ops::token_overlay::lmhead_overlay_routed
- layers::ops::transpose_block_scale
- layers::ops::transpose_fp8
- layers::ops::transpose_u8
- layers::ops::use_gemv_sw
- layers::ops::w4a16_decode_gemv
- layers::ops::w4a16_gemm
- layers::ops::w4a16_gemm_n128
- layers::ops::w4a16_gemm_n128_ldb
- layers::ops::w4a16_gemm_n128_m128
- layers::ops::w4a16_gemm_n128_m128_bf16
- layers::ops::w4a16_gemm_n128_m128_bf16_ldb
- layers::ops::w4a16_gemm_n128_m128_v2
- layers::ops::w4a16_gemm_n128_m128_v3
- layers::ops::w4a16_gemv
- layers::ops::w4a16_gemv_batch2
- layers::ops::w4a16_gemv_batch3
- layers::ops::w4a16_gemv_batchm
- layers::ops::w4a16_gemv_dual
- layers::ops::w4a16_gemv_dual_batch2
- layers::ops::w4a16_gemv_dual_batch3
- layers::ops::w4a16_gemv_dual_sw
- layers::ops::w4a16_gemv_grid_x
- layers::ops::w4a16_gemv_qg
- layers::ops::w4a16_gemv_qg_batch2
- layers::ops::w4a16_gemv_qg_batch3
- layers::ops::w4a16_gemv_qkvz
- layers::ops::w4a16_gemv_silu_input
- layers::ops::w4a16_gemv_silu_input_sw
- layers::ops::w4a16_gemv_sw
- layers::ops::w4a16_gemv_sw_grid_x
- layers::ops::w4a16_gemv_sw_raw
- layers::ops::w4a4_gemm
- layers::ops::w4a4_gemm_mfast
- layers::ops::w8a16_gemm
- layers::ops::w8a16_gemm_n128_m128
- layers::ops::w8a16_gemm_pipelined
- layers::ops::w8a16_gemm_t
- layers::ops::w8a16_gemm_t_pipelined
- layers::ops::w8a16_gemv
- layers::ops::w8a16_gemv_batch2
- layers::ops::w8a16_gemv_batch4
- layers::ops::w8a16_gemv_dual
- layers::ops::w8a16_gemv_silu_input
- layers::ops::wide_prefill_kernel
- layers::ops::widen_block_scale_f32
- layers::ple::dump::tap_bf16
- layers::ple::dump::tap_f32
- layers::ple::dump::tap_highway
- layers::ple::ids::ple_ngram_ids
- layers::qwen3_attention::add_attn_phase_us
- layers::qwen3_attention::add_ffn_host_us
- layers::qwen3_attention::take_attn_phase_us
- layers::qwen3_attention::take_ffn_host_us
- layers::qwen3_attention::validate_required_kv_kernels
- layers::qwen3_ssm::gdn_flags::default_dflash_gamma
- layers::qwen3_ssm::gdn_flags::flags
- layers::qwen3_ssm::gdn_flags::gdn_fused_norm_enabled
- layers::qwen3_ssm::gdn_flags::set_from_cli
- layers::qwen3_ssm::gdn_flags::ssm_batched_recurrent_enabled
- layers::qwen3_ssm::gdn_flags::ssm_h_dtype_bits
- layers::qwen3_ssm::gdn_flags::ssm_h_f16_pool_enabled
- layers::qwen3_ssm::gdn_flags::ssm_h_fp16_enabled
- layers::qwen3_ssm::gdn_flags::verify_exact_enabled
- layers::tgemm_kernel
- layers::try_kernel
- layers::w4a16_gemv_tiers::exact_m_tiers_enabled
- layers::w4a16_gemv_tiers::select_tier
- layers::w4a16_v2_kernel
- layers::w4a16_v3_kernel
- lora::adapter_id_hash
- lora::allow_partial_targets
- lora::apply_expert_lora_sorted
- lora::apply_router_lora
- lora::build_moe_row_adapter_decode
- lora::build_moe_row_adapter_host
- lora::build_overlay
- lora::build_override_set
- lora::build_seq_slot_host
- lora::clamp_trainable_to_vocab
- lora::classify_key
- lora::classify_overlay_key
- lora::ensure_decode_route_servable
- lora::expert_delta_workitems
- lora::expert_router_bytes
- lora::full_attention_layers
- lora::is_gdn_key
- lora::load_lora_adapters_generic
- lora::load_lora_adapters_multi
- lora::lora_eager_env
- lora::lora_experts_env
- lora::lora_peer_env
- lora::lora_rotate_env
- lora::max_lora_expert_rank
- lora::no_batch_verify
- lora::override_source
- lora::pack_store_into_slot
- lora::prefill_bgmv_forced
- lora::rdma_stage::build_land_targets
- lora::rdma_stage::fetch_adapter_manifest
- lora::rdma_stage::rebuild_slot_layers
- lora::rdma_stage::slot_bytes
- lora::reject_pending_overlay
- lora::resolve_moe_lora_route
- lora::routed_prefill_slot_of
- lora::router_dims
- lora::select_routed_pair
- lora::select_victim_slot
- lora::stage_overlay_raw
- lora::validate_peft_config
- model_type_ships_vanilla_norm_weights
- mtp_layout::detect
- mtp_layout::detect_in_store
- preflight::preflight
- quant_format::detect_quant_format
- requires_single_chunk_prefill
- seq_state_reserve::per_sequence_state_bytes
- ships_vanilla_norm_weights
- speculative::draft_conf_tau
- speculative::hidden_fingerprint
- speculative::ladder::mtp_ladder_disabled
- speculative::ladder::mtp_ladder_drafts
- speculative::ladder::mtp_max_seqs
- speculative::mtp_accept_debug
- speculative::mtp_catchup_enabled
- speculative::mtp_ep_propose_enabled
- speculative::mtp_multi_seq_mode
- speculative::mtp_refeed_accepted_enabled
- speculative::mtp_refeed_debug
- speculative::mtp_refeed_shift
- speculative::shadow_topk
- speculative::verify_key::canonical_assignment
- speculative::verify_key::canonical_key_min_width
- speculative::verify_key::canonical_verify_key_enabled
- speculative::verify_key::verify_batch_order
- speculative::verify_key::verify_batch_permutation
- speculative::verify_key::verify_graph_key
- ssm_reserve::decode_rollback_ring_slots
- ssm_reserve::marconi_reserve_full
- ssm_reserve::marconi_snapshot_slots
- ssm_reserve::marconi_snapshot_slots_with
- ssm_reserve::mtp_pool_full_width
- ssm_reserve::mtp_state_slots
- ssm_reserve::mtp_state_slots_with
- ssm_reserve::prefix_caching_active
- ssm_reserve::set_ssm_rollback_mode
- ssm_reserve::ssm_h_prefill_stage_bytes
- ssm_reserve::ssm_h_stored_bytes
- ssm_reserve::ssm_pool_reserve_bytes
- ssm_reserve::ssm_replay_ring_bytes
- ssm_reserve::ssm_replay_row_bytes
- ssm_reserve::ssm_rollback_mode
- ssm_reserve::verify_slot_drafts
- ssm_reserve::verify_slot_drafts_with
- ssm_reserve::verify_slot_h_intermediates
- tp_shard::load_qk_norms_tp
- tp_shard::load_qkvo_tp
- tp_shard::shard_dense_1d_bf16
- tp_shard::shard_dense_bf16
- tp_shard::shard_dense_weight
- tp_shard::shard_fp8_block_scaled
- tp_shard::shard_gdn_ba_rows
- tp_shard::shard_gdn_conv_rows
- tp_shard::shard_gdn_out_proj_row_parallel
- tp_shard::shard_gdn_qkv_rows
- tp_shard::shard_gdn_qkvz_rows
- tp_shard::shard_gdn_value_vector
- tp_shard::shard_quantized_nvfp4
- traits::bf16_to_f32
- traits::extract_bf16
- traits::logprob_of
- traits::padded_batch_n
- video_decode_ffmpeg::decode_frames
- video_decode_ffmpeg::probe
- video_preprocess::decode_frames
- video_preprocess::preprocess_video
- video_preprocess::sample_indices
- vision_preprocess::preprocess_image
- vision_preprocess::preprocess_image_with_max_pixels
- weight_loader::dflash_loader::load_dflash_weights
- weight_loader::dflash_loader::parse_dflash_config
- weight_loader::dflash_loader::store_has_dflash_weights
- weight_loader::glm5_next::account
- weight_loader::glm5_next::classify
- weight_loader::glm5_next::is_mtp_only_name
- weight_loader::glm5_next::layer_index
- weight_map::detect_nvfp4_variant
- weight_map::load_fp8_block_scaled_as_fp8weight
- weight_map::load_fp8_weight
- weight_map::quantize_to_fp8
- weight_map::quantize_to_fp8_blockscaled
Type Aliases
- layers::glm5next_dsa::build::LoadFn
- layers::glm5next_mlp::build::ExpertFn
- layers::glm5next_mlp::build::LoadFn
Statics
Constants
- layer::VERIFY_WY_LAYER_STRIDE_BYTES
- layer::VERIFY_WY_TABLES_PER_LAYER
- layer::VERIFY_WY_TABLE_SEQS
- layer::VERIFY_WY_TABLE_STRIDE_BYTES
- layers::glm5next_dsa::DSA_MODULE
- layers::glm5next_dsa::KERNEL_KV_LORA_DIM
- layers::glm5next_dsa::KERNEL_MAX_KPOOL
- layers::glm5next_dsa::LAYERNORM_MODULE
- layers::glm5next_dsa::MASKED_ATTN_MAX_KEYS
- layers::glm5next_dsa::attend::DSA_DECODE_MODULE
- layers::glm5next_dsa::select::TOPK_SMEM_CEILING
- layers::glm5next_dsa_ref::INVALID
- layers::glm5next_kda::SMEM_CEILING
- layers::glm5next_kda::binding::DSA_MARKERS
- layers::glm5next_kda::binding::KDA_TENSORS
- layers::glm5next_layer::profile::DSA_ATTEND
- layers::glm5next_layer::profile::DSA_INDEXER
- layers::glm5next_layer::profile::DSA_PROJ
- layers::glm5next_layer::profile::DSA_SELECT
- layers::glm5next_layer::profile::KDA
- layers::glm5next_layer::profile::MHC
- layers::glm5next_layer::profile::MHC_POST
- layers::glm5next_layer::profile::MLP_DENSE
- layers::glm5next_layer::profile::MOE_COMBINE
- layers::glm5next_layer::profile::MOE_EXPERTS
- layers::glm5next_layer::profile::MOE_HOSTSYNC
- layers::glm5next_layer::profile::MOE_ROUTER
- layers::glm5next_layer::profile::MOE_SHARED
- layers::glm5next_layer::profile::NORM
- layers::glm5next_layer::profile::REDUCE_ATTN
- layers::glm5next_layer::profile::REDUCE_ATTN_BAR
- layers::glm5next_layer::profile::REDUCE_ATTN_ENQ
- layers::glm5next_layer::profile::REDUCE_MLP
- layers::glm5next_layer::profile::REDUCE_MLP_BAR
- layers::glm5next_layer::profile::REDUCE_MLP_ENQ
- layers::glm5next_mlp::FFN_MODULE
- layers::glm5next_mlp::GEMM_MODULE
- layers::glm5next_mlp::KERNEL_MAX_TOP_K
- layers::glm5next_mlp::W4A16_GEMV_MODULE
- layers::glm5next_mlp::W4A16_MODULE
- layers::glm5next_mlp::forward::MOE_ROW_BATCH_MAX_ROWS
- layers::glm5next_mlp::forward::MOE_ROW_UNION_MAX_IDS
- layers::ops::DENSE_GEMV_BATCHM_DECODE_MAX_M
- layers::ops::DENSE_GEMV_BATCHM_MAX_M
- layers::ops::GLM5NEXT_MHC_MODULE
- layers::ops::MAX_DYNAMIC_SMEM
- layers::ops::MHC_MIX_MAX_TOKENS
- layers::ops::MOE_TOPK_SIGMOID_MAX_EXPERTS
- layers::ops::MOE_TOPK_SIGMOID_MAX_TOP_K
- layers::ops::NVFP4_BLOCK_BYTES
- layers::ops::NVFP4_MMQ_SMEM
- layers::ops::Q2_0_BLOCK_BYTES
- layers::ops::Q2_BATCHM_MAX_M
- layers::ops::Q4K_BLOCK_BYTES
- layers::ops::Q4K_MMQ_SMEM
- layers::ops::QK2_0
- layers::ops::QK_K
- layers::ops::QK_NVFP4
- layers::ops::SSD_L
- layers::ops::SSD_PT
- layers::ops::W4A16_GEMV_OUTS_PER_BLOCK
- layers::ops::W4A16_GEMV_SW_OUTS_PER_BLOCK
- layers::ops::moe_lora_grouped::MLG_M_TILE
- layers::qwen3_ssm::gdn_flags::MAX_F16_TWIN_DFLASH_GAMMA
- layers::qwen3_ssm::gdn_flags::MAX_F16_TWIN_K
- layers::vision_encoder::IMAGE_PAD_TOKEN_ID
- layers::vision_encoder::VIDEO_PAD_TOKEN_ID
- layers::w4a16_gemv_tiers::W4A16_BATCHM_WIDTHS
- lora::ROWDIFF_THRESH
- speculative::EP_CMD_MTP_PROPOSE
- speculative::tree_shape::MAX_NODES
- speculative::tree_shape::MAX_RANK
- speculative::verify_key::CANONICAL_KEY_MIN_WIDTH
- video_preprocess::DEFAULT_FPS
- video_preprocess::DEFAULT_MAX_FRAMES
- video_preprocess::DEFAULT_MIN_FRAMES