[NPU] Bugfix for qwen35 on NPU (#19756)

This commit is contained in:
Hexq0210
2026-03-10 20:03:26 +08:00
committed by GitHub
parent 6ed996bf65
commit 9884957c07
2 changed files with 3 additions and 1 deletions

View File

@@ -33,11 +33,13 @@ if is_cuda():
causal_conv1d_fn = causal_conv1d_fn_cuda
elif is_npu():
from sgl_kernel_npu.fla.fused_gdn_gating import fused_gdn_gating_npu
from sgl_kernel_npu.mamba.causal_conv1d import (
causal_conv1d_fn_npu,
causal_conv1d_update_npu,
)
fused_gdn_gating = fused_gdn_gating_npu
causal_conv1d_fn = causal_conv1d_fn_npu
causal_conv1d_update = causal_conv1d_update_npu
elif is_cpu():

View File

@@ -440,7 +440,7 @@ class ModelRunnerKVCacheMixin:
# Initialize token_to_kv_pool
is_nsa_model = is_deepseek_nsa(self.model_config.hf_config)
if self.server_args.attention_backend == "ascend":
if self.server_args.attention_backend == "ascend" and not self.mambaish_config:
if self.use_mla_backend:
from sglang.srt.hardware_backend.npu.memory_pool_npu import (
NPUMLATokenToKVPool,