From 9884957c07ce0a98fad34ea0055803594c459cb1 Mon Sep 17 00:00:00 2001 From: Hexq0210 <893781835@qq.com> Date: Tue, 10 Mar 2026 20:03:26 +0800 Subject: [PATCH] [NPU] Bugfix for qwen35 on NPU (#19756) --- python/sglang/srt/layers/attention/linear/gdn_backend.py | 2 ++ python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py | 2 +- 2 files changed, 3 insertions(+), 1 deletion(-) diff --git a/python/sglang/srt/layers/attention/linear/gdn_backend.py b/python/sglang/srt/layers/attention/linear/gdn_backend.py index 8b7851dfa..d15ad8fe5 100644 --- a/python/sglang/srt/layers/attention/linear/gdn_backend.py +++ b/python/sglang/srt/layers/attention/linear/gdn_backend.py @@ -33,11 +33,13 @@ if is_cuda(): causal_conv1d_fn = causal_conv1d_fn_cuda elif is_npu(): + from sgl_kernel_npu.fla.fused_gdn_gating import fused_gdn_gating_npu from sgl_kernel_npu.mamba.causal_conv1d import ( causal_conv1d_fn_npu, causal_conv1d_update_npu, ) + fused_gdn_gating = fused_gdn_gating_npu causal_conv1d_fn = causal_conv1d_fn_npu causal_conv1d_update = causal_conv1d_update_npu elif is_cpu(): diff --git a/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py b/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py index 577508b1f..588da8034 100644 --- a/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py +++ b/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py @@ -440,7 +440,7 @@ class ModelRunnerKVCacheMixin: # Initialize token_to_kv_pool is_nsa_model = is_deepseek_nsa(self.model_config.hf_config) - if self.server_args.attention_backend == "ascend": + if self.server_args.attention_backend == "ascend" and not self.mambaish_config: if self.use_mla_backend: from sglang.srt.hardware_backend.npu.memory_pool_npu import ( NPUMLATokenToKVPool,