From 3e01f3a533d3135049b3a445617e85ce05e0ab47 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?=D0=90=D1=80=D1=82=D0=B5=D0=BC=20=D0=A1=D0=B0=D0=B2=D0=BA?= =?UTF-8?q?=D0=B8=D0=BD?= <58187114+OrangeRedeng@users.noreply.github.com> Date: Sat, 20 Dec 2025 09:53:46 +0300 Subject: [PATCH] [NPU] [BUGFIX] [CRITICAL!] Fix NPU inference (torch_npu._npu_reshape_and_cache() crash) (#15484) --- .../hardware_backend/npu/memory_pool_npu.py | 40 +++++++++---------- 1 file changed, 20 insertions(+), 20 deletions(-) diff --git a/python/sglang/srt/hardware_backend/npu/memory_pool_npu.py b/python/sglang/srt/hardware_backend/npu/memory_pool_npu.py index 41fb2aae2..4968c03e8 100644 --- a/python/sglang/srt/hardware_backend/npu/memory_pool_npu.py +++ b/python/sglang/srt/hardware_backend/npu/memory_pool_npu.py @@ -34,18 +34,18 @@ class NPUMHATokenToKVPool(MHATokenToKVPool): ): self.use_fia = get_bool_env_var("ASCEND_USE_FIA", "False") super().__init__( - size, - page_size, - dtype, - head_num, - head_dim, - layer_num, - device, - enable_memory_saver, - start_layer, - end_layer, - enable_alt_stream, - enable_kv_cache_copy, + size=size, + page_size=page_size, + dtype=dtype, + head_num=head_num, + head_dim=head_dim, + layer_num=layer_num, + device=device, + enable_memory_saver=enable_memory_saver, + start_layer=start_layer, + end_layer=end_layer, + enable_alt_stream=enable_alt_stream, + enable_kv_cache_copy=enable_kv_cache_copy, ) def _create_buffers(self): @@ -181,14 +181,14 @@ class NPUMLATokenToKVPool(MLATokenToKVPool): end_layer: Optional[int] = None, ): super(MLATokenToKVPool, self).__init__( - size, - page_size, - dtype, - layer_num, - device, - enable_memory_saver, - start_layer, - end_layer, + size=size, + page_size=page_size, + dtype=dtype, + layer_num=layer_num, + device=device, + enable_memory_saver=enable_memory_saver, + start_layer=start_layer, + end_layer=end_layer, ) self.kv_lora_rank = kv_lora_rank