From a119363f08633a1c44b0722db60dda40e2a99b09 Mon Sep 17 00:00:00 2001 From: Rain Jiang <96632942+rainj-me@users.noreply.github.com> Date: Thu, 6 Nov 2025 15:27:28 -0800 Subject: [PATCH] =?UTF-8?q?ignore=20the=20deepgemm=20check=20when=20the=20?= =?UTF-8?q?model=20weight=20with=20nvfp4=20and=20moe=20ba=E2=80=A6=20(#127?= =?UTF-8?q?82)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- python/sglang/srt/layers/moe/ep_moe/layer.py | 10 +++++++++- 1 file changed, 9 insertions(+), 1 deletion(-) diff --git a/python/sglang/srt/layers/moe/ep_moe/layer.py b/python/sglang/srt/layers/moe/ep_moe/layer.py index 1793fb273..70cfeb49a 100644 --- a/python/sglang/srt/layers/moe/ep_moe/layer.py +++ b/python/sglang/srt/layers/moe/ep_moe/layer.py @@ -112,8 +112,16 @@ class DeepEPMoE(FusedMoE): self.deepep_mode = get_deepep_mode() - if self.deepep_mode.enable_low_latency() and not _is_npu: + if ( + self.deepep_mode.enable_low_latency() + and not _is_npu + and not ( + get_moe_runner_backend().is_flashinfer_cutedsl() + and self.quant_config.get_name() == "modelopt_fp4" + ) + ): # NPU supports low_latency deepep without deepgemm + # FP4 quantization with flashinfer_cutedsl also supports low_latency deepep without deepgemm assert ( deep_gemm_wrapper.ENABLE_JIT_DEEPGEMM ), f"DeepEP {self.deepep_mode} mode requires deep_gemm"