From 8c34e18140a0174230648e8497abbb856ce29b11 Mon Sep 17 00:00:00 2001 From: kk <43161300+kkHuang-amd@users.noreply.github.com> Date: Wed, 17 Dec 2025 17:53:22 +0800 Subject: [PATCH] Fix the accuracy issue when running mxfp4 dsv3 model and enable ep (#15304) Co-authored-by: wunhuang --- python/sglang/srt/layers/quantization/mxfp4.py | 1 + python/sglang/srt/layers/quantization/quark/quark_moe.py | 1 + 2 files changed, 2 insertions(+) diff --git a/python/sglang/srt/layers/quantization/mxfp4.py b/python/sglang/srt/layers/quantization/mxfp4.py index 4616879ce..84424458c 100644 --- a/python/sglang/srt/layers/quantization/mxfp4.py +++ b/python/sglang/srt/layers/quantization/mxfp4.py @@ -866,5 +866,6 @@ class Mxfp4DynamicQuantMoEMethod(FusedMoEMethodBase): else ActivationType.Gelu ), doweight_stage1=False, + expert_mask=layer.expert_mask_gpu, ) return StandardCombineInput(hidden_states=output) diff --git a/python/sglang/srt/layers/quantization/quark/quark_moe.py b/python/sglang/srt/layers/quantization/quark/quark_moe.py index e48392201..186f6c5d0 100644 --- a/python/sglang/srt/layers/quantization/quark/quark_moe.py +++ b/python/sglang/srt/layers/quantization/quark/quark_moe.py @@ -245,6 +245,7 @@ class QuarkW4A4MXFp4MoEMethod(QuarkMoEMethod): else ActivationType.Gelu ), doweight_stage1=False, + expert_mask=layer.expert_mask_gpu, ) return StandardCombineInput(hidden_states=output)