diff --git a/python/sglang/srt/layers/quantization/mxfp4.py b/python/sglang/srt/layers/quantization/mxfp4.py index 4616879ce..84424458c 100644 --- a/python/sglang/srt/layers/quantization/mxfp4.py +++ b/python/sglang/srt/layers/quantization/mxfp4.py @@ -866,5 +866,6 @@ class Mxfp4DynamicQuantMoEMethod(FusedMoEMethodBase): else ActivationType.Gelu ), doweight_stage1=False, + expert_mask=layer.expert_mask_gpu, ) return StandardCombineInput(hidden_states=output) diff --git a/python/sglang/srt/layers/quantization/quark/quark_moe.py b/python/sglang/srt/layers/quantization/quark/quark_moe.py index e48392201..186f6c5d0 100644 --- a/python/sglang/srt/layers/quantization/quark/quark_moe.py +++ b/python/sglang/srt/layers/quantization/quark/quark_moe.py @@ -245,6 +245,7 @@ class QuarkW4A4MXFp4MoEMethod(QuarkMoEMethod): else ActivationType.Gelu ), doweight_stage1=False, + expert_mask=layer.expert_mask_gpu, ) return StandardCombineInput(hidden_states=output)