fix_get_quant_method_in_fused_moe_condition (#18459)

Signed-off-by: tom-zju <tanjianpingzju1990@gmail.com>
Co-authored-by: Peng Zhang <aniz1905@gmail.com>
This commit is contained in:
tjp_zju
2026-02-16 00:31:42 +08:00
committed by GitHub
parent 536ed3143b
commit 7a607c4900

View File

@@ -18,7 +18,10 @@ from sglang.srt.layers.quantization.base_config import (
QuantizeMethodBase,
)
from sglang.srt.layers.quantization.gptq import GPTQConfig, GPTQMarlinConfig
from sglang.srt.layers.quantization.unquant import UnquantizedLinearMethod
from sglang.srt.layers.quantization.unquant import (
UnquantizedFusedMoEMethod,
UnquantizedLinearMethod,
)
from sglang.srt.utils import get_device_capability, set_weight_attrs
logger = logging.getLogger(__name__)
@@ -194,6 +197,8 @@ class MoeWNA16Config(QuantizationConfig):
from sglang.srt.layers.moe.fused_moe_triton.layer import FusedMoE
if is_layer_skipped_quant(prefix, self.modules_to_not_convert):
if isinstance(layer, FusedMoE):
return UnquantizedFusedMoEMethod()
return UnquantizedLinearMethod()
elif isinstance(layer, LinearBase):