diff --git a/python/sglang/srt/layers/moe/fused_moe_triton/layer.py b/python/sglang/srt/layers/moe/fused_moe_triton/layer.py index d7fdb1079..4cb4acf2a 100644 --- a/python/sglang/srt/layers/moe/fused_moe_triton/layer.py +++ b/python/sglang/srt/layers/moe/fused_moe_triton/layer.py @@ -1037,7 +1037,9 @@ class FlashInferFusedMoE(FusedMoE): final_hidden_states = self.quant_method.apply_with_router_logits( layer=self, dispatch_output=StandardDispatchOutput( - hidden_states=hidden_states, topk_output=topk_output + hidden_states=hidden_states, + hidden_states_scale=None, + topk_output=topk_output, ), ) diff --git a/test/srt/run_suite.py b/test/srt/run_suite.py index 48510c959..863192c00 100644 --- a/test/srt/run_suite.py +++ b/test/srt/run_suite.py @@ -116,6 +116,7 @@ suites = { TestFile("test_swa_unittest.py", 1), TestFile("test_torch_compile.py", 76), TestFile("test_torch_compile_moe.py", 210), + TestFile("test_triton_fused_moe.py", 80), TestFile("test_torch_native_attention_backend.py", 123), TestFile("test_torchao.py", 70), TestFile("test_triton_attention_kernels.py", 4), diff --git a/test/manual/test_triton_fused_moe.py b/test/srt/test_triton_fused_moe.py similarity index 98% rename from test/manual/test_triton_fused_moe.py rename to test/srt/test_triton_fused_moe.py index d989494c9..07e774a9b 100644 --- a/test/manual/test_triton_fused_moe.py +++ b/test/srt/test_triton_fused_moe.py @@ -115,7 +115,7 @@ class TestFusedMOE(CustomTestCase): quant_info = TritonKernelsQuantInfo(w13_weight=w1_tri, w2_weight=w2_tri) dispatch_output = StandardDispatchOutput( - hidden_states=a, topk_output=triton_topk_output + hidden_states=a, hidden_states_scale=None, topk_output=triton_topk_output ) torch_per_expert = self.torch_naive_moe(