[4/N] MoE Refactor: Unified Triton Kernel for FusedMoE and EPMoE (#8515)

This commit is contained in:
Cheng Wan
2025-07-31 02:34:02 -07:00
committed by GitHub
parent e7dc163f57
commit 32fa1e9cc2
6 changed files with 70 additions and 690 deletions

View File

@@ -204,14 +204,6 @@ class UnquantizedFusedMoEMethod(FusedMoEMethodBase, CustomOp):
routed_scaling_factor: Optional[float] = None,
) -> torch.Tensor:
from sglang.srt.layers.moe.ep_moe.layer import EPMoE
if isinstance(layer, EPMoE):
return layer.run_moe(
hidden_states=x,
topk_output=topk_output,
)
return self.forward(
x=x,
layer=layer,