DP Enhancement (#8280)
This commit is contained in:
@@ -550,9 +550,8 @@ class DeepseekV2MoE(nn.Module):
|
||||
def forward_deepep(
|
||||
self, hidden_states: torch.Tensor, forward_batch: ForwardBatch
|
||||
) -> torch.Tensor:
|
||||
forward_mode = forward_batch.forward_mode
|
||||
shared_output = None
|
||||
if is_non_idle_and_non_empty(forward_mode, hidden_states):
|
||||
if hidden_states.shape[0] > 0:
|
||||
# router_logits: (num_tokens, n_experts)
|
||||
router_logits = self.gate(hidden_states)
|
||||
shared_output = self._forward_shared_experts(hidden_states)
|
||||
|
||||
Reference in New Issue
Block a user