diff --git a/python/sglang/srt/batch_invariant_ops/batch_invariant_ops.py b/python/sglang/srt/batch_invariant_ops/batch_invariant_ops.py index 67bb1c5c7..b71fc97db 100644 --- a/python/sglang/srt/batch_invariant_ops/batch_invariant_ops.py +++ b/python/sglang/srt/batch_invariant_ops/batch_invariant_ops.py @@ -297,7 +297,10 @@ def matmul_persistent( return _matmul_persistent_deepgemm(a=a, b=b, bias=bias) if _ENABLE_MM_FALLBACK_VARIANT: - return torch.einsum("ik,kj->ij", a, b) + out = torch.einsum("ik,kj->ij", a, b) + if bias is not None: + out += bias + return out return _matmul_persistent_triton(a=a, b=b, bias=bias)