Co-authored-by: averyhuang <averyh@nvidia.com>
This commit is contained in:
@@ -301,7 +301,7 @@ class GptOssAttention(nn.Module):
|
||||
hidden_states, forward_batch, inner_state = intermediate_state
|
||||
if inner_state is None:
|
||||
return hidden_states
|
||||
attn_output = self.attn(*inner_state, sinks=self.sinks)
|
||||
attn_output = self.attn(*inner_state, sinks=self.sinks.to(torch.float32))
|
||||
output, _ = self.o_proj(attn_output)
|
||||
return output
|
||||
|
||||
|
||||
Reference in New Issue
Block a user