Reduce one step decode for draft model. (#11561)
This commit is contained in:
@@ -2320,7 +2320,7 @@ class FlashAttentionMultiStepBackend:
|
||||
self.topk = topk
|
||||
self.speculative_num_steps = speculative_num_steps
|
||||
self.attn_backends = []
|
||||
for i in range(self.speculative_num_steps):
|
||||
for i in range(self.speculative_num_steps - 1):
|
||||
self.attn_backends.append(
|
||||
FlashAttentionBackend(
|
||||
model_runner,
|
||||
@@ -2335,7 +2335,7 @@ class FlashAttentionMultiStepBackend:
|
||||
self.attn_backends[i].init_forward_metadata(forward_batch)
|
||||
|
||||
def init_cuda_graph_state(self, max_bs: int, max_num_tokens: int):
|
||||
for i in range(self.speculative_num_steps):
|
||||
for i in range(self.speculative_num_steps - 1):
|
||||
self.attn_backends[i].init_cuda_graph_state(max_bs, max_num_tokens)
|
||||
|
||||
def init_forward_metadata_capture_cuda_graph(
|
||||
|
||||
Reference in New Issue
Block a user