From dc1309fc7e4a1f338a13bd3f91a549ac766d6cc0 Mon Sep 17 00:00:00 2001 From: Yi Zhong <207368749+vincentzed@users.noreply.github.com> Date: Wed, 11 Feb 2026 20:27:22 -0500 Subject: [PATCH] Avoid kimi linear stream sync (#16186) Signed-off-by: vincentzed <207368749+vincentzed@users.noreply.github.com> --- .../sglang/srt/layers/attention/hybrid_linear_attn_backend.py | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py b/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py index afbc84017..a19067acb 100644 --- a/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py +++ b/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py @@ -535,7 +535,7 @@ class MambaAttnBackendBase(AttentionBackend): self.query_start_loc_list[bs - 1][: bs - num_padding].copy_( self.cached_cuda_graph_decode_query_start_loc[: bs - num_padding] ) - self.query_start_loc_list[bs - 1][bs - num_padding :].copy_( + self.query_start_loc_list[bs - 1][bs - num_padding :].fill_( bs - num_padding ) elif forward_mode.is_target_verify(): @@ -547,7 +547,7 @@ class MambaAttnBackendBase(AttentionBackend): self.query_start_loc_list[bs - 1][: bs - num_padding].copy_( self.cached_cuda_graph_verify_query_start_loc[: bs - num_padding] ) - self.query_start_loc_list[bs - 1][bs - num_padding :].copy_( + self.query_start_loc_list[bs - 1][bs - num_padding :].fill_( (bs - num_padding) * spec_info.draft_token_num ) else: