From 306c55263901f2bc466b0d25b7f514c5cde3aada Mon Sep 17 00:00:00 2001 From: Kangyan-Zhou Date: Wed, 25 Feb 2026 11:49:50 -0800 Subject: [PATCH] Revert "Fix HybridAttnBackend forward for linear attention" (#19356) --- .../layers/attention/hybrid_attn_backend.py | 28 ------------------- 1 file changed, 28 deletions(-) diff --git a/python/sglang/srt/layers/attention/hybrid_attn_backend.py b/python/sglang/srt/layers/attention/hybrid_attn_backend.py index 6b6a20a60..4f1439c26 100644 --- a/python/sglang/srt/layers/attention/hybrid_attn_backend.py +++ b/python/sglang/srt/layers/attention/hybrid_attn_backend.py @@ -145,31 +145,3 @@ class HybridAttnBackend(AttentionBackend): ) -> Optional[BaseIndexerMetadata]: backend = self._select_backend(forward_batch.forward_mode) return backend.get_indexer_metadata(layer_id, forward_batch) - - def forward( - self, - q: Optional[torch.Tensor] = None, # For full attention - k: Optional[torch.Tensor] = None, # For full attention - v: Optional[torch.Tensor] = None, # For full attention - layer: RadixAttention = None, - forward_batch: ForwardBatch = None, - save_kv_cache: bool = True, - mixed_qkv: Optional[torch.Tensor] = None, # For linear attention - a: Optional[torch.Tensor] = None, # For linear attention - b: Optional[torch.Tensor] = None, # For linear attention - **kwargs, - ): - """Forward method that supports both regular attention (q, k, v) and linear attention (mixed_qkv, a, b).""" - backend = self._select_backend(forward_batch.forward_mode) - return backend.forward( - q=q, - k=k, - v=v, - layer=layer, - forward_batch=forward_batch, - save_kv_cache=save_kv_cache, - mixed_qkv=mixed_qkv, - a=a, - b=b, - **kwargs, - )