From f69ca93d496d96ce881a11b6992601cf0c18bd81 Mon Sep 17 00:00:00 2001 From: AMD-yanfeiwang Date: Fri, 27 Feb 2026 18:15:55 +0800 Subject: [PATCH] [AMD] remove redundancy H2D op in aiter attention backend (#19416) Co-authored-by: root --- python/sglang/srt/layers/attention/aiter_backend.py | 4 +--- 1 file changed, 1 insertion(+), 3 deletions(-) diff --git a/python/sglang/srt/layers/attention/aiter_backend.py b/python/sglang/srt/layers/attention/aiter_backend.py index 2d7692449..a79e61138 100755 --- a/python/sglang/srt/layers/attention/aiter_backend.py +++ b/python/sglang/srt/layers/attention/aiter_backend.py @@ -1487,9 +1487,7 @@ class AiterAttnBackend(AttentionBackend): k = k.to(fp8_dtype) if v.dtype != fp8_dtype: v = v.to(fp8_dtype) - one_scale = torch.tensor( - 1.0, dtype=torch.float32, device=q.device - ) + one_scale = torch.ones((), dtype=torch.float32, device=q.device) kv_indptr_asm = qo_indptr kv_indices_asm = self.forward_metadata.fp8_prefill_kv_indices