From 42e1a72efb7852be3c9e5e3c3c3914aeb871433e Mon Sep 17 00:00:00 2001 From: hlu1 <14827759+hlu1@users.noreply.github.com> Date: Tue, 28 Oct 2025 23:51:20 -0700 Subject: [PATCH] [Deepseek V3.2] Enable flashmla_auto with MTP (#12294) Signed-off-by: Hao Lu <14827759+hlu1@users.noreply.github.com> --- python/sglang/srt/layers/attention/nsa_backend.py | 4 +--- 1 file changed, 1 insertion(+), 3 deletions(-) diff --git a/python/sglang/srt/layers/attention/nsa_backend.py b/python/sglang/srt/layers/attention/nsa_backend.py index 257e7c625..512da38d6 100644 --- a/python/sglang/srt/layers/attention/nsa_backend.py +++ b/python/sglang/srt/layers/attention/nsa_backend.py @@ -1222,11 +1222,9 @@ class NativeSparseAttnBackend(AttentionBackend): if self.enable_auto_select_prefill_impl: if self.nsa_kv_cache_store_fp8: if ( - # TODO(hlu1): enable MTP is_blackwell() and forward_batch is not None - and forward_batch.forward_mode.is_extend() - and forward_batch.spec_algorithm.is_none() + and forward_batch.forward_mode == ForwardMode.EXTEND ): total_kv_tokens = forward_batch.seq_lens_sum total_q_tokens = forward_batch.extend_num_tokens