diff --git a/python/sglang/srt/layers/attention/attention_registry.py b/python/sglang/srt/layers/attention/attention_registry.py index 9020e5260..2353c1599 100644 --- a/python/sglang/srt/layers/attention/attention_registry.py +++ b/python/sglang/srt/layers/attention/attention_registry.py @@ -210,7 +210,8 @@ def attn_backend_wrapper(runner: "ModelRunner", full_attn_backend: "AttentionBac runner.server_args.attention_backend == "triton" or runner.server_args.attention_backend == "trtllm_mha" or runner.server_args.attention_backend == "fa4" - ), "triton or trtllm_mha or fa4 backend are the only supported backends on Blackwell GPUs for hybrid GDN models, use --attention-backend triton or --attention-backend trtllm_mha to specify the backend." + or runner.server_args.attention_backend == "flashinfer" + ), "triton, trtllm_mha, fa4, or flashinfer backend are the only supported backends on Blackwell GPUs for hybrid GDN models, use --attention-backend to specify the backend." if is_npu(): assert ( runner.server_args.attention_backend == "ascend"