From 5438cd20ce9ff4bf21bef998a88c6cc9b125d0de Mon Sep 17 00:00:00 2001 From: Tiwei Bie Date: Sat, 24 Jan 2026 01:52:39 +0800 Subject: [PATCH] [DLLM] Remove cuda graph batch size limitation (#17458) --- python/sglang/srt/server_args.py | 5 ----- 1 file changed, 5 deletions(-) diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 8aca7047e..6455747a8 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -2600,11 +2600,6 @@ class ServerArgs: ) self.attention_backend = "triton" elif not self.disable_cuda_graph: - if self.cuda_graph_bs != [1]: - logger.warning( - "Cuda graph bs is set to [1] because of using diffusion LLM inference" - ) - self.cuda_graph_bs = [1] if self.attention_backend != "flashinfer": logger.warning( "Attention backend is set to flashinfer because of enabling cuda graph in diffusion LLM inference"