From cc1ca61c81fb2133ab134fd4294d11828fa89a9e Mon Sep 17 00:00:00 2001 From: Alison Shao <54658187+alisonshao@users.noreply.github.com> Date: Wed, 25 Feb 2026 10:27:31 -0800 Subject: [PATCH] fix: add --cuda-graph-max-bs to DSV3 FA3 FP8 KV cache test (#19307) --- test/registered/mla/test_mla_deepseek_v3.py | 4 +++- 1 file changed, 3 insertions(+), 1 deletion(-) diff --git a/test/registered/mla/test_mla_deepseek_v3.py b/test/registered/mla/test_mla_deepseek_v3.py index b7518ede6..c30d6827b 100644 --- a/test/registered/mla/test_mla_deepseek_v3.py +++ b/test/registered/mla/test_mla_deepseek_v3.py @@ -110,7 +110,9 @@ class TestMLADeepseekV3Fa3Fp8Kvcache(CustomTestCase): "fp8_e4m3", ] if is_cuda(): - other_args.extend(["--attention-backend", "fa3"]) + other_args.extend( + ["--attention-backend", "fa3", "--cuda-graph-max-bs", "2"] + ) cls.process = popen_launch_server( cls.model, cls.base_url,