From 059428bd8a6202f4f3c07aa0591383d222ce4749 Mon Sep 17 00:00:00 2001 From: Ke Bao Date: Tue, 30 Dec 2025 21:38:06 +0800 Subject: [PATCH] Tiny remove additional args in init_memory_pool (#16158) --- python/sglang/srt/model_executor/model_runner.py | 2 +- .../srt/model_executor/model_runner_kv_cache_mixin.py | 9 +++------ 2 files changed, 4 insertions(+), 7 deletions(-) diff --git a/python/sglang/srt/model_executor/model_runner.py b/python/sglang/srt/model_executor/model_runner.py index db1e325af..50723bc79 100644 --- a/python/sglang/srt/model_executor/model_runner.py +++ b/python/sglang/srt/model_executor/model_runner.py @@ -518,7 +518,7 @@ class ModelRunner(ModelRunnerKVCacheMixin): self.configure_kv_cache_dtype() # Init memory pool and attention backends - self.init_memory_pool(min_per_gpu_memory, server_args) + self.init_memory_pool(min_per_gpu_memory) # Init max running requests self.max_running_requests = min( diff --git a/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py b/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py index 128ee2f90..f4b06a594 100644 --- a/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py +++ b/python/sglang/srt/model_executor/model_runner_kv_cache_mixin.py @@ -33,7 +33,6 @@ from sglang.srt.utils.common import ( if TYPE_CHECKING: from sglang.srt.model_executor.model_runner import ModelRunner - from sglang.srt.server_args import ServerArgs # the ratio of mamba cache pool size to max_running_requests MAMBA_CACHE_SIZE_MAX_RUNNING_REQUESTS_RATIO = 3 @@ -268,11 +267,9 @@ class ModelRunnerKVCacheMixin: f"Use sliding window memory pool. full_layer_tokens={self.full_max_total_num_tokens}, swa_layer_tokens={self.swa_max_total_num_tokens}" ) - def init_memory_pool( - self: ModelRunner, total_gpu_memory: int, server_args: ServerArgs - ): - max_num_reqs = server_args.max_running_requests - max_total_tokens = server_args.max_total_tokens + def init_memory_pool(self: ModelRunner, total_gpu_memory: int): + max_num_reqs = self.server_args.max_running_requests + max_total_tokens = self.server_args.max_total_tokens self.max_total_num_tokens = self.profile_max_num_token(total_gpu_memory) if max_num_reqs is None: