Tiny remove additional args in init_memory_pool (#16158)
This commit is contained in:
@@ -518,7 +518,7 @@ class ModelRunner(ModelRunnerKVCacheMixin):
|
||||
self.configure_kv_cache_dtype()
|
||||
|
||||
# Init memory pool and attention backends
|
||||
self.init_memory_pool(min_per_gpu_memory, server_args)
|
||||
self.init_memory_pool(min_per_gpu_memory)
|
||||
|
||||
# Init max running requests
|
||||
self.max_running_requests = min(
|
||||
|
||||
@@ -33,7 +33,6 @@ from sglang.srt.utils.common import (
|
||||
|
||||
if TYPE_CHECKING:
|
||||
from sglang.srt.model_executor.model_runner import ModelRunner
|
||||
from sglang.srt.server_args import ServerArgs
|
||||
|
||||
# the ratio of mamba cache pool size to max_running_requests
|
||||
MAMBA_CACHE_SIZE_MAX_RUNNING_REQUESTS_RATIO = 3
|
||||
@@ -268,11 +267,9 @@ class ModelRunnerKVCacheMixin:
|
||||
f"Use sliding window memory pool. full_layer_tokens={self.full_max_total_num_tokens}, swa_layer_tokens={self.swa_max_total_num_tokens}"
|
||||
)
|
||||
|
||||
def init_memory_pool(
|
||||
self: ModelRunner, total_gpu_memory: int, server_args: ServerArgs
|
||||
):
|
||||
max_num_reqs = server_args.max_running_requests
|
||||
max_total_tokens = server_args.max_total_tokens
|
||||
def init_memory_pool(self: ModelRunner, total_gpu_memory: int):
|
||||
max_num_reqs = self.server_args.max_running_requests
|
||||
max_total_tokens = self.server_args.max_total_tokens
|
||||
self.max_total_num_tokens = self.profile_max_num_token(total_gpu_memory)
|
||||
|
||||
if max_num_reqs is None:
|
||||
|
||||
Reference in New Issue
Block a user