Update readme (#15425)

This commit is contained in:
Lianmin Zheng
2025-12-18 23:06:00 -08:00
committed by GitHub
parent a36142aa71
commit f228b662a7
2 changed files with 18 additions and 14 deletions

View File

@@ -292,13 +292,8 @@ class Scheduler(
)
)
# Init model config
self.model_config = ModelConfig.from_server_args(server_args)
self.dllm_config = ( # For diffusion LLM
DllmConfig.from_server_args(server_args)
if server_args.dllm_algorithm is not None
else None
)
# Init model configs
self.init_model_config()
# Init metrics stats
self.init_metrics(tp_rank, pp_rank, dp_rank)
@@ -306,7 +301,7 @@ class Scheduler(
# Init inter-process communication
self.init_sockets(server_args, port_args)
# Init pdmux context
# Init PD-multiplexing context
if self.enable_pdmux:
self.init_pdmux()
@@ -316,10 +311,10 @@ class Scheduler(
# Init moe config and GEMM config (FP8 GEMM, etc.)
self.init_moe_gemm_config()
# Launch a tensor parallel worker
# Launch a model worker and draft model worker if using speculative decoding
self.init_model_worker()
# Init cache using the existing memory pool
# Init cache and memory pool
self.init_cache_with_memory_pool()
# Init running status
@@ -340,10 +335,10 @@ class Scheduler(
# Init profiler
self.init_profiler()
# Init disaggregation
# Init prefill-decodedisaggregation
self.init_disaggregation()
# Init overlap
# Init overlap schedule
self.init_overlap()
# Init prefill kv split size when deterministic inference is enabled with various attention backends
@@ -352,6 +347,14 @@ class Scheduler(
# Init request dispatcher
self.init_request_dispatcher()
def init_model_config(self):
self.model_config = ModelConfig.from_server_args(self.server_args)
self.dllm_config = ( # For diffusion LLM
DllmConfig.from_server_args(self.server_args)
if self.server_args.dllm_algorithm is not None
else None
)
def init_sockets(self, server_args: ServerArgs, port_args: PortArgs):
context = zmq.Context(2)
self.idle_sleeper = None