[Core] Replace server_args mutation hack with explicit MemoryPoolConfig for draft worker init (#20183)
This commit is contained in:
@@ -152,6 +152,7 @@ class EAGLEWorker(TpModelWorker):
|
||||
is_draft_worker=True,
|
||||
req_to_token_pool=self.req_to_token_pool,
|
||||
token_to_kv_pool_allocator=self.token_to_kv_pool_allocator,
|
||||
memory_pool_config=target_worker.model_runner.memory_pool_config,
|
||||
)
|
||||
|
||||
embed, head = self.target_worker.model_runner.model.get_embed_and_head()
|
||||
|
||||
@@ -145,6 +145,7 @@ class EagleDraftWorker(BaseDraftWorker):
|
||||
is_draft_worker=True,
|
||||
req_to_token_pool=self.req_to_token_pool,
|
||||
token_to_kv_pool_allocator=self.token_to_kv_pool_allocator,
|
||||
memory_pool_config=target_worker.model_runner.memory_pool_config,
|
||||
)
|
||||
|
||||
# Alias for better readability
|
||||
|
||||
@@ -142,6 +142,7 @@ class MultiLayerEagleWorker(TpModelWorker):
|
||||
is_draft_worker=True,
|
||||
req_to_token_pool=self.req_to_token_pool,
|
||||
token_to_kv_pool_allocator=self.token_to_kv_pool_allocator,
|
||||
memory_pool_config=target_worker.model_runner.memory_pool_config,
|
||||
is_multi_layer_eagle=True,
|
||||
)
|
||||
|
||||
|
||||
@@ -126,6 +126,7 @@ class MultiLayerEagleDraftWorker(BaseDraftWorker):
|
||||
is_draft_worker=True,
|
||||
req_to_token_pool=self.req_to_token_pool,
|
||||
token_to_kv_pool_allocator=self.token_to_kv_pool_allocator,
|
||||
memory_pool_config=target_worker.model_runner.memory_pool_config,
|
||||
is_multi_layer_eagle=True,
|
||||
)
|
||||
|
||||
|
||||
@@ -86,6 +86,7 @@ class StandaloneWorker(EAGLEWorker):
|
||||
is_draft_worker=True,
|
||||
req_to_token_pool=self.req_to_token_pool,
|
||||
token_to_kv_pool_allocator=self.token_to_kv_pool_allocator,
|
||||
memory_pool_config=target_worker.model_runner.memory_pool_config,
|
||||
)
|
||||
|
||||
# Init attention backend and cuda graphs
|
||||
|
||||
@@ -99,6 +99,7 @@ class StandaloneDraftWorker(EagleDraftWorker):
|
||||
is_draft_worker=True,
|
||||
req_to_token_pool=self.req_to_token_pool,
|
||||
token_to_kv_pool_allocator=self.token_to_kv_pool_allocator,
|
||||
memory_pool_config=target_worker.model_runner.memory_pool_config,
|
||||
)
|
||||
|
||||
# Alias for better readability
|
||||
|
||||
Reference in New Issue
Block a user