[RL] support only do cpu backup on draft model (#13318)
This commit is contained in:
@@ -756,9 +756,12 @@ class ModelRunner:
|
||||
# Remove monkey_patch when linear.py quant remove dependencies with vllm
|
||||
monkey_patch_vllm_parallel_state()
|
||||
|
||||
enable_cpu_backup = self.server_args.enable_weights_cpu_backup or (
|
||||
self.is_draft_worker and self.server_args.enable_draft_weights_cpu_backup
|
||||
)
|
||||
with self.memory_saver_adapter.region(
|
||||
GPU_MEMORY_TYPE_WEIGHTS,
|
||||
enable_cpu_backup=self.server_args.enable_weights_cpu_backup,
|
||||
enable_cpu_backup=enable_cpu_backup,
|
||||
):
|
||||
self.model = get_model(
|
||||
model_config=self.model_config,
|
||||
|
||||
Reference in New Issue
Block a user