[RL] support only do cpu backup on draft model (#13318)

This commit is contained in:
Zilin Zhu
2025-11-15 16:31:57 +08:00
committed by GitHub
parent 2a96e302cb
commit 56fc483073
2 changed files with 11 additions and 2 deletions

View File

@@ -756,9 +756,12 @@ class ModelRunner:
# Remove monkey_patch when linear.py quant remove dependencies with vllm
monkey_patch_vllm_parallel_state()
enable_cpu_backup = self.server_args.enable_weights_cpu_backup or (
self.is_draft_worker and self.server_args.enable_draft_weights_cpu_backup
)
with self.memory_saver_adapter.region(
GPU_MEMORY_TYPE_WEIGHTS,
enable_cpu_backup=self.server_args.enable_weights_cpu_backup,
enable_cpu_backup=enable_cpu_backup,
):
self.model = get_model(
model_config=self.model_config,