[RL] enable offloading hybrid linear attn model (#13336)

This commit is contained in:
Zilin Zhu
2025-11-16 17:12:52 +08:00
committed by GitHub
parent 4e19c1d541
commit 9509c4ccd3
2 changed files with 13 additions and 7 deletions

View File

@@ -1837,6 +1837,7 @@ class ModelRunner:
enable_kvcache_transpose=False,
device=self.device,
mamba_pool=self.req_to_token_pool.mamba_pool,
enable_memory_saver=self.server_args.enable_memory_saver,
use_mla=self.use_mla_backend,
**extra_args,
)