Enable memory saver for hybrid model (#11974)
This commit is contained in:
@@ -1798,6 +1798,7 @@ class ModelRunner:
|
||||
),
|
||||
enable_kvcache_transpose=False,
|
||||
device=self.device,
|
||||
enable_memory_saver=self.server_args.enable_memory_saver,
|
||||
mamba_pool=self.req_to_token_pool.mamba_pool,
|
||||
use_mla=self.use_mla_backend,
|
||||
**extra_args,
|
||||
|
||||
Reference in New Issue
Block a user