Enable native ModelOpt quantization support (2/3) (#9991)

Signed-off-by: Zhiyu Cheng <zhiyuc@nvidia.com>
This commit is contained in:
Zhiyu
2025-10-11 07:48:14 +00:00
committed by GitHub
parent 8b85926a6e
commit 129d299278
3 changed files with 127 additions and 26 deletions
@@ -86,6 +86,8 @@ class ModelConfig:
dtype: str = "auto",
quantization: Optional[str] = None,
modelopt_quant: Optional[Union[str, Dict]] = None,
modelopt_checkpoint_restore_path: Optional[str] = None,
modelopt_checkpoint_save_path: Optional[str] = None,
override_config_file: Optional[str] = None,
is_draft_model: bool = False,
hybrid_kvcache_ratio: Optional[float] = None,