From b1cbfce61252f2b93a651b193aead1b7d0b8d324 Mon Sep 17 00:00:00 2001 From: TomerBN-Nvidia Date: Wed, 10 Dec 2025 07:05:05 +0200 Subject: [PATCH] fix server args bug (#14725) --- python/sglang/srt/server_args.py | 11 ++++++----- 1 file changed, 6 insertions(+), 5 deletions(-) diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 34fce6f9c..ddd0d0ca4 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -1233,21 +1233,22 @@ class ServerArgs: ) self.disable_radix_cache = True elif model_arch in ["NemotronHForCausalLM"]: - if self.model_config.quantization in [ + model_config = self.get_model_config() + if model_config.quantization in [ "modelopt", "modelopt_fp8", "modelopt_fp4", ]: - assert self.model_config.hf_config.mlp_hidden_act == "relu2" - if self.model_config.quantization == "modelopt": + assert model_config.hf_config.mlp_hidden_act == "relu2" + if model_config.quantization == "modelopt": self.quantization = ( "modelopt_fp4" - if self.model_config.hf_config.quantization_config["quant_algo"] + if model_config.hf_config.quantization_config["quant_algo"] == "NVFP4" else "modelopt_fp8" ) else: - self.quantization = self.model_config.quantization + self.quantization = model_config.quantization self.moe_runner_backend = "flashinfer_cutlass" elif model_arch in [ "Qwen3MoeForCausalLM",