support llama4 eagle3 (#6985)
Co-authored-by: shuaills <shishuaiuoe@gmail.com> Co-authored-by: Shenggui Li <somerlee.9@gmail.com> Co-authored-by: Yingyi Huang <yingyihuang2000@outlook.com> Co-authored-by: yizhang2077 <1109276519@qq.com>
This commit is contained in:
@@ -124,6 +124,9 @@ def _get_quantization_config(
|
||||
quant_config = get_quant_config(
|
||||
model_config, load_config, packed_modules_mapping
|
||||
)
|
||||
# (yizhang2077) workaround for nvidia/Llama-4-Maverick-17B-128E-Eagle3
|
||||
if quant_config is None:
|
||||
return None
|
||||
major, minor = get_device_capability()
|
||||
|
||||
if major is not None and minor is not None:
|
||||
|
||||
@@ -209,6 +209,17 @@ def get_quant_config(
|
||||
config["adapter_name_or_path"] = model_name_or_path
|
||||
elif model_config.quantization == "modelopt":
|
||||
if config["producer"]["name"] == "modelopt":
|
||||
# (yizhang2077) workaround for nvidia/Llama-4-Maverick-17B-128E-Eagle3
|
||||
if config["quantization"]["quant_algo"] is None:
|
||||
if (
|
||||
model_config.hf_config.architectures[0]
|
||||
!= "LlamaForCausalLMEagle3"
|
||||
):
|
||||
raise ValueError(
|
||||
f"Invalid quant_config, quantization method: {model_config.quantization},"
|
||||
f"hf architectures: {model_config.hf_config.architectures[0]}. "
|
||||
)
|
||||
return None
|
||||
if "FP4" in config["quantization"]["quant_algo"]:
|
||||
return ModelOptFp4Config.from_config(config)
|
||||
else:
|
||||
|
||||
Reference in New Issue
Block a user