[Fix] flashinfer_trtllm intermediate_size assertion with Qwen3 + TP=8 (#16824)

This commit is contained in:
b8zhong
2026-01-16 17:24:05 -08:00
committed by GitHub
parent b0701f02b3
commit d36f6f043c
3 changed files with 44 additions and 27 deletions

View File

@@ -2708,6 +2708,14 @@ def has_hf_quant_config(model_path: str) -> bool:
return False
def get_quantization_config(hf_config) -> str | None:
"""Extract quantization method from HuggingFace config."""
quantization_config = getattr(hf_config, "quantization_config", None)
if quantization_config is not None:
return quantization_config.get("quant_method")
return None
def flatten_nested_list(nested_list):
if isinstance(nested_list, list):
return [