[Fix] flashinfer_trtllm intermediate_size assertion with Qwen3 + TP=8 (#16824)
This commit is contained in:
@@ -2708,6 +2708,14 @@ def has_hf_quant_config(model_path: str) -> bool:
|
||||
return False
|
||||
|
||||
|
||||
def get_quantization_config(hf_config) -> str | None:
|
||||
"""Extract quantization method from HuggingFace config."""
|
||||
quantization_config = getattr(hf_config, "quantization_config", None)
|
||||
if quantization_config is not None:
|
||||
return quantization_config.get("quant_method")
|
||||
return None
|
||||
|
||||
|
||||
def flatten_nested_list(nested_list):
|
||||
if isinstance(nested_list, list):
|
||||
return [
|
||||
|
||||
Reference in New Issue
Block a user