Enable Nvidia's ModelOpt fp8 quantized models (#2535)

This commit is contained in:
Zhiyu
2025-01-06 14:54:52 -08:00
committed by GitHub
parent b8574f6953
commit 287427e2e6
5 changed files with 185 additions and 0 deletions

View File

@@ -44,6 +44,7 @@ WEIGHT_LOADER_V2_SUPPORTED = [
"MarlinLinearMethod",
"GPTQLinearMethod",
"QQQLinearMethod",
"ModelOptFp8LinearMethod",
]