[AMD] Fix Llama 4 FP8 accuracy issues on MI300X (#7699)

This commit is contained in:
Hubert Lu
2025-08-22 13:13:45 -07:00
committed by GitHub
parent e5638573c1
commit f445a1d9a3
5 changed files with 212 additions and 17 deletions

View File

@@ -2228,7 +2228,10 @@ class ServerArgs:
# use bf16 for mxfp4 triton kernels
self.dtype = "bfloat16"
elif "Llama4" in model_arch:
assert self.attention_backend == "fa3", "fa3 is required for Llama4 model"
assert self.attention_backend in {
"fa3",
"aiter",
}, "fa3 or aiter is required for Llama4 model"
elif model_arch in [
"Gemma2ForCausalLM",
"Gemma3ForCausalLM",