model: adapt mllama4 to VisionAttention (#8512)
Co-authored-by: root <mickjagger19@icloud.com>
This commit is contained in:
@@ -241,13 +241,22 @@ class Llama4Attention(nn.Module):
|
||||
if self.use_qk_norm
|
||||
else None
|
||||
)
|
||||
|
||||
qkv_quant_config = quant_config
|
||||
o_quant_config = quant_config
|
||||
if quant_config and hasattr(quant_config, "ignore") and quant_config.ignore:
|
||||
if add_prefix("q_proj", prefix) in quant_config.ignore:
|
||||
qkv_quant_config = None
|
||||
if add_prefix("o_proj", prefix) in quant_config.ignore:
|
||||
o_quant_config = None
|
||||
|
||||
self.qkv_proj = QKVParallelLinear(
|
||||
hidden_size=hidden_size,
|
||||
head_size=self.head_dim,
|
||||
total_num_heads=self.total_num_heads,
|
||||
total_num_kv_heads=self.total_num_kv_heads,
|
||||
bias=bias,
|
||||
quant_config=quant_config,
|
||||
quant_config=qkv_quant_config,
|
||||
prefix=add_prefix("qkv_proj", prefix),
|
||||
tp_rank=attn_tp_rank,
|
||||
tp_size=attn_tp_size,
|
||||
@@ -257,7 +266,7 @@ class Llama4Attention(nn.Module):
|
||||
input_size=self.total_num_heads * self.head_dim,
|
||||
output_size=hidden_size,
|
||||
bias=bias_o_proj,
|
||||
quant_config=quant_config,
|
||||
quant_config=o_quant_config,
|
||||
prefix=add_prefix("o_proj", prefix),
|
||||
tp_rank=attn_tp_rank,
|
||||
tp_size=attn_tp_size,
|
||||
|
||||
Reference in New Issue
Block a user