Implement Siglip Vision model, and support BNB quantization for gemma3-mm (#5339)

This commit is contained in:
Jiajun Li
2025-05-20 23:53:46 -07:00
committed by GitHub
parent 5c0b38f369
commit 4024e1d2a8
4 changed files with 353 additions and 29 deletions
+5 -1
View File
@@ -168,7 +168,7 @@ class CLIPEncoderLayer(nn.Module):
softmax_in_single_precision=softmax_in_single_precision,
flatten_batch=True,
quant_config=quant_config,
prefix=add_prefix("attn", prefix),
prefix=add_prefix("self_attn", prefix),
)
self.mlp = CLIPMLP(
config,
@@ -395,6 +395,10 @@ class CLIPVisionModel(nn.Module):
config, quant_config, prefix=add_prefix("vision_model", prefix)
)
@property
def device(self) -> torch.device:
return self.vision_model.device
def forward(self, pixel_values: torch.Tensor):
return self.vision_model(pixel_values)