Add Mistral Small 4 (Pixtral) support (#20708)
Signed-off-by: Xinyuan Tong <xinyuantong.cs@gmail.com> Co-authored-by: Alex Nails <alexnails@radixark.ai> Co-authored-by: Dimitrios Bariamis <12195802+dbari@users.noreply.github.com> Co-authored-by: dbari <dbari@users.noreply.github.com>
This commit is contained in:
@@ -781,8 +781,8 @@ class DeepseekV2Config(PretrainedConfig):
|
||||
class DeepseekVLV2Config(PretrainedConfig):
|
||||
# model_type = "deepseek_vl_v2"
|
||||
model_type = "deepseek-ocr"
|
||||
vision_config: VisionEncoderConfig
|
||||
projector_config: MlpProjectorConfig
|
||||
vision_config: VisionEncoderConfig = None
|
||||
projector_config: MlpProjectorConfig = None
|
||||
|
||||
tile_tag: str = "2D"
|
||||
global_view_pos: str = "head"
|
||||
|
||||
@@ -649,9 +649,9 @@ class DeepseekV2Config(PretrainedConfig):
|
||||
|
||||
class DeepseekVL2Config(PretrainedConfig):
|
||||
model_type = "deepseek_vl_v2"
|
||||
vision_config: DeepseekVL2VisionEncoderConfig
|
||||
projector_config: DeepseekVL2MlpProjectorConfig
|
||||
language_config: DeepseekV2Config
|
||||
vision_config: DeepseekVL2VisionEncoderConfig = None
|
||||
projector_config: DeepseekVL2MlpProjectorConfig = None
|
||||
language_config: DeepseekV2Config = None
|
||||
|
||||
tile_tag: str = "2D"
|
||||
global_view_pos: str = "head"
|
||||
|
||||
@@ -123,14 +123,14 @@ class SigLIPVisionCfg:
|
||||
|
||||
class MultiModalityConfig(PretrainedConfig):
|
||||
model_type = "multi_modality"
|
||||
vision_config: VisionConfig
|
||||
aligner_config: AlignerConfig
|
||||
vision_config: VisionConfig = None
|
||||
aligner_config: AlignerConfig = None
|
||||
|
||||
gen_vision_config: GenVisionConfig
|
||||
gen_aligner_config: GenAlignerConfig
|
||||
gen_head_config: GenHeadConfig
|
||||
gen_vision_config: GenVisionConfig = None
|
||||
gen_aligner_config: GenAlignerConfig = None
|
||||
gen_head_config: GenHeadConfig = None
|
||||
|
||||
language_config: LlamaConfig
|
||||
language_config: LlamaConfig = None
|
||||
|
||||
def __init__(self, **kwargs):
|
||||
super().__init__(**kwargs)
|
||||
@@ -595,12 +595,12 @@ class VLChatProcessor(ProcessorMixin):
|
||||
|
||||
class VLMImageProcessorConfig(PretrainedConfig):
|
||||
model_type = "deepseek_vlm"
|
||||
image_size: int
|
||||
min_size: int
|
||||
image_mean: Union[Tuple[float, float, float], List[float]]
|
||||
image_std: Union[Tuple[float, float, float], List[float]]
|
||||
rescale_factor: float
|
||||
do_normalize: bool
|
||||
image_size: int = None
|
||||
min_size: int = None
|
||||
image_mean: Union[Tuple[float, float, float], List[float]] = None
|
||||
image_std: Union[Tuple[float, float, float], List[float]] = None
|
||||
rescale_factor: float = None
|
||||
do_normalize: bool = None
|
||||
|
||||
def __init__(
|
||||
self,
|
||||
|
||||
@@ -25,18 +25,18 @@ class JetBlockConfig:
|
||||
class JetNemotronConfig(PretrainedConfig):
|
||||
model_type: str = "jet_nemotron"
|
||||
|
||||
efficient_attention_config: dict[str, dict[str, Any]]
|
||||
hidden_act: str
|
||||
hidden_size: int
|
||||
initializer_range: float
|
||||
intermediate_size: int
|
||||
layer_types: list[str]
|
||||
max_position_embeddings: int
|
||||
num_attention_heads: int
|
||||
num_key_value_heads: int
|
||||
rms_norm_eps: float
|
||||
rope_scaling: None
|
||||
rope_theta: float
|
||||
efficient_attention_config: dict[str, dict[str, Any]] = None
|
||||
hidden_act: str = None
|
||||
hidden_size: int = None
|
||||
initializer_range: float = None
|
||||
intermediate_size: int = None
|
||||
layer_types: list[str] = None
|
||||
max_position_embeddings: int = None
|
||||
num_attention_heads: int = None
|
||||
num_key_value_heads: int = None
|
||||
rms_norm_eps: float = None
|
||||
rope_scaling: None = None
|
||||
rope_theta: float = None
|
||||
|
||||
@property
|
||||
def full_attention_layer_ids(self) -> list[int]:
|
||||
|
||||
Reference in New Issue
Block a user