refactor: minor refactors regarding multimodal processing (#6187)
This commit is contained in:
@@ -324,8 +324,9 @@ class MultimodalInputs:
|
||||
video_token_id: Optional[int] = None
|
||||
|
||||
# audio
|
||||
audio_start_id: Optional[torch.Tensor] = None
|
||||
audio_end_id: Optional[torch.Tensor] = None
|
||||
audio_token_id: Optional[int] = None
|
||||
audio_start_id: Optional[int] = None
|
||||
audio_end_id: Optional[int] = None
|
||||
|
||||
@staticmethod
|
||||
def from_dict(obj: dict):
|
||||
@@ -349,6 +350,7 @@ class MultimodalInputs:
|
||||
"slice_end_id",
|
||||
"audio_start_id",
|
||||
"audio_end_id",
|
||||
"audio_token_id",
|
||||
]
|
||||
for arg in optional_args:
|
||||
if arg in obj:
|
||||
|
||||
Reference in New Issue
Block a user