vlm: support video as an input modality (#5888)
This commit is contained in:
@@ -142,7 +142,7 @@ class LlavaVidForCausalLM(nn.Module):
|
||||
)
|
||||
image_offsets = [
|
||||
flatten_nested_list(
|
||||
[item.image_offsets for item in image_inputs[i].mm_items]
|
||||
[item.offsets for item in image_inputs[i].mm_items]
|
||||
)
|
||||
for i in range(bs)
|
||||
if need_vision[i]
|
||||
|
||||
Reference in New Issue
Block a user