feat: basic support for server-level multimodal cache (#10775)

This commit is contained in:
Mick
2025-11-10 00:27:50 +08:00
committed by GitHub
parent bb00e24f87
commit f5b3ccd9a5
5 changed files with 114 additions and 54 deletions
+3 -3
View File
@@ -14,7 +14,7 @@ from transformers import AutoModel, AutoProcessor, AutoTokenizer
from sglang.srt.configs.model_config import ModelConfig
from sglang.srt.entrypoints.openai.protocol import ChatCompletionRequest
from sglang.srt.managers.mm_utils import embed_mm_inputs, init_embedding_cache
from sglang.srt.managers.mm_utils import embed_mm_inputs, init_mm_embedding_cache
from sglang.srt.managers.schedule_batch import (
Modality,
MultimodalDataItem,
@@ -182,7 +182,7 @@ class TestMiniCPMV2_6Logits(VisionLLMLogitsBase):
.eval()
.to(cls.device)
)
init_embedding_cache()
init_mm_embedding_cache()
async def test_vlm_embedding_output(self):
"""
@@ -288,7 +288,7 @@ class TestMiniCPMV4Logits(VisionLLMLogitsBase):
.eval()
.to(cls.device)
)
init_embedding_cache()
init_mm_embedding_cache()
async def test_vlm_embedding_output(self):
"""