[router] add get server info and get model info in grpc server (#11303)
This commit is contained in:
@@ -5,6 +5,7 @@ Uses GrpcRequestManager for orchestration without tokenization.
|
||||
|
||||
import argparse
|
||||
import asyncio
|
||||
import dataclasses
|
||||
import logging
|
||||
import multiprocessing as mp
|
||||
import os
|
||||
@@ -15,8 +16,11 @@ from typing import AsyncIterator, Dict, Optional, Tuple
|
||||
|
||||
import grpc
|
||||
from google.protobuf.json_format import MessageToDict
|
||||
from google.protobuf.struct_pb2 import Struct
|
||||
from google.protobuf.timestamp_pb2 import Timestamp
|
||||
from grpc_reflection.v1alpha import reflection
|
||||
|
||||
import sglang
|
||||
from sglang.srt.disaggregation.utils import FAKE_BOOTSTRAP_HOST, DisaggregationMode
|
||||
from sglang.srt.entrypoints.grpc_request_manager import GrpcRequestManager
|
||||
from sglang.srt.grpc import sglang_scheduler_pb2, sglang_scheduler_pb2_grpc
|
||||
@@ -173,11 +177,13 @@ class SGLangSchedulerServicer(sglang_scheduler_pb2_grpc.SglangSchedulerServicer)
|
||||
request_manager: GrpcRequestManager,
|
||||
server_args: ServerArgs,
|
||||
model_info: Dict,
|
||||
scheduler_info: Dict,
|
||||
):
|
||||
"""Initialize the standalone gRPC service."""
|
||||
self.request_manager = request_manager
|
||||
self.server_args = server_args
|
||||
self.model_info = model_info
|
||||
self.scheduler_info = scheduler_info
|
||||
self.start_time = time.time()
|
||||
|
||||
# Start the request manager's event loop using auto_create_handle_loop
|
||||
@@ -396,6 +402,89 @@ class SGLangSchedulerServicer(sglang_scheduler_pb2_grpc.SglangSchedulerServicer)
|
||||
message=str(e),
|
||||
)
|
||||
|
||||
async def GetModelInfo(
|
||||
self,
|
||||
request: sglang_scheduler_pb2.GetModelInfoRequest,
|
||||
context: grpc.aio.ServicerContext,
|
||||
) -> sglang_scheduler_pb2.GetModelInfoResponse:
|
||||
"""Get model information."""
|
||||
logger.info("Model info request received")
|
||||
|
||||
is_generation = self.scheduler_info.get("is_generation")
|
||||
if is_generation is None:
|
||||
is_generation = not self.server_args.is_embedding
|
||||
|
||||
return sglang_scheduler_pb2.GetModelInfoResponse(
|
||||
model_path=self.server_args.model_path,
|
||||
tokenizer_path=self.server_args.tokenizer_path or "",
|
||||
is_generation=is_generation,
|
||||
preferred_sampling_params=(
|
||||
self.server_args.preferred_sampling_params or ""
|
||||
),
|
||||
weight_version=self.server_args.weight_version or "",
|
||||
served_model_name=self.server_args.served_model_name,
|
||||
max_context_length=self.model_info["max_context_length"],
|
||||
vocab_size=self.model_info["vocab_size"],
|
||||
supports_vision=self.model_info["supports_vision"],
|
||||
model_type=self.model_info["model_type"],
|
||||
eos_token_ids=self.model_info["eos_token_ids"],
|
||||
pad_token_id=self.model_info["pad_token_id"],
|
||||
bos_token_id=self.model_info["bos_token_id"],
|
||||
max_req_input_len=self.model_info["max_req_input_len"],
|
||||
)
|
||||
|
||||
async def GetServerInfo(
|
||||
self,
|
||||
request: sglang_scheduler_pb2.GetServerInfoRequest,
|
||||
context: grpc.aio.ServicerContext,
|
||||
) -> sglang_scheduler_pb2.GetServerInfoResponse:
|
||||
"""Get server information."""
|
||||
logger.info("Server info request received")
|
||||
|
||||
server_args_dict = dataclasses.asdict(self.server_args)
|
||||
server_args_struct = Struct()
|
||||
|
||||
def make_serializable(obj):
|
||||
if obj is None:
|
||||
return None
|
||||
elif isinstance(obj, (str, int, float, bool)):
|
||||
return obj
|
||||
elif isinstance(obj, (list, tuple, set)):
|
||||
return [make_serializable(item) for item in obj]
|
||||
elif isinstance(obj, dict):
|
||||
return {k: make_serializable(v) for k, v in obj.items()}
|
||||
else:
|
||||
return str(obj)
|
||||
|
||||
serializable_args = make_serializable(server_args_dict)
|
||||
server_args_struct.update(serializable_args)
|
||||
|
||||
# Convert scheduler_info to Struct
|
||||
scheduler_info_struct = Struct()
|
||||
scheduler_info_struct.update(self.scheduler_info)
|
||||
|
||||
# Get runtime state from request manager
|
||||
manager_state = self.request_manager.get_server_info()
|
||||
|
||||
# Calculate uptime
|
||||
uptime = time.time() - self.start_time
|
||||
|
||||
# Create timestamp
|
||||
start_timestamp = Timestamp()
|
||||
start_timestamp.FromSeconds(int(self.start_time))
|
||||
|
||||
return sglang_scheduler_pb2.GetServerInfoResponse(
|
||||
server_args=server_args_struct,
|
||||
scheduler_info=scheduler_info_struct,
|
||||
active_requests=manager_state["active_requests"],
|
||||
is_paused=manager_state["paused"],
|
||||
last_receive_timestamp=manager_state["last_receive_time"],
|
||||
uptime_seconds=uptime,
|
||||
sglang_version=sglang.__version__,
|
||||
server_type="grpc",
|
||||
start_time=start_timestamp,
|
||||
)
|
||||
|
||||
# Helper methods for request/response conversion
|
||||
|
||||
def _convert_generate_request(
|
||||
@@ -756,6 +845,7 @@ async def serve_grpc(
|
||||
request_manager=request_manager,
|
||||
server_args=server_args,
|
||||
model_info=model_info,
|
||||
scheduler_info=scheduler_info,
|
||||
)
|
||||
sglang_scheduler_pb2_grpc.add_SglangSchedulerServicer_to_server(servicer, server)
|
||||
|
||||
|
||||
Reference in New Issue
Block a user