[feat] support in-flight weight update (#10071)

Co-authored-by: 赵晨阳 <zhaochen20@outlook.com>
This commit is contained in:
ShawnY112358
2025-11-26 14:03:13 +08:00
committed by GitHub
parent 7130ad3a29
commit 007c3e234c
10 changed files with 401 additions and 34 deletions

View File

@@ -78,6 +78,7 @@ from sglang.srt.managers.io_struct import (
AbortReq,
CloseSessionReqInput,
ConfigureLoggingReq,
ContinueGenerationReqInput,
DestroyWeightsUpdateGroupReqInput,
EmbeddingReqInput,
GenerateReqInput,
@@ -87,6 +88,7 @@ from sglang.srt.managers.io_struct import (
LoadLoRAAdapterReqInput,
OpenSessionReqInput,
ParseFunctionCallReq,
PauseGenerationReqInput,
ProfileReqInput,
ReleaseMemoryOccupationReqInput,
ResumeMemoryOccupationReqInput,
@@ -1087,9 +1089,9 @@ async def separate_reasoning_request(obj: SeparateReasoningReqInput, request: Re
@app.post("/pause_generation")
async def pause_generation(request: Request):
async def pause_generation(obj: PauseGenerationReqInput, request: Request):
"""Pause generation."""
await _global_state.tokenizer_manager.pause_generation()
await _global_state.tokenizer_manager.pause_generation(obj)
return ORJSONResponse(
content={"message": "Generation paused successfully.", "status": "ok"},
status_code=200,
@@ -1097,9 +1099,9 @@ async def pause_generation(request: Request):
@app.post("/continue_generation")
async def continue_generation(request: Request):
async def continue_generation(obj: ContinueGenerationReqInput, request: Request):
"""Continue generation."""
await _global_state.tokenizer_manager.continue_generation()
await _global_state.tokenizer_manager.continue_generation(obj)
return ORJSONResponse(
content={"message": "Generation continued successfully.", "status": "ok"},
status_code=200,