Add cuda_graph_forward_passes_total and num_retracted_reqs_total (#15189)

This commit is contained in:
fzyzcjy
2025-12-17 21:19:42 +08:00
committed by GitHub
parent 6c4bf8a0be
commit b12b40dea4
3 changed files with 25 additions and 0 deletions
+2
View File
@@ -2012,6 +2012,8 @@ class Scheduler(
self.server_args, self.decode_mem_cache_buf_multiplier
)
self.num_retracted_reqs = len(retracted_reqs)
if self.enable_metrics and (x := len(retracted_reqs)) > 0:
self.metrics_collector.increment_num_retracted_reqs(x)
self.new_token_ratio = new_token_ratio
for req in reqs_to_abort:
abort_reason: FINISH_ABORT = req.to_finish
@@ -337,6 +337,8 @@ class SchedulerOutputProcessorMixin:
self.num_generated_tokens += len(batch.reqs)
if not batch.spec_algorithm.is_none():
self.update_spec_metrics(batch.batch_size(), result.num_accepted_tokens)
if self.enable_metrics:
self.metrics_collector.increment_cuda_graph_pass(value=can_run_cuda_graph)
self.token_to_kv_pool_allocator.free_group_begin()