Add cuda_graph_forward_passes_total and num_retracted_reqs_total (#15189)
This commit is contained in:
@@ -2012,6 +2012,8 @@ class Scheduler(
|
||||
self.server_args, self.decode_mem_cache_buf_multiplier
|
||||
)
|
||||
self.num_retracted_reqs = len(retracted_reqs)
|
||||
if self.enable_metrics and (x := len(retracted_reqs)) > 0:
|
||||
self.metrics_collector.increment_num_retracted_reqs(x)
|
||||
self.new_token_ratio = new_token_ratio
|
||||
for req in reqs_to_abort:
|
||||
abort_reason: FINISH_ABORT = req.to_finish
|
||||
|
||||
@@ -337,6 +337,8 @@ class SchedulerOutputProcessorMixin:
|
||||
self.num_generated_tokens += len(batch.reqs)
|
||||
if not batch.spec_algorithm.is_none():
|
||||
self.update_spec_metrics(batch.batch_size(), result.num_accepted_tokens)
|
||||
if self.enable_metrics:
|
||||
self.metrics_collector.increment_cuda_graph_pass(value=can_run_cuda_graph)
|
||||
|
||||
self.token_to_kv_pool_allocator.free_group_begin()
|
||||
|
||||
|
||||
Reference in New Issue
Block a user