Add per-request retraction count (#11177)
This commit is contained in:
@@ -811,6 +811,34 @@ class TokenizerMetricsCollector:
|
||||
buckets=bucket_e2e_request_latency,
|
||||
)
|
||||
|
||||
# Retraction count histogram
|
||||
self.num_retractions = Histogram(
|
||||
name="sglang:num_retractions",
|
||||
documentation="Histogram of retraction counts per request.",
|
||||
labelnames=labels.keys(),
|
||||
buckets=[
|
||||
0,
|
||||
1,
|
||||
2,
|
||||
3,
|
||||
4,
|
||||
5,
|
||||
6,
|
||||
7,
|
||||
8,
|
||||
9,
|
||||
10,
|
||||
15,
|
||||
20,
|
||||
25,
|
||||
30,
|
||||
40,
|
||||
50,
|
||||
75,
|
||||
100,
|
||||
],
|
||||
)
|
||||
|
||||
def observe_one_finished_request(
|
||||
self,
|
||||
labels: Dict[str, str],
|
||||
@@ -819,6 +847,7 @@ class TokenizerMetricsCollector:
|
||||
cached_tokens: int,
|
||||
e2e_latency: float,
|
||||
has_grammar: bool,
|
||||
retraction_count: int,
|
||||
):
|
||||
self.prompt_tokens_total.labels(**labels).inc(prompt_tokens)
|
||||
self.generation_tokens_total.labels(**labels).inc(generation_tokens)
|
||||
@@ -833,6 +862,7 @@ class TokenizerMetricsCollector:
|
||||
self.generation_tokens_histogram.labels(**labels).observe(
|
||||
float(generation_tokens)
|
||||
)
|
||||
self.num_retractions.labels(**labels).observe(retraction_count)
|
||||
|
||||
def observe_time_to_first_token(self, labels: Dict[str, str], value: float):
|
||||
self.histogram_time_to_first_token.labels(**labels).observe(value)
|
||||
|
||||
Reference in New Issue
Block a user