Revert "tiny remove deprecated endpoint call" (#14533)
This commit is contained in:
@@ -79,7 +79,7 @@ class TestDeepseekV32CP(CustomTestCase):
|
||||
metrics = run_eval_few_shot_gsm8k(args)
|
||||
print(f"{metrics=}")
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -77,7 +77,7 @@ class TestEagleDPAttnServerBase(CustomTestCase):
|
||||
metrics = run_eval_few_shot_gsm8k(args)
|
||||
print(f"{metrics=}")
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -3,7 +3,7 @@ Test weight version functionality.
|
||||
|
||||
This test suite verifies the weight_version feature implementation including:
|
||||
1. Default weight_version setting
|
||||
2. /weight_version endpoint
|
||||
2. /get_weight_version endpoint
|
||||
3. /update_weight_version endpoint
|
||||
4. /generate request meta_info contains weight_version
|
||||
5. OpenAI API response metadata contains weight_version
|
||||
@@ -48,13 +48,13 @@ class TestWeightVersion(CustomTestCase):
|
||||
def test_weight_version_comprehensive(self):
|
||||
"""Comprehensive test for all weight_version functionality."""
|
||||
|
||||
response = requests.get(f"{self.base_url}/model_info")
|
||||
response = requests.get(f"{self.base_url}/get_model_info")
|
||||
self.assertEqual(response.status_code, 200)
|
||||
data = response.json()
|
||||
self.assertIn("weight_version", data)
|
||||
self.assertEqual(data["weight_version"], "test_version_1.0")
|
||||
|
||||
response = requests.get(f"{self.base_url}/weight_version")
|
||||
response = requests.get(f"{self.base_url}/get_weight_version")
|
||||
self.assertEqual(response.status_code, 200)
|
||||
data = response.json()
|
||||
self.assertIn("weight_version", data)
|
||||
@@ -114,7 +114,7 @@ class TestWeightVersion(CustomTestCase):
|
||||
self.assertTrue(data["success"])
|
||||
self.assertEqual(data["new_version"], "updated_version_2.0")
|
||||
|
||||
response = requests.get(f"{self.base_url}/weight_version")
|
||||
response = requests.get(f"{self.base_url}/get_weight_version")
|
||||
self.assertEqual(response.status_code, 200)
|
||||
data = response.json()
|
||||
self.assertEqual(data["weight_version"], "updated_version_2.0")
|
||||
@@ -148,13 +148,13 @@ class TestWeightVersion(CustomTestCase):
|
||||
self.assertTrue(data["success"])
|
||||
self.assertEqual(data["new_version"], "final_version_3.0")
|
||||
|
||||
# Check /weight_version
|
||||
response = requests.get(f"{self.base_url}/weight_version")
|
||||
# Check /get_weight_version
|
||||
response = requests.get(f"{self.base_url}/get_weight_version")
|
||||
self.assertEqual(response.status_code, 200)
|
||||
self.assertEqual(response.json()["weight_version"], "final_version_3.0")
|
||||
|
||||
# Check /model_info
|
||||
response = requests.get(f"{self.base_url}/model_info")
|
||||
# Check /get_model_info
|
||||
response = requests.get(f"{self.base_url}/get_model_info")
|
||||
self.assertEqual(response.status_code, 200)
|
||||
self.assertEqual(response.json()["weight_version"], "final_version_3.0")
|
||||
|
||||
@@ -193,7 +193,7 @@ class TestWeightVersion(CustomTestCase):
|
||||
print("Testing weight_version update with real weight operations...")
|
||||
|
||||
# Get current model info for reference
|
||||
model_info_response = requests.get(f"{self.base_url}/model_info")
|
||||
model_info_response = requests.get(f"{self.base_url}/get_model_info")
|
||||
self.assertEqual(model_info_response.status_code, 200)
|
||||
current_model_path = model_info_response.json()["model_path"]
|
||||
|
||||
@@ -214,7 +214,7 @@ class TestWeightVersion(CustomTestCase):
|
||||
)
|
||||
|
||||
# Verify version was updated
|
||||
version_response = requests.get(f"{self.base_url}/weight_version")
|
||||
version_response = requests.get(f"{self.base_url}/get_weight_version")
|
||||
self.assertEqual(version_response.status_code, 200)
|
||||
self.assertEqual(
|
||||
version_response.json()["weight_version"], "disk_update_v2.0.0"
|
||||
|
||||
@@ -143,7 +143,7 @@ class TestDeepseekMTP(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.92)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -307,7 +307,7 @@ class TestMTP(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
@@ -381,7 +381,7 @@ class TestMTPWithTBO(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -152,7 +152,7 @@ class TestHiCacheEagle(HiCacheBaseServer, HiCacheEvalMixin):
|
||||
self.assertGreaterEqual(metrics["score"], self.expected_mmlu_score)
|
||||
|
||||
# EAGLE-specific check
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
print(f"{server_info=}")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
|
||||
@@ -103,7 +103,7 @@ class TestDeepseekV3W4Afp8Mtp(CustomTestCase):
|
||||
metrics = run_eval_few_shot_gsm8k(args)
|
||||
print(f"{metrics=}")
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -113,7 +113,7 @@ class TestServerUpdateWeightsFromDisk(CustomTestCase):
|
||||
return response.json()
|
||||
|
||||
def get_model_info(self):
|
||||
response = requests.get(self.base_url + "/model_info")
|
||||
response = requests.get(self.base_url + "/get_model_info")
|
||||
model_path = response.json()["model_path"]
|
||||
print(json.dumps(response.json()))
|
||||
return model_path
|
||||
@@ -254,7 +254,7 @@ class TestServerUpdateWeightsFromDiskAbortAllRequests(CustomTestCase):
|
||||
return response.json()
|
||||
|
||||
def get_model_info(self):
|
||||
response = requests.get(self.base_url + "/model_info")
|
||||
response = requests.get(self.base_url + "/get_model_info")
|
||||
model_path = response.json()["model_path"]
|
||||
print(json.dumps(response.json()))
|
||||
return model_path
|
||||
@@ -386,7 +386,7 @@ class TestUpdateWeightsFromDiskParameterized(CustomTestCase):
|
||||
return response.json()["text"]
|
||||
|
||||
def get_model_info():
|
||||
response = requests.get(base_url + "/model_info")
|
||||
response = requests.get(base_url + "/get_model_info")
|
||||
model_path = response.json()["model_path"]
|
||||
print(json.dumps(response.json()))
|
||||
return model_path
|
||||
|
||||
@@ -209,7 +209,7 @@ class TestServerUpdateWeightsFromTensorNonBlocking(CustomTestCase):
|
||||
return response.json()
|
||||
|
||||
def get_model_info(self):
|
||||
response = requests.get(self.base_url + "/model_info")
|
||||
response = requests.get(self.base_url + "/get_model_info")
|
||||
model_path = response.json()["model_path"]
|
||||
print(json.dumps(response.json()))
|
||||
return model_path
|
||||
|
||||
@@ -65,12 +65,12 @@ class TestDataParallelism(CustomTestCase):
|
||||
|
||||
def test_get_memory_pool_size(self):
|
||||
# use `get_server_info` instead since `get_memory_pool_size` is merged into `get_server_info`
|
||||
response = requests.get(self.base_url + "/server_info")
|
||||
response = requests.get(self.base_url + "/get_server_info")
|
||||
assert response.status_code == 200
|
||||
|
||||
time.sleep(1)
|
||||
|
||||
response = requests.get(self.base_url + "/server_info")
|
||||
response = requests.get(self.base_url + "/get_server_info")
|
||||
assert response.status_code == 200
|
||||
|
||||
|
||||
|
||||
@@ -69,7 +69,7 @@ class TestDeepseekV32MTP(CustomTestCase):
|
||||
metrics = run_eval_few_shot_gsm8k(args)
|
||||
print(f"{metrics=}")
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -143,7 +143,7 @@ class TestDeepseekV3FP4MTP(CustomTestCase):
|
||||
metrics = run_eval_few_shot_gsm8k(args)
|
||||
print(f"{metrics=}")
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -67,7 +67,7 @@ class TestDeepseekV3MTP(CustomTestCase):
|
||||
metrics = run_eval_few_shot_gsm8k(args)
|
||||
print(f"{metrics=}")
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -112,7 +112,7 @@ class TestDPAttentionDP2TP2DeepseekV3MTP(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -78,7 +78,7 @@ class TestEAGLE3EngineDPAttention(CustomTestCase):
|
||||
metrics = run_eval_few_shot_gsm8k(args)
|
||||
print(f"{metrics=}")
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
server_data = server_info.json()
|
||||
|
||||
# Try to get avg_spec_accept_length
|
||||
|
||||
@@ -144,7 +144,7 @@ class TestEAGLEServer(CustomTestCase):
|
||||
print(f"{metrics=}")
|
||||
self.assertGreater(metrics["accuracy"], 0.20)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info").json()
|
||||
server_info = requests.get(self.base_url + "/get_server_info").json()
|
||||
avg_spec_accept_length = server_info["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -112,7 +112,7 @@ class BaseFlashAttentionTest(CustomTestCase):
|
||||
self.assertGreater(metrics[metric_key], self.accuracy_threshold)
|
||||
|
||||
if self.speculative_decode:
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -119,7 +119,7 @@ class TestFlashMLAMTP(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
print(f"{server_info=}")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
|
||||
@@ -88,7 +88,7 @@ class TestHybridAttnBackendBase(CustomTestCase):
|
||||
self.assertGreater(metrics[metric_key], self.accuracy_threshold)
|
||||
|
||||
if self.speculative_decode:
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -179,7 +179,7 @@ class TestDeepseekV3MTP(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -111,7 +111,7 @@ class TestFlashinferMLAMTP(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
print(f"{server_info=}")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
|
||||
@@ -113,7 +113,7 @@ class TestDeepseekV3MTPChannelInt8(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
@@ -217,7 +217,7 @@ class TestDeepseekV3MTPBlockInt8(CustomTestCase):
|
||||
|
||||
self.assertGreater(metrics["accuracy"], 0.60)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -80,7 +80,7 @@ class TestNgramSpeculativeDecodingBase(CustomTestCase):
|
||||
metric_key = "accuracy"
|
||||
self.assertGreater(metrics[metric_key], self.accuracy_threshold)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
@@ -496,7 +496,7 @@ class TestSRTEndpoint(CustomTestCase):
|
||||
self.assertEqual(send_and_check_cached_tokens(range(0, 11000)), 10000)
|
||||
|
||||
def test_get_server_info(self):
|
||||
response = requests.get(self.base_url + "/server_info")
|
||||
response = requests.get(self.base_url + "/get_server_info")
|
||||
response_json = response.json()
|
||||
|
||||
max_total_num_tokens = response_json["max_total_num_tokens"]
|
||||
@@ -626,7 +626,7 @@ class TestSRTEndpoint(CustomTestCase):
|
||||
tp = ThreadPoolExecutor(max_workers=30)
|
||||
|
||||
def s():
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
server_info.json()
|
||||
|
||||
futures = []
|
||||
|
||||
@@ -88,7 +88,7 @@ class TestStandaloneSpeculativeDecodingBase(CustomTestCase):
|
||||
metric_key = "accuracy"
|
||||
self.assertGreater(metrics[metric_key], self.accuracy_threshold)
|
||||
|
||||
server_info = requests.get(self.base_url + "/server_info")
|
||||
server_info = requests.get(self.base_url + "/get_server_info")
|
||||
avg_spec_accept_length = server_info.json()["internal_states"][0][
|
||||
"avg_spec_accept_length"
|
||||
]
|
||||
|
||||
Reference in New Issue
Block a user