diff --git a/.github/workflows/pr-test.yml b/.github/workflows/pr-test.yml index 23e94b866..793a3b3d9 100644 --- a/.github/workflows/pr-test.yml +++ b/.github/workflows/pr-test.yml @@ -672,6 +672,58 @@ jobs: fi python3 run_suite.py --hw cuda --suite stage-b-test-large-1-gpu $CONTINUE_ON_ERROR_FLAG + # 5090 dry run stage - only runs on scheduled CI or when explicitly targeted via /rerun-stage + # Used to validate 5090 compatibility before full integration + stage-b-test-small-1-gpu-5090: + needs: [check-changes, call-gate, stage-a-test-1, sgl-kernel-build-wheels] + if: | + always() && + ( + (inputs.target_stage == 'stage-b-test-small-1-gpu-5090') || + ( + !inputs.target_stage && + github.event_name == 'schedule' && + (!failure() && !cancelled()) && + ((needs.check-changes.outputs.main_package == 'true') || (needs.check-changes.outputs.sgl_kernel == 'true')) + ) + ) + runs-on: 1-gpu-5090 + continue-on-error: true + env: + RUNNER_LABELS: 1-gpu-5090 + IS_BLACKWELL: "1" + strategy: + fail-fast: false + max-parallel: 8 + matrix: + partition: [0, 1, 2, 3, 4, 5, 6, 7] + steps: + - name: Checkout code + uses: actions/checkout@v4 + with: + ref: ${{ inputs.pr_head_sha || inputs.ref || github.sha }} + + - name: Download artifacts + if: needs.check-changes.outputs.sgl_kernel == 'true' + uses: actions/download-artifact@v4 + with: + path: sgl-kernel/dist/ + merge-multiple: true + pattern: wheel-python3.10-cuda12.9 + + - name: Install dependencies + timeout-minutes: 10 + run: | + source /etc/profile.d/sglang-ci.sh + CUSTOM_BUILD_SGL_KERNEL=${{needs.check-changes.outputs.sgl_kernel}} bash scripts/ci/ci_install_dependency.sh + + - name: Run test + timeout-minutes: 30 + run: | + source /etc/profile.d/sglang-ci.sh + cd test/ + python3 run_suite.py --hw cuda --suite stage-b-test-small-1-gpu-5090 --auto-partition-id ${{ matrix.partition }} --auto-partition-size 8 --continue-on-error + stage-b-test-large-2-gpu: needs: [check-changes, call-gate, stage-a-test-1, sgl-kernel-build-wheels] if: | diff --git a/scripts/ci/ci_install_dependency.sh b/scripts/ci/ci_install_dependency.sh index 4f975124c..582179428 100755 --- a/scripts/ci/ci_install_dependency.sh +++ b/scripts/ci/ci_install_dependency.sh @@ -136,7 +136,18 @@ if [ "${CUSTOM_BUILD_SGL_KERNEL:-}" = "true" ]; then fi $PIP_CMD install sgl-kernel/dist/sgl_kernel-${SGL_KERNEL_VERSION_FROM_KERNEL}-cp310-abi3-manylinux2014_${WHEEL_ARCH}.whl --force-reinstall $PIP_INSTALL_SUFFIX else - $PIP_CMD install sgl-kernel==${SGL_KERNEL_VERSION_FROM_SRT} --force-reinstall $PIP_INSTALL_SUFFIX + # On Blackwell machines, skip reinstall if correct version already installed to avoid race conditions + if [ "$IS_BLACKWELL" = "1" ]; then + INSTALLED_SGL_KERNEL=$(pip show sgl-kernel 2>/dev/null | grep "^Version:" | awk '{print $2}' || echo "") + if [ "$INSTALLED_SGL_KERNEL" = "$SGL_KERNEL_VERSION_FROM_SRT" ]; then + echo "sgl-kernel==${SGL_KERNEL_VERSION_FROM_SRT} already installed, skipping reinstall" + else + echo "Installing sgl-kernel==${SGL_KERNEL_VERSION_FROM_SRT} (current: ${INSTALLED_SGL_KERNEL:-none})" + $PIP_CMD install sgl-kernel==${SGL_KERNEL_VERSION_FROM_SRT} $PIP_INSTALL_SUFFIX + fi + else + $PIP_CMD install sgl-kernel==${SGL_KERNEL_VERSION_FROM_SRT} --force-reinstall $PIP_INSTALL_SUFFIX + fi fi # Show current packages @@ -152,10 +163,30 @@ if [ "$IS_BLACKWELL" != "1" ]; then fi # DeepEP depends on nvshmem 3.4.5 -$PIP_CMD install nvidia-nvshmem-cu12==3.4.5 --force-reinstall $PIP_INSTALL_SUFFIX +# On Blackwell machines, skip reinstall if correct version already installed to avoid race conditions +if [ "$IS_BLACKWELL" = "1" ]; then + INSTALLED_NVSHMEM=$(pip show nvidia-nvshmem-cu12 2>/dev/null | grep "^Version:" | awk '{print $2}' || echo "") + if [ "$INSTALLED_NVSHMEM" = "3.4.5" ]; then + echo "nvidia-nvshmem-cu12==3.4.5 already installed, skipping reinstall" + else + $PIP_CMD install nvidia-nvshmem-cu12==3.4.5 $PIP_INSTALL_SUFFIX + fi +else + $PIP_CMD install nvidia-nvshmem-cu12==3.4.5 --force-reinstall $PIP_INSTALL_SUFFIX +fi # Cudnn with version less than 9.16.0.29 will cause performance regression on Conv3D kernel -$PIP_CMD install nvidia-cudnn-cu12==9.16.0.29 --force-reinstall $PIP_INSTALL_SUFFIX +# On Blackwell machines, skip reinstall if correct version already installed to avoid race conditions +if [ "$IS_BLACKWELL" = "1" ]; then + INSTALLED_CUDNN=$(pip show nvidia-cudnn-cu12 2>/dev/null | grep "^Version:" | awk '{print $2}' || echo "") + if [ "$INSTALLED_CUDNN" = "9.16.0.29" ]; then + echo "nvidia-cudnn-cu12==9.16.0.29 already installed, skipping reinstall" + else + $PIP_CMD install nvidia-cudnn-cu12==9.16.0.29 $PIP_INSTALL_SUFFIX + fi +else + $PIP_CMD install nvidia-cudnn-cu12==9.16.0.29 --force-reinstall $PIP_INSTALL_SUFFIX +fi $PIP_CMD uninstall xformers || true # Install flashinfer-jit-cache with caching and retry logic (flashinfer.ai can have transient DNS issues) diff --git a/scripts/ci/slash_command_handler.py b/scripts/ci/slash_command_handler.py index 1f95baa92..a61329bd3 100644 --- a/scripts/ci/slash_command_handler.py +++ b/scripts/ci/slash_command_handler.py @@ -227,6 +227,7 @@ def handle_rerun_stage( "stage-a-cpu-only", "stage-b-test-small-1-gpu", "stage-b-test-large-1-gpu", + "stage-b-test-small-1-gpu-5090", "stage-b-test-large-2-gpu", "stage-c-test-large-4-gpu", "stage-c-test-large-4-gpu-b200", diff --git a/test/registered/attention/test_create_kvindices.py b/test/registered/attention/test_create_kvindices.py index 881e68d6e..0928dbfbc 100644 --- a/test/registered/attention/test_create_kvindices.py +++ b/test/registered/attention/test_create_kvindices.py @@ -9,6 +9,7 @@ from sglang.test.test_utils import CustomTestCase # Triton kernel unit test for KV indices creation register_cuda_ci(est_time=10, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=10, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/attention/test_mamba_unittest.py b/test/registered/attention/test_mamba_unittest.py index 0a0f45fb8..3e9ce3160 100644 --- a/test/registered/attention/test_mamba_unittest.py +++ b/test/registered/attention/test_mamba_unittest.py @@ -15,6 +15,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=9, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") class TestMamba(unittest.TestCase): diff --git a/test/registered/attention/test_radix_attention.py b/test/registered/attention/test_radix_attention.py index 5931a0921..a9871adba 100644 --- a/test/registered/attention/test_radix_attention.py +++ b/test/registered/attention/test_radix_attention.py @@ -15,6 +15,7 @@ from sglang.test.test_utils import ( # RadixAttention server integration tests register_cuda_ci(est_time=100, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=79, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=100, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/attention/test_radix_cache_unit.py b/test/registered/attention/test_radix_cache_unit.py index cb30a1e50..08282df29 100644 --- a/test/registered/attention/test_radix_cache_unit.py +++ b/test/registered/attention/test_radix_cache_unit.py @@ -21,6 +21,7 @@ from sglang.test.ci.ci_register import register_cuda_ci # CPU-based unit test, runs quickly on any GPU runner register_cuda_ci(est_time=5, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") import time import unittest diff --git a/test/registered/attention/test_torch_native_attention_backend.py b/test/registered/attention/test_torch_native_attention_backend.py index 2e6bc256d..5abbef881 100644 --- a/test/registered/attention/test_torch_native_attention_backend.py +++ b/test/registered/attention/test_torch_native_attention_backend.py @@ -19,6 +19,7 @@ from sglang.test.test_utils import ( # Torch native attention backend integration test with MMLU eval register_cuda_ci(est_time=169, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=120, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=150, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/constrained_decoding/test_constrained_decoding.py b/test/registered/constrained_decoding/test_constrained_decoding.py index 20f8e7388..899080aae 100644 --- a/test/registered/constrained_decoding/test_constrained_decoding.py +++ b/test/registered/constrained_decoding/test_constrained_decoding.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=111, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=76, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=179, suite="stage-b-test-small-1-gpu-amd") import unittest diff --git a/test/registered/core/test_hidden_states.py b/test/registered/core/test_hidden_states.py index 0933df815..3f18fddf8 100644 --- a/test/registered/core/test_hidden_states.py +++ b/test/registered/core/test_hidden_states.py @@ -8,6 +8,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase register_cuda_ci(est_time=55, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=31, suite="stage-b-test-small-1-gpu-5090") class TestHiddenState(CustomTestCase): diff --git a/test/registered/core/test_input_embeddings.py b/test/registered/core/test_input_embeddings.py index bf80328f8..0ad440f07 100644 --- a/test/registered/core/test_input_embeddings.py +++ b/test/registered/core/test_input_embeddings.py @@ -17,6 +17,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=38, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=40, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=38, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/core/test_model_hooks.py b/test/registered/core/test_model_hooks.py index ae14a2abd..5caaeceb6 100644 --- a/test/registered/core/test_model_hooks.py +++ b/test/registered/core/test_model_hooks.py @@ -10,6 +10,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=6, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=5, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=10, suite="stage-b-test-small-1-gpu-amd") HOOK_CALLS = [] diff --git a/test/registered/core/test_page_size.py b/test/registered/core/test_page_size.py index b28bd3c7d..2b5c8c69e 100644 --- a/test/registered/core/test_page_size.py +++ b/test/registered/core/test_page_size.py @@ -14,6 +14,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=60, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=62, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=60, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/core/test_request_queue_validation.py b/test/registered/core/test_request_queue_validation.py index c76e006ca..21a1b5d3a 100644 --- a/test/registered/core/test_request_queue_validation.py +++ b/test/registered/core/test_request_queue_validation.py @@ -18,6 +18,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=47, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=49, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=70, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/core/test_server_args.py b/test/registered/core/test_server_args.py index 91e90a3e4..2df9f730a 100644 --- a/test/registered/core/test_server_args.py +++ b/test/registered/core/test_server_args.py @@ -7,6 +7,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=9, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=1, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/core/test_srt_endpoint.py b/test/registered/core/test_srt_endpoint.py index 92aeff84c..4b9ee0800 100644 --- a/test/registered/core/test_srt_endpoint.py +++ b/test/registered/core/test_srt_endpoint.py @@ -28,6 +28,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=127, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=122, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=130, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/debug_utils/test_tensor_dump_forward_hook.py b/test/registered/debug_utils/test_tensor_dump_forward_hook.py index 0cbc43627..c66f0a6fe 100644 --- a/test/registered/debug_utils/test_tensor_dump_forward_hook.py +++ b/test/registered/debug_utils/test_tensor_dump_forward_hook.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=9, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=15, suite="stage-b-test-small-1-gpu-amd") import unittest diff --git a/test/registered/hicache/test_hicache_storage.py b/test/registered/hicache/test_hicache_storage.py index 75da6e138..801c6c2b5 100644 --- a/test/registered/hicache/test_hicache_storage.py +++ b/test/registered/hicache/test_hicache_storage.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=96, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=96, suite="stage-b-test-small-1-gpu-5090") import time import unittest diff --git a/test/registered/layers/mamba/test_causal_conv1d.py b/test/registered/layers/mamba/test_causal_conv1d.py index a4a65b799..c50384f16 100644 --- a/test/registered/layers/mamba/test_causal_conv1d.py +++ b/test/registered/layers/mamba/test_causal_conv1d.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=25, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=3, suite="stage-b-test-small-1-gpu-5090") # Adapted from https://github.com/vllm-project/vllm/blob/main/tests/kernels/mamba/test_causal_conv1d.py diff --git a/test/registered/layers/mamba/test_mamba_ssm.py b/test/registered/layers/mamba/test_mamba_ssm.py index a2372a16b..0eac3f597 100644 --- a/test/registered/layers/mamba/test_mamba_ssm.py +++ b/test/registered/layers/mamba/test_mamba_ssm.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=5, suite="stage-b-test-small-1-gpu-5090") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/layers/mamba/test_mamba_ssm_ssd.py b/test/registered/layers/mamba/test_mamba_ssm_ssd.py index d7d42be1e..727b6ae49 100644 --- a/test/registered/layers/mamba/test_mamba_ssm_ssd.py +++ b/test/registered/layers/mamba/test_mamba_ssm_ssd.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=13, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu-5090") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/lora/test_lora_backend.py b/test/registered/lora/test_lora_backend.py index 0cc2aca9b..e4447905d 100644 --- a/test/registered/lora/test_lora_backend.py +++ b/test/registered/lora/test_lora_backend.py @@ -30,6 +30,7 @@ from sglang.test.lora_utils import ( from sglang.test.test_utils import CustomTestCase, is_in_ci register_cuda_ci(est_time=200, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=137, suite="stage-b-test-small-1-gpu-5090") register_amd_ci( est_time=200, suite="stage-b-test-small-1-gpu-amd", diff --git a/test/registered/lora/test_lora_eviction.py b/test/registered/lora/test_lora_eviction.py index 4404d11ec..4b8505437 100644 --- a/test/registered/lora/test_lora_eviction.py +++ b/test/registered/lora/test_lora_eviction.py @@ -24,6 +24,7 @@ from sglang.test.runners import SRTRunner from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=224, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=215, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=224, suite="stage-b-test-small-1-gpu-amd") PROMPTS = [ diff --git a/test/registered/lora/test_lora_hf_sgl_logprob_diff.py b/test/registered/lora/test_lora_hf_sgl_logprob_diff.py index ddb671373..e8105ff56 100644 --- a/test/registered/lora/test_lora_hf_sgl_logprob_diff.py +++ b/test/registered/lora/test_lora_hf_sgl_logprob_diff.py @@ -41,6 +41,10 @@ register_cuda_ci( est_time=150, suite="stage-b-test-small-1-gpu", ) +register_cuda_ci( + est_time=76, + suite="stage-b-test-small-1-gpu-5090", +) from sglang.test.test_utils import DEFAULT_PORT_FOR_SRT_TEST_RUNNER, CustomTestCase diff --git a/test/registered/metrics/test_metrics.py b/test/registered/metrics/test_metrics.py index 9b0f9eee8..d1d47bee7 100644 --- a/test/registered/metrics/test_metrics.py +++ b/test/registered/metrics/test_metrics.py @@ -6,6 +6,7 @@ import requests from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=32, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=29, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=32, suite="stage-b-test-small-1-gpu-amd") from prometheus_client.parser import text_string_to_metric_families from prometheus_client.samples import Sample diff --git a/test/registered/model_loading/test_external_models.py b/test/registered/model_loading/test_external_models.py index 3dbfcecf8..7aac71fef 100644 --- a/test/registered/model_loading/test_external_models.py +++ b/test/registered/model_loading/test_external_models.py @@ -6,6 +6,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=30, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=26, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=45, suite="stage-b-test-small-1-gpu") diff --git a/test/registered/model_loading/test_modelopt_loader.py b/test/registered/model_loading/test_modelopt_loader.py index 96aaffa95..af61eeceb 100644 --- a/test/registered/model_loading/test_modelopt_loader.py +++ b/test/registered/model_loading/test_modelopt_loader.py @@ -26,6 +26,7 @@ CALIBRATION_NUM_SAMPLES = 512 DEFAULT_DEVICE = "cuda:0" register_cuda_ci(est_time=11, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu-5090") class TestModelOptModelLoader(CustomTestCase): diff --git a/test/registered/models/test_cross_encoder_models.py b/test/registered/models/test_cross_encoder_models.py index cc60d5d4a..5b8ac32ef 100644 --- a/test/registered/models/test_cross_encoder_models.py +++ b/test/registered/models/test_cross_encoder_models.py @@ -2,6 +2,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Cross encoder model tests register_cuda_ci(est_time=100, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=105, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=150, suite="stage-b-test-small-1-gpu-amd") import multiprocessing as mp diff --git a/test/registered/models/test_embedding_models.py b/test/registered/models/test_embedding_models.py index 03ebe8a12..9541d2cc0 100644 --- a/test/registered/models/test_embedding_models.py +++ b/test/registered/models/test_embedding_models.py @@ -2,6 +2,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Embedding model tests register_cuda_ci(est_time=73, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=58, suite="stage-b-test-small-1-gpu-5090") register_amd_ci( est_time=73, suite="stage-b-test-small-1-gpu-amd", diff --git a/test/registered/models/test_encoder_embedding_models.py b/test/registered/models/test_encoder_embedding_models.py index 1bfb7c7aa..d922c47be 100644 --- a/test/registered/models/test_encoder_embedding_models.py +++ b/test/registered/models/test_encoder_embedding_models.py @@ -2,6 +2,7 @@ from sglang.test.ci.ci_register import register_cuda_ci # Encoder embedding model tests (CUDA only) register_cuda_ci(est_time=270, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=144, suite="stage-b-test-small-1-gpu-5090") # Copyright 2023-2024 SGLang Team # Licensed under the Apache License, Version 2.0 (the "License"); diff --git a/test/registered/models/test_qwen_models.py b/test/registered/models/test_qwen_models.py index cdfa4c06f..1bcb4914d 100644 --- a/test/registered/models/test_qwen_models.py +++ b/test/registered/models/test_qwen_models.py @@ -2,6 +2,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Qwen model tests register_cuda_ci(est_time=90, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=84, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=130, suite="stage-b-test-small-1-gpu-amd") import unittest diff --git a/test/registered/models/test_reward_models.py b/test/registered/models/test_reward_models.py index 2f615d272..5c357b2ff 100644 --- a/test/registered/models/test_reward_models.py +++ b/test/registered/models/test_reward_models.py @@ -2,6 +2,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Reward model tests register_cuda_ci(est_time=103, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=69, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=132, suite="stage-b-test-small-1-gpu-amd") # Copyright 2023-2024 SGLang Team diff --git a/test/registered/models/test_transformers_models.py b/test/registered/models/test_transformers_models.py index cf570a14b..5358ebaf8 100644 --- a/test/registered/models/test_transformers_models.py +++ b/test/registered/models/test_transformers_models.py @@ -2,6 +2,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Transformers fallback model tests register_cuda_ci(est_time=245, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=210, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=320, suite="stage-b-test-small-1-gpu-amd") import dataclasses diff --git a/test/registered/openai_server/basic/test_openai_embedding.py b/test/registered/openai_server/basic/test_openai_embedding.py index 1432a5307..0b49a2d54 100644 --- a/test/registered/openai_server/basic/test_openai_embedding.py +++ b/test/registered/openai_server/basic/test_openai_embedding.py @@ -14,6 +14,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=70, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=48, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=141, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/basic/test_openai_server.py b/test/registered/openai_server/basic/test_openai_server.py index 3f27fb500..35d628c77 100644 --- a/test/registered/openai_server/basic/test_openai_server.py +++ b/test/registered/openai_server/basic/test_openai_server.py @@ -29,6 +29,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=184, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=130, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=149, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/basic/test_protocol.py b/test/registered/openai_server/basic/test_protocol.py index 47bf56381..561ebbdfa 100644 --- a/test/registered/openai_server/basic/test_protocol.py +++ b/test/registered/openai_server/basic/test_protocol.py @@ -31,6 +31,7 @@ from sglang.srt.entrypoints.openai.protocol import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=3, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=2, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=10, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/basic/test_serving_chat.py b/test/registered/openai_server/basic/test_serving_chat.py index d81f2efb0..4764edb6b 100644 --- a/test/registered/openai_server/basic/test_serving_chat.py +++ b/test/registered/openai_server/basic/test_serving_chat.py @@ -24,6 +24,7 @@ from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=10, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=10, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/basic/test_serving_completions.py b/test/registered/openai_server/basic/test_serving_completions.py index 34c262e60..bbc3c5c6e 100644 --- a/test/registered/openai_server/basic/test_serving_completions.py +++ b/test/registered/openai_server/basic/test_serving_completions.py @@ -14,6 +14,7 @@ from sglang.srt.managers.tokenizer_manager import TokenizerManager from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=10, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=10, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/features/test_json_mode.py b/test/registered/openai_server/features/test_json_mode.py index 946d8e0ff..112b08b3c 100644 --- a/test/registered/openai_server/features/test_json_mode.py +++ b/test/registered/openai_server/features/test_json_mode.py @@ -14,6 +14,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=109, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=84, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=180, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/features/test_openai_server_ebnf.py b/test/registered/openai_server/features/test_openai_server_ebnf.py index 165bbcf78..f024d0455 100644 --- a/test/registered/openai_server/features/test_openai_server_ebnf.py +++ b/test/registered/openai_server/features/test_openai_server_ebnf.py @@ -14,6 +14,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=27, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=20, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/features/test_openai_server_hidden_states.py b/test/registered/openai_server/features/test_openai_server_hidden_states.py index 0ac3d3265..8218fedfd 100644 --- a/test/registered/openai_server/features/test_openai_server_hidden_states.py +++ b/test/registered/openai_server/features/test_openai_server_hidden_states.py @@ -17,6 +17,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=186, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=134, suite="stage-b-test-small-1-gpu-5090") register_amd_ci( est_time=186, suite="stage-b-test-small-1-gpu-amd", diff --git a/test/registered/openai_server/features/test_reasoning_content.py b/test/registered/openai_server/features/test_reasoning_content.py index 2c59921fe..ad80d02a0 100644 --- a/test/registered/openai_server/features/test_reasoning_content.py +++ b/test/registered/openai_server/features/test_reasoning_content.py @@ -24,6 +24,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=89, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=77, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=89, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/function_call/test_tool_choice.py b/test/registered/openai_server/function_call/test_tool_choice.py index b12cd70d0..77e3825f1 100644 --- a/test/registered/openai_server/function_call/test_tool_choice.py +++ b/test/registered/openai_server/function_call/test_tool_choice.py @@ -23,6 +23,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=120, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=109, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=258, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/validation/test_matched_stop.py b/test/registered/openai_server/validation/test_matched_stop.py index aa890e363..88f264d99 100644 --- a/test/registered/openai_server/validation/test_matched_stop.py +++ b/test/registered/openai_server/validation/test_matched_stop.py @@ -12,6 +12,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=40, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=39, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=60, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/openai_server/validation/test_openai_server_ignore_eos.py b/test/registered/openai_server/validation/test_openai_server_ignore_eos.py index bbf696d41..891f67855 100644 --- a/test/registered/openai_server/validation/test_openai_server_ignore_eos.py +++ b/test/registered/openai_server/validation/test_openai_server_ignore_eos.py @@ -12,6 +12,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=6, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=37, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=47, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/ops/test_repeat_interleave.py b/test/registered/ops/test_repeat_interleave.py index 5337281a1..8a9b97445 100644 --- a/test/registered/ops/test_repeat_interleave.py +++ b/test/registered/ops/test_repeat_interleave.py @@ -2,6 +2,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Ops - Repeat Interleave tests (1-GPU) register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=75, suite="stage-b-test-small-1-gpu-amd") import time diff --git a/test/registered/profiling/test_profile_merger.py b/test/registered/profiling/test_profile_merger.py index 412ae8046..4f52dcfe9 100644 --- a/test/registered/profiling/test_profile_merger.py +++ b/test/registered/profiling/test_profile_merger.py @@ -18,6 +18,7 @@ from sglang.srt.utils.profile_merger import ProfileMerger from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=8, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/profiling/test_profile_merger_http_api.py b/test/registered/profiling/test_profile_merger_http_api.py index 9bf656f26..bf9d38c32 100644 --- a/test/registered/profiling/test_profile_merger_http_api.py +++ b/test/registered/profiling/test_profile_merger_http_api.py @@ -5,6 +5,7 @@ from sglang.srt.managers.io_struct import ProfileReqInput from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=9, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=6, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=9, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/profiling/test_start_profile.py b/test/registered/profiling/test_start_profile.py index ddd19b6bb..a59316374 100644 --- a/test/registered/profiling/test_start_profile.py +++ b/test/registered/profiling/test_start_profile.py @@ -30,6 +30,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=41, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=39, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=60, suite="stage-b-test-small-1-gpu-amd") OUTPUT_DIR = "./profiler_dir" diff --git a/test/registered/quant/test_autoround.py b/test/registered/quant/test_autoround.py index df69f1e5c..d7000b702 100644 --- a/test/registered/quant/test_autoround.py +++ b/test/registered/quant/test_autoround.py @@ -18,6 +18,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=77, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=76, suite="stage-b-test-small-1-gpu-5090") class TestAutoRound(CustomTestCase): diff --git a/test/registered/quant/test_block_int8.py b/test/registered/quant/test_block_int8.py index 91f2cd474..d090e5443 100644 --- a/test/registered/quant/test_block_int8.py +++ b/test/registered/quant/test_block_int8.py @@ -11,6 +11,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=44, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=25, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=22, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/quant/test_int8_kernel.py b/test/registered/quant/test_int8_kernel.py index d45f82efb..6e2726a72 100644 --- a/test/registered/quant/test_int8_kernel.py +++ b/test/registered/quant/test_int8_kernel.py @@ -12,6 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=10, suite="stage-b-test-small-1-gpu-5090") def native_w8a8_per_token_matmul(A, B, As, Bs, output_dtype=torch.float16): diff --git a/test/registered/quant/test_torchao.py b/test/registered/quant/test_torchao.py index bc2c93884..30480f894 100644 --- a/test/registered/quant/test_torchao.py +++ b/test/registered/quant/test_torchao.py @@ -7,6 +7,7 @@ from sglang import Engine from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=103, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=88, suite="stage-b-test-small-1-gpu-5090") from sglang.lang.chat_template import get_chat_template_by_model_path from sglang.srt.utils import kill_process_tree from sglang.test.run_eval import run_eval diff --git a/test/registered/quant/test_triton_scaled_mm.py b/test/registered/quant/test_triton_scaled_mm.py index 35a30d710..512191ee6 100644 --- a/test/registered/quant/test_triton_scaled_mm.py +++ b/test/registered/quant/test_triton_scaled_mm.py @@ -9,6 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=9, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=12, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/rl/test_fp32_lm_head.py b/test/registered/rl/test_fp32_lm_head.py index 4d4acee9a..b59698a6c 100644 --- a/test/registered/rl/test_fp32_lm_head.py +++ b/test/registered/rl/test_fp32_lm_head.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=9, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=8, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=15, suite="stage-b-test-small-1-gpu-amd") import unittest diff --git a/test/registered/rl/test_lora_load_from_tensor.py b/test/registered/rl/test_lora_load_from_tensor.py index c656e2f8c..a5633a73a 100644 --- a/test/registered/rl/test_lora_load_from_tensor.py +++ b/test/registered/rl/test_lora_load_from_tensor.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=90, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=54, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=90, suite="stage-b-test-small-1-gpu") import json diff --git a/test/registered/rl/test_update_weights_from_tensor.py b/test/registered/rl/test_update_weights_from_tensor.py index 9faff8e26..7a37c9195 100644 --- a/test/registered/rl/test_update_weights_from_tensor.py +++ b/test/registered/rl/test_update_weights_from_tensor.py @@ -1,6 +1,7 @@ from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=195, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=164, suite="stage-b-test-small-1-gpu-5090") import gc import json diff --git a/test/registered/sampling/test_original_logprobs.py b/test/registered/sampling/test_original_logprobs.py index 9093dea51..3056f4a2a 100644 --- a/test/registered/sampling/test_original_logprobs.py +++ b/test/registered/sampling/test_original_logprobs.py @@ -18,6 +18,7 @@ import os from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=41, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=43, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=60, suite="stage-b-test-small-1-gpu-amd") import random import unittest diff --git a/test/registered/sampling/test_penalty.py b/test/registered/sampling/test_penalty.py index d73b5d62a..d4f84cd69 100644 --- a/test/registered/sampling/test_penalty.py +++ b/test/registered/sampling/test_penalty.py @@ -10,6 +10,7 @@ from sglang.srt.utils import kill_process_tree from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=82, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=44, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=82, suite="stage-b-test-small-1-gpu-amd") from sglang.test.test_utils import ( DEFAULT_SMALL_MODEL_NAME_FOR_TEST, diff --git a/test/registered/sampling/test_pytorch_sampling_backend.py b/test/registered/sampling/test_pytorch_sampling_backend.py index 51bf254a6..e98e8d9bd 100644 --- a/test/registered/sampling/test_pytorch_sampling_backend.py +++ b/test/registered/sampling/test_pytorch_sampling_backend.py @@ -7,6 +7,7 @@ from sglang.srt.utils import kill_process_tree from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=66, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=64, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=66, suite="stage-b-test-small-1-gpu-amd") from sglang.test.run_eval import run_eval from sglang.test.test_utils import ( diff --git a/test/registered/scheduler/test_abort.py b/test/registered/scheduler/test_abort.py index b8e6b691d..c2b3e8c2d 100644 --- a/test/registered/scheduler/test_abort.py +++ b/test/registered/scheduler/test_abort.py @@ -18,6 +18,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=131, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=119, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=51, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/scheduler/test_chunked_prefill.py b/test/registered/scheduler/test_chunked_prefill.py index 951b09f74..336200a20 100644 --- a/test/registered/scheduler/test_chunked_prefill.py +++ b/test/registered/scheduler/test_chunked_prefill.py @@ -8,6 +8,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, run_mmlu_test, run_mulit_request_test register_cuda_ci(est_time=312, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=323, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=312, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/scheduler/test_prefill_adder.py b/test/registered/scheduler/test_prefill_adder.py index f11b0b16f..587ddb8e0 100644 --- a/test/registered/scheduler/test_prefill_adder.py +++ b/test/registered/scheduler/test_prefill_adder.py @@ -8,6 +8,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=1, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=6, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=2, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/scheduler/test_priority_scheduling.py b/test/registered/scheduler/test_priority_scheduling.py index b3ba23ea0..fb998fd71 100644 --- a/test/registered/scheduler/test_priority_scheduling.py +++ b/test/registered/scheduler/test_priority_scheduling.py @@ -18,6 +18,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=130, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=146, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=195, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/scheduler/test_retract_decode.py b/test/registered/scheduler/test_retract_decode.py index 80dc74cec..c1df809f8 100644 --- a/test/registered/scheduler/test_retract_decode.py +++ b/test/registered/scheduler/test_retract_decode.py @@ -18,6 +18,7 @@ from sglang.test.test_utils import ( from sglang.utils import is_in_ci register_cuda_ci(est_time=311, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=400, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=450, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/spec/eagle/test_eagle3_basic.py b/test/registered/spec/eagle/test_eagle3_basic.py index b60b167d0..a346214ad 100644 --- a/test/registered/spec/eagle/test_eagle3_basic.py +++ b/test/registered/spec/eagle/test_eagle3_basic.py @@ -12,6 +12,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=50, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=87, suite="stage-b-test-small-1-gpu-5090") class TestEagle3Basic(EagleServerBase): diff --git a/test/registered/spec/eagle/test_eagle_infer_beta.py b/test/registered/spec/eagle/test_eagle_infer_beta.py index c67ff334a..fe488e99a 100644 --- a/test/registered/spec/eagle/test_eagle_infer_beta.py +++ b/test/registered/spec/eagle/test_eagle_infer_beta.py @@ -17,6 +17,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=283, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=404, suite="stage-b-test-small-1-gpu-5090") class TestEagleServerBase(CustomTestCase, MatchedStopMixin): diff --git a/test/registered/spec/utils/test_build_eagle_tree.py b/test/registered/spec/utils/test_build_eagle_tree.py index 3f5c71125..32dc413c9 100644 --- a/test/registered/spec/utils/test_build_eagle_tree.py +++ b/test/registered/spec/utils/test_build_eagle_tree.py @@ -9,6 +9,7 @@ from sglang.srt.speculative.eagle_utils import ( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=3, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=2, suite="stage-b-test-small-1-gpu-5090") class TestBuildEagleTree(unittest.TestCase): diff --git a/test/registered/tokenizer/test_skip_tokenizer_init.py b/test/registered/tokenizer/test_skip_tokenizer_init.py index 7d95c19cf..c00a655cf 100644 --- a/test/registered/tokenizer/test_skip_tokenizer_init.py +++ b/test/registered/tokenizer/test_skip_tokenizer_init.py @@ -24,6 +24,7 @@ from sglang.test.test_utils import ( ) register_cuda_ci(est_time=77, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=52, suite="stage-b-test-small-1-gpu-5090") register_amd_ci(est_time=117, suite="stage-b-test-small-1-gpu-amd") diff --git a/test/registered/vlm/test_evs.py b/test/registered/vlm/test_evs.py index 0b6742a71..78592245e 100644 --- a/test/registered/vlm/test_evs.py +++ b/test/registered/vlm/test_evs.py @@ -7,6 +7,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import run_doctests register_cuda_ci(est_time=20, suite="stage-b-test-small-1-gpu") +register_cuda_ci(est_time=7, suite="stage-b-test-small-1-gpu-5090") def test_resolve_evs_config(): diff --git a/test/run_suite.py b/test/run_suite.py index 1a687b0f8..4cd75678d 100644 --- a/test/run_suite.py +++ b/test/run_suite.py @@ -27,6 +27,7 @@ PER_COMMIT_SUITES = { HWBackend.CUDA: [ "stage-a-test-1", "stage-b-test-small-1-gpu", + "stage-b-test-small-1-gpu-5090", "stage-b-test-large-1-gpu", "stage-b-test-large-2-gpu", "stage-c-test-large-4-gpu",