Clean up server_args.py (#7037)
This commit is contained in:
@@ -72,32 +72,33 @@ INIT_INCREMENTAL_DETOKENIZATION_OFFSET = 5
|
||||
|
||||
GLOBAL_SERVER_ARGS_KEYS = [
|
||||
"attention_backend",
|
||||
"mm_attention_backend",
|
||||
"debug_tensor_dump_inject",
|
||||
"debug_tensor_dump_output_folder",
|
||||
"chunked_prefill_size",
|
||||
"deepep_mode",
|
||||
"device",
|
||||
"disable_chunked_prefix_cache",
|
||||
"disable_radix_cache",
|
||||
"enable_deepep_moe",
|
||||
"enable_dp_attention",
|
||||
"enable_two_batch_overlap",
|
||||
"enable_dp_lm_head",
|
||||
"enable_deepep_moe",
|
||||
"deepep_mode",
|
||||
"enable_ep_moe",
|
||||
"moe_dense_tp_size",
|
||||
"ep_dispatch_algorithm",
|
||||
"deepep_config",
|
||||
"ep_num_redundant_experts",
|
||||
"enable_nan_detection",
|
||||
"flashinfer_mla_disable_ragged",
|
||||
"max_micro_batch_size",
|
||||
"moe_dense_tp_size",
|
||||
"ep_dispatch_algorithm",
|
||||
"disable_shared_experts_fusion",
|
||||
"sampling_backend",
|
||||
"speculative_accept_threshold_acc",
|
||||
"speculative_accept_threshold_single",
|
||||
"torchao_config",
|
||||
"triton_attention_reduce_in_fp32",
|
||||
"ep_num_redundant_experts",
|
||||
"mm_attention_backend",
|
||||
"num_reserved_decode_tokens",
|
||||
]
|
||||
|
||||
# Put some global args for easy access
|
||||
|
||||
Reference in New Issue
Block a user