feat: Add Non-intrusive Tensor Dumping for Model Inference (#10566)
This commit is contained in:
@@ -40,6 +40,9 @@ from sglang.srt.configs.model_config import (
|
||||
)
|
||||
from sglang.srt.configs.update_config import adjust_config_with_unaligned_cpu_tp
|
||||
from sglang.srt.constants import GPU_MEMORY_TYPE_WEIGHTS
|
||||
from sglang.srt.debug_utils.tensor_dump_forward_hook import (
|
||||
register_forward_hook_for_model,
|
||||
)
|
||||
from sglang.srt.distributed import (
|
||||
get_pp_group,
|
||||
get_tp_group,
|
||||
@@ -791,6 +794,15 @@ class ModelRunner:
|
||||
f"avail mem={after_avail_memory:.2f} GB, "
|
||||
f"mem usage={self.weight_load_mem_usage:.2f} GB."
|
||||
)
|
||||
if self.server_args.debug_tensor_dump_output_folder is not None:
|
||||
register_forward_hook_for_model(
|
||||
self.model,
|
||||
self.server_args.debug_tensor_dump_output_folder,
|
||||
self.server_args.debug_tensor_dump_layers,
|
||||
self.tp_size,
|
||||
self.tp_rank,
|
||||
self.pp_rank,
|
||||
)
|
||||
|
||||
if self.server_args.elastic_ep_backend == "mooncake":
|
||||
# Mooncake does not support `monitored_barrier`
|
||||
|
||||
Reference in New Issue
Block a user