diff --git a/docker/rocm.Dockerfile b/docker/rocm.Dockerfile index 2e3e5ef1b..11df166a9 100644 --- a/docker/rocm.Dockerfile +++ b/docker/rocm.Dockerfile @@ -98,7 +98,7 @@ ARG ENABLE_MORI=0 ARG NIC_BACKEND=none ARG MORI_REPO="https://github.com/ROCm/mori.git" -ARG MORI_COMMIT="20920706a9004018dbd87c7387f207d08d0e05af" +ARG MORI_COMMIT="2f88d06aba75400262ca5c1ca5986cf1fdf4cd82" # AMD AINIC apt repo settings ARG AINIC_VERSION=1.117.5 diff --git a/python/sglang/srt/layers/moe/token_dispatcher/moriep.py b/python/sglang/srt/layers/moe/token_dispatcher/moriep.py index a0ea4656a..6c189d0f7 100644 --- a/python/sglang/srt/layers/moe/token_dispatcher/moriep.py +++ b/python/sglang/srt/layers/moe/token_dispatcher/moriep.py @@ -189,6 +189,8 @@ def init_mori_op( world_size = get_moe_expert_parallel_world_size() rank = get_moe_expert_parallel_rank() + gpu_per_node = 8 if world_size >= 8 else world_size + cpu_group = group.cpu_group torch._C._distributed_c10d._register_process_group("mori", cpu_group) mori.shmem.shmem_torch_process_group_init("mori") @@ -227,6 +229,7 @@ def init_mori_op( warp_num_per_block=warp_num_per_block, block_num=block_num, kernel_type=kernel_type, + gpu_per_node=gpu_per_node, rdma_block_num=rdma_block_num, num_qp_per_pe=2, )