[DLLM] Implement initial dynamic batching for diffusion LLM (#14883)

This commit is contained in:
Zehuan Li
2026-01-17 16:48:15 +08:00
committed by GitHub
parent 737a1183d6
commit d2c863878c
8 changed files with 380 additions and 87 deletions

View File

@@ -2,7 +2,7 @@ from __future__ import annotations
import dataclasses
import logging
from typing import TYPE_CHECKING, List, Optional
from typing import TYPE_CHECKING, List, Optional, Union
import torch
@@ -24,7 +24,7 @@ logger = logging.getLogger(__name__)
class GenerationBatchResult:
logits_output: Optional[LogitsProcessorOutput] = None
pp_hidden_states_proxy_tensors: Optional[PPProxyTensors] = None
next_token_ids: Optional[torch.Tensor] = None
next_token_ids: Optional[Union[torch.Tensor, List[torch.Tensor]]] = None
num_accepted_tokens: int = 0
accept_length_per_req_cpu: Optional[List[int]] = None
can_run_cuda_graph: bool = False