[sgl-kernel][1/2] Fused qk_norm_rope for Qwen3-MoE (#14036)

Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
This commit is contained in:
Yuan Luo
2025-11-28 12:25:15 +08:00
committed by GitHub
parent bce40fa217
commit e12c78aab6
7 changed files with 696 additions and 0 deletions

View File

@@ -378,6 +378,23 @@ void apply_shuffle_mul_sum(
const torch::Tensor& permutation,
const std::optional<torch::Tensor>& factors);
void fused_qk_norm_rope(
torch::Tensor& qkv,
int64_t num_heads_q,
int64_t num_heads_k,
int64_t num_heads_v,
int64_t head_dim,
double eps,
torch::Tensor& q_weight,
torch::Tensor& k_weight,
double base,
bool is_neox,
torch::Tensor& position_ids,
double factor,
double low,
double high,
double attention_factor);
void cutlass_fp4_group_mm(
torch::Tensor& output,
const torch::Tensor& a,