Fuse routed scaling factor in topk_reduce kernel (#6220)
This commit is contained in:
@@ -328,4 +328,5 @@ class W8A8FP8MoEMethod:
|
||||
a1_scale=layer.w13_input_scale,
|
||||
a2_scale=layer.w2_input_scale,
|
||||
no_combine=no_combine,
|
||||
routed_scaling_factor=routed_scaling_factor,
|
||||
)
|
||||
|
||||
Reference in New Issue
Block a user