Shu Wang
|
5c02217746
|
Inclusion of nvfp4 blockscale in EPLB Rebalance (#17158)
|
2026-01-19 17:45:27 +08:00 |
|
Shu Wang
|
665cb02003
|
Fix regression caused by fa3 block_table (#15009)
|
2025-12-12 19:11:09 -08:00 |
|
Shu Wang
|
a56f770277
|
Fix global scaling factor loading hang (#13484)
|
2025-11-21 16:07:06 -08:00 |
|
Shu Wang
|
6664083522
|
Replace [silu_and_mul_]scaled_fp4_group_quant by Flashinfer equivalent (#12376)
|
2025-11-13 00:26:00 -08:00 |
|
Shu Wang
|
7aa443903d
|
Fix nan in global scaling factor for large scale nvfp4 EP (#13162)
|
2025-11-12 15:32:23 -08:00 |
|
Shu Wang
|
82f39dc11d
|
Add mm_fp4 trtllm backend (#12406)
|
2025-11-05 14:31:46 -08:00 |
|
Shu Wang
|
1ba137e98f
|
Enable trtllm mla prefix extend (#10526)
|
2025-09-17 16:44:11 -07:00 |
|
Shu Wang
|
124097fc5b
|
enable prefix cache with dp (#10459)
|
2025-09-16 18:26:58 -07:00 |
|
 Shu WangandElfie Guo
|
36acd2ff16
|
Fix chunked prefix cache for nvfp4 (#10180)
Co-authored-by: Elfie Guo <elfieg@nvidia.com>
|
2025-09-12 03:20:30 -07:00 |
|
Shu Wang
|
3df05f4d6a
|
[NVIDIA] [3/N] Nvfp4 Masked Gemm: Add flashinfer grouped_gemm_nt_masked (#9199)
|
2025-09-11 20:18:43 -07:00 |
|
Shu Wang
|
288ae41f7a
|
[NVIDIA] Fix num_experts in modelopt_quant (#8811)
|
2025-08-06 14:35:07 -07:00 |
|
Shu Wang
|
b01eeb80f8
|
[NVIDIA]Fix local_num_experts for EP (#8779)
|
2025-08-04 22:01:14 -07:00 |
|
Shu Wang
|
ad4e58bf67
|
Support fp8 gemm for blackwell (#4558)
|
2025-03-20 12:40:28 -07:00 |
|