Commit Graph
20 Commits
Author SHA1 Message Date
Kaixi HouandClaude Opus 4.5 4181290efd [NVIDIA] Add --top-k argument to run_eval.py (#18025)
Co-authored-by: Claude Opus 4.5 <noreply@anthropic.com>
2026-02-02 22:17:53 -08:00
Kaixi HouandBaizhou Zhang db2d362d04 [NVIDIA] Add cutedsl e2e test to GB200 CI (#12672)
Co-authored-by: Baizhou Zhang <sobereddiezhang@gmail.com>
2025-11-20 18:30:12 -08:00
Kaixi Hou c3c4da71fb [NVIDIA] Add fp8 gemm benchmark on blackwell (#13528) 2025-11-19 19:35:00 -08:00
e389f91dec [NVIDIA] Fix broken fp8 MoE of deepseek v3 (#13264)
Co-authored-by: Baizhou Zhang <sobereddiezhang@gmail.com>
Co-authored-by: Kangyan-Zhou <zky314343421@gmail.com>
2025-11-17 16:13:28 -08:00
Kaixi HouandBaizhou Zhang 5ae0ac4244 [NVIDIA] Fix use case of SGLANG_ENABLE_FLASHINFER_GEMM (#13274)
Co-authored-by: Baizhou Zhang <sobereddiezhang@gmail.com>
2025-11-14 12:51:11 -08:00
Kaixi Hou 141278048e [NVIDIA] Fix unit test of MoE and add it to nightly ci (#12709) 2025-11-05 14:33:18 -08:00
Kaixi Hou 0711d1509b [NVIDIA] Fix cutedsl backend of MoE (#12353) 2025-11-04 18:54:55 -08:00
Kaixi Hou 34f7564df0 [NVIDIA] Fix wrong symmetric sizes for fp4 cases (#12640) 2025-11-04 14:19:37 -08:00
Kaixi Hou c0d02cf4d1 [NVIDIA] Add CI workloads for GB200 (#12242) 2025-10-30 14:32:03 -07:00
Kaixi Hou ff60406429 [NVIDIA] Change default quant method for model_opt (#11991) 2025-10-25 22:04:57 -07:00
Kaixi Hou 90dfe3de4c [NVIDIA] disable chunked prefix cache when dp and blackwell is used (#9861) 2025-09-06 14:05:16 +08:00
Kaixi Hou 9a719b7afc [NVIDIA] Remove unused get_fused_moe_impl_class function (#9764) 2025-09-05 22:41:22 -07:00
Kaixi Hou 5c34b4f1c7 [NVIDIA] [2/N] Optimize silu_and_mul_scaled_fp4_grouped_quant perf (#9556) 2025-08-29 17:17:03 -07:00
Kaixi Hou e5638573c1 [NVIDA] [1/N] Nvfp4 Masked Gemm: Add quant op for the flashinfer grouped gemm (#9200) 2025-08-22 12:19:45 -07:00
Kaixi Hou 18da2c96ec [NVIDIA] Fix trtllm fp4 moe backend when used in MTP (#9384) 2025-08-21 00:54:01 -07:00
Kaixi Hou b4c9f38a76 [NVIDIA] Fix missing get_col_major_tma_aligned_tensor for Blackwell deepgemm in EpMoE (#8955) 2025-08-08 01:12:33 -07:00
Kaixi Hou 6d0646da11 [NVIDIA] Fix breakage of using trtllm-gen fp8 moe (#8773) 2025-08-04 16:30:13 -07:00
Kaixi Houandkushanam aa4c66b564 [NVIDIA] Enable Flashinfer MoE blockscale fp8 backend for TP MoE (#8450)
Co-authored-by: kushanam <42385577+kushanam@users.noreply.github.com>
2025-07-31 19:56:34 -07:00
Kaixi Hou 134fa43e19 [NVIDIA] Change to use num_local_experts (#8453) 2025-07-28 10:38:19 -07:00
Kaixi Hou 85486b6f6f [NVIDIA] Add Flashinfer MoE blockscale fp8 backend (#8036) 2025-07-27 00:34:41 -07:00