 Kaixi HouandClaude Opus 4.5
|
4181290efd
|
[NVIDIA] Add --top-k argument to run_eval.py (#18025)
Co-authored-by: Claude Opus 4.5 <noreply@anthropic.com>
|
2026-02-02 22:17:53 -08:00 |
|
 Kaixi HouandBaizhou Zhang
|
db2d362d04
|
[NVIDIA] Add cutedsl e2e test to GB200 CI (#12672)
Co-authored-by: Baizhou Zhang <sobereddiezhang@gmail.com>
|
2025-11-20 18:30:12 -08:00 |
|
Kaixi Hou
|
c3c4da71fb
|
[NVIDIA] Add fp8 gemm benchmark on blackwell (#13528)
|
2025-11-19 19:35:00 -08:00 |
|
 
|
e389f91dec
|
[NVIDIA] Fix broken fp8 MoE of deepseek v3 (#13264)
Co-authored-by: Baizhou Zhang <sobereddiezhang@gmail.com>
Co-authored-by: Kangyan-Zhou <zky314343421@gmail.com>
|
2025-11-17 16:13:28 -08:00 |
|
 Kaixi HouandBaizhou Zhang
|
5ae0ac4244
|
[NVIDIA] Fix use case of SGLANG_ENABLE_FLASHINFER_GEMM (#13274)
Co-authored-by: Baizhou Zhang <sobereddiezhang@gmail.com>
|
2025-11-14 12:51:11 -08:00 |
|
Kaixi Hou
|
141278048e
|
[NVIDIA] Fix unit test of MoE and add it to nightly ci (#12709)
|
2025-11-05 14:33:18 -08:00 |
|
Kaixi Hou
|
0711d1509b
|
[NVIDIA] Fix cutedsl backend of MoE (#12353)
|
2025-11-04 18:54:55 -08:00 |
|
Kaixi Hou
|
34f7564df0
|
[NVIDIA] Fix wrong symmetric sizes for fp4 cases (#12640)
|
2025-11-04 14:19:37 -08:00 |
|
Kaixi Hou
|
c0d02cf4d1
|
[NVIDIA] Add CI workloads for GB200 (#12242)
|
2025-10-30 14:32:03 -07:00 |
|
Kaixi Hou
|
ff60406429
|
[NVIDIA] Change default quant method for model_opt (#11991)
|
2025-10-25 22:04:57 -07:00 |
|
Kaixi Hou
|
90dfe3de4c
|
[NVIDIA] disable chunked prefix cache when dp and blackwell is used (#9861)
|
2025-09-06 14:05:16 +08:00 |
|
Kaixi Hou
|
9a719b7afc
|
[NVIDIA] Remove unused get_fused_moe_impl_class function (#9764)
|
2025-09-05 22:41:22 -07:00 |
|
Kaixi Hou
|
5c34b4f1c7
|
[NVIDIA] [2/N] Optimize silu_and_mul_scaled_fp4_grouped_quant perf (#9556)
|
2025-08-29 17:17:03 -07:00 |
|
Kaixi Hou
|
e5638573c1
|
[NVIDA] [1/N] Nvfp4 Masked Gemm: Add quant op for the flashinfer grouped gemm (#9200)
|
2025-08-22 12:19:45 -07:00 |
|
Kaixi Hou
|
18da2c96ec
|
[NVIDIA] Fix trtllm fp4 moe backend when used in MTP (#9384)
|
2025-08-21 00:54:01 -07:00 |
|
Kaixi Hou
|
b4c9f38a76
|
[NVIDIA] Fix missing get_col_major_tma_aligned_tensor for Blackwell deepgemm in EpMoE (#8955)
|
2025-08-08 01:12:33 -07:00 |
|
Kaixi Hou
|
6d0646da11
|
[NVIDIA] Fix breakage of using trtllm-gen fp8 moe (#8773)
|
2025-08-04 16:30:13 -07:00 |
|
 Kaixi Houandkushanam
|
aa4c66b564
|
[NVIDIA] Enable Flashinfer MoE blockscale fp8 backend for TP MoE (#8450)
Co-authored-by: kushanam <42385577+kushanam@users.noreply.github.com>
|
2025-07-31 19:56:34 -07:00 |
|
Kaixi Hou
|
134fa43e19
|
[NVIDIA] Change to use num_local_experts (#8453)
|
2025-07-28 10:38:19 -07:00 |
|
Kaixi Hou
|
85486b6f6f
|
[NVIDIA] Add Flashinfer MoE blockscale fp8 backend (#8036)
|
2025-07-27 00:34:41 -07:00 |
|