Commit Graph
33 Commits
Author SHA1 Message Date
Minglei Zhu 4bffd3a232 [GPT-OSS] support fp8 online quantization for gpt-oss bf16 (#18988)
merge it as all required CI passed
2026-02-20 14:16:57 -08:00
Minglei Zhu bf52388354 [PCG] support piecewise cuda graph for kimi-linear model (#18849) 2026-02-17 23:31:12 +08:00
Minglei Zhu 8be18c655d [Perf] refactor piecewise cuda graph support of Qwen3-Next (#17613) 2026-02-14 09:30:50 +08:00
Minglei Zhu 38d275a9fd [BugFix] fix gpt-oss accuracy issue when enabling piecewise cuda graph (#18013) 2026-02-01 14:26:26 +08:00
Minglei Zhu d90c0837e5 [hybrid-model] clean up and consolidate redundant fields in RadixLinearAttention (#17660) 2026-01-27 10:37:58 -08:00
Minglei Zhu 2b2f317383 fix gpt-oss launch failure with piecewise cuda graph (#17532) 2026-01-22 22:41:38 -08:00
Minglei Zhu 419bbcee10 refactor Qwen3-Next with a new RadixLinearAttention (#17373) 2026-01-22 17:42:06 +08:00
Minglei ZhuandMinglei Zhu 64946679b5 [Perf] fuse q, k norm for Flux2Attention (#17241)
Co-authored-by: Minglei Zhu <zminglei@linkedin.com>
2026-01-19 14:33:34 +08:00
Minglei Zhu a2c2c09d7d [BugFix] fix gpt-oss-120b launch failure with --enable-piecewise-cuda-graph (#16757) 2026-01-11 09:19:59 +08:00
Minglei Zhu 4c85f9d039 Only allocate encoder metadata for encoder-decoder models (#16527) 2026-01-06 22:17:04 -08:00
Minglei ZhuandBinyao Jiang b62e7e3bfe [CI]add nightly CI for glm4v_moe arch model (#14927)
Co-authored-by: Binyao Jiang <byjiang1996@gmail.com>
2025-12-11 18:29:45 -08:00
Minglei Zhu be4a3ec376 support piecewise cuda graph for Olmo models (#14476) 2025-12-06 17:57:44 -08:00
Minglei Zhu b76e303e6a clean up gemlite usage (#14444) 2025-12-04 21:52:56 -08:00
e8542db558 [piecewise] move piecewise_cuda_graph_runner init to model_runner initialize (#14034)
Co-authored-by: Stefan He <hebiaobuaa@gmail.com>
Co-authored-by: Binyao Jiang <byjiang1996@gmail.com>
2025-11-30 22:16:04 -08:00
Minglei Zhu fafaa2ccea [BugFix] fix outplace_fused_experts missing is_gated (#13864) 2025-11-24 12:36:14 -08:00
Minglei Zhu 3798055929 purge unnecessary env variable set in deterministic test (#13481) 2025-11-18 20:43:51 -08:00
Minglei Zhu 9846f8ed72 fix MambaPool clear method after refactoring (#13449) 2025-11-18 10:03:45 +08:00
Minglei Zhu 8a4373405e re-submit 12911 but relax the requirement for deepgemm (#13226) 2025-11-15 15:37:12 +08:00
Minglei Zhu a5be6ef98e [Deterministic] Support Qwen3-Next model deterministic inference (#13100) 2025-11-14 18:01:18 -08:00
Minglei Zhu 8a821af793 fallback to triton mm_persistent kernel when deepGemm fail (#12911) 2025-11-08 23:42:26 -08:00
Minglei Zhu c14cc47e39 [Deterministic] Optimize bmm_batch_invariant op (#12522) 2025-11-04 00:33:31 -08:00
Minglei Zhu 229256c505 [Deterministic] add deepseek v3 deterministic inference CI test (#12412) 2025-11-01 18:10:32 -07:00
Minglei Zhu e39628fd07 [2/2] Deepseek deterministic: support deepseek v3 deterministic inference on 8 x H200 (#12095) 2025-10-29 11:49:04 -07:00
Minglei Zhu f4b78d137c [1/2] deepseek deterministic: support deterministic inference for deepseek arch models on a single GPU (#12000) 2025-10-24 15:17:28 -07:00
Minglei Zhu 200a3c0bb1 [Documentation] add doc for deterministic inference (#11956) 2025-10-22 12:36:15 -05:00
Minglei Zhu f4488e9dd9 set default attention backend for deterministic inference (#11801) 2025-10-18 00:01:24 -07:00
Minglei ZhuandBaizhou Zhang 13219e1e48 completely remove mixed mode deterministic test as prefix mode could cover it (#11783)
Co-authored-by: Baizhou Zhang <sobereddiezhang@gmail.com>
2025-10-17 17:46:03 -07:00
Minglei Zhu 46ccbed2cd update GLM nightly test threshold (#10331) 2025-09-11 14:54:58 -07:00
Minglei Zhu 6ee6619b7a add zai-org/GLM-4.5-Air-FP8 model into nightly CI (#8894) 2025-08-08 01:44:19 -07:00
2ae95d17e8 Disable tp for shared experts under expert parallelism for GLM4.5 model (#8647) (#8647)
Co-authored-by: Stefan He <hebiaobuaa@gmail.com>
Co-authored-by: Cheng Wan <54331508+ch-wan@users.noreply.github.com>
2025-08-01 12:02:35 -07:00
Minglei Zhu 25f73c6cf3 fix GLM4_MOE launch with compressed_tensor quant model (#8456) 2025-07-28 01:31:20 -07:00
Minglei Zhu 8a32355704 Feat: Support Granite 3.0 MoE in SGLang (#7959) 2025-07-17 20:56:03 -07:00
Minglei Zhu 79961afa82 optimize pad operations in fa3 to accelarate 100+us (#6077) 2025-05-07 23:40:08 -07:00