Commit Graph
14 Commits
Author SHA1 Message Date
Li Hui 2f42749184 Fix topk inference performance reduce (#6474) 2025-05-23 02:58:31 -07:00
lambert0312 1698e94e67 Add A800 fused moe config for qwen3 235b (#5900) 2025-04-29 20:18:11 -07:00
lambert0312 3c8a52311a Fix check_env script (#5901) 2025-04-29 18:54:54 -07:00
lambert0312 91dda4cd06 Add A800 fused moe config for qwen3 30b (#5880) 2025-04-29 02:02:24 -07:00
lambert0312 a086a11305 Use sgl-kernel sgl_per_token_group_quant_int8 (#4971) 2025-04-26 20:19:42 -07:00
lambert0312 76d17c7ecb Fix shared experts fusion error without quantization (#5632) 2025-04-22 09:22:26 -07:00
lambert0312 c44f2869c9 Modify metrics service endpoint (#3443) 2025-04-21 00:35:38 -07:00
lambert0312 471650dee0 Fix broadcast use cuda device lead to memory capacity unbalanced (#5416) 2025-04-15 02:47:26 -07:00
lambert0312 61e7c4dd21 Add A800 shared experts fused MoE kernel tuning configs for DeepSeek V3/R1 (#5368) 2025-04-14 18:39:44 -07:00
lambert0312 1b1b47a949 Fix w8a8_int8 model shared experts fusion load weights error (#5120) 2025-04-11 23:33:51 -07:00
lambert0312 2e0f94ab79 [Fix] fix output_top_logprobs is not exist (#4597) 2025-03-27 21:45:57 -07:00
lambert0312 481f608b8e Add INT8 support MTP NextN function (#3911) 2025-03-12 01:37:16 -07:00
lambert0312 7140ba3573 Add A800 tuning configs for DeepSeek R1/V3 channel-wise INT8 (#4323) 2025-03-11 18:25:56 -07:00
lambert0312 d3ecd63204 Add A800 tuning configs support DeepSeek V3/R1 BF16 and INT8(block-wise) (#4136) 2025-03-11 00:32:25 -07:00