This website requires JavaScript.
Explore
Help
Sign In
chenchenghao
/
sglang
Watch
1
Star
0
Fork
0
You've already forked sglang
Code
Issues
Pull Requests
Actions
12
Packages
Projects
Releases
Wiki
Activity
Files
57eec0bfbce964e347ef2affb999e03416f22325
sglang
/
sgl-kernel
/
benchmark
History
Chunan Zeng
65c24c28f9
[Quant Kernel] refactored per token group quant fp8 to support int8 up-to 2x faster (
#4396
)
2025-03-23 23:44:17 -07:00
..
bench_awq_dequant.py
Add awq dequantize kernel to sgl with 1x to 3x speedup (
#4104
)
2025-03-12 00:10:02 -07:00
bench_cublas_grouped_gemm.py
…
bench_fp8_blockwise_gemm.py
…
bench_fp8_gemm.py
…
bench_int8_gemm.py
…
bench_lightning_attention_decode.py
[Fix] use
torch.cat
instead of
torch.concat
to prevent entering the
Autograd
backends. (
#4466
)
2025-03-16 00:02:47 -07:00
bench_moe_align_block_size.py
feat: support ep size < 32 for sgl kernel (
#4348
)
2025-03-12 20:50:46 -07:00
bench_moe_topk_softmax.py
Add moe topk softmax templated from vllm (
#4302
)
2025-03-14 12:03:33 -07:00
bench_per_tensor_quant_fp8.py
[quant kernel] sgl-kernel support per_tensor_quant fp8 (
#3786
)
2025-03-06 18:05:43 -08:00
bench_per_token_group_quant_8bit.py
[Quant Kernel] refactored per token group quant fp8 to support int8 up-to 2x faster (
#4396
)
2025-03-23 23:44:17 -07:00
bench_per_token_quant_fp8.py
fix accuracy issue (
#4376
)
2025-03-13 02:06:22 -07:00