Charles Chen
|
d22c6a3847
|
fix: Properly return abort error for streaming requests if the abort is triggered by scheduler (#19357)
|
2026-03-03 17:18:15 -08:00 |
|
 ![gemini-code-assist[bot] <176961590+gemini-code-assist[bot]@users.noreply.github.com>](/assets/img/avatar_default.png)
|
af0d35b224
|
Fix: Reject requests with a duplicate request ID which can cause server crash/hang (#19035)
Co-authored-by: gemini-code-assist[bot] <176961590+gemini-code-assist[bot]@users.noreply.github.com>
Co-authored-by: hnyls2002 <lsyincs@gmail.com>
|
2026-03-03 00:33:25 -08:00 |
|
Charles Chen
|
9e0ef04e5b
|
Support using different attention backend for draft decoding. (#14843)
|
2025-12-19 08:49:11 +08:00 |
|
Charles Chen
|
b051d76dab
|
Fix: add missing get_embed_and_head in MiniMax M2 for Eagle3 (#13297)
|
2025-11-15 01:36:03 -08:00 |
|
Charles Chen
|
f1a9c72de3
|
Support capturing aux_hidden_states for minimax m2. (#12798)
|
2025-11-08 01:54:22 -08:00 |
|
Charles Chen
|
659bfd1023
|
Add GKE's default CUDA runtime lib location to PATH and LD_LIBRARY_PATH. (#8544)
|
2025-07-30 20:28:07 -07:00 |
|
Charles Chen
|
15f3401343
|
Fix MTP with Deepseek R1 Fp4 (#7376)
|
2025-06-23 21:38:07 -07:00 |
|
Charles Chen
|
e5ddeb04d5
|
Quick fix for DeepGemm requant to also cover MTP. (#7378)
|
2025-06-23 12:08:54 -07:00 |
|
Charles Chen
|
8c16da334e
|
Fix Deepseek R1 0528 FP4 tensor name mismatch issue during weights loading. (#7164)
|
2025-06-17 11:26:23 -07:00 |
|