本次发布 (v0.28.0) 是 vLLM 的一个重要里程碑,包含 270 位贡献者的 584 次提交。主要亮点包括:
* **性能优化:** 通过解码上下文并行 (DCP) 支持、融合内核,以及自适应投机令牌预算带来的 60% 首字延迟 (TTFT) 提升,大幅增强了 **Kimi-K3** 的表现。
* **DeepSeek 及模型支持:** 全面支持 DeepSeek V4(包括稀疏 MLA 和 NVFP4),并新增了 Muse Glimmer 和 Ling 3.0 Flash 等模型。
* **硬件扩展:** 增强了 ROCm 支持 (gfx11/gfx950),扩展了 Intel XPU 后端,并持续改进了 CPU 和 NVIDIA 硬件的性能。
* **引擎与效率:** Model Runner V2 更加成熟,实现了引擎/预填充/解码 (E/P/D) 的解耦,支持分层 KV 缓存卸载(包括磁盘支持),并改进了投机解码 (DFlash2, DSpark)。
* **API 与鲁棒性:** 更新了 Rust 前端,改进了 gRPC 支持,并调整了新的默认设置(将 `max_num_batched_tokens` 翻倍至 16k)。
* **重大变更:** `bitsandbytes` 已移至树外插件,Transformers 版本已提升至 5.15.0。
此次更新显著提升了多模态能力、量化(在线 MXFP4/NVFP4)以及所有受支持平台上的启动可靠性。