vLLM v0.29.0rc2 于 2026-09-03 发布,由 vllm-project 维护,采用 Apache-2.0 许可。本次为预发布候选版本,核心修复多模态推理在共享内存对象存储与前缀缓存共同启用时的稳定性问题。

关键变化

  • 修复 SHM Worker 缓存对 prefix-covered 项的处理:当前缀缓存完全覆盖某项占位范围时,未缓存项以 data=None 到达 Worker,SHM 缓存项保留地址描述符,旧逻辑在接收端断言失败导致 EngineCore 崩溃,修复后地址项仍被正确解析并确认,避免二次相同请求时进程终止;对应仓库问题 vllm#54994。
  • 验证与测试:新增 regression 测试 test_shm_receiver_handles_prefix_covered_items,覆盖重复请求、SHM 命中与 prefix-covered 场景,确认命中对象的 writer 引用能被正确回收,不再永久保护。
  • 版本属性:无许可证变更,保持 Apache-2.0;无破坏性 API 调整,与 v0.29.0rc1 兼容;主要面向已启用多模态前缀缓存与 SHM 缓存的生产部署。

适用对象与兼容性

适用于使用 vLLM 提供多模态大模型推理服务、且启用前缀缓存和共享内存多模态处理器缓存的团队。升级为候选版本,建议先在测试环境验证多模态图像输入的重复请求与长上下文场景。兼容现有安装方式,支持 Linux、CUDA 12.9/13.0、ROCm、CPU 与 XPU 构建,依赖与 v0.29.0rc1 一致。

安装与访问条件

可通过源码或预发布标签获取:拉取 v0.29.0rc2 标签进行构建验证,或等待 PyPI 预发布通道;常规稳定通道仍为 v0.28.0。建议通过 uv pip install vllm 或从源码构建验证,生产环境建议在灰度环境先行验证后再推广。

限制与下一步

本次仅为候选修复,未包含完整的功能新增;若线上已出现多模态二次相同请求导致的 EngineCore 崩溃,可优先验证该候选。后续需关注 v0.29.0 正式版的完整发布说明与回归测试结果,持续跟踪上游对多模态缓存与前缀缓存交互的进一步加固。