发生了什么
vLLM 项目由 vllm-project 维护,定位是大语言模型推理与服务引擎。官方 Release API 显示,v0.26.0 于 2026 年 7 月 27 日 01:06:58 UTC 正式发布,且不是预发布版本;发布说明包含 411 个提交和 212 位贡献者。这是推理基础设施版本更新,不是新的模型权重发布。
关键变化
- 新增 Inkling 模型族的完整支持栈,覆盖基础建模、分段 CUDA Graph、LoRA、MTP=1 speculative decoding 和 ModelOpt NVFP4 量化。
- DeepSeek-V4 获得面向多厂商硬件的推理优化,包括专用路由内核、fused_topk_bias、稀疏解码/预填充,以及 AMD ROCm 和 Intel XPU 路径的相关改进。发布说明中的 TPOT 数字是特定测试结果,不能直接外推到所有设备。
- KV offloading 与分层二级存储继续扩展,加入指标、对象存储工作负载身份、数据并行副本感知分层和 CPU encoder-cache 连接器;这对显存紧张或需要分层缓存的服务部署更相关。
- Rust 前端新增多模态视频、音频、Seed-OSS 工具解析器和原生 vllm-bench;Transformers 依赖升至 5.13.0,并迁移部分模型后端。
兼容性、安装与破坏性变化
版本化 GPU 安装文档提供 Python-only build 和完整编译两条路径。只改 Python 代码时可以使用预编译组件;如果改动 C++、CUDA 或内核代码,则必须完整编译。源码构建要求 GCC/G++ 至少为 11.3,实际安装还要匹配目标 GPU、PyTorch、CUDA/ROCm/XPU 组合。
同一份官方文档明确写明 vLLM 完整运行仅支持 Linux;macOS 等非 Linux 系统可用于开发导入,但文档称其二进制不会在非 Linux 系统上编译并工作。Release API 虽列出 macOS arm64 CPU wheel,仍不应据此推断 macOS 具备完整的生产服务支持。
v0.26.0 的发布说明明确移除 TeleChat、Persimmon 和 Fuyu 模型支持。现有服务如果依赖这些模型,不能把升级视为无感替换,应先固定旧版本或完成模型迁移,并在隔离环境回归 OpenAI 兼容接口、量化、LoRA 和 speculative decoding 等实际用法。
安全与许可证边界
发布说明列出多项安全改动:移除 diskcache 以消除 pickle 反序列化,修复可绕过 CVE 修复的并发稀疏不变量竞态,并增加 derender 资源边界、服务器路径错误响应清理、提示列表上限和正则编译超时。这些是项目方在该版本记录的修复或加固,不等于第三方安全审计,也不能证明部署当前没有漏洞。此次核验的公开 Security Advisories 页面只提供查看和报告入口,生产环境仍应关注维护方后续公告并评估自身暴露面。
v0.26.0 标签中的 LICENSE 为 Apache License 2.0(SPDX:Apache-2.0)。分发或修改 vLLM 代码时仍需遵守该许可证的版权、NOTICE(如适用)和专利等条款;vLLM 代码的许可证也不自动覆盖第三方模型权重、数据集或其他依赖。
给中国用户的下一步
- 先在隔离环境固定 v0.26.0,并按目标硬件选择官方安装路径;不要只依据版本号判断 CUDA、ROCm、XPU、PyTorch 和驱动组合可用。
- 如果服务使用 TeleChat、Persimmon 或 Fuyu,先维持旧版本或确认替代模型,再安排迁移和接口回归。
- 上线前检查新增多模态输入、KV 分层存储和安全边界在本地网络、权限与数据流中的实际行为;项目发布说明和公开公告都不能替代自有测试。