
大模型推理框架的一次版本更新,开始同时触及模型适配、显存调度、异构硬件和安全边界。vLLM在7月25日发布0.26.0版,合入411次提交,来自212位贡献者,其中61位首次参与。它没有用单一功能制造噱头,而是把Inkling完整支持、DeepSeek-V4优化和分层KV卸载放进同一次交付,直接影响模型能否稳定、经济地跑进生产环境。
Inkling获得完整运行栈。基础建模、分段CUDA图、Hopper FA4相对注意力、推测解码、LoRA与NVFP4量化同步进入,重点是从“能加载”走向“能部署”。
KV缓存继续离开单一显存层。对象存储二级层、工作负载身份、数据并行副本感知和卸载指标补齐,让长上下文服务有更多容量与成本选择。
速度与安全一起推进。DeepSeek-V4获得跨CUDA、ROCm和XPU的优化,项目同时移除基于pickle的磁盘反序列化路径,并修复并发竞态与资源边界问题。
推理服务处理长对话时,注意力计算会持续生成KV缓存。它能避免每轮都重算历史内容,却会快速占满昂贵的GPU显存。传统做法通常在显存与主机内存之间搬运;0.26.0把对象存储纳入二级层,并新增读写用量、查找延迟等指标,还让数据并行副本知道缓存属于哪一层、哪一个副本。
这并不意味着把缓存放进对象存储就一定更快。更准确的价值是:高频内容留在快层,低频或可复用内容转入容量更大的慢层,运营团队可以在显存占用、命中率和恢复延迟之间做可观测的取舍。版本还加入编码器缓存的CPU卸载连接器、异构KV组块大小配置,以及混合模型的部分前缀缓存命中,服务多模态与混合注意力模型时更有操作空间。
DeepSeek-V4是本版性能工作的另一条主线。官方说明列出专用路由内核带来的2.94%端到端每输出token时延收益,fused_topk_bias内核达到1.5至2倍加速,移除重复拷贝则带来1.8%的端到端时延改善。ROCm侧增加两阶段压缩器与稀疏预填充、解码优化,AMD和Intel XPU也获得DSpark推测解码路径。
这些数字不能直接等同于任意业务吞吐提升。内核级加速只覆盖完整请求链路的一部分,实际效果还取决于GPU型号、批量、上下文长度、并发和量化配置。更新还允许不同KV缓存组选择不同注意力后端,并把滑动窗口明确标记为后端能力;对混合注意力模型更灵活,但也要求部署者重新核对自动选择结果。
精度侧新增了通过head_dtype让生成模型的输出头保持FP32的能力,并延伸到LoRA路径。它用少量额外成本换取生成头稳定性,说明推理框架的竞争已经不只是追求更低位宽,还要让量化、适配器和最终输出之间的精度边界可配置。
安全改动值得优先升级评估。项目替换磁盘缓存组件以消除pickle反序列化风险,修复一个可能绕过既有漏洞缓解措施的并发稀疏不变量竞态,并为反渲染端点、提示列表和正则编译增加资源上限或超时。错误响应中的服务器文件路径也被清理,减少内部环境信息外泄。
兼容性代价同样明确:依赖升级到Transformers 5.13.0等新版本,TeleChat、Persimmon和Fuyu模型支持被移除。已有镜像、量化权重、LoRA与自定义后端的团队,不宜只替换版本号后直接全量上线;更稳妥的路径是先复现真实流量,比较首token时延、每token时延、缓存命中、显存峰值与输出一致性,再逐步放量。
ATYUN编辑判断:vLLM 0.26.0最重要的信号,是开源推理底座正在从“把更多模型跑起来”转向“把缓存、硬件、精度和安全作为同一套生产系统管理”。411次提交体现的是生态协作规模,不是单点性能承诺。真正值得关注的后续指标,是对象存储二级层在长对话和多模态负载中的命中收益,跨厂商DeepSeek-V4优化能否被独立复现,以及大版本依赖升级是否引入新的兼容成本。
