原标题:《vLLM v0.28.0》 评分: 21 | 作者: mrrrcs 💭 每个版本都先坏再补丁,这也叫稳定发布吗? 🎯 讨论背景 vLLM 是一个开源 LLM 推理/serving 引擎,常被用于在 H200、B300、RTX 6000 这类 GPU 上高吞吐部署新模型。这里讨论的是 v0.28.0 及其前后版本在 DeepSeek-V4-Flash、Gemma-4 等模型上的兼容性问题:有人遇到重复 token loop、进程卡死,甚至输出出奇怪的思维链垃圾文本。评论里还提到,很多团队会在官方 release 之前先用 model-specific images(针对某个模型定制的镜像)和临时 patch,配合 A/B deploys 与 E2E testing 来拦截回归。另一个对照点是 SGLang(另一套 LLM inference 框架),有人在两边都排查过问题,认为当前 nightly 版更稳;同时也有人提到 vLLM 的新 flat model approach,可能是为了减少继承配置和 parser 带来的故障。 📌 讨论焦点 核心抱怨:版本更新后仍频繁崩