vLLM 最新版本支持 FP8 量化,推理吞吐量提升近一倍

PromptCube 初级 2026/5/8 340 浏览 1 点赞 约 2 分钟

vLLM 这次把 FP8 量化正式纳入支持,直接击中了大模型部署最核心的痛点:显存带宽瓶颈。简单来说,就是让模型在不明显损失精度的情况下,用更少的内存占用跑出更高的速度。

vLLM 最新版本支持 FP8 量化,推理吞吐量提升近一倍

这次更新最核心的突破在于,FP8(8位浮点数)相比传统的 FP16 或 BF16,将数据量砍掉了一半,但由于它保留了指数位,比 INT8 这种整数量化更能兼容深度学习模型的权重分布。在实际的推理吞吐量上,近一倍的提升意味着同样的显卡资源,单机能承载的并发请求数直接翻番,这对那些在生产环境下追求极致 QPS 的开发者来说是巨大的红利。

从行业视角看,这标志着模型推理正在从「能跑通」快速转向「低成本大规模商业化」。过去很多团队为了省显存得在量化精度和推理速度之间做艰难抉择,要么忍受 INT4/INT8 带来的精度崩塌,要么忍受 FP16 的缓慢。FP8 的普及实际上是在为 H100 等新一代硬件量身定做,因为这些硬件在底层指令集上就原生支持 FP8 运算。

对于开发者而言,部署门槛进一步降低了。现在不需要复杂的量化工具链,直接通过 vLLM 的量化加载参数就能体验。如果你正在部署 Llama 3 或 Mistral 等主流模型,可以尝试使用如下方式启动:

python -m vllm.entrypoints.openai.api_server \
    --model facebook/opt-125m \
    --quantization fp8

需要注意的是,FP8 的性能红利高度依赖硬件。如果你还在用 A100 之前的老卡,提升可能没那么明显,甚至无法发挥全部潜力;但如果你手握 H100 或 B200,这几乎是目前提升吞吐量的最优解。

这次更新其实释放了一个信号:推理框架的竞争已经从单纯的「算子优化」演变成了「数据格式的极致压榨」。未来,谁能让模型在更低位宽下保持逻辑能力,谁就能在推理成本战中胜出。

全部回复 (0)

还没有回复,来发第一条吧!

发表回复

支持 Markdown 格式