跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分65

transformers vLLM 后端达到原生推理速度

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 更新 vLLM 的 transformers 建模后端,在 Qwen3-4B、Qwen3-32B、Qwen3-235B-A22B-FP8 三种模型上达到或超越原生 vLLM 吞吐。模型作者只需添加 --model-impl transformers 标志即可自动获得优化推理,无需手写自定义实现。

推荐理由

transformers 后端现已达到原生 vLLM 实现同等吞吐,模型作者无需重写代码即可在 vLLM 中获得优化推理性能。

来源:Hugging Face Blog · huggingface.co