Hugging Face Blog·· 2026-07-08精选AI 评分78
Hugging Face 发布 vLLM transformers 后端原速支持
Native-speed vLLM transformers modeling backend
AI 导读
Hugging Face 宣布 transformers 库的 vLLM 建模后端现已实现与 vLLM 原生手写实现相当或更快的推理速度。用户只需添加 --model-impl transformers 标志,即可在无需修改代码的情况下利用 vLLM 的连续批处理和自定义注意力内核进行高效推理。
推荐理由
原文展示了通过单一参数即可让 transformers 模型在 vLLM 中达到原生推理速度,消除了手动移植代码的需求。
来源:Hugging Face Blog · huggingface.co