Hugging Face Blog·· 2026-07-08精选AI 评分79
Hugging Face transformers 建模后端实现 vLLM 原生推理速度
Native-speed vLLM transformers modeling backend
AI 导读
Hugging Face 宣布 transformers 建模后端在 vLLM 中已能为多种 LLM 架构达到或超过自定义 vLLM 实现的吞吐速度。该后端在 Qwen3-4B、Qwen3-32B 和 Qwen3-235B-A22B-FP8 三种部署配置中均达到或超过原生实现速度,并可通过 `--model-impl transformers` 启用。
推荐理由
文章通过 Qwen3 的 4B、32B 和 235B FP8 MoE 对比,说明该后端如何减少模型接入 vLLM 时的重复优化工作。
来源:Hugging Face Blog · huggingface.co