跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分79

Hugging Face transformers 建模后端实现 vLLM 原生推理速度

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 宣布 transformers 建模后端在 vLLM 中已能为多种 LLM 架构达到或超过自定义 vLLM 实现的吞吐速度。该后端在 Qwen3-4B、Qwen3-32B 和 Qwen3-235B-A22B-FP8 三种部署配置中均达到或超过原生实现速度,并可通过 `--model-impl transformers` 启用。

推荐理由

文章通过 Qwen3 的 4B、32B 和 235B FP8 MoE 对比,说明该后端如何减少模型接入 vLLM 时的重复优化工作。

来源:Hugging Face Blog · huggingface.co