跳到正文
原文
Hugging Face Blog·· 2026-07-08AI 评分55

vLLM 的 transformers 建模后端达到原生实现速度

Native-speed vLLM transformers modeling backend

AI 导读

HuggingFace 更新了 vLLM 的 transformers 建模后端,在测试的 3 款 Qwen3 模型上,吞吐量均达到或超过 vLLM 手写原生实现。

来源:Hugging Face Blog · huggingface.co