跳到正文
原文
Hugging Face Blog·· 2025-01-16AI 评分45

Hugging Face 为 Text Generation Inference (TGI) 引入多后端支持

Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference

AI 导读

Hugging Face 推出 TGI Backends 架构,允许通过统一前端集成 vLLM、TensorRT-LLM 等推理引擎。该方案利用 Rust 重构 HTTP 与调度层以规避 Python GIL 限制,提升并发性能。计划于 2025 年第一季度集成 vLLM,并持续扩展对 NVIDIA、AWS 及 Google TPU 等硬件的支持。

来源:Hugging Face Blog · huggingface.co