跳到正文
原文
Hugging Face Blog·· 2025-04-02AI 评分37

TNG 提出 LLM 服务公平调度与动态背压方案

Efficient Request Queueing – Optimizing LLM Performance

AI 导读

TNG Technology Consulting 针对 vLLM 等推理引擎的队列阻塞问题,提出在 API Server 层实施轮询式公平调度。该方案通过动态调整请求发送速率以控制后端队列长度,解决“重度用户”占用资源导致新用户延迟高的问题,并支持基于 KV cache 相似度的路由优化。

来源:Hugging Face Blog · huggingface.co