跳到正文
原文
Hugging Face Blog·· 2025-06-12AI 评分45

vLLM 优化长提示词阻塞问题:并行 Prefill 降低首 Token 延迟

How Long Prompts Block Other Requests - Optimizing LLM Performance

AI 导读

vLLM 通过限制并发长提示词数量实现请求级并行 Prefill,使短请求无需等待长请求处理即可启动。该策略显著降低了 Time-to-First-Token,但受限于 GPU 资源竞争,总完成时间仅小幅改善且解码速度仍受干扰。

来源:Hugging Face Blog · huggingface.co