跳到正文
原文
Hugging Face Blog·· 2025-04-16AI 评分40

Hugging Face 解析 LLM 并发请求中的 Prefill 与 Decode 阶段性能优化

Prefill and Decode for Concurrent Requests - Optimizing LLM Performance

AI 导读

Hugging Face 详解大语言模型推理中 Prefill(并行处理输入)与 Decode(串行生成输出)两阶段的差异及其对延迟和吞吐量的影响。文章指出 Prefill 阶段计算密集,而 Decode 阶段受限于 GPU 内存带宽,需通过批处理提升利用率。针对 TNG 在 24 张 H100 GPU 上的部署案例,分析了如何平衡交互应用所需的低延迟与非交互式场景的高吞吐量需求。

来源:Hugging Face Blog · huggingface.co