Hugging Face Blog·· 2022-10-12AI 评分48
Hugging Face 优化 BLOOM 推理:延迟降低 5 倍,吞吐量提升 50 倍
Optimization story: Bloom inference
AI 导读
Hugging Face 通过移植模型至 transformers 并结合 Accelerate 实现流水线并行,将 BLOOM 推理延迟降低 5 倍,吞吐量提升 50 倍。针对 176B 参数、352GB 显存需求的模型,团队利用 device_map="auto" 自动分片以适配多 GPU 环境。该优化过程涉及解决 Tensor 并行导致的数值差异及建立严格的生成测试套件以确保模型稳定性。
来源:Hugging Face Blog · huggingface.co