跳到正文
原文
Hugging Face Blog·· 2022-01-11AI 评分26

使用 Hugging Face Transformers 和 Amazon SageMaker 部署 GPT-J 6B 进行推理

Deploy GPT-J 6B for inference using Hugging Face Transformers and Amazon SageMaker

AI 导读

通过 `torch.save`/`load` 替代默认加载方式,GPT-J 6B 在 Amazon SageMaker 上的模型加载时间从 83 秒降至 7.7 秒,提速约 10.5 倍。该优化使模型能在 SageMaker 的 60 秒请求限制内完成实时推理,解决了大语言模型生产环境部署难题。

来源:Hugging Face Blog · huggingface.co