Hugging Face Blog·· 2022-01-11AI 评分26
使用 Hugging Face Transformers 和 Amazon SageMaker 部署 GPT-J 6B 进行推理
Deploy GPT-J 6B for inference using Hugging Face Transformers and Amazon SageMaker
AI 导读
通过 `torch.save`/`load` 替代默认加载方式,GPT-J 6B 在 Amazon SageMaker 上的模型加载时间从 83 秒降至 7.7 秒,提速约 10.5 倍。该优化使模型能在 SageMaker 的 60 秒请求限制内完成实时推理,解决了大语言模型生产环境部署难题。
来源:Hugging Face Blog · huggingface.co