Hugging Face Blog·· 2021-01-18AI 评分26
Hugging Face 如何实现 Transformer 推理加速 100 倍
How we sped up transformer inference 100x for 🤗 API customers
AI 导读
Hugging Face 通过优化 🤗 Transformers 和 Tokenizers 库,为 API 客户实现 Transformer 推理速度提升 100 倍。首先利用 Rust 实现的 Tokenizer 缓存及注意力矩阵维度缩减获得 10x 加速;随后针对特定硬件进行模型编译、层融合及量化处理,再获 10x 性能增益。
来源:Hugging Face Blog · huggingface.co