Hugging Face Blog·· 2023-05-16AI 评分38
Intel 推出 Q8-Chat:基于 SmoothQuant 在 Xeon CPU 高效运行 LLM
Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon
AI 导读
Intel 利用 SmoothQuant-O3 技术将 OPT、LLaMA 等模型量化至 INT8,使模型体积缩小约 2x 且精度损失极小。该方案支持在单颗 Intel Sapphire Rapids CPU 上实现 MPT-7B-chat 的实时文本生成,显著降低推理延迟与硬件成本。
来源:Hugging Face Blog · huggingface.co