Hugging Face Blog·· 2024-09-20AI 评分35
使用 Optimum-Intel 和 OpenVINO GenAI 优化部署 Llama 3.1 模型
Optimize and deploy with Optimum-Intel and OpenVINO GenAI
AI 导读
Hugging Face 指导利用 Optimum-Intel 与 OpenVINO GenAI 将 meta-llama/Meta-Llama-3.1-8B 导出为 IR 格式并优化。通过 NNCF 框架支持 INT4/INT8 权重量化,结合 AWQ 等技术降低边缘设备延迟。该方案简化了 C++ 或 Python 环境下的 LLM 推理集成,实现高效低依赖部署。
来源:Hugging Face Blog · huggingface.co