跳到正文
原文
Hugging Face Blog·· 2024-09-20AI 评分35

使用 Optimum-Intel 和 OpenVINO GenAI 优化部署 Llama 3.1 模型

Optimize and deploy with Optimum-Intel and OpenVINO GenAI

AI 导读

Hugging Face 指导利用 Optimum-Intel 与 OpenVINO GenAI 将 meta-llama/Meta-Llama-3.1-8B 导出为 IR 格式并优化。通过 NNCF 框架支持 INT4/INT8 权重量化,结合 AWQ 等技术降低边缘设备延迟。该方案简化了 C++ 或 Python 环境下的 LLM 推理集成,实现高效低依赖部署。

来源:Hugging Face Blog · huggingface.co