ggml 入门指南:轻量级 Transformer 推理库核心概念与编译
ggml 是一个专注于 Transformer 推理的开源 C/C++ 机器学习库,被 llama.cpp、Ollama 等项目用于实现端侧 LLM。其核心优势在于极简主义(少于 5 个文件)、轻量级(二进制小于 1MB)及支持 x86_64、ARM、Apple Silicon 等多硬件后端。开发者需理解 ggml_context、ggml_cgraph 等底层概念以进行高效计算图调度与内存管理。
ggml 是一个专注于 Transformer 推理的开源 C/C++ 机器学习库,被 llama.cpp、Ollama 等项目用于实现端侧 LLM。其核心优势在于极简主义(少于 5 个文件)、轻量级(二进制小于 1MB)及支持 x86_64、ARM、Apple Silicon 等多硬件后端。开发者需理解 ggml_context、ggml_cgraph 等底层概念以进行高效计算图调度与内存管理。
Google 在 Hugging Face 博客宣布扩展 Gemma 模型家族,新增 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器套件。
推荐理由:原文详细展示了 Gemma 2 2B 在端侧部署与辅助生成中的具体用法,以及 ShieldGemma 和 Gemma Scope 的开源特性,为开发者提供了可落地的技术参考。
Hugging Face 发布教程,指导开发者利用 WWDC 24 引入的 Core ML 新特性在 Mac 上运行 Mistral 7B 模型。通过 Swift Tensor、Stateful Buffers 和块量化技术,该方案能将 70 亿参数模型的内存占用降至 4GB 以下。
推荐理由:原文详细演示了利用WWDC 24新特性将Mistral 7B转换为Core ML模型并实现端侧高效推理的完整流程。
Hugging Face 推出 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源了用于训练的 SmolLM-Corpus 数据集。
推荐理由:官方开源了SmolLM系列小模型及其高质量训练语料,展示了在端侧设备上的优异性能与数据构建细节。
Hugging Face 利用 Optimum Intel 库对 Microsoft Phi-2 模型进行 4-bit 量化,并在搭载 Core Ultra 7 155H CPU 的 Intel Meteor Lake 笔记本上成功运行。该方案结合硬件加速与小语言模型优势,实现了本地低延迟、高隐私的 LLM 推理体验。
Hugging Face 发布 swift-transformers、swift-chat 及更新的模型导出工具,旨在帮助开发者在 Mac 和 iPhone 等苹果设备上通过 Core ML 运行 Llama 2 等大语言模型。
推荐理由:原文提供了在苹果设备上运行大语言模型的完整工具链和转换指南,开发者可据此评估本地化部署的可行性。
Hugging Face 联合 Apple 发布 Stable Diffusion XL 的 Core ML 版本,并介绍混合位量化技术以优化 Mac 端运行效率。该技术在保持高画质的同时将模型体积压缩至 1.4 GB(减少 71%),支持在 macOS 14 beta 上通过 CPU+GPU 运行。官方已开源转换脚本、推理 Demo 及预计算量化配方,开发者可直接复用或应用于其他微调模型。
推荐理由:文章详解了混合位量化技术原理及在 Stable Diffusion XL 上的应用,提供了从模型转换到性能测试的完整开源工具链。
Hugging Face 联合 Apple 推出基于 Core ML 的 Stable Diffusion 加速方案,利用 6-bit palettization 技术显著降低模型体积并提升 iPhone、iPad 和 Mac 上的推理速度。
推荐理由:官方展示了 Core ML 6-bit 量化在 iPhone 上的实测提速与内存节省,并提供了可直接下载的优化模型及自定义转换指南。
Hugging Face 推出 🧨Diffusers for Mac v1.1,该开源应用利用 Core ML 优化 Stable Diffusion 模型在 Apple Silicon 上的运行。新版本通过自动选择 GPU 或神经引擎(ANE)作为最佳加速器,使文本生成图像速度最高提升 2 倍。用户可在 Mac App Store 下载体验本地化、隐私保护且无需命令行操作的 AI 绘图功能。