跳到正文

#端侧

今日 0 条
8月13日周二
  1. Hugging Face Blog45

    ggml 入门指南:轻量级 Transformer 推理库核心概念与编译

    ggml 是一个专注于 Transformer 推理的开源 C/C++ 机器学习库,被 llama.cpp、Ollama 等项目用于实现端侧 LLM。其核心优势在于极简主义(少于 5 个文件)、轻量级(二进制小于 1MB)及支持 x86_64、ARM、Apple Silicon 等多硬件后端。开发者需理解 ggml_context、ggml_cgraph 等底层概念以进行高效计算图调度与内存管理。

7月31日周三
7月22日周一
  1. Hugging Face Blog68

    Hugging Face 详解 WWDC 24 Core ML 新特性运行 Mistral 7B

    Hugging Face 发布教程,指导开发者利用 WWDC 24 引入的 Core ML 新特性在 Mac 上运行 Mistral 7B 模型。通过 Swift Tensor、Stateful Buffers 和块量化技术,该方案能将 70 亿参数模型的内存占用降至 4GB 以下。

    推荐理由:原文详细演示了利用WWDC 24新特性将Mistral 7B转换为Core ML模型并实现端侧高效推理的完整流程。

7月16日周二
3月20日周三
8月8日周二
  1. Hugging Face Blog73

    Hugging Face 发布 Swift Transformers 等工具以支持在苹果设备运行 LLM

    Hugging Face 发布 swift-transformers、swift-chat 及更新的模型导出工具,旨在帮助开发者在 Mac 和 iPhone 等苹果设备上通过 Core ML 运行 Llama 2 等大语言模型。

    推荐理由:原文提供了在苹果设备上运行大语言模型的完整工具链和转换指南,开发者可据此评估本地化部署的可行性。

7月27日周四
  1. Hugging Face Blog65

    Hugging Face 发布 Stable Diffusion XL 在 Mac 上的 Core ML 部署与高级量化指南

    Hugging Face 联合 Apple 发布 Stable Diffusion XL 的 Core ML 版本,并介绍混合位量化技术以优化 Mac 端运行效率。该技术在保持高画质的同时将模型体积压缩至 1.4 GB(减少 71%),支持在 macOS 14 beta 上通过 CPU+GPU 运行。官方已开源转换脚本、推理 Demo 及预计算量化配方,开发者可直接复用或应用于其他微调模型。

    推荐理由:文章详解了混合位量化技术原理及在 Stable Diffusion XL 上的应用,提供了从模型转换到性能测试的完整开源工具链。

6月15日周四
  1. Hugging Face Blog68

    Hugging Face 发布基于 Core ML 的 Stable Diffusion 加速方案

    Hugging Face 联合 Apple 推出基于 Core ML 的 Stable Diffusion 加速方案,利用 6-bit palettization 技术显著降低模型体积并提升 iPhone、iPad 和 Mac 上的推理速度。

    推荐理由:官方展示了 Core ML 6-bit 量化在 iPhone 上的实测提速与内存节省,并提供了可直接下载的优化模型及自定义转换指南。

2月24日周五
  1. Hugging Face Blog45

    Hugging Face 发布 🧨Diffusers for Mac v1.1:基于 Core ML 的 Stable Diffusion 原生应用

    Hugging Face 推出 🧨Diffusers for Mac v1.1,该开源应用利用 Core ML 优化 Stable Diffusion 模型在 Apple Silicon 上的运行。新版本通过自动选择 GPU 或神经引擎(ANE)作为最佳加速器,使文本生成图像速度最高提升 2 倍。用户可在 Mac App Store 下载体验本地化、隐私保护且无需命令行操作的 AI 绘图功能。