跳到正文

#端侧

今日 0 条
9月24日周四
9月22日周二
9月1日周二
  1. Hugging Face Blog65

    Hugging Face 发布 @huggingface/kernels:包含 207 个 WebGPU 内核以加速本地 AI

    Hugging Face 推出 @huggingface/kernels 库及包含 207 个 WebGPU 内核的集合,旨在优化浏览器端推理性能。该库支持从 Hub 直接加载版本化内核,并配套 Fleet 工具收集真实硬件测试数据。

    推荐理由:原文给出了WebGPU内核库的发布细节与实测性能数据,读者可据此评估浏览器端推理加速的实际效果。

8月21日周五
  1. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,实现最高 3.2x 推理加速

    Liquid AI 发布适用于 LFM2.5 系列模型的 DSpark 草稿检查点,通过推测解码技术在不改变输出质量的前提下显著提升推理速度。该方案在 H100 GPU 上最高实现 3.18x 吞吐提升,在 M4 Max MacBook Pro 端侧最高实现 2.87x 加速,并已将 llama.cpp 和 SGLang 的集成代码开源。

    推荐理由:原文提供了DSpark草稿模型在GPU和端侧的具体加速数据及开源集成方案,读者可据此评估其在本地部署中的性能收益。

8月10日周一
  1. Hugging Face Blog92

    Meta 发布 Muse Glimmer:面向本地智能体的开源多模态模型

    Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。

    推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。

6月27日周六
6月23日周二
  1. Hugging Face Blog62

    在 Transformers.js 中实验跨源存储 API 以优化浏览器端缓存

    Transformers.js 正在实验性地集成 Chrome 团队提出的跨源存储(Cross-Origin Storage, COS)API,旨在解决不同 Web 应用间共享大型 AI 模型和 Wasm 运行时文件时的重复下载与存储隔离问题。

    推荐理由:文章详细演示了如何利用跨源存储 API 解决浏览器端 AI 模型重复下载问题,提供了 Transformers.js 的具体集成代码与隐私控制策略。

6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。

    推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。

6月2日周二
  1. Hugging Face Blog75

    Holo3.1 系列模型发布:支持快速本地推理的计算机使用智能体

    Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。

    推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。

5月28日周四
4月23日周四
  1. Hugging Face Blog68

    Hugging Face 详解 Transformers.js 在 Chrome 扩展中的架构与实践

    Hugging Face 发布指南,详解如何在 Manifest V3 约束下使用 Transformers.js 构建 Chrome 扩展。文章以 Gemma 4 E2B 为例,展示了后台服务工作者托管模型、侧边栏处理交互及内容脚本提取页面的核心架构。该方案通过明确的消息契约和状态分离策略,解决了多运行时下的模型复用与内存管理问题。

    推荐理由:原文拆解了Manifest V3下模型托管与消息通信的架构细节,为开发者在浏览器扩展中落地本地AI提供了可复用的工程参考。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4:号称每字节性能最强的开源模型家族

    Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。

    推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。

4月2日周四
  1. Hugging Face Blog96

    Gemma 4 系列多模态模型发布

    Gemma 4 系列多模态模型正式发布,包含 E2B、E4B、12B Unified、31B 和 26B A4B 五种尺寸,支持图像、文本和音频输入,采用 Apache 2.0 许可证。

    推荐理由:原文给出了五种尺寸的多模态架构细节与跨框架部署方案,读者可据此评估其在端侧推理和智能体工作流中的实际可用性。

3月5日周四
1月23日周五
12月3日周三
  1. Mistral AI87

    Mistral AI 发布 Mistral 3 系列开源模型

    Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。

    推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。

11月20日周四
  1. Hugging Face Blog65

    Hugging Face 发布 AnyLanguageModel:为 Apple 平台提供本地与远程 LLM 的统一 API

    Hugging Face 推出 Swift 包 AnyLanguageModel,作为 Apple Foundation Models 框架的即插即用替代方案,支持在单一 API 下无缝切换本地(MLX、Core ML、llama.cpp)和云端(OpenAI、Anthropic 等)大模型。

    推荐理由:该工具通过统一 API 简化了 Apple 平台本地与云端大模型的集成,降低了开发者尝试开源模型的技术门槛。

10月30日周四
  1. Google Research68

    Google Research 提出可证明隐私洞察系统以分析生成式 AI 使用

    Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。

    推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。

10月28日周二
  1. Hugging Face Blog52

    IBM 发布 Granite 4.0 Nano 系列小参数模型

    IBM 发布 Granite 4.0 Nano 系列模型,包含 1B 和 350M 参数的混合架构及传统 Transformer 版本,专为边缘和端侧应用设计。该系列采用 Apache 2.0 许可证开源,支持 vLLM、llama.cpp 和 MLX 等运行时,并基于超过 15T tokens 的数据训练,旨在证明无需数百亿参数也能构建高效实用的模型。

10月15日周三
10月11日周六
10月2日周四
9月29日周一
9月26日周五
  1. Hugging Face Blog58

    Hugging Face 发布 swift-transformers v1.0,聚焦端侧 LLM 与智能体支持

    Hugging Face 正式发布 swift-transformers v1.0,标志着该 Swift 库在 Apple Silicon 平台本地模型集成上的稳定性成熟。新版本将 Tokenizers 和 Hub 升级为顶级独立模块,引入更快的 Jinja 模板引擎并移除冗余依赖以简化开发体验。官方表示未来将重点深化对 MLX 框架的支持以及 MCP 等智能体应用场景的探索。

9月4日周四
  1. Hugging Face Blog80

    Google 发布 EmbeddingGemma:面向端侧的高效多语言嵌入模型

    Google DeepMind 发布 EmbeddingGemma,这是一款拥有 308M 参数、支持 100 多种语言的开源多语言文本嵌入模型。该模型基于 Gemma3 架构并采用双向注意力机制,量化后内存占用低于 200 MB,在 MTEB 排行榜上位居同尺寸纯文本模型前列。

    推荐理由:原文展示了308M参数模型在MMTEB上的表现及多框架集成方案,读者可据此评估其在移动端RAG和检索任务中的落地可行性。

8月13日周三
8月12日周二
6月26日周四
  1. Hugging Face Blog84

    Gemma 3n正式登陆开源生态,支持transformers、MLX等主流框架

    Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。

    推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。

6月3日周二
5月15日周四
  1. Hugging Face Blog48

    Hugging Face 发布 Falcon-Edge:基于 BitNet 架构的 1.58bit 可微调语言模型系列

    Hugging Face 推出 Falcon-Edge 系列,这是基于 BitNet 架构的 1.58bit 三元权重语言模型。该系列提供 1B 和 3B 参数版本,包含基础与指令微调模型,并支持 bfloat16、原生 BitNet 及预量化变体以方便微调。Falcon-Edge 在同等规模模型中表现优异,旨在实现边缘设备上的高效部署。

3月20日周四
3月7日周五
2月20日周四
  1. Hugging Face Blog78

    Hugging Face 发布 SmolVLM2 系列模型,支持全设备视频理解

    Hugging Face 发布 SmolVLM2 系列模型,包含 2.2B、500M 和 256M 三种参数规模,旨在让视频理解能力在所有设备上运行。SmolVLM2 2.2B 在 Video-MME 基准测试中表现优于现有 2B 级模型,而 500M 和 256M 版本则提供了极小的内存占用。

    推荐理由:原文给出了三种参数规模的视频理解模型及端侧部署方案,读者可以据此评估小模型在本地设备上的实际可用性。

1月23日周四
  1. Hugging Face Blog65

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 超小型视觉语言模型

    Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。

    推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。

10月16日周三
9月25日周三
  1. Hugging Face Blog92

    Hugging Face 联合 Meta 发布 Llama 3.2 多模态与小型模型

    Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。

    推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。

9月20日周五
8月13日周二
  1. Hugging Face Blog45

    ggml 入门指南:轻量级 Transformer 推理库核心概念与编译

    ggml 是一个专注于 Transformer 推理的开源 C/C++ 机器学习库,被 llama.cpp、Ollama 等项目用于实现端侧 LLM。其核心优势在于极简主义(少于 5 个文件)、轻量级(二进制小于 1MB)及支持 x86_64、ARM、Apple Silicon 等多硬件后端。开发者需理解 ggml_context、ggml_cgraph 等底层概念以进行高效计算图调度与内存管理。

7月31日周三
7月22日周一
  1. Hugging Face Blog68

    Hugging Face 详解 WWDC 24 Core ML 新特性运行 Mistral 7B

    Hugging Face 发布教程,指导开发者利用 WWDC 24 引入的 Core ML 新特性在 Mac 上运行 Mistral 7B 模型。通过 Swift Tensor、Stateful Buffers 和块量化技术,该方案能将 70 亿参数模型的内存占用降至 4GB 以下。

    推荐理由:原文详细演示了利用WWDC 24新特性将Mistral 7B转换为Core ML模型并实现端侧高效推理的完整流程。