Hugging Face 发布 LFM2.5-VL-DSpark 实验性草稿模型,推理速度最高提升 3.13 倍
Hugging Face 推出针对视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型。该模型通过推测解码技术,在仅增加 8.9% 参数量的前提下,实现设备端最高 3.13 倍、H100 上 2.66 倍的解码加速。目前已支持 llama.cpp、MLX-VLM 和 SGLang,提供 Safetensors 和 GGUF 格式供开源部署。
Hugging Face 推出针对视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型。该模型通过推测解码技术,在仅增加 8.9% 参数量的前提下,实现设备端最高 3.13 倍、H100 上 2.66 倍的解码加速。目前已支持 llama.cpp、MLX-VLM 和 SGLang,提供 Safetensors 和 GGUF 格式供开源部署。
oMLX 创建者及维护者 Jun Kim 正式加入 Hugging Face,旨在推动本地 AI 生态发展。此举将使 oMLX 从业余项目转变为完全资助和维护的项目,保持 Apache 2.0 开源协议并由 Jun 继续领导。
Hugging Face 推出 @huggingface/kernels 库及包含 207 个 WebGPU 内核的集合,旨在优化浏览器端推理性能。该库支持从 Hub 直接加载版本化内核,并配套 Fleet 工具收集真实硬件测试数据。
推荐理由:原文给出了WebGPU内核库的发布细节与实测性能数据,读者可据此评估浏览器端推理加速的实际效果。
Liquid AI 发布适用于 LFM2.5 系列模型的 DSpark 草稿检查点,通过推测解码技术在不改变输出质量的前提下显著提升推理速度。该方案在 H100 GPU 上最高实现 3.18x 吞吐提升,在 M4 Max MacBook Pro 端侧最高实现 2.87x 加速,并已将 llama.cpp 和 SGLang 的集成代码开源。
推荐理由:原文提供了DSpark草稿模型在GPU和端侧的具体加速数据及开源集成方案,读者可据此评估其在本地部署中的性能收益。
Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。
推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。
Google 推出新架构,将 Multi-Token Prediction (MTP) 头集成到冻结的 Gemini Nano v3 模型中,已在 Pixel 9/10 系列上线。该方案利用零拷贝架构复用主模型 KV cache,节省 130MB 内存,使文本生成速度提升超 50% 且保持输出完全一致。
Transformers.js 正在实验性地集成 Chrome 团队提出的跨源存储(Cross-Origin Storage, COS)API,旨在解决不同 Web 应用间共享大型 AI 模型和 Wasm 运行时文件时的重复下载与存储隔离问题。
推荐理由:文章详细演示了如何利用跨源存储 API 解决浏览器端 AI 模型重复下载问题,提供了 Transformers.js 的具体集成代码与隐私控制策略。
Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。
推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。
Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。
推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。
Google Research 推出结合密码学与硬件保护的零信任聚合方案,用于设备端 AI 的隐私分析。该方案采用新型单消息提交协议,克服传统多轮交互限制,并集成可信执行环境(TEE)提供严格证明与透明度。此设计确保仅获取匿名化群体洞察,防止个体用户数据泄露。
Hugging Face 发布指南,详解如何在 Manifest V3 约束下使用 Transformers.js 构建 Chrome 扩展。文章以 Gemma 4 E2B 为例,展示了后台服务工作者托管模型、侧边栏处理交互及内容脚本提取页面的核心架构。该方案通过明确的消息契约和状态分离策略,解决了多运行时下的模型复用与内存管理问题。
推荐理由:原文拆解了Manifest V3下模型托管与消息通信的架构细节,为开发者在浏览器扩展中落地本地AI提供了可复用的工程参考。
Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。
推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。
Gemma 4 系列多模态模型正式发布,包含 E2B、E4B、12B Unified、31B 和 26B A4B 五种尺寸,支持图像、文本和音频输入,采用 Apache 2.0 许可证。
推荐理由:原文给出了五种尺寸的多模态架构细节与跨框架部署方案,读者可据此评估其在端侧推理和智能体工作流中的实际可用性。
NXP 提供在 i.MX 95 SoC 上部署 ACT 和 SmolVLA 模型的实践指南,涵盖数据集录制、微调及端侧优化。该方案通过异步推理解决同步控制延迟问题,强调高质量数据一致性以适配嵌入式平台的算力与内存约束。
Google Research 在 EMNLP 2025 发表研究,提出通过分解屏幕摘要与意图提取两阶段流程,使小多模态大语言模型实现设备端用户意图理解。该方法在 Gemini 和 Qwen2 基座模型上验证,其中 Gemini 1.5 Flash 8B 以更低成本和速度达到接近 Gemini 1.5 Pro 的性能表现。
Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。
推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。
Hugging Face 推出 Swift 包 AnyLanguageModel,作为 Apple Foundation Models 框架的即插即用替代方案,支持在单一 API 下无缝切换本地(MLX、Core ML、llama.cpp)和云端(OpenAI、Anthropic 等)大模型。
推荐理由:该工具通过统一 API 简化了 Apple 平台本地与云端大模型的集成,降低了开发者尝试开源模型的技术门槛。
Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。
推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。
IBM 发布 Granite 4.0 Nano 系列模型,包含 1B 和 350M 参数的混合架构及传统 Transformer 版本,专为边缘和端侧应用设计。该系列采用 Apache 2.0 许可证开源,支持 vLLM、llama.cpp 和 MLX 等运行时,并基于超过 15T tokens 的数据训练,旨在证明无需数百亿参数也能构建高效实用的模型。
Hugging Face 发布教程,指导用户通过 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地运行 SmolVLM2-256M-Video-Instruct。流程包括将模型转换为 OpenVINO IR、执行 INT8 权重量化或静态量化以降低内存占用并加速推理。该方案无需昂贵 GPU,旨在提升隐私保护与离线可靠性。
Arm 将于10月22-23日出席 PyTorch Conference,重点展示如何利用 PyTorch 和 ExecuTorch 简化 AI 应用构建与部署。现场提供一对一工作坊及开发者对话环节,涵盖从 NVIDIA/x86 迁移至 Arm、边缘运行 LLMs 等实战挑战。参会者可在 P1 展位体验 vLLM、MoE 及神经图形训练等最新优化用例。
Hugging Face 发布教程,演示如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 从 PyTorch 转换为 Core ML 格式以在苹果设备本地运行。
Hugging Face 在 Intel® Core™ Ultra 上通过 OpenVINO.GenAI 实现 Qwen3-8B 推理加速,结合投机解码与深度剪枝技术将速度提升约 1.4×。该方法使用剪枝后的 Qwen3-0.6B 作为草稿模型,配合 🤗 smolagents 框架支持本地 AI Agent 高效运行工具调用与多步推理任务。
Hugging Face 正式发布 swift-transformers v1.0,标志着该 Swift 库在 Apple Silicon 平台本地模型集成上的稳定性成熟。新版本将 Tokenizers 和 Hub 升级为顶级独立模块,引入更快的 Jinja 模板引擎并移除冗余依赖以简化开发体验。官方表示未来将重点深化对 MLX 框架的支持以及 MCP 等智能体应用场景的探索。
Google DeepMind 发布 EmbeddingGemma,这是一款拥有 308M 参数、支持 100 多种语言的开源多语言文本嵌入模型。该模型基于 Gemma3 架构并采用双向注意力机制,量化后内存占用低于 200 MB,在 MTEB 排行榜上位居同尺寸纯文本模型前列。
推荐理由:原文展示了308M参数模型在MMTEB上的表现及多框架集成方案,读者可据此评估其在移动端RAG和检索任务中的落地可行性。
Arm 宣布即将发布的 ExecuTorch 0.7 beta 将默认启用 KleidiAI,旨在为基于 Arm CPU 的设备提供自动加速。该版本利用自 2015 年起广泛支持的 SDOT 指令优化 Int4 矩阵乘法,使 Llama 3.2 等大语言模型能在包括 Raspberry Pi 5 和旧款 Android 手机在内的约 30 亿台设备上高效运行。
Arm 推出下一代 AI 超分辨率方案 Neural Super Sampling (NSS),专为移动 GPU 上的神经加速器优化。在演示中,该模型将 540p 画面实时放大至 1080p,耗时仅 4ms,并降低 50% 的 GPU 负载。NSS 已集成至 Unreal Engine,开发者可通过插件及 Vulkan ML 扩展立即开始实验。
Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。
推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。
Arm 推出基于 Stable Audio Open 模型的实时 AI 声音生成应用,利用 Arm CPU 实现纯端侧推理,无需 GPU 或云端。该工具通过 PyTorch 优化多线程执行,能在数秒内根据提示词生成 .wav 文件并直接导入 Ableton Live,兼顾隐私与创作效率。
Hugging Face 推出 Falcon-Edge 系列,这是基于 BitNet 架构的 1.58bit 三元权重语言模型。该系列提供 1B 和 3B 参数版本,包含基础与指令微调模型,并支持 bfloat16、原生 BitNet 及预量化变体以方便微调。Falcon-Edge 在同等规模模型中表现优异,旨在实现边缘设备上的高效部署。
Open R1 项目中的 OlympicCoder 7B 模型在 LiveCodeBench 评测中表现优于 Claude 3.7 Sonnet 和 GPT-4o。
Hugging Face 推出基于 React Native 的移动端 LLM 推理教程,支持在 Android 和 iOS 设备上本地运行模型。该方案利用 llama.rn 加载 GGUF 文件,推荐 DeepSeek-R1-Distill-Qwen-1.5B 等小参数模型以平衡性能与隐私。
Hugging Face 发布 SmolVLM2 系列模型,包含 2.2B、500M 和 256M 三种参数规模,旨在让视频理解能力在所有设备上运行。SmolVLM2 2.2B 在 Video-MME 基准测试中表现优于现有 2B 级模型,而 500M 和 256M 版本则提供了极小的内存占用。
推荐理由:原文给出了三种参数规模的视频理解模型及端侧部署方案,读者可以据此评估小模型在本地设备上的实际可用性。
Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。
推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款新模型 Ministral 3B 和 Ministral 8B,旨在优化设备端和边缘计算场景。
推荐理由:官方公布了两款小参数模型的基准表现与定价,为边缘计算场景提供了具体的选型参考。
Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。
推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。
Hugging Face 指导利用 Optimum-Intel 与 OpenVINO GenAI 将 meta-llama/Meta-Llama-3.1-8B 导出为 IR 格式并优化。通过 NNCF 框架支持 INT4/INT8 权重量化,结合 AWQ 等技术降低边缘设备延迟。该方案简化了 C++ 或 Python 环境下的 LLM 推理集成,实现高效低依赖部署。
ggml 是一个专注于 Transformer 推理的开源 C/C++ 机器学习库,被 llama.cpp、Ollama 等项目用于实现端侧 LLM。其核心优势在于极简主义(少于 5 个文件)、轻量级(二进制小于 1MB)及支持 x86_64、ARM、Apple Silicon 等多硬件后端。开发者需理解 ggml_context、ggml_cgraph 等底层概念以进行高效计算图调度与内存管理。
Google 在 Hugging Face 博客宣布扩展 Gemma 模型家族,新增 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器套件。
推荐理由:原文详细展示了 Gemma 2 2B 在端侧部署与辅助生成中的具体用法,以及 ShieldGemma 和 Gemma Scope 的开源特性,为开发者提供了可落地的技术参考。
Hugging Face 发布教程,指导开发者利用 WWDC 24 引入的 Core ML 新特性在 Mac 上运行 Mistral 7B 模型。通过 Swift Tensor、Stateful Buffers 和块量化技术,该方案能将 70 亿参数模型的内存占用降至 4GB 以下。
推荐理由:原文详细演示了利用WWDC 24新特性将Mistral 7B转换为Core ML模型并实现端侧高效推理的完整流程。