Satlyt 获 800 万美元种子轮融资,开发卫星端 AI 运行软件
Satlyt 完成 800 万美元种子轮融资,致力于构建跨卫星的 AI 运行软件平台。其方案类比 VMware,旨在让多家公司的卫星共享大型计算任务。此前部署 Google DeepMind Gemma 模型使传输数据量减少超 60%,预计本十年末覆盖 20% 卫星。
Satlyt 完成 800 万美元种子轮融资,致力于构建跨卫星的 AI 运行软件平台。其方案类比 VMware,旨在让多家公司的卫星共享大型计算任务。此前部署 Google DeepMind Gemma 模型使传输数据量减少超 60%,预计本十年末覆盖 20% 卫星。
Legato Frames AI 助听眼镜正式发售,起售价 $999,专为轻度至中度听力损失成人设计。该产品利用 AI 技术区分人声与背景噪音,通过双扬声器系统实现定向传声并减少 99% 漏音,支持处方镜片及蓝牙流媒体。
Hugging Face 推出针对视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型。该模型通过推测解码技术,在仅增加 8.9% 参数量的前提下,实现设备端最高 3.13 倍、H100 上 2.66 倍的解码加速。目前已支持 llama.cpp、MLX-VLM 和 SGLang,提供 Safetensors 和 GGUF 格式供开源部署。
oMLX 创建者及维护者 Jun Kim 正式加入 Hugging Face,旨在推动本地 AI 生态发展。此举将使 oMLX 从业余项目转变为完全资助和维护的项目,保持 Apache 2.0 开源协议并由 Jun 继续领导。
Hugging Face 推出 @huggingface/kernels 库及包含 207 个 WebGPU 内核的集合,旨在优化浏览器端推理性能。该库支持从 Hub 直接加载版本化内核,并配套 Fleet 工具收集真实硬件测试数据。
推荐理由:原文给出了WebGPU内核库的发布细节与实测性能数据,读者可据此评估浏览器端推理加速的实际效果。
Liquid AI 发布适用于 LFM2.5 系列模型的 DSpark 草稿检查点,通过推测解码技术在不改变输出质量的前提下显著提升推理速度。该方案在 H100 GPU 上最高实现 3.18x 吞吐提升,在 M4 Max MacBook Pro 端侧最高实现 2.87x 加速,并已将 llama.cpp 和 SGLang 的集成代码开源。
推荐理由:原文提供了DSpark草稿模型在GPU和端侧的具体加速数据及开源集成方案,读者可据此评估其在本地部署中的性能收益。
Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。
推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。
Google 推出新架构,将 Multi-Token Prediction (MTP) 头集成到冻结的 Gemini Nano v3 模型中,已在 Pixel 9/10 系列上线。该方案利用零拷贝架构复用主模型 KV cache,节省 130MB 内存,使文本生成速度提升超 50% 且保持输出完全一致。
Transformers.js 正在实验性地集成 Chrome 团队提出的跨源存储(Cross-Origin Storage, COS)API,旨在解决不同 Web 应用间共享大型 AI 模型和 Wasm 运行时文件时的重复下载与存储隔离问题。
推荐理由:文章详细演示了如何利用跨源存储 API 解决浏览器端 AI 模型重复下载问题,提供了 Transformers.js 的具体集成代码与隐私控制策略。
Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。
推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。
Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。
推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。
Google Research 推出结合密码学与硬件保护的零信任聚合方案,用于设备端 AI 的隐私分析。该方案采用新型单消息提交协议,克服传统多轮交互限制,并集成可信执行环境(TEE)提供严格证明与透明度。此设计确保仅获取匿名化群体洞察,防止个体用户数据泄露。
Hugging Face 发布指南,详解如何在 Manifest V3 约束下使用 Transformers.js 构建 Chrome 扩展。文章以 Gemma 4 E2B 为例,展示了后台服务工作者托管模型、侧边栏处理交互及内容脚本提取页面的核心架构。该方案通过明确的消息契约和状态分离策略,解决了多运行时下的模型复用与内存管理问题。
推荐理由:原文拆解了Manifest V3下模型托管与消息通信的架构细节,为开发者在浏览器扩展中落地本地AI提供了可复用的工程参考。
Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。
推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。
Gemma 4 系列多模态模型正式发布,包含 E2B、E4B、12B Unified、31B 和 26B A4B 五种尺寸,支持图像、文本和音频输入,采用 Apache 2.0 许可证。
推荐理由:原文给出了五种尺寸的多模态架构细节与跨框架部署方案,读者可据此评估其在端侧推理和智能体工作流中的实际可用性。
NXP 提供在 i.MX 95 SoC 上部署 ACT 和 SmolVLA 模型的实践指南,涵盖数据集录制、微调及端侧优化。该方案通过异步推理解决同步控制延迟问题,强调高质量数据一致性以适配嵌入式平台的算力与内存约束。
Google Research 在 EMNLP 2025 发表研究,提出通过分解屏幕摘要与意图提取两阶段流程,使小多模态大语言模型实现设备端用户意图理解。该方法在 Gemini 和 Qwen2 基座模型上验证,其中 Gemini 1.5 Flash 8B 以更低成本和速度达到接近 Gemini 1.5 Pro 的性能表现。
Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。
推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。
Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。
推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。
Google DeepMind 发布 EmbeddingGemma,这是一款拥有 308M 参数、支持 100 多种语言的开源多语言文本嵌入模型。该模型基于 Gemma3 架构并采用双向注意力机制,量化后内存占用低于 200 MB,在 MTEB 排行榜上位居同尺寸纯文本模型前列。
推荐理由:原文展示了308M参数模型在MMTEB上的表现及多框架集成方案,读者可据此评估其在移动端RAG和检索任务中的落地可行性。
Arm 宣布即将发布的 ExecuTorch 0.7 beta 将默认启用 KleidiAI,旨在为基于 Arm CPU 的设备提供自动加速。该版本利用自 2015 年起广泛支持的 SDOT 指令优化 Int4 矩阵乘法,使 Llama 3.2 等大语言模型能在包括 Raspberry Pi 5 和旧款 Android 手机在内的约 30 亿台设备上高效运行。
Arm 推出下一代 AI 超分辨率方案 Neural Super Sampling (NSS),专为移动 GPU 上的神经加速器优化。在演示中,该模型将 540p 画面实时放大至 1080p,耗时仅 4ms,并降低 50% 的 GPU 负载。NSS 已集成至 Unreal Engine,开发者可通过插件及 Vulkan ML 扩展立即开始实验。
Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。
推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。
Arm 推出基于 Stable Audio Open 模型的实时 AI 声音生成应用,利用 Arm CPU 实现纯端侧推理,无需 GPU 或云端。该工具通过 PyTorch 优化多线程执行,能在数秒内根据提示词生成 .wav 文件并直接导入 Ableton Live,兼顾隐私与创作效率。
Hugging Face 推出 Falcon-Edge 系列,这是基于 BitNet 架构的 1.58bit 三元权重语言模型。该系列提供 1B 和 3B 参数版本,包含基础与指令微调模型,并支持 bfloat16、原生 BitNet 及预量化变体以方便微调。Falcon-Edge 在同等规模模型中表现优异,旨在实现边缘设备上的高效部署。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款新模型 Ministral 3B 和 Ministral 8B,旨在优化设备端和边缘计算场景。
推荐理由:官方公布了两款小参数模型的基准表现与定价,为边缘计算场景提供了具体的选型参考。
Hugging Face 利用 Optimum Intel 库对 Microsoft Phi-2 模型进行 4-bit 量化,并在搭载 Core Ultra 7 155H CPU 的 Intel Meteor Lake 笔记本上成功运行。该方案结合硬件加速与小语言模型优势,实现了本地低延迟、高隐私的 LLM 推理体验。