WRITER 发布 Palmyra-mini 系列开源模型
WRITER 推出 Palmyra-mini 系列三款开源轻量模型,参数规模在 1.5B 至 1.7B 之间。其中 palmyra-mini-thinking-a 在 GSM8K 基准测试中达到 82.87% 准确率,palmyra-mini-thinking-b 在 AMC23 上得分 92.5%。
WRITER 推出 Palmyra-mini 系列三款开源轻量模型,参数规模在 1.5B 至 1.7B 之间。其中 palmyra-mini-thinking-a 在 GSM8K 基准测试中达到 82.87% 准确率,palmyra-mini-thinking-b 在 AMC23 上得分 92.5%。
Together AI 宣布新功能,允许用户直接通过其基础设施对 Hugging Face Hub 上的任意兼容 LLM 进行微调。开发者只需指定基础模板和自定义模型参数,即可在几分钟内启动训练任务,并将微调后的模型自动上传回 Hub 或用于推理部署。该集成旨在降低传统微调的复杂度和成本,加速团队基于开源社区模型进行领域适配和迭代优化的速度。
推荐理由:Together AI 与 Hugging Face Hub 打通微调流程,开发者可直接调用平台基础设施定制任意兼容模型并回传社区。
Hugging Face 推出 Jupyter Agent 项目,旨在通过构建高质量训练数据和优化代理脚手架,提升小型语言模型在数据科学任务中的表现。团队利用 Kaggle Notebook 数据集经过多阶段清洗和合成生成约 51k 条轨迹,对 Qwen3-4B 进行全参数微调,使其在 DABStep 基准测试的简单任务上准确率提升至 75%。
推荐理由:原文公开了从数据清洗到微调的完整流水线及代码,展示了小模型在特定脚手架下性能提升的具体路径。
NVIDIA AI-Q 在 DeepResearch Bench“LLM with Search”类别中以 40.52 分登顶,成为首个完全开源且领先的深度研究智能体。
Hugging Face 推出开源 Python 库 Trackio,旨在提供轻量级的机器学习实验追踪功能。该工具支持本地仪表盘并可与 Hugging Face Spaces 集成以实现便捷分享,其 API 设计为 wandb 的直接替代方案,允许用户通过简单的导入替换即可开始使用。
推荐理由:Trackio 作为 wandb 的轻量级开源替代品,提供了本地优先的实验追踪与 Spaces 无缝分享能力,适合需要快速可视化训练指标且希望数据自主可控的研究者。
Hugging Face 官方将 CLI 从 huggingface-cli 重命名为 hf,采用按资源分组的清晰命令结构。用户需升级 huggingface_hub 至 0.34.0 版本以使用新语法,旧版 CLI 仍保留但已弃用。同时推出 hf jobs 命令,支持在 Hugging Face 基础设施上按需付费运行脚本或 Docker 镜像。
Gradio v5.38.0 发布,针对 MCP 服务器推出五项核心更新。新增“File Upload”MCP 服务器以支持本地文件无缝上传,并实现实时进度通知流式传输。此外,通过 `gr.load_openapi` 一行代码即可将 OpenAPI 规范转换为 MCP 服务,同时优化了基于 `gr.Header` 的身份验证及工具描述自定义功能。
Mistral AI 发布开源语音理解模型 Voxtral,包含适用于生产环境的 24B 版本和适用于本地/边缘部署的 3B 版本(Voxtral Mini),均采用 Apache 2.0 许可证。
推荐理由:原文给出了两种参数规模的开源语音理解模型及其在转录和语义理解上的基准表现,读者可以据此评估其在本地部署或生产环境中的成本与能力平衡。
Hugging Face Hub 已将超过 50 万个仓库和 20 PB 数据从 Git LFS 迁移至新的 Xet 存储后端,目前超 100 万用户正在使用 Xet。该迁移通过 Git LFS Bridge 和后台内容迁移机制实现零中断兼容,支持新旧客户端无缝访问。自本月起,Xet 将向所有用户开放,新创建仓库默认启用 Xet,现有仓库将自动迁移,同时计划开源 Xet 协议及基础设施栈。
推荐理由:原文详述了从 Git LFS 到 Xet 的无感迁移架构与性能数据,为理解大规模 AI 存储系统的平滑演进提供了工程参考。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 和升级版 Devstral Small 1.1,旨在提升智能体编程能力。
推荐理由:Mistral 联合 All Hands AI 推出 Devstral Medium 及 Small 1.1,前者在 SWE-Bench Verified 得分超越 Gemini 2.5 Pro 且价格更低,后者以 Apache 2.0 开源并刷新开放模型代码智能体纪录。
Pollen Robotics 联合 Hugging Face 推出开源机器人 Reachy Mini,Lite 版售价 $399,Compute 版 $499。该设备高 28cm、重 1.5kg,支持 Python 编程及仿真测试,内置摄像头与麦克风以实现多模态交互。用户可通过 Hugging Face Hub 共享机器人行为,并调用最新开源模型进行 AI 实验。
Hugging Face 推出完全开源的 3B 参数模型 SmolLM3,包含 Base 和 Instruct/Reasoning 版本,支持英语、法语等 6 种语言及最高 128k 上下文窗口。
推荐理由:Hugging Face 发布了 SmolLM3 及其完整训练配方,展示了在 3B 规模下通过公开数据实现长上下文和双模式推理的工程路径。
Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。
推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。
SGLang 新增对 Hugging Face transformers 库的后端支持,允许用户通过设置 `impl="transformers"` 或自动回退机制运行任意兼容模型。
Hugging Face 发布教程,指导开发者使用遥操作数据对 NVIDIA Isaac GR00T N1.5 进行后训练(微调),使其适配开源 LeRobot SO-101 机械臂。该流程利用 EmbodimentTag 系统实现跨形态定制,默认微调需约 25G VRAM,支持通过 `--no-tune_diffusion_model` 参数降低显存需求。
Mistral AI 发布其首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数)和企业版 Magistral Medium。
推荐理由:原文给出了双版本参数规模、AIME2024 具体得分及多语言原生推理特性,读者可据此评估其在专业领域与合规场景下的实际能力边界。
Arm 推出基于 Stable Audio Open 模型的实时 AI 声音生成应用,利用 Arm CPU 实现纯端侧推理,无需 GPU 或云端。该工具通过 PyTorch 优化多线程执行,能在数秒内根据提示词生成 .wav 文件并直接导入 Ableton Live,兼顾隐私与创作效率。
Hugging Face 推出 SmolVLA-450M,这是一款紧凑的开源视觉语言动作(VLA)模型,专为机器人设计且可在消费级硬件上运行。该模型仅使用 LeRobot 社区共享的数据集进行预训练,在 LIBERO、Meta-World 模拟环境及 SO100/SO101 真实任务中表现优于 ACT 等更强基线。
推荐理由:原文展示了仅用社区数据训练的紧凑视觉语言动作模型,在消费级硬件上实现高效推理并超越更大基线,为机器人研究提供了可复现的低门槛方案。
Mistral AI 联合 All Hands AI 推出 Devstral,这是一款专为解决真实 GitHub 问题设计的智能体大模型。Devstral 在 SWE-Bench Verified 基准测试中取得 46.8% 的成绩,比此前开源最佳模型高出 6% 以上,并超越了 Deepseek-V3-0324 和 Qwen3 232B-A22B 等更大参数量的模型。
推荐理由:该模型在SWE-Bench Verified上大幅超越现有开源基准,且支持单卡本地部署,为隐私敏感场景提供了高性价比的编码智能体方案。
TII 推出 Falcon-H1 系列共六款开源模型(0.5B 至 34B),采用 Transformer 注意力机制与 State Space Model (SSM) 结合的混合架构。
推荐理由:TII 发布 Falcon-H1 系列混合架构开源模型,通过 Attention 与 SSM 结合实现长上下文高效推理,小参数量下性能对标大模型。
Hugging Face 推出基于 Falcon 3 架构的 7B 参数多语言模型 Falcon-Arabic,支持阿拉伯语、英语等语言及 32,000 tokens 上下文窗口。该模型在 OALL v2 基准测试中显著超越同尺寸及 4 倍规模的现有阿拉伯语 LLM,通过扩展 32,000 个阿拉伯语专用 token 和优化嵌入策略实现高性能。
微软在 Build 大会上宣布与 Hugging Face 扩大合作,在 Azure AI Foundry 中提供超过 10,000 个 Hugging Face 模型的快速部署能力。
Hugging Face 推出 Falcon-Edge 系列,这是基于 BitNet 架构的 1.58bit 三元权重语言模型。该系列提供 1B 和 3B 参数版本,包含基础与指令微调模型,并支持 bfloat16、原生 BitNet 及预量化变体以方便微调。Falcon-Edge 在同等规模模型中表现优异,旨在实现边缘设备上的高效部署。
Hugging Face 宣布将 Transformers 库打造为机器学习生态系统的核心枢纽,旨在统一模型定义标准。目前该库支持超过 300 种模型架构,并已与 vLLM、SGLang、llama.cpp 等主流推理引擎及 Axolotl、Unsloth 等训练框架深度集成,实现“一次贡献,全生态可用”。未来团队将进一步简化建模代码 API,降低新模型接入门槛,推动从训练到部署的全链路互操作性。
推荐理由:Hugging Face 将 Transformers 定位为跨框架的模型定义标准,通过简化贡献流程实现与主流推理引擎及训练框架的深度互操作。
Kaggle 上线与 Hugging Face 的集成,支持在 Notebook 中直接加载 HF 模型并自动生成对应页面。用户可通过“Use this model”按钮无缝跳转,私有或受限模型需正常认证。双方正开发离线竞赛支持方案以保障数据完整性。
LeRobot 正通过简化录制与上传流程,推动 Hugging Face Hub 上社区贡献数据集快速增长,旨在构建机器人领域的“ImageNet”。目前 So100 和 Koch 机械臂数据占主导,涵盖抽屉操作、下棋等多样化任务。该举措致力于解决 VLA 模型泛化能力受限于数据多样性的问题,降低硬件门槛以实现更广泛的数据共享。
Cohere 成为首个在 Hugging Face Hub 直接分享并服务模型的提供商,支持通过 Inference Providers 运行 serverless 推理。
Hugging Face 宣布收购拥有 9 年开源机器人研发经验的 Pollen Robotics,这是其第五次收购。双方将共同推进开源机器人战略,目前提供的首款产品是面向研究和教育的开源人形机器人 Reachy 2,支持 VR 遥操作,售价为 70,000 美元。
推荐理由:原文披露了收购细节及首款开源人形机器人 Reachy 2 的定价与能力,为观察 AI 巨头布局实体硬件提供了具体样本。
Hugging Face 正式上架 Meta 发布的 Llama 4 Maverick (~400B) 和 Llama 4 Scout (~109B) 模型权重。
推荐理由:原文详细披露了 Llama 4 Maverick 和 Scout 的 MoE 架构、超长上下文支持及在 Hugging Face 上的集成方式,为开发者提供了从权重下载到推理部署的具体技术路径。
Gradio 月活跃开发者已超 100 万,成为构建 AI Web 应用的主流工具。Hugging Face 团队指出,其成功源于坚持底层原语设计、聚焦机器学习垂直领域以及快速迭代策略。该库通过 Blocks API 支持复杂工作流,并借助 Hugging Face Spaces 实现病毒式传播。
Hugging Face 将其经典的 NLP 课程正式更名为 LLM 课程,以涵盖微调大语言模型及构建 DeepSeek R1 等推理模型的新章节。原有经典 NLP 内容将被保留并现代化更新,同时新增与 LlamaIndex、LangChain 等第三方工具协作的开源教程,旨在让前沿 AI 研究更易于获取。
Open R1 项目中的 OlympicCoder 7B 模型在 LiveCodeBench 评测中表现优于 Claude 3.7 Sonnet 和 GPT-4o。
Hugging Face 向白宫科技政策办公室提交关于 AI 行动计划的回复,主张开源系统是实现高性能、广泛采用及安全保障的基础。文中引用 OlympicCoder(7B 参数)超越 Claude 3.7 及 OLMo 2 匹配 o1-mini 的案例,证明开源模型具备竞争力。
Mistral AI 发布 Mistral Small 3.1,这是一款 Apache 2.0 许可的开源模型,支持 128k tokens 上下文窗口和多模态理解。该模型推理速度达 150 tokens/s,可在单张 RTX 4090 或 32GB RAM Mac 上运行,目前已上线 Hugging Face 和 La Plateforme API。
推荐理由:官方公布小参数模型在文本、多模态及长上下文维度的性能数据与硬件适配细节,为端侧部署提供具体参考。
Google 发布新一代开源多模态大模型 Gemma 3,包含 1B、4B、12B 和 27B 四种参数规模。除 1B 版本仅支持文本外,其余版本均支持图像输入,上下文窗口最高达 128k tokens,并支持 140 多种语言。
推荐理由:原文详细列出了Gemma 3各尺寸参数、上下文长度及多语言支持,并提供了在Hugging Face生态中的具体部署与推理代码示例。
Cohere For AI 推出 Aya Vision 8B 和 32B 两款开源权重视觉语言模型(VLM),旨在解决多模态模型的多语言性能挑战。该系列基于 SigLIP2 视觉编码器和 Aya Expanse 语言模型,采用动态图像分块、Pixel Shuffle 降采样以及多模态模型合并等技术,支持 23 种语言的图像描述、视觉问答及 OCR 等任务。
推荐理由:Cohere For AI 发布 Aya Vision 系列开源多模态模型,通过合成标注与模型合并技术提升23种语言下的视觉理解能力。
Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时通信库,旨在简化实时音频和视频 AI 应用的构建。它内置了自动语音检测、轮次管理以及基于 Gradio 的 UI,支持 WebRTC 和 WebSocket,并可一键部署为 FastAPI 应用或获取免费电话号码进行通话测试。
推荐理由:该库通过封装 WebRTC 和自动语音检测,让 Python 开发者能低门槛构建实时音视频 AI 应用,并支持快速部署与电话接入。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个 Serverless Inference Providers,支持 DeepSeek-R1 和 Flux.1 等模型。
Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。
推荐理由:原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。
Hugging Face 与 2A2I、TII 等机构推出第二代 Open Arabic LLM Leaderboard,旨在解决初代版本在算力门槛与结果真实性上的局限。该榜单已吸引超 46,000 访客并收录逾 700 个模型,涵盖从 1B 到 70B+ 参数规模,成为阿拉伯语 NLP 社区最活跃的评测平台之一。