跳到正文

全部动态

今日 12 条
6月30日周二
  1. Hugging Face Blog32

    DiScoFormer:单 Transformer 同时估计密度与分数

    Hugging Face 推出 DiScoFormer,该模型通过单次前向传播即可同时估计数据分布的密度和分数,无需针对新分布重新训练。在 100 维数据上,其分数误差比最佳 KDE 低约 6.5 倍,密度误差降低超 37 倍,且能泛化至非高斯分布。这一预训练插件式估计器有望大幅降低生成建模及科学计算中的成本。

6月29日周一
6月27日周六
6月26日周五
  1. Hugging Face Blog68

    Hugging Face 教程:用一条命令在 HF Jobs 上运行 vLLM 服务器

    Hugging Face 发布教程,指导用户通过 `hf jobs run` 命令在 HF Jobs 基础设施上快速启动私有且兼容 OpenAI API 的 vLLM 服务器。

    推荐理由:原文提供了在 Hugging Face Jobs 上通过单条命令快速启动 vLLM 服务的具体步骤、代码示例及与 Inference Endpoints 的选型对比,适合需要临时测试或批量生成模型的开发者参考。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 原生集成计算机使用功能

    Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。

    推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。

6月24日周三
  1. Mistral AI40

    Mistral AI 增强 Connectors 管控:支持工作区级权限、多账号连接及调试器

    Mistral AI 推出多项新能力以增强对 Connectors 的安全管控,包括正式发布的富化管理员控制、带作用域的 API 密钥和多账号连接器。新增的 Connectors Debugger(公开预览)提供 MCP 连接器的端到端根因分析,同时 Workflows 和 Vibe Code 现已集成连接器功能,支持超过 60 个预构建连接器及自定义 MCP 选项。

  2. Hugging Face Blog42

    Hugging Face 与 Treble Technologies 推出首个开源远场 ASR 基准 FFASR Leaderboard

    Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。

6月23日周二
  1. Mistral AI78

    Mistral 发布 OCR 4:支持边界框与块分类的结构化文档解析模型

    Mistral AI 正式发布 Mistral OCR 4,这是一款专注于文档解析的小模型,在提取文本的同时返回边界框、块类型分类(如标题、表格、公式)以及内联置信度分数。

    推荐理由:Mistral OCR 4 引入边界框和块分类等结构化输出,支持单容器自托管,为 RAG 和企业搜索提供高精度多语言文档解析方案。

  2. Hugging Face Blog68

    Hugging Face 分享基于 AI 和开源工具的每周自动发布实践

    Hugging Face 公开了 huggingface_hub 的自动化发布工作流,将发布频率从每4-6周提升至每周一次。该流程利用 GitHub Actions、OpenCode 和 GLM-5.2 模型起草发布说明,并通过确定性脚本校验 PR 完整性及文档准确性,确保在保留人工审核关键决策的同时实现低成本高效交付。

    推荐理由:文章展示了如何用开源工具构建自动化发布流程,其确定性校验机制为AI辅助开发提供了可复用的安全范式。

  3. Hugging Face Blog62

    在 Transformers.js 中实验跨源存储 API 以优化浏览器端缓存

    Transformers.js 正在实验性地集成 Chrome 团队提出的跨源存储(Cross-Origin Storage, COS)API,旨在解决不同 Web 应用间共享大型 AI 模型和 Wasm 运行时文件时的重复下载与存储隔离问题。

    推荐理由:文章详细演示了如何利用跨源存储 API 解决浏览器端 AI 模型重复下载问题,提供了 Transformers.js 的具体集成代码与隐私控制策略。

6月22日周一
  1. Hugging Face Blog73

    Hugging Face 分享使用本地模型对 OpenClaw 仓库进行免费分诊的实践

    Hugging Face 介绍了如何使用 Gemma 和 Qwen 等本地模型结合 Pi Agent 框架,对 OpenClaw 仓库的海量 Issue 和 PR 进行实时分类与通知。该方案通过受限 Shell 确保安全性,并在 NVIDIA GB10 硬件上实现了高并发推理,相比云端 API 具有成本优势且响应更快。

    推荐理由:展示了在本地硬件上利用 Agent 框架实现高吞吐开源仓库自动分诊的完整工程方案与评测数据。

6月19日周五
  1. Hugging Face Blog60

    Hugging Face 发布 MosaicLeaks:深度研究智能体的隐私泄露风险与 PA-DR 防御方法

    Hugging Face 联合 ServiceNow 等机构发布 MosaicLeaks 基准,揭示深度研究智能体在多跳检索中因“马赛克效应”导致私有信息通过 Web 查询日志泄露的风险。

    推荐理由:提出MosaicLeaks基准与PA-DR训练法,量化智能体查询隐私泄露风险并给出兼顾任务性能与隐私保护的RL方案。

6月18日周四
  1. Hugging Face Blog58

    Hugging Face 解析 PEFT 技术:LoRA 并非微调的最优默认选择

    Hugging Face 发布博客探讨参数高效微调(PEFT)技术,指出虽然 LoRA 占据主导地位,但其他技术在特定场景下表现更优。团队在 LLM 数学推理和图像生成任务上对超过 40 种 PEFT 技术进行了标准化基准测试,结果显示 OFT 在图像生成的相似度和显存占用上均优于 LoRA,而 BEFT 和 Lily 等变体在 LLM 任务的精度与内存权衡中也展现出竞争力。

  2. Hugging Face Blog78

    Hugging Face 发布 agent-eval 基准测试工具以评估开源模型在自有工具上的表现

    Hugging Face 推出名为 `agent-eval` 的基准测试工具,用于衡量编码智能体使用特定软件(如 transformers)完成任务时的效率与成本,而不仅关注最终答案的正确性。该工具通过对比不同模型、代码版本及上下文层级(bare/clone/skill),发现为大型开放模型引入 CLI 和 Skill 能显著减少耗时,但可能导致小型模型因误解文档或读取过多源码而性能下降甚至失败。

    推荐理由:原文提供了评估代码库对智能体友好程度的具体方法,揭示了同一工具改进对不同规模模型产生的相反影响。

6月17日周三
  1. Hugging Face Blog78

    AWS Strands Robots 集成 LeRobot 实现从 Hub 数据集到物理机器人的全流程指南

    AWS 开源 SDK Strands Robots 集成了 Hugging Face LeRobot 栈,允许开发者通过单个 Agent 循环完成从 Hub 数据集记录、策略训练到物理机器人部署的全流程。

    推荐理由:原文提供了从 Hub 数据集到物理机器人的完整代码示例,展示了如何用单一 Agent 循环统一仿真与硬件部署流程。

  2. Hugging Face Blog86

    智谱发布 GLM-5.2:支持 1M 上下文的长程任务旗舰模型

    智谱(Z.ai)发布最新旗舰模型 GLM-5.2,主打长程任务处理能力并首次提供稳定的 1M-token 上下文窗口。该模型采用 IndexShare 架构降低计算成本,在 FrontierSWE、PostTrainBench 等长程编码基准中表现优于多数闭源模型,成为排名第一的开源模型。

    推荐理由:原文给出了1M上下文在长程编码任务中的实测表现与架构优化细节,读者可以据此判断其作为开源旗舰模型的实际工程落地能力。

  3. Google DeepMind48

    Google DeepMind 与英国政府合作开发基于 Gemini 的 AI 规划原型

    Google DeepMind 联合英国政府推出基于 Gemini 的 AI 规划原型,旨在将住房申请处理时间缩短 50%。该工具通过数据整合、政策识别及报告起草辅助规划官员,同时保留人工最终决策权并记录审计轨迹。计划于 2027 年向全英议会推广,以加速实现 2029 年新建 150 万套住房的目标。