跳到正文

全部动态

今日 42 条
6月30日周二
  1. Google Research80

    Google Research 发布表格数据零样本基础模型 TabFM

    Google Research 发布专为表格数据分类和回归设计的零样本基础模型 TabFM。该模型将表格预测重构为上下文学习问题,利用混合注意力架构和在数亿合成数据集上的预训练,无需手动特征工程或超参数调整即可在单次前向传播中生成高质量预测。

    推荐理由:Google Research 推出面向表格数据的零样本基础模型 TabFM,通过上下文学习消除传统监督模型的训练与调优瓶颈。

  2. Hugging Face Blog32

    DiScoFormer:单 Transformer 同时估计密度与分数

    Hugging Face 推出 DiScoFormer,该模型通过单次前向传播即可同时估计数据分布的密度和分数,无需针对新分布重新训练。在 100 维数据上,其分数误差比最佳 KDE 低约 6.5 倍,密度误差降低超 37 倍,且能泛化至非高斯分布。这一预训练插件式估计器有望大幅降低生成建模及科学计算中的成本。

6月29日周一
  1. Import AI28

    NVIDIA 推出 ENPIRE 实现机器人自我改进;10k 中国 GPU 集群及人类时代挽歌

    NVIDIA 开发 ENPIRE 框架,利用 GPT-5.5、Opus 4.7 等编码智能体驱动 YAM 机械臂自主迭代策略,在 PushT 等任务中实现 99% 成功率。该闭环系统通过自动评估与重置最小化人工干预,但多智能体扩展面临硬件利用率挑战。此外,文章提及 10k 中国 GPU 集群动态及关于技术预测偏差的评论。

6月27日周六
6月26日周五
  1. Hugging Face Blog68

    Hugging Face 教程:用一条命令在 HF Jobs 上运行 vLLM 服务器

    Hugging Face 发布教程,指导用户通过 `hf jobs run` 命令在 HF Jobs 基础设施上快速启动私有且兼容 OpenAI API 的 vLLM 服务器。

    推荐理由:原文提供了在 Hugging Face Jobs 上通过单条命令快速启动 vLLM 服务的具体步骤、代码示例及与 Inference Endpoints 的选型对比,适合需要临时测试或批量生成模型的开发者参考。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 原生集成计算机使用功能

    Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。

    推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。

6月24日周三
  1. Mistral AI40

    Mistral AI 增强 Connectors 管控:支持工作区级权限、多账号连接及调试器

    Mistral AI 推出多项新能力以增强对 Connectors 的安全管控,包括正式发布的富化管理员控制、带作用域的 API 密钥和多账号连接器。新增的 Connectors Debugger(公开预览)提供 MCP 连接器的端到端根因分析,同时 Workflows 和 Vibe Code 现已集成连接器功能,支持超过 60 个预构建连接器及自定义 MCP 选项。

  2. Hugging Face Blog42

    Hugging Face 与 Treble Technologies 推出首个开源远场 ASR 基准 FFASR Leaderboard

    Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。

6月23日周二
  1. Mistral AI78

    Mistral 发布 OCR 4:支持边界框与块分类的结构化文档解析模型

    Mistral AI 正式发布 Mistral OCR 4,这是一款专注于文档解析的小模型,在提取文本的同时返回边界框、块类型分类(如标题、表格、公式)以及内联置信度分数。

    推荐理由:Mistral OCR 4 引入边界框和块分类等结构化输出,支持单容器自托管,为 RAG 和企业搜索提供高精度多语言文档解析方案。

  2. Hugging Face Blog68

    Hugging Face 分享基于 AI 和开源工具的每周自动发布实践

    Hugging Face 公开了 huggingface_hub 的自动化发布工作流,将发布频率从每4-6周提升至每周一次。该流程利用 GitHub Actions、OpenCode 和 GLM-5.2 模型起草发布说明,并通过确定性脚本校验 PR 完整性及文档准确性,确保在保留人工审核关键决策的同时实现低成本高效交付。

    推荐理由:文章展示了如何用开源工具构建自动化发布流程,其确定性校验机制为AI辅助开发提供了可复用的安全范式。

  3. Hugging Face Blog62

    在 Transformers.js 中实验跨源存储 API 以优化浏览器端缓存

    Transformers.js 正在实验性地集成 Chrome 团队提出的跨源存储(Cross-Origin Storage, COS)API,旨在解决不同 Web 应用间共享大型 AI 模型和 Wasm 运行时文件时的重复下载与存储隔离问题。

    推荐理由:文章详细演示了如何利用跨源存储 API 解决浏览器端 AI 模型重复下载问题,提供了 Transformers.js 的具体集成代码与隐私控制策略。

6月22日周一
  1. Hugging Face Blog73

    Hugging Face 分享使用本地模型对 OpenClaw 仓库进行免费分诊的实践

    Hugging Face 介绍了如何使用 Gemma 和 Qwen 等本地模型结合 Pi Agent 框架,对 OpenClaw 仓库的海量 Issue 和 PR 进行实时分类与通知。该方案通过受限 Shell 确保安全性,并在 NVIDIA GB10 硬件上实现了高并发推理,相比云端 API 具有成本优势且响应更快。

    推荐理由:展示了在本地硬件上利用 Agent 框架实现高吞吐开源仓库自动分诊的完整工程方案与评测数据。

6月19日周五
  1. Hugging Face Blog60

    Hugging Face 发布 MosaicLeaks:深度研究智能体的隐私泄露风险与 PA-DR 防御方法

    Hugging Face 联合 ServiceNow 等机构发布 MosaicLeaks 基准,揭示深度研究智能体在多跳检索中因“马赛克效应”导致私有信息通过 Web 查询日志泄露的风险。

    推荐理由:提出MosaicLeaks基准与PA-DR训练法,量化智能体查询隐私泄露风险并给出兼顾任务性能与隐私保护的RL方案。

6月18日周四
  1. Hugging Face Blog58

    Hugging Face 解析 PEFT 技术:LoRA 并非微调的最优默认选择

    Hugging Face 发布博客探讨参数高效微调(PEFT)技术,指出虽然 LoRA 占据主导地位,但其他技术在特定场景下表现更优。团队在 LLM 数学推理和图像生成任务上对超过 40 种 PEFT 技术进行了标准化基准测试,结果显示 OFT 在图像生成的相似度和显存占用上均优于 LoRA,而 BEFT 和 Lily 等变体在 LLM 任务的精度与内存权衡中也展现出竞争力。

  2. Hugging Face Blog78

    Hugging Face 发布 agent-eval 基准测试工具以评估开源模型在自有工具上的表现

    Hugging Face 推出名为 `agent-eval` 的基准测试工具,用于衡量编码智能体使用特定软件(如 transformers)完成任务时的效率与成本,而不仅关注最终答案的正确性。该工具通过对比不同模型、代码版本及上下文层级(bare/clone/skill),发现为大型开放模型引入 CLI 和 Skill 能显著减少耗时,但可能导致小型模型因误解文档或读取过多源码而性能下降甚至失败。

    推荐理由:原文提供了评估代码库对智能体友好程度的具体方法,揭示了同一工具改进对不同规模模型产生的相反影响。

6月17日周三
  1. Hugging Face Blog78

    AWS Strands Robots 集成 LeRobot 实现从 Hub 数据集到物理机器人的全流程指南

    AWS 开源 SDK Strands Robots 集成了 Hugging Face LeRobot 栈,允许开发者通过单个 Agent 循环完成从 Hub 数据集记录、策略训练到物理机器人部署的全流程。

    推荐理由:原文提供了从 Hub 数据集到物理机器人的完整代码示例,展示了如何用单一 Agent 循环统一仿真与硬件部署流程。