跳到正文

#Agent

今日 13 条
7月23日周四
  1. Google Research75

    Google Research 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体研究

    Google Research 发表关于 SymptomAI 的研究论文,介绍了一种用于日常症状评估的对话式 AI 智能体。在一项涉及 13,917 名参与者的随机全国性研究中,SymptomAI 生成的鉴别诊断(DDx)在超过 50% 的案例中被临床专家优先选择,且准确率高于其他临床医生提供的诊断。

    推荐理由:原文展示了基于大规模真实用户对话的研究结果,提供了AI在症状评估中对比临床专家的表现数据及与可穿戴设备生物信号的关联分析。

7月21日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。

    推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。

7月16日周四
  1. Hugging Face Blog62

    IBM Research:模型路由是系统优化而非简单分类

    IBM Research 提出智能体系统中的模型路由不应被视为简单的任务难度分类问题,而是一个需要同时优化成本、质量和延迟的系统工程挑战。文章通过 AppWorld Test Challenge 实验指出,实际成本受缓存命中率影响巨大,例如 Claude Sonnet 4.6 因高缓存收益比 GPT-4.1 更便宜;同时,路由决策需兼顾合规性、数据驻留及基础设施状态。

    推荐理由:IBM Research 指出模型路由并非简单的分类问题,而是涉及缓存、合规与基础设施的系统优化难题,并展示了基于多目标优化的路由器在成本与精度上的权衡优势。

7月7日周二
  1. Berkeley AI Research53

    Berkeley AI Research 探讨智能体时代数据系统的三大挑战与机遇

    伯克利 AI 研究团队指出随着推理成本急剧下降,数据系统面临为智能体服务、作为智能体基底以及由智能体构建的三大新挑战。文章分析了智能体推测性查询带来的优化机会,探讨了支持多智能体协调的结构化记忆机制,并讨论了利用智能体从零合成可验证定制数据系统的可行性与难点。

7月1日周三
  1. Hugging Face Blog45

    ScarfBench:评估 AI 智能体企业 Java 框架迁移能力的基准测试

    Hugging Face 推出开源基准 ScarfBench,评估 AI 智能体在 Spring、Jakarta EE 和 Quarkus 间的 Java 框架迁移能力。该基准包含 34 个应用和 204 个迁移任务,要求通过构建、部署及行为验证。结果显示最强智能体行为成功率低于 10%,且存在自我评估过度自信问题,配置与依赖管理是主要难点。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 原生集成计算机使用功能

    Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。

    推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。

6月24日周三
  1. Mistral AI40

    Mistral AI 增强 Connectors 管控:支持工作区级权限、多账号连接及调试器

    Mistral AI 推出多项新能力以增强对 Connectors 的安全管控,包括正式发布的富化管理员控制、带作用域的 API 密钥和多账号连接器。新增的 Connectors Debugger(公开预览)提供 MCP 连接器的端到端根因分析,同时 Workflows 和 Vibe Code 现已集成连接器功能,支持超过 60 个预构建连接器及自定义 MCP 选项。

6月23日周二
  1. Mistral AI78

    Mistral 发布 OCR 4:支持边界框与块分类的结构化文档解析模型

    Mistral AI 正式发布 Mistral OCR 4,这是一款专注于文档解析的小模型,在提取文本的同时返回边界框、块类型分类(如标题、表格、公式)以及内联置信度分数。

    推荐理由:Mistral OCR 4 引入边界框和块分类等结构化输出,支持单容器自托管,为 RAG 和企业搜索提供高精度多语言文档解析方案。

6月22日周一
  1. Hugging Face Blog73

    Hugging Face 分享使用本地模型对 OpenClaw 仓库进行免费分诊的实践

    Hugging Face 介绍了如何使用 Gemma 和 Qwen 等本地模型结合 Pi Agent 框架,对 OpenClaw 仓库的海量 Issue 和 PR 进行实时分类与通知。该方案通过受限 Shell 确保安全性,并在 NVIDIA GB10 硬件上实现了高并发推理,相比云端 API 具有成本优势且响应更快。

    推荐理由:展示了在本地硬件上利用 Agent 框架实现高吞吐开源仓库自动分诊的完整工程方案与评测数据。

6月19日周五
  1. Hugging Face Blog60

    Hugging Face 发布 MosaicLeaks:深度研究智能体的隐私泄露风险与 PA-DR 防御方法

    Hugging Face 联合 ServiceNow 等机构发布 MosaicLeaks 基准,揭示深度研究智能体在多跳检索中因“马赛克效应”导致私有信息通过 Web 查询日志泄露的风险。

    推荐理由:提出MosaicLeaks基准与PA-DR训练法,量化智能体查询隐私泄露风险并给出兼顾任务性能与隐私保护的RL方案。

6月18日周四
  1. Hugging Face Blog78

    Hugging Face 发布 agent-eval 基准测试工具以评估开源模型在自有工具上的表现

    Hugging Face 推出名为 `agent-eval` 的基准测试工具,用于衡量编码智能体使用特定软件(如 transformers)完成任务时的效率与成本,而不仅关注最终答案的正确性。该工具通过对比不同模型、代码版本及上下文层级(bare/clone/skill),发现为大型开放模型引入 CLI 和 Skill 能显著减少耗时,但可能导致小型模型因误解文档或读取过多源码而性能下降甚至失败。

    推荐理由:原文提供了评估代码库对智能体友好程度的具体方法,揭示了同一工具改进对不同规模模型产生的相反影响。

6月17日周三
  1. Hugging Face Blog78

    AWS Strands Robots 集成 LeRobot 实现从 Hub 数据集到物理机器人的全流程指南

    AWS 开源 SDK Strands Robots 集成了 Hugging Face LeRobot 栈,允许开发者通过单个 Agent 循环完成从 Hub 数据集记录、策略训练到物理机器人部署的全流程。

    推荐理由:原文提供了从 Hub 数据集到物理机器人的完整代码示例,展示了如何用单一 Agent 循环统一仿真与硬件部署流程。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 以保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI 智能体的纵深防御框架,旨在应对模型对齐不完美时的安全风险。该框架借鉴 MITRE ATT&CK 标准,将未受信任的智能体视为潜在内部威胁,通过实时行为监控和分级响应机制来检测与阻止异常操作。

    推荐理由:原文提出了将内部 AI 智能体视为潜在内部威胁的防御框架,并公开了基于百万条轨迹分析的监控实践细节。

6月12日周五
6月10日周三
6月9日周二
  1. Hugging Face Blog75

    智能体通过串联两个 Hugging Face Spaces 构建 3D 巴黎画廊的实践

    作者演示了编码智能体如何通过读取 Gradio Space 暴露的 `agents.md` 文件,自动调用 `ideogram-ai/ideogram4` 生成图像并串联 `VAST-AI/TripoSplat` 进行 3D Gaussian splat 重建,最终部署为静态 Space。

    推荐理由:展示了利用 agents.md 让智能体自动串联图像生成与3D重建Space的完整流程,为构建多媒体应用提供了可复用的集成方法。

6月8日周一
6月5日周五
  1. Google Research60

    Gemini Enterprise Agent Platform 推出基于 Agentic RAG 的跨语料检索功能

    Google Research 在 Gemini Enterprise Agent Platform 中推出了由 Agentic RAG 驱动的跨语料检索功能,旨在解决传统单步 RAG 在处理多源、多跳商业查询时的局限性。

    推荐理由:原文介绍了 Gemini Enterprise Agent Platform 中 Agentic RAG 的架构设计与实验数据,读者可了解其如何通过多智能体协作与充分上下文检查提升复杂查询的准确性。

6月4日周四
  1. Hugging Face Blog72

    Hugging Face 发布面向智能体优化的 hf CLI 及基准测试结果

    Hugging Face 重构了官方命令行工具 hf,使其同时适配人类用户和编码智能体(如 Claude Code、Codex)。通过自动检测环境变量,CLI 为智能体提供无 ANSI 码、不截断的 TSV 结构化输出,并引入下一步命令提示和非阻塞重试机制。

    推荐理由:官方展示了针对智能体优化的CLI设计细节与基准测试数据,揭示了在复杂多步任务中相比原生SDK能显著降低Token消耗并提升成功率。

6月2日周二
  1. Hugging Face Blog75

    Holo3.1 系列模型发布:支持快速本地推理的计算机使用智能体

    Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。

    推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。

6月1日周一
5月29日周五
  1. Google Research78

    Google Research 在 I/O 2026 发布 Gemini for Science 与 Antigravity 2.0 等成果

    Google Research 在 I/O 2026 上发布了多项基于最新模型的研究成果和产品更新,重点推出了用于加速科学发现的 Gemini for Science 套件以及提升开发者效率的 Agentic 开发平台 Google Antigravity 2.0。

    推荐理由:原文展示了从科学发现到开发者效率的全栈 AI 工具链,读者可据此了解 Google 如何将前沿研究转化为具体的生产力应用。

5月28日周四
  1. Mistral AI57

    Mistral 发布工业工程 AI 栈与统一智能体 Vibe

    Mistral 在 AI Now Summit 上发布了面向工业工程的集成 AI 栈,并与 Airbus、BMW 和 ASML 达成合作以优化设计、仿真和生产流程。其 agentic AI 工具 Vibe 升级为处理编码和研究等长周期任务的统一智能体。此外,Mistral 宣布将于 2026 年第三季度在法国启用一座 10 MW 的推理专用数据中心,以增强算力控制与安全性。

  2. Mistral AI83

    Mistral 发布统一 AI 智能体 Vibe,整合办公与编程功能

    Mistral 正式推出统一 AI 智能体 Vibe,取代原有的 Le Chat,旨在同时处理长周期办公任务和复杂编程工作。Vibe 分为 Work Mode 和 Code Mode,前者支持跨企业工具的多步任务执行、结构化数据分析及文档生成,后者提供基于 Web 和 VS Code 扩展的远程编码代理,能自动完成从功能开发到合并 Pull Request 的全流程。

    推荐理由:Mistral 将 Le Chat 升级为统一智能体 Vibe,整合了办公与编程场景,提供了从多步任务规划到远程代码会话的完整工作流。

5月25日周一
5月22日周五
5月20日周三
5月17日周日
  1. Google DeepMind73

    Google DeepMind 发布 Gemini for Science 系列科研工具与技能

    Google DeepMind 正式推出 Gemini for Science,这是一套旨在扩展科学探索规模与精度的工具集合。该计划包含 Google Labs 上的三个实验性原型:基于 Co-Scientist 的假设生成、结合 AlphaEvolve 和 ERA 的计算发现,以及利用 NotebookLM 实现的文献洞察。

    推荐理由:Google DeepMind 推出 Gemini for Science,包含三个实验性工具和科学技能包,旨在通过 AI 智能体加速科学研究的核心步骤。

5月16日周六
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。

    推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。

5月12日周二
  1. Google DeepMind82

    Google DeepMind 推出 Co-Scientist 多智能体 AI 科研助手

    Google DeepMind 发布基于 Gemini 的多智能体系统 Co-Scientist,旨在加速科学研究假设的生成与验证。该系统通过生成、辩论和进化三个阶段协同工作,已在肝纤维化、ALS 等研究中展示应用潜力,并计划通过 Hypothesis Generation 工具向研究人员开放。

    推荐理由:原文展示了多智能体系统在假设生成中的具体分工与实测案例,读者可据此评估其辅助科研的实际效能。