跳到正文

#Agent

今日 14 条
9月23日周二
9月22日周一
  1. Hugging Face Blog68

    Hugging Face 发布 Gaia2 智能体基准与 ARE 开源框架

    Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。

    推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。

9月10日周三
  1. Hugging Face Blog68

    Hugging Face 发布 Jupyter Agent:通过合成数据与简化脚手架增强小模型数据分析能力

    Hugging Face 推出 Jupyter Agent 项目,旨在通过构建高质量训练数据和优化代理脚手架,提升小型语言模型在数据科学任务中的表现。团队利用 Kaggle Notebook 数据集经过多阶段清洗和合成生成约 51k 条轨迹,对 Qwen3-4B 进行全参数微调,使其在 DABStep 基准测试的简单任务上准确率提升至 75%。

    推荐理由:原文公开了从数据清洗到微调的完整流水线及代码,展示了小模型在特定脚手架下性能提升的具体路径。

9月2日周二
8月18日周一
8月12日周二
8月5日周二
  1. Hugging Face Blog98

    Hugging Face 欢迎 OpenAI 开源 GPT OSS 模型家族

    OpenAI 发布了名为 GPT OSS 的开源权重模型家族,包含 gpt-oss-120b 和 gpt-oss-20b 两个混合专家(MoE)模型,均采用 MXFP4 量化并遵循 Apache 2.0 许可证。

    推荐理由:原文详细说明了 GPT OSS 的架构特性、量化方案及在主流框架下的本地部署与微调方法,为开发者提供了从云端 API 到端侧运行的完整技术路径。

8月1日周五
  1. OpenAI News19

    Figma 利用 AI 变革数字设计

    Figma 通过 AI 工具变革数字设计,David Kossnick 介绍了 Figma Make 如何赋能团队进行原型制作、协作与构建。该工具重塑了设计师、开发者及非技术创作者的工作流程,使各类用户均能借助 AI 提升设计与开发效率。

7月30日周三
  1. Mistral AI65

    Mistral AI 发布 Codestral 25.08 及企业级完整编码栈

    Mistral AI 发布 Codestral 25.08 模型及面向企业的完整编码解决方案,旨在解决传统 AI 编程助手在私有化部署、定制化及可观测性方面的限制。

    推荐理由:Mistral AI 官方发布了 Codestral 25.08 及完整企业级编码栈,提供了从代码补全到自主智能体工作流的集成方案,适合关注私有化部署和合规性要求的工程团队参考。

7月24日周四
7月23日周三
7月22日周二
7月17日周四
  1. Mistral AI68

    Mistral Le Chat 发布深度研究、Voxtral 语音模式及 Magistral 推理新功能

    Mistral AI 为其助手 Le Chat 推出多项重大更新,包括预览版 Deep Research 模式、基于 Voxtral 模型的语音交互以及由 Magistral 模型驱动的原生多语言推理能力。

    推荐理由:Mistral 为 Le Chat 集中上线了深度研究、语音交互及原生多语言推理等核心功能,展示了其助手向全能型生产力工具演进的具体路径。

  2. OpenAI News70

    OpenAI 发布 ChatGPT Agent 模式

    OpenAI 在 ChatGPT 中推出 Agent 模式,该功能允许模型自主规划并执行多步任务。用户可通过文本或语音指令启动,系统将调用虚拟浏览器和计算机环境完成网页操作、文件处理及代码运行等工作。

    推荐理由:官方发布的新智能体功能展示了从对话到自主执行任务的转变,为理解 AI 代理的实际落地形态提供了直接参考。

  3. OpenAI News78

    OpenAI 发布 ChatGPT Agent 模式

    OpenAI 正式推出 ChatGPT Agent 模式,该功能允许模型自主规划并执行多步任务。用户可通过自然语言指令让 AI 操作浏览器、调用工具及处理文件,实现从简单问答到复杂工作流的自动化升级。

    推荐理由:官方发布的新功能直接展示了智能体在复杂任务中的执行能力,为评估自动化工作流提供了最新参考。

7月10日周四
7月1日周二
6月26日周四
6月24日周二
6月6日周五
  1. Hugging Face Blog65

    Hugging Face 发布 ScreenSuite:最全面的 GUI 智能体评估套件

    Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。

    推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。

6月4日周三
  1. Mistral AI60

    Mistral AI 发布 Mistral Code 企业级 AI 编码助手

    Mistral AI 推出 Mistral Code,这是一款面向企业软件团队的 AI 编码助手,现已在 JetBrains IDEs 和 VSCode 开放私有测试。

    推荐理由:原文展示了面向企业的安全合规AI编码助手,整合了模型、IDE插件及私有化部署选项,适合关注代码安全与效率的团队评估。

6月3日周二
  1. Hugging Face Blog65

    H Company 发布 Holo1 GUI 自动化 VLM 家族及 Surfer-H 智能体

    H Company 在 Hugging Face Hub 上发布了 Holo1 系列动作视觉语言模型(Action VLMs)和 WebClick 基准测试。该系列包含 Holo1-3B 和 Holo1-7B 两个版本,基于 Qwen2.5-VL 架构,其中 Holo1-7B 在通用 UI 定位基准上达到 76.2% 的平均准确率。

    推荐理由:原文发布了专为GUI自动化设计的开源视觉语言模型家族及基准,提供了低成本实现网页任务自动化的具体性能数据。

5月28日周三
  1. Hugging Face Blog63

    Hugging Face 研究:结构化生成提升 CodeAgent 执行可靠性

    Hugging Face 发布研究指出,强制 CodeAgent 以 JSON 格式生成思考和代码能显著提升执行可靠性。在 SmolBench 基准测试中,该方法使高性能模型的准确率平均提高 2-7 个百分点,并将因解析错误导致的失败率从 2.4% 降至零。

    推荐理由:原文通过对比实验量化了结构化输出对代码智能体解析错误率的降低作用,并明确了模型能力阈值,为 Agent 架构选型提供了具体依据。

5月27日周二
  1. Mistral AI65

    Mistral AI 发布 Agents API 以支持构建具备工具调用和记忆能力的 AI 智能体

    Mistral AI 正式推出 Agents API,旨在通过结合其语言模型与内置连接器、持久记忆及智能体编排能力,解决传统模型在动作执行和上下文维持上的局限。

    推荐理由:Mistral 推出 Agents API,整合内置连接器与 MCP 工具,提供持久记忆及多智能体编排能力,助力企业构建复杂任务处理框架。

5月23日周五
5月12日周一
5月7日周三
4月25日周五
4月10日周四
4月2日周三
3月27日周四
3月25日周二
3月18日周二