跳到正文

#Agent

今日 4 条
8月5日周二
8月1日周五
  1. OpenAI News19

    Figma 利用 AI 变革数字设计

    Figma 通过 AI 工具变革数字设计,David Kossnick 介绍了 Figma Make 如何赋能团队进行原型制作、协作与构建。该工具重塑了设计师、开发者及非技术创作者的工作流程,使各类用户均能借助 AI 提升设计与开发效率。

7月30日周三
  1. Mistral AI65

    Mistral AI 发布 Codestral 25.08 及企业级完整编码栈

    Mistral AI 发布 Codestral 25.08 模型及面向企业的完整编码解决方案,旨在解决传统 AI 编程助手在私有化部署、定制化及可观测性方面的限制。

    推荐理由:Mistral AI 官方发布了 Codestral 25.08 及完整企业级编码栈,提供了从代码补全到自主智能体工作流的集成方案,适合关注私有化部署和合规性要求的工程团队参考。

7月24日周四
7月23日周三
7月22日周二
7月17日周四
  1. Mistral AI68

    Mistral Le Chat 发布深度研究、Voxtral 语音模式及 Magistral 推理新功能

    Mistral AI 为其助手 Le Chat 推出多项重大更新,包括预览版 Deep Research 模式、基于 Voxtral 模型的语音交互以及由 Magistral 模型驱动的原生多语言推理能力。

    推荐理由:Mistral 为 Le Chat 集中上线了深度研究、语音交互及原生多语言推理等核心功能,展示了其助手向全能型生产力工具演进的具体路径。

  2. OpenAI News70

    OpenAI 发布 ChatGPT Agent 模式

    OpenAI 在 ChatGPT 中推出 Agent 模式,该功能允许模型自主规划并执行多步任务。用户可通过文本或语音指令启动,系统将调用虚拟浏览器和计算机环境完成网页操作、文件处理及代码运行等工作。

    推荐理由:官方发布的新智能体功能展示了从对话到自主执行任务的转变,为理解 AI 代理的实际落地形态提供了直接参考。

  3. OpenAI News78

    OpenAI 发布 ChatGPT Agent 模式

    OpenAI 正式推出 ChatGPT Agent 模式,该功能允许模型自主规划并执行多步任务。用户可通过自然语言指令让 AI 操作浏览器、调用工具及处理文件,实现从简单问答到复杂工作流的自动化升级。

    推荐理由:官方发布的新功能直接展示了智能体在复杂任务中的执行能力,为评估自动化工作流提供了最新参考。

7月10日周四
7月1日周二
6月26日周四
6月24日周二
6月6日周五
  1. Hugging Face Blog65

    Hugging Face 发布 ScreenSuite:最全面的 GUI 智能体评估套件

    Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。

    推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。

6月4日周三
  1. Mistral AI60

    Mistral AI 发布 Mistral Code 企业级 AI 编码助手

    Mistral AI 推出 Mistral Code,这是一款面向企业软件团队的 AI 编码助手,现已在 JetBrains IDEs 和 VSCode 开放私有测试。

    推荐理由:原文展示了面向企业的安全合规AI编码助手,整合了模型、IDE插件及私有化部署选项,适合关注代码安全与效率的团队评估。

6月3日周二
  1. Hugging Face Blog65

    H Company 发布 Holo1 GUI 自动化 VLM 家族及 Surfer-H 智能体

    H Company 在 Hugging Face Hub 上发布了 Holo1 系列动作视觉语言模型(Action VLMs)和 WebClick 基准测试。该系列包含 Holo1-3B 和 Holo1-7B 两个版本,基于 Qwen2.5-VL 架构,其中 Holo1-7B 在通用 UI 定位基准上达到 76.2% 的平均准确率。

    推荐理由:原文发布了专为GUI自动化设计的开源视觉语言模型家族及基准,提供了低成本实现网页任务自动化的具体性能数据。

5月28日周三
  1. Hugging Face Blog63

    Hugging Face 研究:结构化生成提升 CodeAgent 执行可靠性

    Hugging Face 发布研究指出,强制 CodeAgent 以 JSON 格式生成思考和代码能显著提升执行可靠性。在 SmolBench 基准测试中,该方法使高性能模型的准确率平均提高 2-7 个百分点,并将因解析错误导致的失败率从 2.4% 降至零。

    推荐理由:原文通过对比实验量化了结构化输出对代码智能体解析错误率的降低作用,并明确了模型能力阈值,为 Agent 架构选型提供了具体依据。

5月27日周二
  1. Mistral AI65

    Mistral AI 发布 Agents API 以支持构建具备工具调用和记忆能力的 AI 智能体

    Mistral AI 正式推出 Agents API,旨在通过结合其语言模型与内置连接器、持久记忆及智能体编排能力,解决传统模型在动作执行和上下文维持上的局限。

    推荐理由:Mistral 推出 Agents API,整合内置连接器与 MCP 工具,提供持久记忆及多智能体编排能力,助力企业构建复杂任务处理框架。

5月23日周五
5月12日周一
5月7日周三
4月25日周五
4月10日周四
4月2日周三
3月27日周四
3月25日周二
3月18日周二
3月4日周二
2月28日周五
2月27日周四
2月7日周五
  1. Mistral AI73

    Mistral AI 发布全新 le Chat 助手并推出 Pro/Team/Enterprise 服务层级

    Mistral AI 正式发布全新 le Chat AI 助手,支持 iOS 和 Android 平台,并引入 Pro、Team 及企业级私有预览服务。该助手具备高达 ~1000 words / sec 的 Flash Answers 快速响应能力、基于 Black Forest Labs Flux Ultra 的图像生成以及 Code interpreter 代码执行功能。

    推荐理由:原文详细列出了 Flash Answers、Code interpreter 及 Enterprise 私有预览等具体功能变化,读者可据此评估其作为通用助手与生产力工具的实际能力边界。

2月4日周二
  1. Hugging Face Blog80

    Hugging Face 开源 DeepResearch 复现框架

    Hugging Face 发布开源项目 Open Deep Research,旨在复现 OpenAI Deep Research 的功能并公开其智能体框架。该项目利用 smolagents 库构建代码代理(CodeAgent),在 GAIA 验证集上达到 55.15% 的成绩,优于此前开源框架约 46% 的水平。

    推荐理由:Hugging Face 开源了基于 smolagents 的 DeepResearch 复现框架,展示了代码代理在 GAIA 基准测试中相比传统 JSON 动作生成的显著性能提升。

2月3日周一
  1. OpenAI News82

    OpenAI 发布 Deep Research 智能体

    OpenAI 推出名为 Deep Research 的新智能体,能够利用在线资源进行多步骤研究并生成详细报告。该工具旨在通过结合网络搜索与模型推理能力来辅助复杂的研究任务,目前向 Plus 和 Pro 用户开放。

    推荐理由:官方介绍了具备多步推理能力的研究智能体,展示了其整合在线信息生成报告的工作流。