跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1–15 条 · 共 15 条
10月1日周四
  1. The Verge · AI77

    OpenAI 发布 Dots 智能体以对抗 Meta Muse,但面临免费竞争挑战

    OpenAI 在 DevDay 大会上发布了由 GPT-6 Astra 驱动的 AI 智能体 Dots,旨在与 Meta 的 Muse 平台竞争。Dots 定位为“首席助理”或资深工程师,擅长处理长期任务和知识工作,但目前仅限 $20/月 Pro 及以上计划用户使用,而 Muse 提供免费的专用虚拟机。

    推荐理由:原文对比了 OpenAI Dots 与 Meta Muse 在定价、功能定位及安全策略上的差异,揭示了 AI Agent 领域免费模式与高端付费路线的竞争格局。

  2. The Decoder78

    Ataraxos AI 击败 Stratego 历史最佳选手 Niemeijer,终结人类最后堡垒之一

    新系统 Ataraxos 在 Stratego 游戏中击败了被认为是历史上最伟大玩家的 Jeroen Niemeijer,有效胜率达到 85%。该研究指出,Ataraxos 仅使用约 8000 美元的算力成本(16 块 Nvidia H100 GPU 运行一周加 4 块 GPU 四天),远低于此前 DeepMind 的 DeepNash 系统所需的数百万美元。

    推荐理由:原文详细对比了 Ataraxos 与 DeepNash 在算力成本上的巨大差异,并展示了其在 Stratego 中击败人类顶尖选手的具体数据。

  3. Latent Space78

    Latent Space 访谈 OpenAI 团队:反驳 Dwarkesh 关于 Computer Use 停滞的观点及解析新 API

    Latent Space 在 OpenAI DevDay 后访谈了 Computer Use 负责人 Ari Weinstein 和 API 产品负责人 Nikunj Handa,反驳了此前关于 Computer Use 进展缓慢的观点,指出其能力已发生巨大变化。

    推荐理由:文章通过访谈 OpenAI 团队,澄清了 Computer Use 的技术演进现状,并解析了 Decisions API 等开发者工具的设计逻辑。

  4. Google DeepMind94

    Google DeepMind 发布 Gemini 4 Argon 模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。

9月30日周三
  1. Latent Space95

    OpenAI DevDay 2026:Dots、GPT-6.1 Sol、Decisions API 等发布

    OpenAI 在 DevDay 2026 上发布了 Dots 智能体、GPT-6.1 Sol 模型以及 Decisions API 等多项平台更新。GPT-6.1 Sol 定价为 $2/$10 per M tokens,宣称以 Astra 五分之一的价格提供接近其性能;Dots 作为常驻智能体可连接 4,000+ 应用并支持用户设定权限边界。

    推荐理由:原文汇总了 OpenAI DevDay 2026 的 Dots、GPT-6.1 Sol 及多项平台 API 更新,并收录了独立评测数据与行业反馈,适合快速掌握发布全貌。

9月29日周二
  1. Simon Willison92

    OpenAI DevDay 2026:发布 Dots 智能体、GPT-6.1 Sol 及多项平台更新

    OpenAI 在 DevDay 2026 上发布了名为 Dots 的个人智能体产品,由 Astra 模型驱动,并推出了价格更低、速度更快的 GPT-6.1 Sol 模型。此外,OpenAI 还上线了 ChatGPT Space、Codex Security Cloud、Sign in with ChatGPT 以及新的 Pro 500 订阅计划。

    推荐理由:作者现场记录了 OpenAI DevDay 发布的 Dots 智能体、GPT-6.1 Sol 模型及 Codex Security Cloud,提供了第一手的产品细节与演示实况。

  2. Latent Space78

    Anthropic Thariq Shihipar 谈 Claude Code 演进、Claude Mods 与智能体安全

    Anthropic 工程师 Thariq Shihipar 在访谈中详解了 Claude Code 的最新演进方向,重点介绍了允许用户自定义执行循环和 UI 的 Claude Mods 系统以及支持持久化数据交互的 Artifacts 功能。

    推荐理由:文章梳理了Claude Code从CLI向可定制Harness演进的路径,并深入探讨了智能体安全与提示词工程的核心价值。

9月26日周六
  1. GitHub Blog · AI & ML63

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用推出 canvases 功能,允许用户通过 `/create-canvas` 技能用自然语言描述生成可定制的双向交互界面。该界面支持看板、清单等多种形态,用户与智能体可实时同步操作状态,无需编写代码即可创建并复用扩展工具。

    推荐理由:原文演示了如何通过自然语言描述生成双向交互界面,为构建个性化智能体工作流提供了具体方法。

9月25日周五
  1. GitHub Blog · AI & ML68

    GitHub Copilot 提出用 canvas 替代聊天作为主要交互界面

    GitHub Copilot 推出 canvas 功能,允许用户在应用内创建全栈自定义界面以替代传统聊天窗口进行交互。canvas 支持双向通信和本地代码执行,可用于构建如 Connect 4 游戏、Winget 包管理器等工具,从而减少不必要的 token 消耗并提升开发工作流的自动化程度。

    推荐理由:文章通过具体案例展示了如何利用 canvas 构建自定义交互界面,帮助开发者优化与 AI 智能体的协作流程。

  2. Google Research60

    Google Research 发布 AI 视频联合导演框架以自动化连贯长视频生成

    Google Research 推出名为“AI video co-director”的统一多智能体框架,旨在解决现有扩散模型在生成长篇叙事视频时面临的语义漂移和级联失败挑战。

    推荐理由:Google Research 提出基于 Gemini 和 Veo 的多智能体框架,通过全局优化和世界状态跟踪解决长视频生成的语义漂移问题。

  3. GitHub Blog · AI & ML78

    GitHub Security Lab 发布 AI 驱动的模糊测试工具 Taskflow Agent

    GitHub Security Lab 推出 Fuzzing Taskflow,这是一个用于 C/C++ 项目的自主模糊测试流水线。该工具利用 LLM Agent 自动识别入口点、编写 AFL++ Harness、分析覆盖率报告并分诊崩溃,最终生成漏洞报告。用户只需指定 GitHub 仓库即可启动,但需在隔离环境中运行以防范提示注入风险。

    推荐理由:GitHub Security Lab 开源了基于 LLM Agent 的自动化模糊测试流水线,展示了如何将编写 Harness、分析覆盖率和分诊崩溃等重复性安全工作交给 AI 处理。

9月23日周三
9月16日周三
9月9日周三
  1. Mistral AI66

    Mistral AI 分享使用智能体将 40,000 行 Fortran 77 代码迁移至 C++ 的实践

    Mistral AI 协助一家欧洲能源运营商,利用 AI 智能体将 40,000 行 Fortran 77 物理模拟代码成功迁移至 C++。团队首先构建了基于数值一致性的校验框架(parity harness),并通过 Vibe CLI 生成调用树以自动化文档整理。

    推荐理由:文章详细拆解了从构建数值校验框架到多智能体协作迁移Fortran代码的完整工程路径,为处理无测试遗留系统提供了可复用的结构化方法论。