跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 81–100 条 · 共 131 条
2月18日周三
  1. Hugging Face Blog72

    Gradio 6 发布 gr.HTML 新功能支持单文件构建 Web 应用

    Gradio 6 更新了 gr.HTML 组件,支持自定义模板、作用域 CSS 和 JavaScript 交互,允许通过单个 Python 文件构建完整 Web 应用。该功能使 LLM 能一次性生成前端、后端及状态管理代码,无需构建步骤即可快速部署至 Hugging Face Spaces。

    推荐理由:原文展示了 gr.HTML 新特性如何支持单文件构建复杂交互组件,为 LLM 辅助开发提供了极简工作流参考。

2月12日周四
2月10日周二
  1. Google DeepMind84

    Google DeepMind 发布两篇论文:Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发布两篇研究论文,展示 Gemini Deep Think 模式在专家指导下解决数学、物理和计算机科学领域专业研究问题的能力。

    推荐理由:原文展示了 Gemini Deep Think 在纯数学、物理和计算机科学领域的具体科研突破案例及人机协作方法论,为评估 AI 在专业科研中的实际能力提供了详实依据。

2月5日周四
  1. OpenAI News70

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一款专为 Codex 设计的智能体模型。它将前沿编码性能与通用推理相结合,旨在支持长周期的真实世界技术工作。

    推荐理由:官方明确该模型专为 Codex 设计,结合前沿编码与通用推理以支持长周期技术工作。

2月4日周三
  1. OpenAI News65

    OpenAI 发布 Codex App Server 支持双向通信与工具调用

    OpenAI 推出 Codex App Server,这是一个基于 JSON-RPC 的双向通信服务器,旨在让客户端应用与 Codex agent 进行交互。该服务器支持流式响应、工具调用审批以及会话管理,允许开发者构建自定义界面来驱动 Codex agent 执行编程任务。通过这一组件,用户可以将 Codex 的能力嵌入到 IDE、Web 应用或其他工作流中,实现更灵活的代码生成与修改体验。

    推荐理由:官方披露了 Codex App Server 的架构细节,开发者可据此评估如何集成其双向通信与工具调用能力。

1月28日周三
  1. Mistral AI68

    Mistral 发布 Vibe 2.0 终端编码智能体及 Devstral 2 模型更新

    Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型家族驱动。新版本支持构建自定义子代理、执行前多选项澄清、通过斜杠命令加载技能以及统一代理模式,并包含自动更新功能。

    推荐理由:Mistral Vibe 2.0 引入自定义子代理和斜杠命令技能,配合 Devstral 2 模型升级,为终端原生编码提供了更灵活的工作流配置。

1月15日周四
  1. Hugging Face Blog78

    Hugging Face 推出开源推理标准 Open Responses

    Hugging Face 联合社区推出基于 Responses API 的开源推理标准 Open Responses,旨在替代 Chat Completion 格式以更好地支持智能体(Agent)工作流。

    推荐理由:原文详细说明了 Open Responses 如何扩展 Responses API 以支持智能体工作流,并提供了具体的迁移指南和代码示例。

12月17日周三
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3 Flash:兼顾前沿智能与速度

    Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。

    推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。

12月16日周二
  1. Hugging Face Blog65

    IBM Research 发布 CUGA 智能体并上线 Hugging Face Spaces 演示

    IBM Research 宣布其开源通用智能体框架 CUGA (Configurable Generalist Agent) 正式集成至 Hugging Face Spaces,并提供在线演示。

    推荐理由:IBM Research 将 CUGA 智能体集成至 Hugging Face Spaces,提供基于 gpt-oss-120b 的可视化演示及 Langflow 低代码支持,便于开发者快速评估其在复杂任务中的表现。

12月13日周六
12月11日周四
  1. Hugging Face Blog72

    Hugging Face 发布教程:使用 Codex 和 HF Skills 实现端到端开源模型训练

    Hugging Face 发布教程,指导用户通过 HF Skills 仓库配置 OpenAI Codex,使其能够自动完成大语言模型的微调、评估及发布全流程。该方案支持监督微调(SFT)、直接偏好优化(DPO)等生产级方法,Codex 可自动验证数据集格式、根据模型规模选择 GPU 硬件并提交任务至 Hugging Face Jobs。

    推荐理由:展示了如何通过 HF Skills 让 Codex 自动执行从数据验证、硬件选择到模型发布的全流程,为开发者提供了可复用的自动化训练工作流参考。

11月25日周二
  1. Hugging Face Blog60

    Tavily 分享构建 SOTA 深度研究智能体的技术经验

    Tavily 团队发布了关于构建 State-of-the-Art 深度研究智能体的技术复盘,介绍了其核心架构设计与工程原则。文章详细阐述了“上下文工程”策略,通过将工具输出蒸馏为反思而非直接传递原始数据,使 Token 消耗相比 Open Deep Research 降低了 66%,同时在 DeepResearch Bench 上取得了 SOTA 表现。

    推荐理由:Tavily 分享了构建深度研究智能体的工程经验,重点解析了通过上下文管理将 Token 消耗降低 66% 的具体方法。

11月19日周三
  1. Google Research82

    Google 推出 Generative UI:在 Gemini 和搜索中实现动态交互式界面

    Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。

    推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。

11月13日周四
  1. Google DeepMind65

    Google DeepMind 发布 SIMA 2:具备推理与自我学习能力的虚拟世界智能体

    Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。

    推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。

10月31日周五
10月30日周四
  1. Hugging Face Blog60

    MiniMax 解析 M2 智能体对齐:从基准测试到真实世界泛化

    MiniMax 团队发布博客阐述 MiniMax M2 在智能体后训练阶段的对齐经验,强调需同时兼顾开源基准表现与真实世界的鲁棒性。文章提出“交错思考”(Interleaved Thinking)机制以维持长程任务焦点并适应外部扰动,并指出真正的泛化源于对系统提示、环境及工具响应等全操作空间扰动的稳定性,而非仅靠增加工具数量。

    推荐理由:MiniMax 团队分享 M2 模型在智能体对齐中的核心洞察,指出泛化关键在于应对全轨迹扰动而非单纯工具扩展。