跳到正文

#Agent

今日 4 条
12月2日周二
12月1日周一
11月25日周二
  1. Hugging Face Blog60

    Tavily 分享构建 SOTA 深度研究智能体的技术经验

    Tavily 团队发布了关于构建 State-of-the-Art 深度研究智能体的技术复盘,介绍了其核心架构设计与工程原则。文章详细阐述了“上下文工程”策略,通过将工具输出蒸馏为反思而非直接传递原始数据,使 Token 消耗相比 Open Deep Research 降低了 66%,同时在 DeepResearch Bench 上取得了 SOTA 表现。

    推荐理由:Tavily 分享了构建深度研究智能体的工程经验,重点解析了通过上下文管理将 Token 消耗降低 66% 的具体方法。

11月24日周一
11月19日周三
  1. Google Research82

    Google 推出 Generative UI:在 Gemini 和搜索中实现动态交互式界面

    Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。

    推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。

11月13日周四
  1. Google DeepMind65

    Google DeepMind 发布 SIMA 2:具备推理与自我学习能力的虚拟世界智能体

    Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。

    推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。

11月7日周五
11月5日周三
11月1日周六
  1. Berkeley AI Research37

    Berkeley AI Research 提出基于分治策略的无 TD 学习强化学习算法

    Berkeley AI Research 团队提出一种不依赖时序差分(TD)学习的强化新范式,利用“分而治之”策略解决长视野任务中的误差累积难题。该算法在目标条件 RL 中首次实现规模化应用,通过递归分割轨迹将 Bellman 更新次数降至对数级,无需调节 n-step 超参数即可提升 off-policy RL 的可扩展性。

10月31日周五
10月30日周四
  1. Hugging Face Blog60

    MiniMax 解析 M2 智能体对齐:从基准测试到真实世界泛化

    MiniMax 团队发布博客阐述 MiniMax M2 在智能体后训练阶段的对齐经验,强调需同时兼顾开源基准表现与真实世界的鲁棒性。文章提出“交错思考”(Interleaved Thinking)机制以维持长程任务焦点并适应外部扰动,并指出真正的泛化源于对系统提示、环境及工具响应等全操作空间扰动的稳定性,而非仅靠增加工具数量。

    推荐理由:MiniMax 团队分享 M2 模型在智能体对齐中的核心洞察,指出泛化关键在于应对全轨迹扰动而非单纯工具扩展。

10月28日周二
10月24日周五
10月23日周四
  1. Google Research68

    Google Earth AI 发布新基础模型与地理空间推理智能体

    Google Earth AI 推出新的图像和人口基础模型及基于 Gemini 的地理空间推理智能体,旨在通过跨模态推理解决复杂的行星尺度问题。新模型在多个公开地球观测基准上达到 SOTA,其中文本图像搜索平均提升超 16%,零样本目标检测准确率翻倍。

    推荐理由:原文展示了基础模型与智能体协同在复杂地理空间推理中的性能提升,为开发者提供了评估其解决现实世界问题能力的具体基准。

  2. Hugging Face Blog83

    Meta与Hugging Face联合发布OpenEnv Hub及0.1规范

    Meta和Hugging Face宣布合作推出OpenEnv Hub,这是一个用于构建、共享和探索智能体环境的开放社区中心。该Hub旨在解决大语言模型缺乏安全工具访问的问题,通过定义包含工具、API和执行上下文的沙盒环境,支持强化学习训练与部署。

    推荐理由:Meta与Hugging Face联合推出OpenEnv Hub,为智能体提供标准化的训练与部署环境,开发者可据此构建兼容的RL基础设施。

10月21日周二
10月8日周三
10月6日周一
9月29日周一
9月25日周四
9月23日周二
9月22日周一
  1. Hugging Face Blog68

    Hugging Face 发布 Gaia2 智能体基准与 ARE 开源框架

    Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。

    推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。

9月10日周三
  1. Hugging Face Blog68

    Hugging Face 发布 Jupyter Agent:通过合成数据与简化脚手架增强小模型数据分析能力

    Hugging Face 推出 Jupyter Agent 项目,旨在通过构建高质量训练数据和优化代理脚手架,提升小型语言模型在数据科学任务中的表现。团队利用 Kaggle Notebook 数据集经过多阶段清洗和合成生成约 51k 条轨迹,对 Qwen3-4B 进行全参数微调,使其在 DABStep 基准测试的简单任务上准确率提升至 75%。

    推荐理由:原文公开了从数据清洗到微调的完整流水线及代码,展示了小模型在特定脚手架下性能提升的具体路径。

9月2日周二
8月18日周一
8月12日周二
8月5日周二
  1. Hugging Face Blog98

    Hugging Face 欢迎 OpenAI 开源 GPT OSS 模型家族

    OpenAI 发布了名为 GPT OSS 的开源权重模型家族,包含 gpt-oss-120b 和 gpt-oss-20b 两个混合专家(MoE)模型,均采用 MXFP4 量化并遵循 Apache 2.0 许可证。

    推荐理由:原文详细说明了 GPT OSS 的架构特性、量化方案及在主流框架下的本地部署与微调方法,为开发者提供了从云端 API 到端侧运行的完整技术路径。