Mirakl 借助 ChatGPT Enterprise 推进智能体商务愿景
Mirakl 利用 AI 智能体和 ChatGPT Enterprise 重新定义商务,实现了更快的文档处理与更智能的客户支持。该公司正通过构建 Mirakl Nexus 平台,向原生智能体商务(agent-native commerce)迈进。
Mirakl 利用 AI 智能体和 ChatGPT Enterprise 重新定义商务,实现了更快的文档处理与更智能的客户支持。该公司正通过构建 Mirakl Nexus 平台,向原生智能体商务(agent-native commerce)迈进。
Accenture 与 OpenAI 达成合作,旨在帮助企业将 agentic AI 能力融入核心业务。该合作致力于解锁新的增长水平,推动企业级人工智能的成功落地。
Tavily 团队发布了关于构建 State-of-the-Art 深度研究智能体的技术复盘,介绍了其核心架构设计与工程原则。文章详细阐述了“上下文工程”策略,通过将工具输出蒸馏为反思而非直接传递原始数据,使 Token 消耗相比 Open Deep Research 降低了 66%,同时在 DeepResearch Bench 上取得了 SOTA 表现。
推荐理由:Tavily 分享了构建深度研究智能体的工程经验,重点解析了通过上下文管理将 Token 消耗降低 66% 的具体方法。
Google DeepMind 宣布支持白宫发起的 Genesis Mission,旨在通过 AI 技术变革科学研究方式并加速美国科学创新。该计划将动员美国能源部下属的 17 个国家实验室、工业界和学术界共同构建集成发现平台。
OpenAI 发布 GPT-5.1-Codex-Max,这是一款专为 Codex 设计的更快、更智能的智能体编码模型。该模型针对长时间运行和项目级工作进行了优化,具备增强的推理能力和更高的 token 效率。
Google DeepMind 正式发布 Gemini 3 Pro,该模型在 Terminal-Bench 2.0 上得分 54.2%,并在 WebDev Arena 中以 1487 Elo 登顶。
推荐理由:原文给出了 Gemini 3 Pro 在智能体编程和多模态推理上的基准表现,以及配套的 Antigravity 平台和 API 定价细节。
Google DeepMind 正式发布 Gemini 3 系列模型,其中 Gemini 3 Pro 已在 Google 搜索、Gemini App 及开发者平台上线。
推荐理由:原文披露了 Gemini 3 Pro 在多项基准测试中的具体分数及 Deep Think 模式的性能提升,并介绍了配套的 Antigravity 开发平台,为评估其实际能力边界提供了量化依据。
Google DeepMind 推出名为 Google Antigravity 的新智能体开发平台,旨在将 IDE 演变为支持浏览器控制和异步交互的 agent-first 环境。
推荐理由:原文详细阐述了从同步 IDE 向异步 Agent-first 平台演进的产品形态,为开发者提供了评估下一代智能体编程工具的具体维度。
Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。
推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。
Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。
推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。
Google Research 发布 DS-STAR,通过文件分析、LLM 验证及迭代规划解决复杂数据科学任务。该智能体在 DABStep 基准测试中将准确率从 41.0% 提升至 45.2%,并在 KramaBench 和 DA-Code 上超越 AutoGen 等现有方法。
Chime CMO Vineet Mehra 指出,AI 正将营销重塑为智能体驱动模式。他强调,优先考虑 AI 素养和审慎采用的领导者将推动业务增长。
Berkeley AI Research 团队提出一种不依赖时序差分(TD)学习的强化新范式,利用“分而治之”策略解决长视野任务中的误差累积难题。该算法在目标条件 RL 中首次实现规模化应用,通过递归分割轨迹将 Bellman 更新次数降至对数级,无需调节 n-step 超参数即可提升 off-policy RL 的可扩展性。
Google Research 在 Research@ 活动中发布了多项最新研究突破,包括 Google Earth AI、DeepSomatic 和 Quantum Echoes。
推荐理由:原文汇总了地球AI、基因组学和量子计算领域的最新突破,展示了从基础模型到实际应用的完整闭环。
OpenAI 发布名为 Aardvark 的 AI 智能体安全研究员,可自主大规模发现、验证并协助修复软件漏洞。该系统目前处于私有测试阶段,用户需注册以参与早期测试。
MiniMax 团队发布博客阐述 MiniMax M2 在智能体后训练阶段的对齐经验,强调需同时兼顾开源基准表现与真实世界的鲁棒性。文章提出“交错思考”(Interleaved Thinking)机制以维持长程任务焦点并适应外部扰动,并指出真正的泛化源于对系统提示、环境及工具响应等全操作空间扰动的稳定性,而非仅靠增加工具数量。
推荐理由:MiniMax 团队分享 M2 模型在智能体对齐中的核心洞察,指出泛化关键在于应对全轨迹扰动而非单纯工具扩展。
OpenAI 公布 ChatGPT Atlas 浏览器新架构 OWL,通过解耦 Chromium 实现快速启动、丰富 UI 及智能体浏览功能。该架构专为基于 ChatGPT 的浏览器设计,旨在提升性能与交互体验。
Google 宣布在 Fitbit 应用中推出由 Gemini 模型驱动的个人健康教练公开预览版,面向美国地区符合条件的 Android 用户开放,iOS 版本即将跟进。
推荐理由:原文披露了基于 Gemini 的多智能体架构与 SHARP 评估框架,展示了健康教练从通用建议向个性化数据驱动转型的技术路径。
Mistral AI 发布 Mistral AI Studio,旨在解决企业 AI 从原型到生产的落地瓶颈。该平台基于 Temporal 构建 Agent Runtime,提供可观测性、AI Registry 及治理功能,支持混合云部署与私有数据微调。
Consensus 采用 GPT-5 和 OpenAI Responses API 构建多智能体研究助手,可在几分钟内完成证据阅读、分析与综合。该工具已服务超 800 万研究人员,显著加速科学发现进程。
Google Earth AI 推出新的图像和人口基础模型及基于 Gemini 的地理空间推理智能体,旨在通过跨模态推理解决复杂的行星尺度问题。新模型在多个公开地球观测基准上达到 SOTA,其中文本图像搜索平均提升超 16%,零样本目标检测准确率翻倍。
推荐理由:原文展示了基础模型与智能体协同在复杂地理空间推理中的性能提升,为开发者提供了评估其解决现实世界问题能力的具体基准。
Meta和Hugging Face宣布合作推出OpenEnv Hub,这是一个用于构建、共享和探索智能体环境的开放社区中心。该Hub旨在解决大语言模型缺乏安全工具访问的问题,通过定义包含工具、API和执行上下文的沙盒环境,支持强化学习训练与部署。
推荐理由:Meta与Hugging Face联合推出OpenEnv Hub,为智能体提供标准化的训练与部署环境,开发者可据此构建兼容的RL基础设施。
OpenAI 推出名为 ChatGPT Atlas 的浏览器,该浏览器内置了 ChatGPT 功能。目前该产品已被弃用。
HiBob 借助 ChatGPT Enterprise 和自定义 GPTs,将 2,500 个 GPTs 转化为产品功能并促进团队增长。该方案旨在扩大 AI 采用率、提升营收并简化 HR 工作流程,最终在 Bob 平台中交付由 AI 驱动的功能。
OpenAI 推出 AgentKit、扩展的评估(Evals)功能以及面向智能体的强化微调(RFT)。这些新工具旨在帮助开发者加速从原型到生产环境的部署流程。
OpenAI 构建了内部 AI 销售助手,用于自动化账户研究、会议准备、产品知识检索及客户跟进。该工具旨在提升销售团队的生产力与客户成功表现。
OpenAI 的研究助手帮助团队分析数百万张支持工单,从而更快地发现洞察并在公司内部扩展好奇心。该工具旨在提升数据处理效率,支持大规模信息挖掘与知识共享。
OpenAI 使用内部 AI 销售助手筛选 inbound leads、个性化回复并协助销售团队转化客户兴趣。该工具旨在通过自动化流程提升从潜在客户到正式客户的转化率,优化销售效率。
OpenAI 构建了一套系统以快速提取合同数据,从而缩短处理周期并简化团队对细节的访问。该方案旨在提升内部文档检索效率,使相关人员能更便捷地获取所需信息。
Hugging Face 在 Intel® Core™ Ultra 上通过 OpenVINO.GenAI 实现 Qwen3-8B 推理加速,结合投机解码与深度剪枝技术将速度提升约 1.4×。该方法使用剪枝后的 Qwen3-0.6B 作为草稿模型,配合 🤗 smolagents 框架支持本地 AI Agent 高效运行工具调用与多步推理任务。
ChatGPT 推出新的共享项目、更智能的连接器以及合规与安全更新。这些功能旨在帮助团队更高效地协作,并更好地集成外部工具以提升工作效率。
OpenAI 面向移动端 Pro 用户发布 ChatGPT Pulse 预览版。该功能让 ChatGPT 主动开展研究,并依据用户的聊天记录、反馈及日历等已连接应用提供个性化更新。
Hugging Face 推出 Smol2Operator 项目,展示如何将 SmolVLM2-2.2B-Instruct 从零基础转化为具备 GUI 操作能力的智能体。
推荐理由:展示了如何通过两阶段微调将无 GUI 能力的轻量级 VLM 转化为具备推理能力的智能体,并开源了完整训练配方和数据集。
Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。
推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。
Hugging Face 推出 Jupyter Agent 项目,旨在通过构建高质量训练数据和优化代理脚手架,提升小型语言模型在数据科学任务中的表现。团队利用 Kaggle Notebook 数据集经过多阶段清洗和合成生成约 51k 条轨迹,对 Qwen3-4B 进行全参数微调,使其在 DABStep 基准测试的简单任务上准确率提升至 75%。
推荐理由:原文公开了从数据清洗到微调的完整流水线及代码,展示了小模型在特定脚手架下性能提升的具体路径。
Mistral AI 为 Le Chat 推出包含 20+ 安全连接器的目录及自定义 MCP 扩展能力,并上线记忆(Memories)功能以保留用户偏好和事实上下文。
推荐理由:官方发布了支持自定义 MCP 连接器和记忆功能的 Le Chat 更新,提供了企业级工具集成与个性化上下文管理的入口。
Hugging Face 推出 Research Tracker MCP,允许 AI 智能体通过自然语言指令自动连接 arXiv、GitHub 和 Hugging Face 等研究平台。该工具将 Python 脚本封装为 MCP 服务,支持 Claude Desktop、Cursor 等客户端一键配置,实现跨平台论文检索与代码关联的自动化。
Hugging Face 发布基于 25 款 Infocom 经典游戏的 TextQuests 基准,测试 LLM 作为自主智能体的长上下文推理与探索学习能力。评测显示,当上下文超过 100K tokens 时,前沿模型常出现幻觉、动作重复及空间导航失败(如 Zork I 迷宫),难以有效构建心理地图。
Basis 构建的 AI 智能体基于 OpenAI o3、o3-Pro、GPT-4.1 和 GPT-5,帮助会计师事务所节省高达 30% 的时间。这一方案通过自动化流程释放资源,使事务所能够扩展咨询与增长能力。
OpenAI 发布了名为 GPT OSS 的开源权重模型家族,包含 gpt-oss-120b 和 gpt-oss-20b 两个混合专家(MoE)模型,均采用 MXFP4 量化并遵循 Apache 2.0 许可证。
推荐理由:原文详细说明了 GPT OSS 的架构特性、量化方案及在主流框架下的本地部署与微调方法,为开发者提供了从云端 API 到端侧运行的完整技术路径。