TRUSTBANK 利用 OpenAI 模型构建 Choice AI 以个性化推荐故乡税礼品
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型构建了名为 Choice AI 的系统。该工具通过个性化对话推荐简化了日本“故乡税”(Furusato Nozei)礼品的发现过程。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型构建了名为 Choice AI 的系统。该工具通过个性化对话推荐简化了日本“故乡税”(Furusato Nozei)礼品的发现过程。
Codex CLI 通过 Responses API 协调模型、工具与提示词,实现智能体循环。该机制详细说明了如何编排上述组件以优化性能表现。
Netomi 结合并发、治理和多步推理,利用 GPT-4.1 和 GPT-5.2 将 AI 智能体扩展至企业生产环境。该方案旨在实现可靠的工作流,展示了大语言模型在企业级应用中的规模化路径。
Google发布Gemini 3 Pro与Flash,前者在MathArena Apex达23.4% SOTA并登顶LMArena,后者以更低成本实现Pro级推理。开源模型Gemma 3增强多模态能力,Google Antigravity推动AI辅助软件开发。
OpenAI 利用基于强化学习的自动化红队测试,持续加固 ChatGPT Atlas 抵御提示注入攻击。该主动发现与修补循环旨在早期识别新型漏洞,并随着 AI 向智能体化演进,增强浏览器代理的防御能力。
Google Research 发布 2025 年成果,Gemini 3 在 SimpleQA Verified 和 FACTS 基准上实现 SOTA 事实性表现。开源模型 Gemma 支持超 140 种语言,成为最佳多语言开放模型;量子领域宣布“可验证量子优势”并推出 verifiable quantum echo 算法。
Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。
推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。
IBM Research 宣布其开源通用智能体框架 CUGA (Configurable Generalist Agent) 正式集成至 Hugging Face Spaces,并提供在线演示。
推荐理由:IBM Research 将 CUGA 智能体集成至 Hugging Face Spaces,提供基于 gpt-oss-120b 的可视化演示及 Langflow 低代码支持,便于开发者快速评估其在复杂任务中的表现。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio 模型,旨在优化实时语音代理的自然对话与复杂任务处理能力。
推荐理由:官方更新了 Gemini 2.5 Flash Native Audio 模型,显著提升了实时语音代理在复杂工作流处理、指令遵循及多轮对话中的表现。
Hugging Face 发布教程,指导用户通过 HF Skills 仓库配置 OpenAI Codex,使其能够自动完成大语言模型的微调、评估及发布全流程。该方案支持监督微调(SFT)、直接偏好优化(DPO)等生产级方法,Codex 可自动验证数据集格式、根据模型规模选择 GPU 硬件并提交任务至 Hugging Face Jobs。
推荐理由:展示了如何通过 HF Skills 让 Codex 自动执行从数据验证、硬件选择到模型发布的全流程,为开发者提供了可复用的自动化训练工作流参考。
Google DeepMind 宣布深化与英国政府的合作,重点加速 AI 在科学发现、教育现代化及国家安全领域的落地。双方将提供 AlphaEvolve、AlphaGenome 等前沿模型优先访问权,并于 2026 年在英国建立首个全自动材料科学实验室。
Intel AI Software Group 推出 DeepMath,这是一个基于 Qwen3-4B Thinking 并通过 GRPO 微调的轻量级数学推理智能体。该模型利用 smolagents 库生成简短 Python 代码片段并在沙箱中执行,将输出长度减少高达 66% 的同时提升准确率。
Tavily 团队发布了关于构建 State-of-the-Art 深度研究智能体的技术复盘,介绍了其核心架构设计与工程原则。文章详细阐述了“上下文工程”策略,通过将工具输出蒸馏为反思而非直接传递原始数据,使 Token 消耗相比 Open Deep Research 降低了 66%,同时在 DeepResearch Bench 上取得了 SOTA 表现。
推荐理由:Tavily 分享了构建深度研究智能体的工程经验,重点解析了通过上下文管理将 Token 消耗降低 66% 的具体方法。
Google DeepMind 宣布支持白宫发起的 Genesis Mission,旨在通过 AI 技术变革科学研究方式并加速美国科学创新。该计划将动员美国能源部下属的 17 个国家实验室、工业界和学术界共同构建集成发现平台。
OpenAI 发布 GPT-5.1-Codex-Max,这是一款专为 Codex 设计的更快、更智能的智能体编码模型。该模型针对长时间运行和项目级工作进行了优化,具备增强的推理能力和更高的 token 效率。
Google DeepMind 正式发布 Gemini 3 Pro,该模型在 Terminal-Bench 2.0 上得分 54.2%,并在 WebDev Arena 中以 1487 Elo 登顶。
推荐理由:原文给出了 Gemini 3 Pro 在智能体编程和多模态推理上的基准表现,以及配套的 Antigravity 平台和 API 定价细节。
Google DeepMind 正式发布 Gemini 3 系列模型,其中 Gemini 3 Pro 已在 Google 搜索、Gemini App 及开发者平台上线。
推荐理由:原文披露了 Gemini 3 Pro 在多项基准测试中的具体分数及 Deep Think 模式的性能提升,并介绍了配套的 Antigravity 开发平台,为评估其实际能力边界提供了量化依据。
Google DeepMind 推出名为 Google Antigravity 的新智能体开发平台,旨在将 IDE 演变为支持浏览器控制和异步交互的 agent-first 环境。
推荐理由:原文详细阐述了从同步 IDE 向异步 Agent-first 平台演进的产品形态,为开发者提供了评估下一代智能体编程工具的具体维度。
Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。
推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。
Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。
推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。
Google Research 发布 DS-STAR,通过文件分析、LLM 验证及迭代规划解决复杂数据科学任务。该智能体在 DABStep 基准测试中将准确率从 41.0% 提升至 45.2%,并在 KramaBench 和 DA-Code 上超越 AutoGen 等现有方法。
Berkeley AI Research 团队提出一种不依赖时序差分(TD)学习的强化新范式,利用“分而治之”策略解决长视野任务中的误差累积难题。该算法在目标条件 RL 中首次实现规模化应用,通过递归分割轨迹将 Bellman 更新次数降至对数级,无需调节 n-step 超参数即可提升 off-policy RL 的可扩展性。
Google Research 在 Research@ 活动中发布了多项最新研究突破,包括 Google Earth AI、DeepSomatic 和 Quantum Echoes。
推荐理由:原文汇总了地球AI、基因组学和量子计算领域的最新突破,展示了从基础模型到实际应用的完整闭环。
MiniMax 团队发布博客阐述 MiniMax M2 在智能体后训练阶段的对齐经验,强调需同时兼顾开源基准表现与真实世界的鲁棒性。文章提出“交错思考”(Interleaved Thinking)机制以维持长程任务焦点并适应外部扰动,并指出真正的泛化源于对系统提示、环境及工具响应等全操作空间扰动的稳定性,而非仅靠增加工具数量。
推荐理由:MiniMax 团队分享 M2 模型在智能体对齐中的核心洞察,指出泛化关键在于应对全轨迹扰动而非单纯工具扩展。
Google 宣布在 Fitbit 应用中推出由 Gemini 模型驱动的个人健康教练公开预览版,面向美国地区符合条件的 Android 用户开放,iOS 版本即将跟进。
推荐理由:原文披露了基于 Gemini 的多智能体架构与 SHARP 评估框架,展示了健康教练从通用建议向个性化数据驱动转型的技术路径。
Mistral AI 发布 Mistral AI Studio,旨在解决企业 AI 从原型到生产的落地瓶颈。该平台基于 Temporal 构建 Agent Runtime,提供可观测性、AI Registry 及治理功能,支持混合云部署与私有数据微调。
Consensus 采用 GPT-5 和 OpenAI Responses API 构建多智能体研究助手,可在几分钟内完成证据阅读、分析与综合。该工具已服务超 800 万研究人员,显著加速科学发现进程。
Google Earth AI 推出新的图像和人口基础模型及基于 Gemini 的地理空间推理智能体,旨在通过跨模态推理解决复杂的行星尺度问题。新模型在多个公开地球观测基准上达到 SOTA,其中文本图像搜索平均提升超 16%,零样本目标检测准确率翻倍。
推荐理由:原文展示了基础模型与智能体协同在复杂地理空间推理中的性能提升,为开发者提供了评估其解决现实世界问题能力的具体基准。
Meta和Hugging Face宣布合作推出OpenEnv Hub,这是一个用于构建、共享和探索智能体环境的开放社区中心。该Hub旨在解决大语言模型缺乏安全工具访问的问题,通过定义包含工具、API和执行上下文的沙盒环境,支持强化学习训练与部署。
推荐理由:Meta与Hugging Face联合推出OpenEnv Hub,为智能体提供标准化的训练与部署环境,开发者可据此构建兼容的RL基础设施。
OpenAI 推出名为 ChatGPT Atlas 的浏览器,该浏览器内置了 ChatGPT 功能。目前该产品已被弃用。
HiBob 借助 ChatGPT Enterprise 和自定义 GPTs,将 2,500 个 GPTs 转化为产品功能并促进团队增长。该方案旨在扩大 AI 采用率、提升营收并简化 HR 工作流程,最终在 Bob 平台中交付由 AI 驱动的功能。
OpenAI 推出 AgentKit、扩展的评估(Evals)功能以及面向智能体的强化微调(RFT)。这些新工具旨在帮助开发者加速从原型到生产环境的部署流程。
Hugging Face 在 Intel® Core™ Ultra 上通过 OpenVINO.GenAI 实现 Qwen3-8B 推理加速,结合投机解码与深度剪枝技术将速度提升约 1.4×。该方法使用剪枝后的 Qwen3-0.6B 作为草稿模型,配合 🤗 smolagents 框架支持本地 AI Agent 高效运行工具调用与多步推理任务。
Hugging Face 推出 Smol2Operator 项目,展示如何将 SmolVLM2-2.2B-Instruct 从零基础转化为具备 GUI 操作能力的智能体。
推荐理由:展示了如何通过两阶段微调将无 GUI 能力的轻量级 VLM 转化为具备推理能力的智能体,并开源了完整训练配方和数据集。
Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。
推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。
Hugging Face 推出 Jupyter Agent 项目,旨在通过构建高质量训练数据和优化代理脚手架,提升小型语言模型在数据科学任务中的表现。团队利用 Kaggle Notebook 数据集经过多阶段清洗和合成生成约 51k 条轨迹,对 Qwen3-4B 进行全参数微调,使其在 DABStep 基准测试的简单任务上准确率提升至 75%。
推荐理由:原文公开了从数据清洗到微调的完整流水线及代码,展示了小模型在特定脚手架下性能提升的具体路径。
Mistral AI 为 Le Chat 推出包含 20+ 安全连接器的目录及自定义 MCP 扩展能力,并上线记忆(Memories)功能以保留用户偏好和事实上下文。
推荐理由:官方发布了支持自定义 MCP 连接器和记忆功能的 Le Chat 更新,提供了企业级工具集成与个性化上下文管理的入口。
Hugging Face 推出 Research Tracker MCP,允许 AI 智能体通过自然语言指令自动连接 arXiv、GitHub 和 Hugging Face 等研究平台。该工具将 Python 脚本封装为 MCP 服务,支持 Claude Desktop、Cursor 等客户端一键配置,实现跨平台论文检索与代码关联的自动化。
Hugging Face 发布基于 25 款 Infocom 经典游戏的 TextQuests 基准,测试 LLM 作为自主智能体的长上下文推理与探索学习能力。评测显示,当上下文超过 100K tokens 时,前沿模型常出现幻觉、动作重复及空间导航失败(如 Zork I 迷宫),难以有效构建心理地图。
Basis 构建的 AI 智能体基于 OpenAI o3、o3-Pro、GPT-4.1 和 GPT-5,帮助会计师事务所节省高达 30% 的时间。这一方案通过自动化流程释放资源,使事务所能够扩展咨询与增长能力。