Gemini 3.5 Flash 原生集成计算机使用功能
Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。
推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。
推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。
Mistral AI 正式发布 Mistral OCR 4,这是一款专注于文档解析的小模型,在提取文本的同时返回边界框、块类型分类(如标题、表格、公式)以及内联置信度分数。
推荐理由:Mistral OCR 4 引入边界框和块分类等结构化输出,支持单容器自托管,为 RAG 和企业搜索提供高精度多语言文档解析方案。
Hugging Face 介绍了如何使用 Gemma 和 Qwen 等本地模型结合 Pi Agent 框架,对 OpenClaw 仓库的海量 Issue 和 PR 进行实时分类与通知。该方案通过受限 Shell 确保安全性,并在 NVIDIA GB10 硬件上实现了高并发推理,相比云端 API 具有成本优势且响应更快。
推荐理由:展示了在本地硬件上利用 Agent 框架实现高吞吐开源仓库自动分诊的完整工程方案与评测数据。
Hugging Face 联合 ServiceNow 等机构发布 MosaicLeaks 基准,揭示深度研究智能体在多跳检索中因“马赛克效应”导致私有信息通过 Web 查询日志泄露的风险。
推荐理由:提出MosaicLeaks基准与PA-DR训练法,量化智能体查询隐私泄露风险并给出兼顾任务性能与隐私保护的RL方案。
Hugging Face 推出名为 `agent-eval` 的基准测试工具,用于衡量编码智能体使用特定软件(如 transformers)完成任务时的效率与成本,而不仅关注最终答案的正确性。该工具通过对比不同模型、代码版本及上下文层级(bare/clone/skill),发现为大型开放模型引入 CLI 和 Skill 能显著减少耗时,但可能导致小型模型因误解文档或读取过多源码而性能下降甚至失败。
推荐理由:原文提供了评估代码库对智能体友好程度的具体方法,揭示了同一工具改进对不同规模模型产生的相反影响。
AWS 开源 SDK Strands Robots 集成了 Hugging Face LeRobot 栈,允许开发者通过单个 Agent 循环完成从 Hub 数据集记录、策略训练到物理机器人部署的全流程。
推荐理由:原文提供了从 Hub 数据集到物理机器人的完整代码示例,展示了如何用单一 Agent 循环统一仿真与硬件部署流程。
Hugging Face 发布了 Agentic Resource Discovery (ARD) 规范的参考实现 Discover Tool,旨在解决智能体在运行时动态发现和集成 MCP、Skills 等能力的痛点。
推荐理由:文章详解了ARD规范如何解决智能体能力发现难题,并提供了基于Hugging Face Discover Tool的具体实现与代码示例。
Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI 智能体的纵深防御框架,旨在应对模型对齐不完美时的安全风险。该框架借鉴 MITRE ATT&CK 标准,将未受信任的智能体视为潜在内部威胁,通过实时行为监控和分级响应机制来检测与阻止异常操作。
推荐理由:原文提出了将内部 AI 智能体视为潜在内部威胁的防御框架,并公开了基于百万条轨迹分析的监控实践细节。
作者演示了编码智能体如何通过读取 Gradio Space 暴露的 `agents.md` 文件,自动调用 `ideogram-ai/ideogram4` 生成图像并串联 `VAST-AI/TripoSplat` 进行 3D Gaussian splat 重建,最终部署为静态 Space。
推荐理由:展示了利用 agents.md 让智能体自动串联图像生成与3D重建Space的完整流程,为构建多媒体应用提供了可复用的集成方法。
Hugging Face 宣布 OpenEnv 项目正式由包括 Meta-PyTorch、Nvidia、Microsoft 等在内的委员会共同协调治理,代码库迁移至 huggingface/OpenEnv。
推荐理由:OpenEnv 升级为社区治理的 RL 环境互操作层,明确了协议定位与 MCP 兼容性,为开源智能体训练提供了标准化基础设施。
Google Research 在 Gemini Enterprise Agent Platform 中推出了由 Agentic RAG 驱动的跨语料检索功能,旨在解决传统单步 RAG 在处理多源、多跳商业查询时的局限性。
推荐理由:原文介绍了 Gemini Enterprise Agent Platform 中 Agentic RAG 的架构设计与实验数据,读者可了解其如何通过多智能体协作与充分上下文检查提升复杂查询的准确性。
Hugging Face 重构了官方命令行工具 hf,使其同时适配人类用户和编码智能体(如 Claude Code、Codex)。通过自动检测环境变量,CLI 为智能体提供无 ANSI 码、不截断的 TSV 结构化输出,并引入下一步命令提示和非阻塞重试机制。
推荐理由:官方展示了针对智能体优化的CLI设计细节与基准测试数据,揭示了在复杂多步任务中相比原生SDK能显著降低Token消耗并提升成功率。
Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。
推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。
Google Research 在 I/O 2026 上发布了多项基于最新模型的研究成果和产品更新,重点推出了用于加速科学发现的 Gemini for Science 套件以及提升开发者效率的 Agentic 开发平台 Google Antigravity 2.0。
推荐理由:原文展示了从科学发现到开发者效率的全栈 AI 工具链,读者可据此了解 Google 如何将前沿研究转化为具体的生产力应用。
Mistral 正式推出统一 AI 智能体 Vibe,取代原有的 Le Chat,旨在同时处理长周期办公任务和复杂编程工作。Vibe 分为 Work Mode 和 Code Mode,前者支持跨企业工具的多步任务执行、结构化数据分析及文档生成,后者提供基于 Web 和 VS Code 扩展的远程编码代理,能自动完成从功能开发到合并 Pull Request 的全流程。
推荐理由:Mistral 将 Le Chat 升级为统一智能体 Vibe,整合了办公与编程场景,提供了从多步任务规划到远程代码会话的完整工作流。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 参数的稠密开源权重模型,支持 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:Mistral 推出 Medium 3.5 并同步上线云端异步代理,展示了从本地终端向并行化、长周期智能体工作流的架构演进。
Google Research 发布基于 Gemini 的 Empirical Research Assistance (ERA) 工具,该工具能自动编写和优化科学代码以加速计算实验,其成果已发表于 Nature。
推荐理由:原文展示了ERA在流行病学、气候监测等真实科学问题中的专家级表现,并宣布Computational Discovery工具开始逐步开放。
Google DeepMind 正式推出 Gemini for Science,这是一套旨在扩展科学探索规模与精度的工具集合。该计划包含 Google Labs 上的三个实验性原型:基于 Co-Scientist 的假设生成、结合 AlphaEvolve 和 ERA 的计算发现,以及利用 NotebookLM 实现的文献洞察。
推荐理由:Google DeepMind 推出 Gemini for Science,包含三个实验性工具和科学技能包,旨在通过 AI 智能体加速科学研究的核心步骤。
Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。
推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。
Google DeepMind 发布基于 Gemini 的多智能体系统 Co-Scientist,旨在加速科学研究假设的生成与验证。该系统通过生成、辩论和进化三个阶段协同工作,已在肝纤维化、ALS 等研究中展示应用潜力,并计划通过 Hypothesis Generation 工具向研究人员开放。
推荐理由:原文展示了多智能体系统在假设生成中的具体分工与实测案例,读者可据此评估其辅助科研的实际效能。