Hugging Face 梳理 AI Agent 术语:区分 Harness、Scaffold 与 Model
Hugging Face 发布术语指南,明确界定 AI Agent 中 Model、Scaffold 和 Harness 的区别。Model 指 LLM 本体,Scaffold 定义行为层(如系统提示词),Harness 负责执行循环与工具调用。该分类旨在澄清 Claude Code、Codex 等工具中的概念混淆,提供构建智能体的实用心智模型。
Hugging Face 发布术语指南,明确界定 AI Agent 中 Model、Scaffold 和 Harness 的区别。Model 指 LLM 本体,Scaffold 定义行为层(如系统提示词),Harness 负责执行循环与工具调用。该分类旨在澄清 Claude Code、Codex 等工具中的概念混淆,提供构建智能体的实用心智模型。
新研究显示,400 万美国人正利用 ChatGPT 启动、运营和扩展小型企业。这一趋势通过 AI 技术显著降低了创业成本,使 ChatGPT 逐渐扮演起小企业“首位员工”的关键角色。
Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其作为工业企业 AI 转型合作伙伴的地位。此次收购将整合 Emmi AI 在大型工程模型和实时仿真方面的专长,加速 Mistral 的科学路线图及面向工程师的智能体开发。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 参数的稠密开源权重模型,支持 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:Mistral 推出 Medium 3.5 并同步上线云端异步代理,展示了从本地终端向并行化、长周期智能体工作流的架构演进。
Mistral AI 在 Studio 中推出 Connectors 功能,允许开发者通过 API/SDK 使用内置连接器和自定义 MCP 来构建基于企业数据的 AI 应用。该更新引入了直接工具调用和人工审批流程,使连接器能在 LeChat 和 AI Studio 等应用中集中注册并复用,简化了 OAuth 认证和集成维护工作。
OpenAI 被 Gartner 评为 2026 年《企业 AI 编码智能体魔力象限》的领导者。其 Codex 产品因创新能力和企业级部署表现获得认可。
Virgin Atlantic 使用 Codex 在固定假期截止日前完成移动应用改版,实现近乎完整的单元测试覆盖且零 P1 缺陷。
Google DeepMind 在亚太地区启动首届“AI for the Planet”加速器项目,旨在利用前沿 AI 解决气候、农业及能源等环境风险。该为期三个月的项目面向初创公司、研究团队和非营利组织,提供专家指导并协助集成 Google 的前沿 AI 与科学模型。项目将以新加坡线下训练营为起点,目前开放注册。
AdventHealth 采用 OpenAI 的 ChatGPT for Healthcare 简化工作流程,减轻行政负担。此举旨在将更多时间回归患者护理,提升整体照护效率。
OpenAI 宣布其模型成功证伪了一个长期存在的离散几何猜想。这一成果标志着 AI 在解决复杂数学问题方面取得了实质性进展。
推荐理由:OpenAI 官方宣布其模型在数学领域取得突破,解决了长期存在的离散几何猜想,展示了 AI 在前沿科学研究中的潜在能力。
Ramp 工程师利用 Codex 结合 GPT-5.5 进行代码审查,将获取实质性反馈的时间从数小时缩短至几分钟。这一工作流显著提升了代码改进与发布的效率。
OpenAI 推进其“Education for Countries”计划的下一阶段,旨在通过新合作、教师培训及工具扩大学校在人工智能领域的应用。该举措致力于改善全球学习成果,标志着 OpenAI 在教育科技领域的进一步布局。
OpenAI 正式推出“OpenAI for Singapore”计划,启动一项多年期 AI 合作伙伴关系。该计划旨在扩大 AI 部署规模,培养本地人才,并支持新加坡的企业及公共服务部门应用人工智能技术。
Hugging Face 推出 OlmoEarth v1.1 地球观测模型家族,通过优化 Transformer token 序列长度,将计算成本降低至上一代的三分之一。该版本在保持与 OlmoEarth v1 相当性能的同时,显著提升了推理效率,支持 Base、Tiny 和 Nano 三种规格,使大规模卫星影像处理更经济高效。
Google Research 发布基于 Gemini 的 Empirical Research Assistance (ERA) 工具,该工具能自动编写和优化科学代码以加速计算实验,其成果已发表于 Nature。
推荐理由:原文展示了ERA在流行病学、气候监测等真实科学问题中的专家级表现,并宣布Computational Discovery工具开始逐步开放。
OpenAI 通过 Content Credentials、SynthID 和验证工具推进 AI 内容溯源,旨在帮助用户识别并信任 AI 生成媒体。该举措聚焦于构建更安全、透明的 AI 生态系统,提供具体的技术手段以增强对生成内容的可追溯性。
Hugging Face 发布了基于 ModernBERT 的 Ettin Reranker 系列共六个 CrossEncoder 重排器,参数量从 17M 到 1B。
推荐理由:原文给出了六个尺寸的重排器及其训练配方,读者可以据此评估其在检索管线中的性能与部署成本。
Google DeepMind 的 Co-Scientist 协助生物学家筛选出20多个可能逆转细胞衰老的新型遗传因子,实验室验证显示其推荐因子能成功将细胞推向更年轻状态。该工具通过分析大规模基因筛查数据并结合文献,将原本需6个月的数据解读工作缩短至几天,显著提升了抗衰老研究效率。
PaddleOCR 3.5 引入灵活推理引擎接口,支持通过设置 `engine="transformers"` 使用 Hugging Face Transformers 作为后端。PP-OCRv5 和 PaddleOCR-VL 1.5 等模型可借此融入 PyTorch 生态,简化 RAG 及 Document AI 应用的集成流程。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署的企业环境。该举措旨在帮助企业在保障数据安全的前提下,跨数据和工作流安全部署 AI 编码智能体。
Google DeepMind 宣布其通用世界模型 Project Genie 新增基于 Google Street View 的实景锚定能力,允许用户选择美国境内的真实地点生成互动虚拟环境。
推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟环境能锚定现实地点,为智能体训练和创意探索提供新路径。
Google DeepMind 推出 Gemini Omni Flash,这是 Omni 系列的首个模型,支持从图像、音频、视频和文本等任意输入生成高质量视频。
推荐理由:原文详细说明了 Gemini Omni Flash 支持自然语言对话式视频编辑及多模态输入生成,并给出了具体的分发渠道和订阅权限。
Google DeepMind 正式推出 Gemini for Science,这是一套旨在扩展科学探索规模与精度的工具集合。该计划包含 Google Labs 上的三个实验性原型:基于 Co-Scientist 的假设生成、结合 AlphaEvolve 和 ERA 的计算发现,以及利用 NotebookLM 实现的文献洞察。
推荐理由:Google DeepMind 推出 Gemini for Science,包含三个实验性工具和科学技能包,旨在通过 AI 智能体加速科学研究的核心步骤。
Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 中扩展内容透明度和验证工具,以帮助用户理解网络内容的创建和编辑方式。
推荐理由:官方详细说明了 SynthID 和 C2PA 在搜索、浏览器及云端的集成进展,并发布了新的 AI 内容检测 API,为开发者提供了识别生成内容的具体工具。
Google DeepMind 与新加坡政府启动国家 AI 合作伙伴关系,聚焦医疗、教育与科研。双方将部署 Gemini for Education 赋能教师,利用 AlphaFold 加速疫情研究,并开发基于 Gemma 的视障跑步助手。该合作旨在通过前沿 AI 技术提升公共服务质量,预计至 2040 年创造 33 亿新元经济价值。
Google DeepMind 的 Co-Scientist 工具被用于协助剑桥大学 Clare Bryant 教授团队,通过生成和排序假设来识别导致严重疾病的分子开关。该工具帮助团队将原本需两到三年的实验工作缩短至六个月,并精准定位到具体的氨基酸突变目标以进行细胞系测试。
Google DeepMind 的 Co-Scientist 正被 Calico Life Sciences 用于整合衰老生物学文献并生成可验证假设。该工具帮助研究人员在综合应激反应(ISR)领域提出关于代谢调节的新假说,并通过优化实验设计获得重要发现。
Google DeepMind 的 Co-Scientist 协助爱丁堡大学团队在代谢功能障碍相关脂肪性肝炎(MASH)研究中生成新假设。该系统通过综合文献证据,识别出 NLRP3 炎症小体作为连接肝脏炎症与代谢的关键分子桥梁。这一经实验验证的发现解释了药物 resmetirom 疗效局限的原因,并为开发靶向联合疗法提供了依据。
Google DeepMind 的 Co-Scientist 协助 MIT 与波士顿儿童医院研究人员整合生物工具包,加速 ALS 研究。该 AI 系统压缩了文献梳理时间,帮助生成可测试假设并评估可行性,促成机械工程师与化学生物学家协作。双方正利用其探索靶向 ALS 的新型 RNA 机制及药物。
斯坦福大学遗传学家Gary Peltz团队利用Google DeepMind的Co-Scientist加速寻找治疗肝脏纤维化的重定位药物,相关研究发表于Advanced Science。
Google DeepMind 发布文章说明其 AI 天气模型 WeatherNext 协助美国国家飓风中心(NHC)成功预测了飓风梅丽莎的迅速增强和登陆。该模型在飓风仍为一级时,便以 80% 的置信度提前五天预测出其将以五级强度登陆牙买加,这是首次从如此低的风速起点成功预测达到五级强度的风暴。
推荐理由:原文通过飓风梅丽莎案例,展示了 WeatherNext 在提前五天预测五级强度登陆方面的具体表现及与传统模型的对比优势。
OpenAI 与马耳他达成合作,向该国全体公民提供 ChatGPT Plus。双方还将开展培训,帮助民众掌握实用 AI 技能并负责任地使用人工智能。
Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。
推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。
ChatGPT Work 提供针对项目简报、战略更新、决策包及进度报告的实用运营工作流。该功能旨在帮助用户高效处理日常业务文档与汇报任务,提升团队协作与管理效率。
OpenAI 宣布推出一项新的产品功能。该更新旨在增强用户在特定场景下的使用体验,具体细节需参考官方发布的完整说明。
推荐理由:官方发布的新功能入口,用户可据此了解 OpenAI 在个人助理或生产力场景下的最新能力扩展。
Databricks 宣布在企业智能体工作流中采用 GPT-5.5。该模型在 OfficeQA Pro 基准测试上创下新的最先进(SOTA)成绩,标志着其在企业级应用场景中的能力突破。
Sea Limited 首席产品官阐述为何在工程团队全面部署 Codex,以加速亚洲地区的 AI 原生软件开发。该举措旨在利用 Codex 提升开发效率,推动软件工程的智能化转型。
IBM 发布两款基于 ModernBERT 架构的 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2。
推荐理由:IBM 发布了基于 ModernBERT 架构的 Apache 2.0 多语言嵌入模型,在保持轻量级的同时显著提升了长文档和代码检索能力。
用户可通过 ChatGPT 移动应用随时随地使用 Codex。该功能支持跨设备及远程环境实时监控、引导并批准编码任务,实现多端协同开发。
ChatGPT 推出新的安全更新,旨在提升在敏感对话中对上下文的感知能力。该功能通过随时间推移检测风险,使模型能够做出更安全的响应。