OpenAI 扩展 Stargate 以构建智能时代算力基础设施
OpenAI 正在扩展 Stargate 项目,旨在构建支撑 AGI 的算力基础设施。通过新增数据中心容量,OpenAI 致力于满足日益增长的 AI 需求。
OpenAI 正在扩展 Stargate 项目,旨在构建支撑 AGI 的算力基础设施。通过新增数据中心容量,OpenAI 致力于满足日益增长的 AI 需求。
OpenAI 发布针对智能时代的网络安全五步行动计划,旨在通过普及 AI 驱动的网络防御来保护关键系统。该计划聚焦于利用人工智能技术强化网络防护能力,应对日益复杂的数字安全威胁。
DeepInfra 正式接入 Hugging Face Inference Providers,提供涵盖 LLM、文生图等超 100 个模型的 Serverless 推理服务。开发者可通过 Python/JS SDK 或 Agent Harness 直接调用 DeepSeek V4、Kimi-K2.6 等开源模型,支持自定义 API Key 或经 HF 路由计费两种模式。
NVIDIA 发布 Nemotron 3 Nano Omni,这是一款支持文本、图像、视频和音频的全模态理解模型。该模型采用 Mamba-Transformer MoE 混合骨干网络,在 OCRBenchV2 和 WorldSense 等基准测试中表现优异,并针对长文档分析和智能体计算机使用进行了优化。BF16、FP8 和 NVFP4 检查点已在 Hugging Face 开放下载。
推荐理由:原文给出了混合架构细节与多基准实测数据,读者可以据此评估其在长文档和音视频联合理解任务中的实际能力边界。
OpenAI 公布 ChatGPT 社区安全保护机制,涵盖模型防护、滥用检测、政策执行及安全专家协作。该举措旨在通过多层级技术手段与外部合作,确保平台内容合规与用户安全。
OpenAI GPT 模型、Codex 和 Managed Agents 现已在 AWS 上线。这一集成使企业能够在其 AWS 环境中构建安全的 AI 应用。
OpenAI 获得 FedRAMP Moderate 授权,覆盖 ChatGPT Enterprise 和 OpenAI API。这一进展使美国联邦机构能够安全采用 AI 技术。
Mistral AI 推出 Workflows 公共预览版,作为 Studio 的一部分提供企业级 AI 编排能力。该工具基于 Temporal 引擎构建,支持 Python SDK 开发,具备持久执行、全链路可观测性及单行代码实现的人工审批暂停功能。
推荐理由:原文展示了企业级AI编排层如何解决生产环境中的持久性、可观测性和人工审批痛点,为开发者提供了从原型到落地的具体路径。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,将在首尔设立 AI Campus。双方将利用 AlphaEvolve、AlphaFold 等前沿模型加速生命科学与气候研究,并与韩国 AI 安全研究所(AISI)在安全实践上展开协作。
OpenAI 与微软宣布达成一项修订后的协议,旨在简化双方合作关系并为长期发展提供明确性。该新协议将支持大规模人工智能创新的持续推进。
Choco 使用 OpenAI APIs 实现食品分销自动化。该方案旨在简化流程、提升生产力并释放增长潜力,展示了 AI 在真实业务场景中的应用效果。
OpenAI 推出 Symphony,这是一份用于 Codex 编排的开源规范。该规范将 issue tracker 转化为始终在线的智能体系统,旨在提升工程产出并减少上下文切换。
Hugging Face 官方博客发布教程,演示如何利用 OpenAI 新开源的 Privacy Filter 模型和 gradio.Server 框架构建三个隐私处理 Web 应用。文章详细介绍了文档隐私浏览器、图像匿名化工具和智能脱敏粘贴板的具体实现逻辑及代码结构。
推荐理由:通过三个具体应用案例,展示了如何结合 OpenAI Privacy Filter 与 gradio.Server 构建可扩展的隐私处理 Web 应用。
OpenAI CEO Sam Altman 公布五项指导原则,旨在确保 AGI 造福全人类。这些原则将作为公司工作的核心指引,明确其使命方向。
OpenAI 推出新框架,分析 921 种职业和 1.48 亿个美国工作岗位。该模型旨在识别面临自动化风险、重组、增长或受 AI 影响最小的角色。
DeepSeek 发布 V4 系列模型,包含 DeepSeek-V4-Pro(1.6T 总参数/49B 激活)和 DeepSeek-V4-Flash(284B 总参数/13B 激活),均支持 1M-token 上下文窗口。
推荐理由:原文详细拆解了 DeepSeek-V4 通过混合注意力机制大幅降低长上下文推理成本的技术细节,并展示了其在智能体任务中的具体性能表现。
OpenAI 官方宣布发布一款新模型。目前公开信息主要确认了发布事件本身,具体的技术参数、基准测试成绩或应用场景细节未在简短公告中展开。
推荐理由:OpenAI 官方发布了新模型,读者可关注其具体能力变化及在现有生态中的定位。
OpenAI 发布 ChatGPT Work 日常办公工作流指南,涵盖重复性任务、更新、研究、规划及团队运营等场景。该指南旨在帮助用户掌握 ChatGPT Work 在实际业务中的具体应用方法,提升工作效率与协作能力。
Hugging Face 发布指南,详解如何在 Manifest V3 约束下使用 Transformers.js 构建 Chrome 扩展。文章以 Gemma 4 E2B 为例,展示了后台服务工作者托管模型、侧边栏处理交互及内容脚本提取页面的核心架构。该方案通过明确的消息契约和状态分离策略,解决了多运行时下的模型复用与内存管理问题。
推荐理由:原文拆解了Manifest V3下模型托管与消息通信的架构细节,为开发者在浏览器扩展中落地本地AI提供了可复用的工程参考。
Google Research 宣布在 Google Photos 的 Auto frame 功能中集成新的机器学习方法,通过理解场景空间布局并利用生成式 AI 想象新视角,实现拍摄后照片的自动重新构图。
推荐理由:Google Photos 的 Auto frame 功能引入基于 3D 场景重建的新方法,能自动调整照片视角并修复广角畸变。
OpenAI 宣布对 ChatGPT 进行针对临床场景的功能改进。该更新旨在更好地支持医生在诊断、治疗规划及文档记录等医疗工作流中的使用需求。
Google DeepMind 推出 Decoupled DiLoCo 架构,支持在低带宽下跨数据中心异步训练 LLM。该方案利用 Gemma 4 模型验证,通过隔离硬件故障提升系统韧性,并在 2-5 Gbps 网络下比传统同步方法快 20 倍以上完成 12B 参数模型训练。
OpenAI 在 Responses API 中引入 WebSockets 和连接级缓存,显著降低 API 开销并优化模型延迟。该方案深入解析 Codex 智能体循环机制,旨在提升智能体工作流的执行效率与响应速度。
OpenAI 在 ChatGPT 中推出了由 Codex 驱动的工作区智能体(Workspace agents)。这些智能体可在云端运行,旨在安全地自动化复杂工作流并帮助团队跨工具扩展工作。
推荐理由:官方介绍了基于 Codex 的工作区智能体,展示了其在云端自动化复杂工作流及跨工具协作的能力。
ChatGPT 推出 Workspace Agents,支持用户构建并用于自动化可重复的工作流。该功能允许连接各类工具,从而简化团队运营流程。
OpenAI 推出名为 OpenAI Privacy Filter 的开源权重模型,旨在以最先进的准确率检测和脱敏文本中的个人身份信息(PII)。该模型专注于隐私保护场景下的数据处理能力。
Google Research 在 ICLR 论文中推出 ReasoningBank,一种能从成功和失败经历中提炼高层推理模式的 Agent 记忆框架。该框架结合 MaTTS 技术,在 Web 浏览和软件工程基准测试中显著提升了 Agent 的成功率并减少了任务步骤。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 及 McKinsey 合作,旨在推动前沿 AI 在企业规模化落地。合作伙伴将获得 Gemini 系列模型的早期访问权限,并共同开发针对金融、制造等行业的专用智能体解决方案。此举意在缩小当前仅 25% 组织成功实现 AI 生产化应用的差距,助力全球经济增长。
OpenAI 于 2026 年推出 ChatGPT Images 2.0,重点提升了文本渲染、多语言支持和视觉推理能力。该版本旨在优化图像生成质量与理解力。
Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。
OpenAI 推出 Codex Labs,并与 Accenture、PwC、Infosys 等企业合作,助力企业在软件开发生命周期中部署和扩展 Codex。目前 Codex 的周活跃用户数已达到 400 万。
Hugging Face 指出 Mythos 等前沿 LLM 结合自主系统可快速发现并修补软件漏洞,但完全自主存在失控风险。开源代码和工具通过分布式协作加速检测、验证与补丁传播,有效对抗闭源系统的单点故障及逆向工程威胁。半自主智能体配合开源生态能缩小攻防能力差距,是构建防御的关键路径。
GRASP 是一种针对学习动力学(世界模型)的梯度规划器,旨在解决长时域规划中的病态优化与局部极小值问题。该方法通过将轨迹提升至虚拟状态实现时间并行优化,在状态迭代中直接引入随机性以增强探索,并重塑梯度信号以规避高维视觉模型中脆弱的“状态-输入”梯度依赖。
Hyatt 在其全球员工中部署了 ChatGPT Enterprise,利用 GPT-5.4 和 Codex 提升生产力、运营效率及宾客体验。
Google Research 推出 Simula,一种基于推理优先的无种子智能体框架,通过机制设计从第一性原理构建合成数据集。该方案利用 Gemini 2.5 Flash 作为教师模型、Gemma-3 4B 作为学生模型进行验证,将生成过程分解为全局/局部多样性、复杂化及质量检查四个可控轴。
Google Research 发布开源模型 MoGen,利用点云流匹配生成合成神经元以增强 PATHFINDER 训练数据。该方法使小鼠轴突重建错误率降低 4.4%,在完整小鼠脑尺度上相当于节省 157 人年的手动校对工作。
OpenAI 为 Codex 推出新功能,旨在通过支持计算机操作来加速开发者的编码工作流。该更新聚焦于提升工具在实际编程场景中的自动化处理能力。
推荐理由:官方介绍了 Codex 的新功能,开发者可据此评估其如何辅助日常编码工作流。
OpenAI 正式发布了新一代大语言模型 GPT-4o。该模型具备更强的多模态处理能力,支持文本、音频和图像的实时交互,旨在提升自然对话体验并降低推理成本。
推荐理由:OpenAI 官方宣布推出新模型 GPT-4o,提供了关于其多模态能力和实时交互特性的第一手信息。
OpenAI 启动 Trusted Access for Cyber 计划,联合领先安全企业和机构共同加强全球网络防御。参与者将使用 GPT-5.4-Cyber 模型,并获得总计 $10M 的 API 补贴以支持相关应用开发。
Sentence Transformers 库支持对处理文本、图像、音频和视频的多模态嵌入及重排序模型进行训练或微调。以 Qwen3-VL-Embedding-2B 为例,通过 Visual Document Retrieval 数据集微调后,NDCG@10 从 0.888 提升至 0.947,性能超越参数量大其 4 倍的现有模型。
推荐理由:原文提供了微调多模态嵌入模型的具体代码和Matryoshka训练策略,读者可据此复现视觉文档检索任务并优化部署效率。