OpenAI 日本发布青少年安全蓝图
OpenAI 日本推出“Japan Teen Safety Blueprint”,旨在优先保障青少年使用生成式 AI 的安全。该蓝图引入了更严格的年龄保护、家长控制及身心健康保障措施。
OpenAI 日本推出“Japan Teen Safety Blueprint”,旨在优先保障青少年使用生成式 AI 的安全。该蓝图引入了更严格的年龄保护、家长控制及身心健康保障措施。
Codex Security 不依赖传统静态应用安全测试(SAST),而是采用 AI 驱动的约束推理与验证机制。该方法旨在发现真实漏洞并减少误报,从而替代传统的 SAST 报告模式。
SPEX 和 ProxySPEX 算法通过稀疏性和低阶性假设,高效识别 LLM 中的关键特征、数据及组件交互。ProxySPEX 利用层级结构特性,在保持性能的同时将消融次数减少约 10 倍。该框架解决了传统方法在大规模上下文下计算不可行的问题,显著提升了可解释性分析效率。
OpenAI 通过约束高风险操作并保护敏感数据,设计了能抵御提示注入和社会工程攻击的 AI 智能体。该方案旨在增强 ChatGPT 在智能体工作流中的安全性,防止恶意指令干扰模型行为。
OpenAI 推出 IH-Challenge,旨在训练模型优先处理可信指令。该方法提升了前沿大语言模型的指令层级、安全可控性以及对提示注入攻击的抵抗力。
OpenAI 推出 CoT-Control,发现推理模型难以有效控制其思维链。这一结果强化了将可监控性作为 AI 安全保障的重要性。
OpenAI 分享其在心理健康安全领域的工作更新,重点包括家长控制、受信任联系人功能及改进的困扰检测机制。此外,文章还提及了近期相关的诉讼进展。
OpenAI 发布最新威胁报告,重点分析恶意行为者如何将 AI 模型与网站及社交平台相结合。该报告旨在揭示此类滥用模式对检测与防御机制的具体影响。
OpenAI 向 The Alignment Project 承诺提供 750 万美元资金,以支持独立的 AI 对齐研究。此举旨在加强全球应对 AGI 安全与风险的努力。
ChatGPT 新增 Lockdown Mode 和 Elevated Risk 标签,旨在帮助组织防御提示注入攻击及 AI 驱动的数据泄露。
OpenAI 正式推出名为 Trusted Access 的网络安全访问计划。该机制旨在通过建立可信身份验证流程,在加强防御措施的同时,为合规用户提供必要的模型能力以应对网络威胁。
OpenAI 封禁了与 Rybar 网络相关的账户,该网络部分源自俄罗斯。这些账户利用 AI 技术在多语言网站和社交平台上支持影响力活动。
OpenAI 封禁了与名为“Trolling Stone”的未公开影响力行动相关的账号。该行动利用 AI 生成关于阿根廷一名涉嫌俄罗斯邪教头目被捕的评论。
OpenAI 封禁了极可能源自柬埔寨的账号,这些账号利用 AI 伪装成恢复服务、律师事务所及执法机构。其目标直指遭受欺诈侵害的人群,旨在通过虚假身份实施进一步诈骗或误导。
OpenAI 封禁了极可能源自柬埔寨的账户,这些账户利用 AI 对印尼用户实施“Date Bait”诈骗。其手段包括使用 AI 进行翻译和互动以诱导受害者。
OpenAI 封禁了利用 AI 支持浪漫诈骗工作流的账户,涵盖外联、翻译、受害者互动及投资欺诈诱饵等环节。此举旨在打击通过自动化手段实施的情感操控与金融诈骗行为。
OpenAI 封禁了一个与中国执法人员有关联的账户。该账户被用于策划影响力活动、骚扰及在线操作。
OpenAI 推出 EMEA Youth & Wellbeing Grant,提供 €500,000 资金资助 NGO 和研究者。该计划旨在支持 AI 时代下的青年安全与福祉项目。
OpenAI 介绍其内置安全措施,防止 AI Agent 在打开链接时发生基于 URL 的数据外泄和提示词注入。该机制旨在保护用户数据,确保智能体在处理外部链接时的安全性。
OpenAI 在 ChatGPT 中推出年龄预测功能,用于估算账户用户是否未满或已满 18 岁。该机制旨在为青少年应用安全保护措施,并将随着时间推移持续优化预测准确性。
OpenAI 利用基于强化学习的自动化红队测试,持续加固 ChatGPT Atlas 抵御提示注入攻击。该主动发现与修补循环旨在早期识别新型漏洞,并随着 AI 向智能体化演进,增强浏览器代理的防御能力。
OpenAI 推出针对思维链(chain-of-thought)可监控性的新框架与评估套件,涵盖 24 个环境下的 13 项评估。研究发现,监控模型内部推理比仅监控输出更有效,为 AI 系统能力增长后的可扩展控制提供了可行路径。
OpenAI 推出新的 AI 素养资源,旨在帮助青少年和家长安全、自信地使用 ChatGPT。这些指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界设定,以及如何支持青少年处理情感或敏感话题。
OpenAI 更新其 Model Spec,新增 Under-18 Principles 以规范 ChatGPT 对青少年的支持。该更新基于发展科学提供适龄指导,旨在强化安全护栏并明确高风险场景下的模型行为预期。
Google DeepMind 发布 Gemma Scope 2,这是目前规模最大的开源可解释性工具套件,支持从 270M 到 27B 参数的所有 Gemma 3 模型。该工具结合稀疏自编码器(SAEs)和转码器,旨在帮助研究人员追踪模型内部决策过程以调试越狱、幻觉等安全问题。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型数据,重点开展思维链监控、社会情感影响评估及经济系统模拟等前沿课题。此举旨在通过联合报告与技术协作,提升 Gemini 3 等先进模型的安全性并推动行业进步。
OpenAI 发布 GPT-5.2 系统卡更新,确认其作为 GPT-5 系列最新模型族的安全缓解策略与 GPT-5 及 GPT-5.1 基本一致。该模型基于公开互联网、第三方合作及用户提供的多样化数据集进行训练。
Google Research 在 COLM 2025 发布 Urania 框架,利用差分隐私(DP)聚类与关键词提取从 LLM 对话中生成安全洞察。该方案通过数学化隐私预算 ε 确保单条对话不影响结果,相比 CLIO 等启发式方法提供更强的形式化隐私保证。
OpenAI 正投资加强安全防护与防御能力,以应对 AI 模型在网络安全领域日益增强的功能。该公司通过评估风险、限制滥用以及与社区合作来强化网络韧性。
OpenAI 研究人员正在测试一种名为“confessions”的方法,旨在训练模型在犯错或行为不当时主动承认。该机制有助于提升 AI 的诚实度、透明度及用户对模型输出的信任感。
OpenAI 披露 Mixpanel 发生安全事件,仅涉及有限的 API 分析数据。此次事件未暴露任何 API 内容、凭证或支付详情。OpenAI 已采取措施保护用户并说明具体情况。
Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。
推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。
OpenAI 与独立专家合作,通过第三方测试评估前沿 AI 系统。此举旨在加强安全性、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述其全面安全措施。该文档涵盖针对有害任务和提示注入的模型级安全训练,以及智能体沙箱和可配置网络访问等产品级缓解机制。
OpenAI 正探索机制可解释性以理解神经网络推理,提出一种新的稀疏模型方法。该方案旨在提升 AI 系统的透明度,并支持更安全、可靠的行为表现。
Google Research 发布 JAX-Privacy 1.0,基于 JAX 构建模块化差分隐私训练与审计工具包。该版本集成最新研究进展,支持 DP-SGD、DP-FTRL 及矩阵分解等算法,利用 JAX 原生并行特性实现大规模模型的高效私有训练。
OpenAI 发布 GPT-5.1 Instant 和 GPT-5.1 Thinking 的系统卡附录,更新了安全指标。该文档新增了针对心理健康和情感依赖的评估内容。
OpenAI 将提示词注入定义为 AI 系统的前沿安全挑战。该机构正通过推进研究、训练模型及构建用户防护措施来应对此类攻击。
OpenAI 发布 Teen Safety Blueprint,这是一份旨在负责任地构建 AI 的路线图。该蓝图通过实施安全保护措施、采用适龄设计以及加强协作,致力于保护并赋能在线青少年用户。
Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。
推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。