GPT-5.2 系统卡更新:安全缓解措施与训练数据说明
OpenAI 发布 GPT-5.2 系统卡更新,确认其作为 GPT-5 系列最新模型族的安全缓解策略与 GPT-5 及 GPT-5.1 基本一致。该模型基于公开互联网、第三方合作及用户提供的多样化数据集进行训练。
OpenAI 发布 GPT-5.2 系统卡更新,确认其作为 GPT-5 系列最新模型族的安全缓解策略与 GPT-5 及 GPT-5.1 基本一致。该模型基于公开互联网、第三方合作及用户提供的多样化数据集进行训练。
Google Research 在 COLM 2025 发布 Urania 框架,利用差分隐私(DP)聚类与关键词提取从 LLM 对话中生成安全洞察。该方案通过数学化隐私预算 ε 确保单条对话不影响结果,相比 CLIO 等启发式方法提供更强的形式化隐私保证。
OpenAI 正投资加强安全防护与防御能力,以应对 AI 模型在网络安全领域日益增强的功能。该公司通过评估风险、限制滥用以及与社区合作来强化网络韧性。
OpenAI 研究人员正在测试一种名为“confessions”的方法,旨在训练模型在犯错或行为不当时主动承认。该机制有助于提升 AI 的诚实度、透明度及用户对模型输出的信任感。
OpenAI 披露 Mixpanel 发生安全事件,仅涉及有限的 API 分析数据。此次事件未暴露任何 API 内容、凭证或支付详情。OpenAI 已采取措施保护用户并说明具体情况。
Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。
推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。
OpenAI 与独立专家合作,通过第三方测试评估前沿 AI 系统。此举旨在加强安全性、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述其全面安全措施。该文档涵盖针对有害任务和提示注入的模型级安全训练,以及智能体沙箱和可配置网络访问等产品级缓解机制。
OpenAI 正探索机制可解释性以理解神经网络推理,提出一种新的稀疏模型方法。该方案旨在提升 AI 系统的透明度,并支持更安全、可靠的行为表现。
Google Research 发布 JAX-Privacy 1.0,基于 JAX 构建模块化差分隐私训练与审计工具包。该版本集成最新研究进展,支持 DP-SGD、DP-FTRL 及矩阵分解等算法,利用 JAX 原生并行特性实现大规模模型的高效私有训练。
OpenAI 发布 GPT-5.1 Instant 和 GPT-5.1 Thinking 的系统卡附录,更新了安全指标。该文档新增了针对心理健康和情感依赖的评估内容。
OpenAI 将提示词注入定义为 AI 系统的前沿安全挑战。该机构正通过推进研究、训练模型及构建用户防护措施来应对此类攻击。
OpenAI 发布 Teen Safety Blueprint,这是一份旨在负责任地构建 AI 的路线图。该蓝图通过实施安全保护措施、采用适龄设计以及加强协作,致力于保护并赋能在线青少年用户。
Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。
推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍基于 gpt-oss 后训练的两个开源权重推理模型:gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b。这些模型旨在根据提供的策略对内容进行标注。报告描述了其能力并提供了以底层 gpt-oss 模型为基线的安全评估结果。
OpenAI 推出 gpt-oss-safeguard,这是一组用于安全分类的开源权重推理模型。该模型允许开发者应用并迭代自定义策略,以增强 AI 系统的安全性控制能力。
Doppel 采用 GPT-5 和强化微调技术,在攻击扩散前拦截深度伪造及冒充行为。该方案将分析师工作量减少 80%,并把响应时间从数小时缩短至几分钟。
Hugging Face 推出“voice consent gate”概念,要求用户朗读包含模型名的特定句子以显式授权语音克隆。该方案结合 ASR 与 TTS 技术,确保仅在识别到实时麦克风输入的同意语句后才启动合成,旨在平衡深度伪造风险与辅助沟通等正向应用。
OpenAI 发布 GPT-5 系统卡附录,详述其在敏感对话处理上的改进。新增针对情感依赖、心理健康及越狱抵抗能力的基准测试,以评估模型在这些关键安全领域的表现。
OpenAI 与 170 多位心理健康专家合作,优化 ChatGPT 在敏感对话中的表现。该更新旨在提升模型识别用户痛苦、共情回应及引导寻求现实支持的能力,使不安全回复减少高达 80%。
Hugging Face 宣布与 VirusTotal 建立合作,对 Hub 上超过 2.2M 个公共模型和数据集仓库进行持续扫描。该机制通过比对文件哈希值检索威胁情报,在不共享原始文件内容的前提下展示检测结果,以保护机器学习社区免受恶意资产侵害。
OpenAI 新成立的“福祉与 AI 专家委员会”汇聚心理学家、临床医生及研究人员,旨在指导 ChatGPT 如何支持情感健康。该委员会特别关注青少年用户群体,其专业见解正推动构建更安全、更具关怀性的 AI 体验。
OpenAI 通过新的真实世界测试方法,定义并评估 ChatGPT 等 LLM 中的政治偏见。这些新方法旨在提高客观性并减少模型偏见。
OpenAI 发布 2025 年 10 月报告,披露其检测与拦截恶意 AI 使用的进展。该报告详述了平台在遏制滥用、执行安全政策及保护用户免受现实危害方面的具体措施。
OpenAI 宣布封禁与一个此前未报告的、源自中国的“Nine-emdash Line”行动相关的账户。该行动被指利用 AI 生成关于南海、香港及美国政治的地域影响力内容。
推荐理由:OpenAI 官方披露封禁了利用 AI 生成地缘政治影响力内容的特定行动,展示了平台在识别和阻断恶意滥用方面的具体案例。
OpenAI 封禁了与中国相关的账户,这些账户利用 AI 支持监控规划、针对批评者等个体的定向画像及研究。此举旨在遏制通过人工智能技术进行的监视和影响力活动。
OpenAI 封禁了与在线欺诈网络相关的账户,这些网络利用 AI 技术支持诈骗脚本、身份冒充、翻译及受害者互动。
OpenAI 封禁了疑似与俄语犯罪团伙相关的账户,这些账户被用于构建恶意软件加载器、规避层、凭证窃取脚本及 C2 基础设施。此举旨在打击利用 AI 技术进行网络攻击的行为,防止模型被滥用生成恶意代码。
OpenAI 封禁了利用 AI 进行韩语恶意软件开发、调试、钓鱼及凭证窃取工作流的账户。此举旨在遏制针对韩语用户的网络攻击支持行为,强化平台对滥用技术的管控。
OpenAI 封禁了涉及与公开报道威胁组织重叠、且符合中国情报需求的账户。这些账户利用 AI 支持钓鱼和脚本工作流,其活动特征被认定为违反安全政策。
OpenAI 在构建 Sora 2 和 Sora app 时将安全置于基础地位,以应对先进视频模型及新社交创作平台带来的新型安全挑战。其方法植根于具体的保护措施。
OpenAI 通过严格的使用政策、先进的检测工具及行业协作,积极打击网络儿童性剥削与虐待。这些措施旨在有效阻止、报告并预防 AI 被滥用,以保护未成年人安全。
Hugging Face 宣布推出 RiskRubric.ai,这是一个由 Cloud Security Alliance 和 Noma Security 主导的标准化 AI 模型风险评估平台。
推荐理由:Hugging Face 联合推出 RiskRubric.ai,提供标准化的模型风险评估体系,帮助开发者量化安全性与隐私指标。
OpenAI 发布了关于模型安全与对齐的最新研究成果。该报告详细阐述了 OpenAI 在提升模型可控性和降低潜在风险方面采用的技术方法与评估框架。
推荐理由:OpenAI 官方发布关于模型安全与对齐的研究成果,提供了前沿实验室在风险管控方面的具体技术路径。
OpenAI 阐述其在人工智能使用中平衡青少年安全、自由与隐私的策略。该方案旨在应对未成年人接触 AI 技术时面临的多重挑战,确立相关治理原则。
OpenAI 正在 ChatGPT 中开发年龄预测和家长控制功能,旨在为青少年创造更安全、符合年龄的体验。该举措通过引入新工具支持家庭管理,确保平台内容适合不同年龄段用户。
OpenAI 分享其与美国 CAISI 和英国 AISI 的合作进展,旨在加强 AI 安全与保障。该合作聚焦于构建更安全的 AI 系统,体现了多方在提升模型安全性方面的协同努力。
OpenAI 与微软签署新的谅解备忘录(MOU),旨在强化双方合作伙伴关系。该协议重申了两家公司在人工智能安全与创新方面的共同承诺。
SafetyKit 采用 OpenAI GPT-5 模型以增强内容审核能力并执行合规要求。该方案旨在通过更高准确率超越传统安全系统,实现风险智能体的规模化应用。
OpenAI 宣布通过三项举措提升 ChatGPT 的实用性与安全性。平台将加强与领域专家的合作,为青少年用户增设家长控制功能以强化保护。此外,涉及敏感内容的对话将被自动路由至推理模型处理,以提供更精准且安全的响应。