OpenAI 推出高级账户安全功能
OpenAI 推出 Advanced Account Security,提供防钓鱼登录、更强的恢复机制及增强保护。该功能旨在保障敏感数据安全并防止账户被接管。
OpenAI 推出 Advanced Account Security,提供防钓鱼登录、更强的恢复机制及增强保护。该功能旨在保障敏感数据安全并防止账户被接管。
OpenAI 解析了 GPT-5 模型中出现“goblin”风格输出的原因及修复方案。文章梳理了该现象在 AI 模型中的传播时间线,揭示了由人格化驱动导致的异常行为根源。
OpenAI 发布针对智能时代的网络安全五步行动计划,旨在通过普及 AI 驱动的网络防御来保护关键系统。该计划聚焦于利用人工智能技术强化网络防护能力,应对日益复杂的数字安全威胁。
OpenAI 公布 ChatGPT 社区安全保护机制,涵盖模型防护、滥用检测、政策执行及安全专家协作。该举措旨在通过多层级技术手段与外部合作,确保平台内容合规与用户安全。
OpenAI CEO Sam Altman 公布五项指导原则,旨在确保 AGI 造福全人类。这些原则将作为公司工作的核心指引,明确其使命方向。
Hugging Face 指出 Mythos 等前沿 LLM 结合自主系统可快速发现并修补软件漏洞,但完全自主存在失控风险。开源代码和工具通过分布式协作加速检测、验证与补丁传播,有效对抗闭源系统的单点故障及逆向工程威胁。半自主智能体配合开源生态能缩小攻防能力差距,是构建防御的关键路径。
OpenAI 启动 Trusted Access for Cyber 计划,联合领先安全企业和机构共同加强全球网络防御。参与者将使用 GPT-5.4-Cyber 模型,并获得总计 $10M 的 API 补贴以支持相关应用开发。
Google Research 提出框架评估 25 个 LLM 的行为倾向,发现模型在共识场景下存在方向性偏差,且在无共识时无法覆盖人类意见范围。该研究利用情境判断测试(SJT)替代自报问卷,通过对比模型响应与 10 名标注者偏好分布,量化模型在共情、情绪调节等特质上与人类行为的对齐程度。
Google DeepMind 发布新研究成果,推出首个经实证验证的工具包以衡量 AI 在现实世界中的有害操纵潜力。该研究基于英国、美国和印度的九项实验(涉及超过 10,000 名参与者),重点测试了金融和健康等高利害场景,发现 AI 在健康话题上的操纵效果最弱,且不同领域的成功并不互通。
推荐理由:Google DeepMind 发布了首个经实证验证的 AI 有害操纵评估工具包,通过九项涵盖万余人的研究量化了模型在金融与健康场景下的操纵能力与倾向。
OpenAI 推出基于提示词的青少年安全策略,供使用 gpt-oss-safeguard 的开发者构建更安全的 AI 体验。该方案旨在帮助开发者在 AI 系统中审核与年龄相关的特定风险。
OpenAI 在构建 Sora 2 模型及 Sora App 时将安全性作为基础,以应对前沿视频模型和新社交平台带来的挑战。该方案依托于具体的保护措施,旨在解决新型安全风险。
OpenAI 利用思维链(chain-of-thought)监控技术,研究其内部编码智能体(coding agents)的对齐问题。通过分析真实部署场景,该机制旨在检测潜在风险并强化 AI 安全保护措施。
OpenAI 日本推出“Japan Teen Safety Blueprint”,旨在优先保障青少年使用生成式 AI 的安全。该蓝图引入了更严格的年龄保护、家长控制及身心健康保障措施。
Codex Security 不依赖传统静态应用安全测试(SAST),而是采用 AI 驱动的约束推理与验证机制。该方法旨在发现真实漏洞并减少误报,从而替代传统的 SAST 报告模式。
SPEX 和 ProxySPEX 算法通过稀疏性和低阶性假设,高效识别 LLM 中的关键特征、数据及组件交互。ProxySPEX 利用层级结构特性,在保持性能的同时将消融次数减少约 10 倍。该框架解决了传统方法在大规模上下文下计算不可行的问题,显著提升了可解释性分析效率。
OpenAI 通过约束高风险操作并保护敏感数据,设计了能抵御提示注入和社会工程攻击的 AI 智能体。该方案旨在增强 ChatGPT 在智能体工作流中的安全性,防止恶意指令干扰模型行为。
OpenAI 推出 IH-Challenge,旨在训练模型优先处理可信指令。该方法提升了前沿大语言模型的指令层级、安全可控性以及对提示注入攻击的抵抗力。
OpenAI 推出 CoT-Control,发现推理模型难以有效控制其思维链。这一结果强化了将可监控性作为 AI 安全保障的重要性。
OpenAI 分享其在心理健康安全领域的工作更新,重点包括家长控制、受信任联系人功能及改进的困扰检测机制。此外,文章还提及了近期相关的诉讼进展。
OpenAI 发布最新威胁报告,重点分析恶意行为者如何将 AI 模型与网站及社交平台相结合。该报告旨在揭示此类滥用模式对检测与防御机制的具体影响。
OpenAI 向 The Alignment Project 承诺提供 750 万美元资金,以支持独立的 AI 对齐研究。此举旨在加强全球应对 AGI 安全与风险的努力。
ChatGPT 新增 Lockdown Mode 和 Elevated Risk 标签,旨在帮助组织防御提示注入攻击及 AI 驱动的数据泄露。
OpenAI 正式推出名为 Trusted Access 的网络安全访问计划。该机制旨在通过建立可信身份验证流程,在加强防御措施的同时,为合规用户提供必要的模型能力以应对网络威胁。
Google DeepMind 发布 Gemma Scope 2,这是目前规模最大的开源可解释性工具套件,支持从 270M 到 27B 参数的所有 Gemma 3 模型。该工具结合稀疏自编码器(SAEs)和转码器,旨在帮助研究人员追踪模型内部决策过程以调试越狱、幻觉等安全问题。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型数据,重点开展思维链监控、社会情感影响评估及经济系统模拟等前沿课题。此举旨在通过联合报告与技术协作,提升 Gemini 3 等先进模型的安全性并推动行业进步。
Google Research 在 COLM 2025 发布 Urania 框架,利用差分隐私(DP)聚类与关键词提取从 LLM 对话中生成安全洞察。该方案通过数学化隐私预算 ε 确保单条对话不影响结果,相比 CLIO 等启发式方法提供更强的形式化隐私保证。
Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。
推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。
Google Research 发布 JAX-Privacy 1.0,基于 JAX 构建模块化差分隐私训练与审计工具包。该版本集成最新研究进展,支持 DP-SGD、DP-FTRL 及矩阵分解等算法,利用 JAX 原生并行特性实现大规模模型的高效私有训练。
Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。
推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。
Hugging Face 推出“voice consent gate”概念,要求用户朗读包含模型名的特定句子以显式授权语音克隆。该方案结合 ASR 与 TTS 技术,确保仅在识别到实时麦克风输入的同意语句后才启动合成,旨在平衡深度伪造风险与辅助沟通等正向应用。
Hugging Face 宣布与 VirusTotal 建立合作,对 Hub 上超过 2.2M 个公共模型和数据集仓库进行持续扫描。该机制通过比对文件哈希值检索威胁情报,在不共享原始文件内容的前提下展示检测结果,以保护机器学习社区免受恶意资产侵害。
Hugging Face 宣布推出 RiskRubric.ai,这是一个由 Cloud Security Alliance 和 Noma Security 主导的标准化 AI 模型风险评估平台。
推荐理由:Hugging Face 联合推出 RiskRubric.ai,提供标准化的模型风险评估体系,帮助开发者量化安全性与隐私指标。
Meta 发布 Llama Guard 4,这是一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,支持检测图像和文本中的不安全内容。同时推出两个轻量级 Llama Prompt Guard 2 模型(86M 和 22M 参数),专门用于检测提示词注入和越狱攻击。
推荐理由:原文详细说明了 Llama Guard 4 的架构剪枝来源、多语言分类能力及与上一代在单图和多图场景下的性能对比数据。
Protect AI 与 Hugging Face 合作六个月,已扫描 Hub 上 141 万个仓库中的 447 万模型版本,识别出 35.2 万个不安全或可疑问题。Guardian 新增 PAIT-ARV-100、PAIT-JOBLIB-101、PAIT-TF-200 和 PAIT-LMAFL-300 四个威胁检测模块,覆盖更多文件格式并检测 Keras CVE-2025-1550 等漏洞。
Hugging Face 宣布与 JFrog 建立合作伙伴关系,将 JFrog 扫描器集成至 Hub 以增强模型安全。该扫描器通过解析代码深层分析来减少误报,能检测 pickle 及 Keras Lambda 层等格式中的恶意执行风险。所有公共模型仓库在推送文件时将自动接受扫描,无需用户额外操作。
Hugging Face 指出当前多数 AI Agents 基于 LLM 构建,具备分解任务并自主执行的能力。分析显示系统自主性越高,隐私与安全等风险越大,因此建议不开发能自行编写执行代码的全自主 Agent,而应聚焦于人类保留控制权的半自主模式。
Mistral AI 推出基于 LLM 的内容审核 API,该模型将文本分类为 9 个类别,支持原始文本和对话内容端点。此 API 驱动 Le Chat 的审核服务,原生支持阿拉伯语、中文等 11 种语言,旨在通过处理无资质建议和 PII 等风险增强系统级安全防护。
Hugging Face 宣布与 Truffle Security 合作,将开源工具 TruffleHog 的密钥扫描功能集成至平台。该集成扩展了自动安全扫描管道,新增针对密码、令牌和 API 密钥的检测能力,并在发现已验证泄露时通知用户。同时推出原生 `trufflehog huggingface` 命令,支持用户主动扫描模型、数据集及 Spaces 中的敏感信息。
Hugging Face 发布2024年安全功能概览,涵盖细粒度令牌、双因素认证及提交签名等默认防护机制。平台通过 ClamAV 和 picklescan 实现自动化恶意软件与密钥扫描,保障 Hub 用户资产安全。企业版额外提供 SSO 单点登录及资源组隔离等高级控制选项。
Google 在 Hugging Face 博客宣布扩展 Gemma 模型家族,新增 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器套件。
推荐理由:原文详细展示了 Gemma 2 2B 在端侧部署与辅助生成中的具体用法,以及 ShieldGemma 和 Gemma Scope 的开源特性,为开发者提供了可落地的技术参考。