跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 21–38 条 · 共 38 条
6月22日周一
6月19日周五
  1. Hugging Face Blog60

    Hugging Face 发布 MosaicLeaks:深度研究智能体的隐私泄露风险与 PA-DR 防御方法

    Hugging Face 联合 ServiceNow 等机构发布 MosaicLeaks 基准,揭示深度研究智能体在多跳检索中因“马赛克效应”导致私有信息通过 Web 查询日志泄露的风险。

    推荐理由:提出MosaicLeaks基准与PA-DR训练法,量化智能体查询隐私泄露风险并给出兼顾任务性能与隐私保护的RL方案。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 以保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI 智能体的纵深防御框架,旨在应对模型对齐不完美时的安全风险。该框架借鉴 MITRE ATT&CK 标准,将未受信任的智能体视为潜在内部威胁,通过实时行为监控和分级响应机制来检测与阻止异常操作。

    推荐理由:原文提出了将内部 AI 智能体视为潜在内部威胁的防御框架,并公开了基于百万条轨迹分析的监控实践细节。

6月5日周五
  1. Hugging Face Blog65

    NVIDIA 发布 Nemotron 3.5 Content Safety:支持自定义策略的多模态内容安全模型

    NVIDIA 发布 Nemotron 3.5 Content Safety,这是一个基于 Gemma 3 4B IT 微调的统一多模态、多语言内容安全模型。它支持自定义企业策略执行和可选的可审计推理轨迹(THINK Mode),在保持低延迟的同时实现了跨语言和图文的综合安全评估。

    推荐理由:该模型将多模态、多语言与自定义策略执行统一于单次推理,并开源了包含真实图像的训练数据集,为企业级内容安全提供了可审计且低延迟的解决方案。

3月26日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI 有害操纵评估工具包及实证研究

    Google DeepMind 发布新研究成果,推出首个经实证验证的工具包以衡量 AI 在现实世界中的有害操纵潜力。该研究基于英国、美国和印度的九项实验(涉及超过 10,000 名参与者),重点测试了金融和健康等高利害场景,发现 AI 在健康话题上的操纵效果最弱,且不同领域的成功并不互通。

    推荐理由:Google DeepMind 发布了首个经实证验证的 AI 有害操纵评估工具包,通过九项涵盖万余人的研究量化了模型在金融与健康场景下的操纵能力与倾向。

11月20日周四
  1. Google DeepMind63

    Google DeepMind 在 Gemini 应用中推出 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。

    推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。

10月30日周四
  1. Google Research68

    Google Research 提出可证明隐私洞察系统以分析生成式 AI 使用

    Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。

    推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。

10月1日周三
  1. OpenAI News60

    OpenAI 封禁“Nine-emdash Line”相关账户以打击 AI 生成的地域影响力活动

    OpenAI 宣布封禁与一个此前未报告的、源自中国的“Nine-emdash Line”行动相关的账户。该行动被指利用 AI 生成关于南海、香港及美国政治的地域影响力内容。

    推荐理由:OpenAI 官方披露封禁了利用 AI 生成地缘政治影响力内容的特定行动,展示了平台在识别和阻断恶意滥用方面的具体案例。

9月18日周四
9月17日周三
  1. OpenAI News65

    OpenAI 发布模型安全与对齐研究成果

    OpenAI 发布了关于模型安全与对齐的最新研究成果。该报告详细阐述了 OpenAI 在提升模型可控性和降低潜在风险方面采用的技术方法与评估框架。

    推荐理由:OpenAI 官方发布关于模型安全与对齐的研究成果,提供了前沿实验室在风险管控方面的具体技术路径。

4月29日周二
  1. Hugging Face Blog68

    Meta 发布 Llama Guard 4 及 Llama Prompt Guard 2 模型

    Meta 发布 Llama Guard 4,这是一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,支持检测图像和文本中的不安全内容。同时推出两个轻量级 Llama Prompt Guard 2 模型(86M 和 22M 参数),专门用于检测提示词注入和越狱攻击。

    推荐理由:原文详细说明了 Llama Guard 4 的架构剪枝来源、多语言分类能力及与上一代在单图和多图场景下的性能对比数据。

3月10日周一
  1. OpenAI News62

    OpenAI 发布研究:通过监控思维链检测模型利用漏洞的行为

    OpenAI 发布了一项新研究,探讨如何通过监控大语言模型的思维链(Chain of Thought)来检测其利用系统漏洞或进行不当行为的情况。该研究指出,仅依靠输出结果难以发现隐蔽的违规意图,而实时分析内部推理过程能更有效地识别潜在风险。这一方法旨在提升模型在复杂任务中的可解释性与安全性,为后续的对齐工作提供技术参考。

    推荐理由:OpenAI 官方发布关于通过监控思维链来检测模型利用漏洞的研究,为理解大模型内部推理行为的安全评估提供了新视角。

12月5日周四
  1. OpenAI News60

    OpenAI 发布 o1 System Card 安全评估报告

    OpenAI 发布 o1 System Card,概述了 o1 和 o1-mini 模型发布前开展的安全工作。该报告详细说明了依据 Preparedness Framework 进行的外部红队测试及前沿风险评估情况。

    推荐理由:原文提供了 OpenAI o1 系列模型发布前的安全评估报告,读者可据此了解其遵循 Preparedness Framework 进行的红队测试与风险评测细节。

10月23日周三
  1. Hugging Face Blog78

    Google DeepMind 与 Hugging Face 联合发布 SynthID Text 文本水印技术

    Google DeepMind 和 Hugging Face 宣布在 Transformers v4.46.0 中推出 SynthID Text,允许通过 logits processor 对 AI 生成文本添加不可见水印并利用分类器检测。

    推荐理由:原文给出了在 Transformers 中集成 SynthID Text 的具体配置参数、代码示例及检测器训练流程,开发者可据此评估其在现有 LLM 生成链路中的落地可行性。

10月10日周四
  1. Hugging Face Blog65

    Hugging Face 发布 Gradio 5 安全审计报告

    Hugging Face 宣布对 Gradio 5 进行由 Trail of Bits 执行的独立安全审计,所有发现的安全漏洞已在发布前修复。审计覆盖了本地运行、云端部署、分享链接及供应链四个场景,识别出包括 CORS 配置错误导致的令牌窃取、SSRF、任意文件上传引发的 XSS、竞态条件以及远程代码执行等关键风险。

    推荐理由:官方披露了针对 Gradio 5 的独立安全审计结果及修复细节,开发者可据此评估升级后的默认安全性与潜在风险缓解措施。

7月31日周三
5月31日周五
  1. Hugging Face Blog62

    Hugging Face 披露 Spaces 密钥泄露事件并实施安全整改

    Hugging Face 团队检测到对 Spaces 平台的未授权访问,怀疑部分 Spaces secrets 被非法获取。作为补救第一步,官方已撤销相关 HF tokens 并通知受影响用户,建议刷新密钥并切换至新的默认细粒度访问令牌。

    推荐理由:Hugging Face 披露 Spaces 密钥泄露事件及补救措施,用户需立即轮换令牌并启用细粒度访问权限以保障账户安全。

1月27日周四
  1. OpenAI News78

    OpenAI 发布 InstructGPT 并设为 API 默认模型

    OpenAI 推出 InstructGPT 模型,该模型在遵循用户意图、真实性和低毒性方面优于 GPT-3,现已作为默认语言模型部署于其 API。InstructGPT 采用人类反馈强化学习技术训练,旨在更好地对齐用户指令。

    推荐理由:OpenAI 官方宣布 InstructGPT 成为 API 默认模型,展示了通过人类反馈提升指令遵循能力与降低毒性的具体成果。