跳到正文

#安全/对齐

今日 0 条
12月11日周四
12月10日周三
12月3日周三
11月27日周四
11月20日周四
  1. Google DeepMind63

    Google DeepMind 在 Gemini 应用中推出 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。

    推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。

11月19日周三
11月13日周四
11月12日周三
11月7日周五
11月6日周四
10月30日周四
  1. Google Research68

    Google Research 提出可证明隐私洞察系统以分析生成式 AI 使用

    Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。

    推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。

10月29日周三
  1. OpenAI News40

    gpt-oss-safeguard 技术报告

    OpenAI 发布 gpt-oss-safeguard 技术报告,介绍基于 gpt-oss 后训练的两个开源权重推理模型:gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b。这些模型旨在根据提供的策略对内容进行标注。报告描述了其能力并提供了以底层 gpt-oss 模型为基线的安全评估结果。

10月28日周二
10月27日周一
10月22日周三
10月14日周二
10月9日周四
10月7日周二
10月1日周三
  1. OpenAI News60

    OpenAI 封禁“Nine-emdash Line”相关账户以打击 AI 生成的地域影响力活动

    OpenAI 宣布封禁与一个此前未报告的、源自中国的“Nine-emdash Line”行动相关的账户。该行动被指利用 AI 生成关于南海、香港及美国政治的地域影响力内容。

    推荐理由:OpenAI 官方披露封禁了利用 AI 生成地缘政治影响力内容的特定行动,展示了平台在识别和阻断恶意滥用方面的具体案例。

9月30日周二
9月29日周一
9月18日周四
9月17日周三
  1. OpenAI News65

    OpenAI 发布模型安全与对齐研究成果

    OpenAI 发布了关于模型安全与对齐的最新研究成果。该报告详细阐述了 OpenAI 在提升模型可控性和降低潜在风险方面采用的技术方法与评估框架。

    推荐理由:OpenAI 官方发布关于模型安全与对齐的研究成果,提供了前沿实验室在风险管控方面的具体技术路径。

9月16日周二
9月12日周五
9月11日周四
9月9日周二
9月2日周二