跳到正文

#安全/对齐

今日 0 条
3月17日周二
3月16日周一
3月13日周五
  1. Berkeley AI Research28

    SPEX 与 ProxySPEX:LLM 大规模交互识别算法

    SPEX 和 ProxySPEX 算法通过稀疏性和低阶性假设,高效识别 LLM 中的关键特征、数据及组件交互。ProxySPEX 利用层级结构特性,在保持性能的同时将消融次数减少约 10 倍。该框架解决了传统方法在大规模上下文下计算不可行的问题,显著提升了可解释性分析效率。

3月11日周三
3月10日周二
3月5日周四
2月27日周五
2月25日周三
2月19日周四
2月13日周五
2月5日周四
2月1日周日
1月28日周三
1月20日周二
12月22日周一
12月18日周四
12月16日周二
12月11日周四
  1. Google DeepMind35

    Google DeepMind 深化与英国 AI 安全研究所合作

    Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型数据,重点开展思维链监控、社会情感影响评估及经济系统模拟等前沿课题。此举旨在通过联合报告与技术协作,提升 Gemini 3 等先进模型的安全性并推动行业进步。

12月10日周三
12月3日周三
11月27日周四
11月20日周四
  1. Google DeepMind63

    Google DeepMind 在 Gemini 应用中推出 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。

    推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。

11月19日周三
11月13日周四
11月12日周三
11月7日周五
11月6日周四
10月30日周四
  1. Google Research68

    Google Research 提出可证明隐私洞察系统以分析生成式 AI 使用

    Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。

    推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。