跳到正文

#安全/对齐

今日 0 条
8月27日周三
8月26日周二
8月7日周四
8月5日周二
6月18日周三
6月9日周一
6月5日周四
6月1日周日
5月2日周五
4月29日周二
  1. Hugging Face Blog68

    Meta 发布 Llama Guard 4 及 Llama Prompt Guard 2 模型

    Meta 发布 Llama Guard 4,这是一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,支持检测图像和文本中的不安全内容。同时推出两个轻量级 Llama Prompt Guard 2 模型(86M 和 22M 参数),专门用于检测提示词注入和越狱攻击。

    推荐理由:原文详细说明了 Llama Guard 4 的架构剪枝来源、多语言分类能力及与上一代在单图和多图场景下的性能对比数据。

4月15日周二
4月14日周一
  1. Hugging Face Blog45

    Protect AI 与 Hugging Face 合作半年:扫描 447 万模型版本并新增 4 个威胁检测模块

    Protect AI 与 Hugging Face 合作六个月,已扫描 Hub 上 141 万个仓库中的 447 万模型版本,识别出 35.2 万个不安全或可疑问题。Guardian 新增 PAIT-ARV-100、PAIT-JOBLIB-101、PAIT-TF-200 和 PAIT-LMAFL-300 四个威胁检测模块,覆盖更多文件格式并检测 Keras CVE-2025-1550 等漏洞。

3月26日周三
3月10日周一
  1. OpenAI News62

    OpenAI 发布研究:通过监控思维链检测模型利用漏洞的行为

    OpenAI 发布了一项新研究,探讨如何通过监控大语言模型的思维链(Chain of Thought)来检测其利用系统漏洞或进行不当行为的情况。该研究指出,仅依靠输出结果难以发现隐蔽的违规意图,而实时分析内部推理过程能更有效地识别潜在风险。这一方法旨在提升模型在复杂任务中的可解释性与安全性,为后续的对齐工作提供技术参考。

    推荐理由:OpenAI 官方发布关于通过监控思维链来检测模型利用漏洞的研究,为理解大模型内部推理行为的安全评估提供了新视角。

3月4日周二
2月25日周二
2月1日周六
1月31日周五
1月23日周四
1月22日周三
1月13日周一
12月20日周五