跳到正文

#安全/对齐

今日 0 条
12月5日周四
  1. OpenAI News60

    OpenAI 发布 o1 System Card 安全评估报告

    OpenAI 发布 o1 System Card,概述了 o1 和 o1-mini 模型发布前开展的安全工作。该报告详细说明了依据 Preparedness Framework 进行的外部红队测试及前沿风险评估情况。

    推荐理由:原文提供了 OpenAI o1 系列模型发布前的安全评估报告,读者可据此了解其遵循 Preparedness Framework 进行的红队测试与风险评测细节。

11月21日周四
11月7日周四
  1. Mistral AI44

    Mistral AI 发布内容审核 API

    Mistral AI 推出基于 LLM 的内容审核 API,该模型将文本分类为 9 个类别,支持原始文本和对话内容端点。此 API 驱动 Le Chat 的审核服务,原生支持阿拉伯语、中文等 11 种语言,旨在通过处理无资质建议和 PII 等风险增强系统级安全防护。

10月23日周三
  1. Hugging Face Blog78

    Google DeepMind 与 Hugging Face 联合发布 SynthID Text 文本水印技术

    Google DeepMind 和 Hugging Face 宣布在 Transformers v4.46.0 中推出 SynthID Text,允许通过 logits processor 对 AI 生成文本添加不可见水印并利用分类器检测。

    推荐理由:原文给出了在 Transformers 中集成 SynthID Text 的具体配置参数、代码示例及检测器训练流程,开发者可据此评估其在现有 LLM 生成链路中的落地可行性。

10月22日周二
10月15日周二
10月10日周四
  1. Hugging Face Blog65

    Hugging Face 发布 Gradio 5 安全审计报告

    Hugging Face 宣布对 Gradio 5 进行由 Trail of Bits 执行的独立安全审计,所有发现的安全漏洞已在发布前修复。审计覆盖了本地运行、云端部署、分享链接及供应链四个场景,识别出包括 CORS 配置错误导致的令牌窃取、SSRF、任意文件上传引发的 XSS、竞态条件以及远程代码执行等关键风险。

    推荐理由:官方披露了针对 Gradio 5 的独立安全审计结果及修复细节,开发者可据此评估升级后的默认安全性与潜在风险缓解措施。

10月1日周二
9月16日周一
9月4日周三
  1. Hugging Face Blog35

    Hugging Face 与 TruffleHog 合作集成密钥扫描功能

    Hugging Face 宣布与 Truffle Security 合作,将开源工具 TruffleHog 的密钥扫描功能集成至平台。该集成扩展了自动安全扫描管道,新增针对密码、令牌和 API 密钥的检测能力,并在发现已验证泄露时通知用户。同时推出原生 `trufflehog huggingface` 命令,支持用户主动扫描模型、数据集及 Spaces 中的敏感信息。

8月6日周二
  1. Hugging Face Blog23

    Hugging Face 2024年安全功能亮点

    Hugging Face 发布2024年安全功能概览,涵盖细粒度令牌、双因素认证及提交签名等默认防护机制。平台通过 ClamAV 和 picklescan 实现自动化恶意软件与密钥扫描,保障 Hub 用户资产安全。企业版额外提供 SSO 单点登录及资源组隔离等高级控制选项。

7月31日周三
7月24日周三
7月17日周三
7月10日周三
6月27日周四
6月20日周四
6月8日周六
5月31日周五
  1. Hugging Face Blog62

    Hugging Face 披露 Spaces 密钥泄露事件并实施安全整改

    Hugging Face 团队检测到对 Spaces 平台的未授权访问,怀疑部分 Spaces secrets 被非法获取。作为补救第一步,官方已撤销相关 HF tokens 并通知受影响用户,建议刷新密钥并切换至新的默认细粒度访问令牌。

    推荐理由:Hugging Face 披露 Spaces 密钥泄露事件及补救措施,用户需立即轮换令牌并启用细粒度访问权限以保障账户安全。

5月30日周四
5月24日周五
5月21日周二
5月1日周三
4月20日周六