OpenAI 发布 o1 System Card 安全评估报告
OpenAI 发布 o1 System Card,概述了 o1 和 o1-mini 模型发布前开展的安全工作。该报告详细说明了依据 Preparedness Framework 进行的外部红队测试及前沿风险评估情况。
推荐理由:原文提供了 OpenAI o1 系列模型发布前的安全评估报告,读者可据此了解其遵循 Preparedness Framework 进行的红队测试与风险评测细节。
OpenAI 发布 o1 System Card,概述了 o1 和 o1-mini 模型发布前开展的安全工作。该报告详细说明了依据 Preparedness Framework 进行的外部红队测试及前沿风险评估情况。
推荐理由:原文提供了 OpenAI o1 系列模型发布前的安全评估报告,读者可据此了解其遵循 Preparedness Framework 进行的红队测试与风险评测细节。
OpenAI 宣布在红队测试中结合人类专家与 AI 技术,以进一步提升模型安全性。该举措旨在通过人机协作的方式,更全面地识别和修复潜在风险。
Mistral AI 推出基于 LLM 的内容审核 API,该模型将文本分类为 9 个类别,支持原始文本和对话内容端点。此 API 驱动 Le Chat 的审核服务,原生支持阿拉伯语、中文等 11 种语言,旨在通过处理无资质建议和 PII 等风险增强系统级安全防护。
Google DeepMind 和 Hugging Face 宣布在 Transformers v4.46.0 中推出 SynthID Text,允许通过 logits processor 对 AI 生成文本添加不可见水印并利用分类器检测。
推荐理由:原文给出了在 Transformers 中集成 SynthID Text 的具体配置参数、代码示例及检测器训练流程,开发者可据此评估其在现有 LLM 生成链路中的落地可行性。
Hugging Face 宣布与 Protect AI 建立合作伙伴关系,将 Guardian 工具集成至其扫描器套件以增强模型安全性。Guardian 能检测 pickle 和 Keras Lambda 层等序列化格式中的任意代码执行漏洞。所有公共模型仓库在推送到 Hub 时将被自动扫描,无需用户额外操作。
OpenAI 分析了 ChatGPT 如何根据用户姓名进行回应,以评估其公平性。研究团队利用 AI 研究助手处理数据,从而在分析过程中保护用户隐私。
Hugging Face 宣布对 Gradio 5 进行由 Trail of Bits 执行的独立安全审计,所有发现的安全漏洞已在发布前修复。审计覆盖了本地运行、云端部署、分享链接及供应链四个场景,识别出包括 CORS 配置错误导致的令牌窃取、SSRF、任意文件上传引发的 XSS、竞态条件以及远程代码执行等关键风险。
推荐理由:官方披露了针对 Gradio 5 的独立安全审计结果及修复细节,开发者可据此评估升级后的默认安全性与潜在风险缓解措施。
OpenAI 封禁了名为“A2Z”的账号,这些账号利用 AI 生成关于选举、乌克兰及政治的多语言影响力内容。该行动旨在打击跨平台传播此类操纵性信息的行为。
OpenAI 封禁了名为“STORM-2035”的伊朗来源账号,这些账号利用 AI 生成美国和英国选举内容并在多个网站发布。
OpenAI 封禁了一个疑似源自美国的账号,该账号利用 AI 生成虚假的 ChatGPT 错误信息,谎称检测到“俄罗斯水军”活动。
OpenAI 封禁了与伊朗关联的 STORM-0817 账户,这些账户利用 AI 调试 Android 恶意软件、抓取社交平台数据并翻译工具。该行动旨在遏制滥用 AI 技术进行网络攻击和数据收集的行为。
OpenAI 封禁了利用 AI 起草针对越南公众人物和平台的滥用报告与投诉的账号。此举旨在打击通过自动化手段发起恶意举报的行为,维护平台秩序。
OpenAI 封禁了疑似属于 CyberAv3ngers 的账户。这些账户被指利用 AI 研究工业控制系统、默认凭证及攻击目标。
OpenAI 封禁了疑似属于中国关联威胁组织 SweetSpecter 的账户。该组织被指利用 AI 研究漏洞、编写代码并支持鱼叉式钓鱼攻击活动。
OpenAI 封禁了利用 AI 生成党派评论的卢旺达来源账户。该行动旨在应对该国大选前的政治操纵行为,阻止通过自动化手段大规模发布 partisan comments。
OpenAI 封禁了利用 AI 生成批评俄罗斯反腐基金会及相关人物评论的账号。此举旨在打击通过自动化手段针对特定机构和个人进行恶意攻击的行为,体现了平台对滥用 AI 生成有害内容的治理措施。
OpenAI 封禁了名为“Stop News”的俄罗斯来源账户,这些账户利用 AI 生成多语言文章和帖子,针对乌克兰及西方进行影响力活动。
OpenAI 封禁了通过一家以色列初创公司访问其模型以生成对话并在 X 平台发送赌博网站链接的账户。该行动针对名为“Bet Bot”的赌博垃圾信息网络,旨在遏制利用 AI 模型进行自动化恶意营销的行为。
OpenAI 发布关于其安全与隐私实践的最新进展。该更新旨在向用户透明展示公司在保障服务安全性方面的具体措施与改进方向。
Hugging Face 宣布与 Truffle Security 合作,将开源工具 TruffleHog 的密钥扫描功能集成至平台。该集成扩展了自动安全扫描管道,新增针对密码、令牌和 API 密钥的检测能力,并在发现已验证泄露时通知用户。同时推出原生 `trufflehog huggingface` 命令,支持用户主动扫描模型、数据集及 Spaces 中的敏感信息。
Hugging Face 发布2024年安全功能概览,涵盖细粒度令牌、双因素认证及提交签名等默认防护机制。平台通过 ClamAV 和 picklescan 实现自动化恶意软件与密钥扫描,保障 Hub 用户资产安全。企业版额外提供 SSO 单点登录及资源组隔离等高级控制选项。
Google 在 Hugging Face 博客宣布扩展 Gemma 模型家族,新增 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器套件。
推荐理由:原文详细展示了 Gemma 2 2B 在端侧部署与辅助生成中的具体用法,以及 ShieldGemma 和 Gemma Scope 的开源特性,为开发者提供了可落地的技术参考。
OpenAI 开发并应用了一种名为 Rule-Based Rewards (RBRs) 的新方法,旨在使模型在无需大量人工数据收集的情况下实现安全对齐。该方案通过基于规则的奖励机制优化模型行为,降低了对传统人类标注数据的依赖。
OpenAI 研究表明,Prover-Verifier Games 能显著提升语言模型输出的可读性。该方法使 AI 解决方案对人类和机器而言更清晰、更易验证且更具可信度。
OpenAI 与洛斯阿拉莫斯国家实验室宣布建立研究合作伙伴关系。双方将共同开发安全评估体系,以衡量前沿模型相关的生物能力与风险。
Hugging Face 在 Dataset Hub 推出新功能,利用开源工具 Presidio 自动生成数据集个人身份信息(PII)检测报告。该功能旨在帮助机器学习从业者识别预训练数据中残留的敏感信息,辅助其在模型训练前进行数据过滤与合规性验证。
OpenAI 发布了名为 CriticGPT 的新模型,该模型基于 GPT-4 构建,专门用于对 ChatGPT 的回答生成批评意见。其核心目的是在 RLHF(基于人类反馈的强化学习)过程中,帮助人类训练师更准确地识别 ChatGPT 回答中的错误。
OpenAI 启动网络安全资助计划,旨在支持创新研究与 AI 在网络安全领域的整合。该计划重点强调利用人工智能技术增强网络防御能力,推动相关前沿探索与应用落地。
OpenAI 提出一种构建稳健且实用的自然语言分类系统的整体方法,旨在解决现实世界中的内容审核问题。该方案聚焦于提升模型在真实场景下对不良内容的检测能力与实用性。
OpenAI 深入解析其文本转语音模型 Voice Engine 的技术原理,并分享相关安全研究成果。该文章重点探讨了支撑这一语音合成技术的底层机制及相应的安全防护措施。
Hugging Face 团队检测到对 Spaces 平台的未授权访问,怀疑部分 Spaces secrets 被非法获取。作为补救第一步,官方已撤销相关 HF tokens 并通知受影响用户,建议刷新密钥并切换至新的默认细粒度访问令牌。
推荐理由:Hugging Face 披露 Spaces 密钥泄露事件及补救措施,用户需立即轮换令牌并启用细粒度访问权限以保障账户安全。
OpenAI 终止了与隐蔽影响行动相关的账户,并指出其服务未导致受众显著增加。此举旨在破坏利用 AI 进行的欺骗性活动,防止相关操作通过平台扩大影响力。
Meta 推出开源基准测试框架 CyberSecEval 2,用于评估 LLM 在代码解释器滥用、攻击性能力及提示注入方面的安全风险。数据显示,自 2023 年 12 月首版以来,LLM 协助网络攻击的平均合规率已从 52% 降至 28%,但提示注入防御仍是未解难题。
OpenAI 阐述其安全实践,强调通用人工智能(AGI)虽能惠及生活各方面,但必须负责任地开发与部署。
OpenAI 封禁了与名为“Bad Grammar”的俄罗斯关联行动相关的账户。该行动利用 AI 生成关于乌克兰、摩尔多瓦、波罗的海及美国政治的英语和俄语 Telegram 评论。
OpenAI 封禁了与俄罗斯“Doppelganger”行动相关的账户,该行动利用 AI 生成反乌克兰的社交媒体评论、翻译及多语言网站文案。
OpenAI 封禁了与伊朗起源的“IUVM”影响力内容网络相关的账户。该网络利用 AI 生成和翻译支持伊朗、反对以色列及美国的网站内容。
OpenAI 宣布已阻止一个名为“Disruptive Cyber Group”的团体利用其模型进行虚假宣传活动。该组织被指试图通过自动化手段大规模生成误导性内容以操纵舆论,OpenAI 通过内部监控机制识别并切断了相关账户的使用权限。
OpenAI 封禁了与名为“Zero Zeno”的以色列关联行动相关的账户。该行动利用 AI 生成反哈马斯、反卡塔尔、亲以色列、反 BJP 及支持 Histadrut 的内容。
OpenAI 提出“指令层级”方法,旨在训练大语言模型优先遵循系统级特权指令。当前 LLM 易受提示注入和越狱攻击,导致原始指令被恶意覆盖。该方案通过区分指令优先级,增强模型对对抗性攻击的防御能力。