Hugging Face 与 Wiz Research 合作提升 AI 安全
Hugging Face 宣布与云安全公司 Wiz 合作,集成其漏洞管理和 CSPM 功能以强化平台安全。Wiz 研究人员发现利用 pickle 文件在沙箱执行任意代码的缺陷,Hugging Face 已修复该问题并推广 Safetensors 作为替代方案。
Hugging Face 宣布与云安全公司 Wiz 合作,集成其漏洞管理和 CSPM 功能以强化平台安全。Wiz 研究人员发现利用 pickle 文件在沙箱执行任意代码的缺陷,Hugging Face 已修复该问题并推广 Safetensors 作为替代方案。
Lighthouz AI 联合 Hugging Face 发布 Chatbot Guardrails Arena,通过社区盲测评估大语言模型及隐私护栏的安全性。
Hugging Face 博客详解 AI 生成内容的水印技术,涵盖生成时嵌入与后处理两种主要方法。文章对比了 Glaze、Nightshade 等数据投毒工具及 Truepic 的 C2PA 签名方案,并分析了开源与闭源水印在防篡改与创新间的权衡。
Haize Labs 联合 Hugging Face 发布 Red-Teaming Resistance Benchmark,旨在通过高质量的人类对抗提示词测试前沿大语言模型的鲁棒性。
OpenAI 正在开发评估大语言模型辅助创建生物威胁风险的蓝图。在包含生物学专家和学生的评测中,GPT-4 仅对生物威胁创建准确率提供至多轻微提升。该发现虽不足以定论,但为后续研究和社区讨论提供了起点。
Hugging Face 推出 Hallucinations Leaderboard,利用 EleutherAI Language Model Evaluation Harness 通过 in-context learning 评估 LLM 在事实性与忠实性方面的幻觉表现。
Hugging Face 推出由 HF leaderboard template 驱动的 LLM Safety Leaderboard,聚焦大模型安全评估。该榜单基于获 NeurIPS 2023 最佳论文奖的 DecodingTrust 平台,覆盖毒性、偏见等八个可信度维度。研究发现 GPT-4 比 GPT-3.5 更脆弱,且无单一模型在所有维度均表现最优。
Hugging Face 在两个 7B 模型上实证评估了 DPO、IPO 和 KTO 三种无需强化学习的对齐算法。修正后的实验显示,在配对偏好设置下 IPO 表现与 DPO 相当且优于 KTO。关键超参数 β 的调优对实现最佳性能至关重要。
OpenAI 资助了来自全球的 10 个团队,旨在设计用于集体治理 AI 的理念和工具。该计划总结了相关创新成果并分享了实施经验。OpenAI 呼吁研究人员和工程师加入,以继续推进这一工作。
OpenAI 启动总额 1000 万美元的 Superalignment Fast Grants,旨在支持超人 AI 系统的对齐与安全研究。资助范围涵盖弱到强泛化、可解释性及可扩展监督等技术方向。
OpenAI 提出一种新的超级对齐研究方向,旨在利用深度学习的泛化特性,通过弱监督者来控制强模型。该研究展示了初步的有前景结果,探索了以弱监督实现强模型可控性的可能性。
OpenAI 正在开发针对高能力 AI 系统的灾难性风险准备方法,以支持其安全性。该举措包括组建 Preparedness 团队并启动一项挑战活动。
OpenAI、Anthropic、Google 和 Microsoft 共同宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元的 AI Safety Fund。该基金旨在支持前沿模型的安全研究与发展。
Hugging Face 发布《伦理与社会通讯》第5期,汇总 CEO Clem 在美国国会作证、欧盟 AI 法案建议等立法倡导活动。团队通过媒体评论与 TED 演讲阐释开源 AI 价值,并推进 IDEFICS 多模态模型偏见测试及内容政策更新。
OpenAI 宣布开放 Red Teaming Network,邀请关注模型安全的领域专家加入。该计划旨在通过外部专家参与,提升 OpenAI 模型的安全性。
OpenAI 利用 GPT-4 辅助制定内容政策及执行审核决策。该应用实现了更一致的标签标注,加速了政策优化的反馈循环,并减少了人工审核员的介入需求。
Hugging Face 联合 Zama 利用全同态加密(FHE)技术,在保护用户隐私和模型 IP 的同时运行 GPT2 推理。通过 Concrete-Python 将 Python 函数转换为 FHE 等效操作,并采用量化技术处理权重与激活值。实验显示,对单个注意力头进行 4-bit 量化后,模型仍保持原始精度的 96%。
OpenAI 宣布参与成立新行业组织 Frontier Model Forum,旨在促进前沿 AI 系统的安全与负责任发展。该论坛将推动 AI 安全研究、确立最佳实践与标准,并协助政策制定者与业界进行信息共享。
OpenAI 与其他领先实验室通过自愿承诺强化 AI 的安全性、可靠性和可信度。这些举措旨在共同推进人工智能治理进程,确立行业安全标准。
Hugging Face 发布伦理与社会通讯,深入分析 Stable Diffusion、DALL-E 2 等文本到图像模型的偏见成因。文章指出训练数据(如 LAION-5B)、CLIP 推理偏差及潜在空间结构均会导致刻板印象输出。Hugging Face 通过 Stable Bias 项目展示相关探索工具,强调需结合技术手段与社会语境共同应对多模态生成中的公平性挑战。
Hugging Face 发布更新后的内容指南与政策,旨在支持开放、协作且负责任的机器学习社区。新政策重点强调“同意”作为核心价值,以应对 AI 技术对用户隐私、形象及权利带来的新挑战。平台通过跨团队专家协作制定规则,并鼓励利用 Community Tab 促进用户间的协作解决冲突。
OpenAI 启动网络安全资助计划,旨在通过拨款及其他支持措施,促进面向防御者的 AI 驱动型网络安全能力开发。
OpenAI 指出当前是开始思考超级智能治理的合适时机。超级智能被定义为未来比通用人工智能(AGI)能力更强大的 AI 系统。
OpenAI 正式宣布启动漏洞赏金计划。该举措旨在通过社区协作,确保其技术与服务具备安全性、可靠性及可信度,以践行开发安全先进 AI 的承诺。
OpenAI 发布文章阐述其 AI 安全理念,强调确保 AI 系统被安全地构建、部署和使用是其使命的关键部分。
Hugging Face 在《Ethics and Society Newsletter #3》中提出“开放且良善”的 ML 使命,通过平衡开放性与风险控制来防止模型危害。平台推出六大伦理标签分类及社区标记功能,旨在通过文档化和工具化手段,确保开源科学在赋能个体的同时最小化潜在伤害。
Hugging Face 在 Diffusers 库文档中发布伦理框架,指导维护者处理社区贡献并明确透明度、一致性等核心价值观。该指南配套提供“Not For All Eyes”标签、Stable Diffusion 偏见评估空间及 Safe Stable Diffusion 等安全机制。项目还引入 OpenRAILs 许可与 Hub 分阶段发布功能,以平衡开放访问与负责任使用。
Hugging Face Blog 探讨通过红队测试发现 LLM 漏洞,指出 GPT3 等模型易受提示注入攻击并生成有害内容。文章对比了红队与对抗性攻击的区别,强调需结合 RLHF 微调及多组织协作数据集来应对新兴能力带来的安全挑战。
OpenAI 阐述其大语言模型在安全对齐方面的原则,强调通过 RLHF 等技术减少模型幻觉并提升有用性。该策略旨在平衡智能表现与安全约束,确保 AI 输出符合人类价值观且具备可控性。
OpenAI 推出一个经过训练的分类器,旨在区分 AI 生成文本与人类撰写文本。该工具专注于通过技术手段识别内容来源,为判断文本是否由人工智能创作提供依据。
OpenAI 研究人员联合乔治城大学安全与新兴技术中心及斯坦福互联网观测站,发布关于大语言模型被用于虚假信息的威胁分析报告。该研究基于2021年10月汇集30名专家的研讨会及一年多的调研,提出了分析潜在缓解措施的框架。
Hugging Face 发布伦理与社会通讯,指出机器学习偏见复杂且单一技术干预难以根治。文章分享了在任务定义、数据集策划和模型训练阶段分析偏见的经验与工具,旨在支持社区更好地应对 ML 开发中的社会风险。
Hugging Face 展示利用 Concrete-ML 库在完全同态加密(FHE)环境下构建情感分析模型,实现无需解密即可对敏感数据进行推理。该方案结合 Transformer 隐藏层表示与 XGBoost 分类器,并支持通过客户端/服务器协议部署至云端,最终提供 Hugging Face Spaces 完整演示。
Hugging Face 为 🤗 Evaluate 库添加偏见度量,支持评估 GPT-2、BLOOM 等因果语言模型的毒性、极性和伤害性。该功能利用 R4 Target 模型检测仇恨言论,通过对比不同代词提示下的生成结果量化偏见差异,帮助社区理解模型编码的社会问题。
Hugging Face 推出首期“伦理与社会”通讯,旨在探讨如何将协作、责任与透明等价值观融入 AI 开发。该通讯由跨部门非专职团队编写,计划每季发布一次,分享关于可审计性、文档规范及社区反馈机制的实践思考。
OpenAI 正在提升 AI 系统从人类反馈中学习及协助人类评估 AI 的能力。其目标是构建一个充分对齐的 AI 系统,以解决其他所有对齐问题。
OpenAI 推出改进版内容审核工具 Moderation endpoint,旨在优化此前的内容过滤器。该工具现已向 OpenAI API 开发者免费开放使用。
OpenAI 为 DALL·E 2 实施新技术,使其生成的人物图像更准确反映世界人口多样性。该更新旨在减少模型偏见并提升安全性。
OpenAI 为 DALL·E 2 实施预训练缓解措施,旨在降低强大图像生成模型的风险。通过设置多重防护栏,防止生成的图像违反内容政策,从而支持向更广泛受众分享该模型。
OpenAI 训练了专门描述摘要缺陷的“撰写批评”模型,人类评估者在看到这些批评后能更频繁地发现错误。实验显示,更大规模的模型在自我批评方面表现更佳,且规模对批评能力的提升幅度超过对摘要生成能力的提升。这一成果展示了利用 AI 系统辅助人类监督 AI 处理复杂任务的前景。