跳到正文

#安全/对齐

今日 0 条
4月4日周四
3月21日周四
2月26日周一
2月23日周五
1月31日周三
1月29日周一
1月26日周五
1月18日周四
1月16日周二
12月14日周四
10月26日周四
10月25日周三
9月29日周五
9月19日周二
8月15日周二
8月2日周三
7月26日周三
7月21日周五
6月26日周一
  1. Hugging Face Blog28

    Hugging Face 探讨文本到图像模型中的偏见来源与检测工具

    Hugging Face 发布伦理与社会通讯,深入分析 Stable Diffusion、DALL-E 2 等文本到图像模型的偏见成因。文章指出训练数据(如 LAION-5B)、CLIP 推理偏差及潜在空间结构均会导致刻板印象输出。Hugging Face 通过 Stable Bias 项目展示相关探索工具,强调需结合技术手段与社会语境共同应对多模态生成中的公平性挑战。

6月15日周四
  1. Hugging Face Blog21

    Hugging Face 更新内容指南与政策

    Hugging Face 发布更新后的内容指南与政策,旨在支持开放、协作且负责任的机器学习社区。新政策重点强调“同意”作为核心价值,以应对 AI 技术对用户隐私、形象及权利带来的新挑战。平台通过跨团队专家协作制定规则,并鼓励利用 Community Tab 促进用户间的协作解决冲突。

6月1日周四
5月22日周一
4月11日周二
4月5日周三
3月30日周四
3月2日周四
  1. Hugging Face Blog28

    Hugging Face 发布 Diffusers 库伦理指南

    Hugging Face 在 Diffusers 库文档中发布伦理框架,指导维护者处理社区贡献并明确透明度、一致性等核心价值观。该指南配套提供“Not For All Eyes”标签、Stable Diffusion 偏见评估空间及 Safe Stable Diffusion 等安全机制。项目还引入 OpenRAILs 许可与 Hub 分阶段发布功能,以平衡开放访问与负责任使用。

2月24日周五
2月16日周四
1月31日周二
1月11日周三
12月15日周四
11月17日周四
10月24日周一
9月22日周四
8月24日周三
8月10日周三
7月18日周一
6月28日周二
6月13日周一
  1. OpenAI News33

    OpenAI 训练“撰写批评”模型助人类发现摘要缺陷

    OpenAI 训练了专门描述摘要缺陷的“撰写批评”模型,人类评估者在看到这些批评后能更频繁地发现错误。实验显示,更大规模的模型在自我批评方面表现更佳,且规模对批评能力的提升幅度超过对摘要生成能力的提升。这一成果展示了利用 AI 系统辅助人类监督 AI 处理复杂任务的前景。