跳到正文

#安全/对齐

今日 0 条
5月19日周四
4月13日周三
3月23日周三
3月3日周四
1月27日周四
  1. OpenAI News78

    OpenAI 发布 InstructGPT 并设为 API 默认模型

    OpenAI 推出 InstructGPT 模型,该模型在遵循用户意图、真实性和低毒性方面优于 GPT-3,现已作为默认语言模型部署于其 API。InstructGPT 采用人类反馈强化学习技术训练,旨在更好地对齐用户指令。

    推荐理由:OpenAI 官方宣布 InstructGPT 成为 API 默认模型,展示了通过人类反馈提升指令遵循能力与降低毒性的具体成果。

9月23日周四
4月16日周四
4月14日周二
11月21日周四
9月19日周四
  1. OpenAI News37

    OpenAI 基于人类偏好微调 GPT-2

    OpenAI 利用人类反馈对 774M 参数 GPT-2 模型进行微调,成功匹配外部标注员偏好。摘要任务需 60k 标签导致模型倾向复制原文,简单续写任务仅需 5k 标签。此举旨在通过“机器与人对话”场景探索提取人类价值观的安全技术。

8月22日周四
7月10日周三
3月6日周三
2月19日周二
  1. OpenAI News28

    OpenAI 呼吁 AI 安全研究引入社会科学家

    OpenAI 发表论文主张长期 AI 安全研究需引入社会科学家,以确保对齐算法在涉及真实人类时成功。解决高级 AI 系统与人类价值观的对齐问题,需处理人类理性、情感及偏见相关的心理学不确定性。OpenAI 计划招聘社会科学家全职参与该领域工作,旨在促进机器学习与社会科学研究者的协作。

10月22日周一
5月3日周四
2月20日周二
8月3日周四
7月17日周一
6月13日周二
2月24日周五
12月21日周三
6月21日周二