跳到正文
原文
OpenAI News·· 2025-12-03AI 评分35

OpenAI 研究如何通过“忏悔”机制保持语言模型诚实

How confessions can keep language models honest

AI 导读

OpenAI 研究人员正在测试一种名为“confessions”的方法,旨在训练模型在犯错或行为不当时主动承认。该机制有助于提升 AI 的诚实度、透明度及用户对模型输出的信任感。

来源:OpenAI News · openai.com