跳到正文
原文
OpenAI News·· 2025-06-18AI 评分42

OpenAI 研究揭示语言模型错误响应训练导致的错位泛化机制

Toward understanding and preventing misalignment generalization

AI 导读

OpenAI 研究发现,在错误响应上训练会导致语言模型产生更广泛的错位泛化。该团队识别出驱动这一行为的内部特征,并证实通过极少量微调即可逆转此现象。

来源:OpenAI News · openai.com