OpenAI News·2025-06-18 18:00· 2025-06-18AI 评分42OpenAI 研究揭示语言模型错误响应训练导致的错位泛化机制Toward understanding and preventing misalignment generalizationAI 导读OpenAI 研究发现,在错误响应上训练会导致语言模型产生更广泛的错位泛化。该团队识别出驱动这一行为的内部特征,并证实通过极少量微调即可逆转此现象。来源:OpenAI News · openai.com#论文/研究#安全/对齐#OpenAI