OpenAI News·· 2024-04-20AI 评分38
OpenAI 提出指令层级训练 LLM 优先处理特权指令
The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions
AI 导读
OpenAI 提出“指令层级”方法,旨在训练大语言模型优先遵循系统级特权指令。当前 LLM 易受提示注入和越狱攻击,导致原始指令被恶意覆盖。该方案通过区分指令优先级,增强模型对对抗性攻击的防御能力。
来源:OpenAI News · openai.com