跳到正文
原文
OpenAI News·· 2024-04-20AI 评分38

OpenAI 提出指令层级训练 LLM 优先处理特权指令

The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

AI 导读

OpenAI 提出“指令层级”方法,旨在训练大语言模型优先遵循系统级特权指令。当前 LLM 易受提示注入和越狱攻击,导致原始指令被恶意覆盖。该方案通过区分指令优先级,增强模型对对抗性攻击的防御能力。

来源:OpenAI News · openai.com