提示词注入

提示词注入

提示词注入(Prompt Injection)是一种针对大语言模型(LLM)等人工智能系统的攻击技术,攻击者通过精心构造的输入诱导模型绕过其预设规则,执行非预期的恶意操作 。该攻击主要分为直接提示注入和间接提示注入两种方式 ,并被开放全球应用安全项目(OWASP)列为大型语言模型应用的头号安全威胁 。

该问题至少自2020年5月GPT-3发布起就已为安全研究人员所认知 。2022年,相关漏洞被独立发现并公开披露 。2023年初,基于GPT-3 API的Twitter机器人@remoteli.io成为早期公开受害者 ;同年,安全研究人员披露了LangChain框架中多个插件存在的提示注入漏洞 。随着AI Agent的广泛应用,攻击载体从直接输入扩展到网页、文档等外部数据源 ,并出现了针对自动驾驶系统的现实世界攻击案例 。防御方面,OpenAI于2024年4月推出了指令层次法作为缓解对策 ,UC伯克利与Meta的研究团队也提出了相应的防御框架 。

想要了解更多“提示词注入”的信息,请点击:提示词注入百科