帮你快速理解、总结文档立即下载

提示词攻击防护

最近更新时间:2026-08-17 17:46:01
我的收藏

功能概述

提示词攻击(Prompt Injection Attack)是指攻击者通过精心构造的输入文本,诱导大模型突破预设的安全边界,执行越权操作、泄露系统提示词或生成违规内容。其典型特征是输入表面合规无害,但通过越狱指令、角色扮演、虚构情境假设、身份伪造、指令覆盖及编码/多语种转换等诱导性手段,操纵模型脱离既定安全设定。
提示词攻击防护是大模型安全的核心能力之一,通过内置小模型安全检测引擎,对大模型应用输入的请求进行实时审核,精准识别并拦截各类 Prompt 注入攻击与越狱行为。

检测能力

注入模式识别:基于海量攻击样本库,匹配已知注入特征与恶意指令模式,快速阻断常规攻击。
越狱检测:深度识别角色扮演、规则覆盖、逻辑陷阱等试图绕过模型原生安全限制的越狱行为。
编码绕过检测:智能解析 Base64、Hex、Unicode 等多种编码混淆手段,还原真实输入,洞察隐藏攻击意图。
上下文分析:结合多轮对话上下文进行语义关联分析,动态评估输入风险,有效防范碎片化、渐进式攻击。

配置步骤

流量接入

前提条件

已通过 流量接入 方式将大模型业务接入大模型安全功能。

操作步骤

1. 登录 Web 应用防火墙控制台,在左侧导航栏,选择大模型安全 > 防护配置
2. 选择目标业务实例和域名,单击自定义防护规则
3. 在自定义防护规则页面,单击添加规则
4. 在添加自定义防护规则窗口中,进行参数配置。
5. 检测内容选择提示词注入,具体参数说明详情请参考 参数说明
6. 完成所有参数设置后,打开规则开关,然后单击确定提交配置,该规则即可生效。

SDK/API 接入

前提条件

已通过 SDK/API 接入 方式将大模型业务接入大模型安全功能。
已调用 DescribeLLMContentSecCheck 接口将输入的提示词上报至大模型安全功能。

操作步骤

1. 登录 Web 应用防火墙控制台,在左侧导航栏选择大模型安全 > SDK 接入
2. 在目标应用的操作列,单击防护配置
3. 在防护配置区域,打开提示词攻击防护功能开关。
4. 单击提示词攻击防护,切换至提示词攻击防护页签。
5. 在规则列表中,找到需要启用的规则,单击右侧规则开关将其打开。
6. 执行动作列下拉框中,选择命中后的处理方式:
观察:记录命中日志,不阻断请求。在策略上线初期可优先选择该动作,便于评估误报率。
拦截:阻断请求,并返回拦截提示。对于输入内容,将阻断用户发往源站的请求;对于输出内容,将停止模型输出并返回提示信息。
说明:
首次启用时,建议先将处置动作设为观察模式,运行一段时间评估误报和漏报情况后再调整为拦截
7. 如需对多条规则进行批量操作,可勾选规则前的复选框,单击列表上方的批量配置,统一调整执行动作规则开关

注意事项

提示词攻击防护仅对输入侧请求进行检测。
如果您的业务涉及合法的角色扮演场景(如游戏对话、剧本创作),建议先将相关规则设为观察模式,评估误报情况。
提示词注入防护结果可通过 日志审计 查询,方便审计和回溯。

相关文档