帮你快速理解、总结文档立即下载

内容合规检测

最近更新时间:2026-08-21 14:18:31
我的收藏

功能概述

内容合规检测是面向大模型应用的内容安全审核能力,对大模型交互的输入和输出进行检测以识别违规内容,帮助落实内容安全合规要求。
大模型在面向用户提供服务的场景中,可能因用户恶意输入或模型自身生成机制缺陷而产生合规风险内容。内容合规检测同时作用于输入侧和输出侧,根据客户设置的安全策略,对交互内容中实际出现的违规内容进行逐条识别与分级处置。

检测类型

内容合规检测覆盖违法、违规、低俗等常见风险类型。完整规则项以控制台展示为准。

配置步骤

流量接入

前提条件

已通过 流量接入 方式将大模型业务接入大模型安全功能。

操作步骤

1. 登录 Web 应用防火墙控制台,在左侧导航栏,选择大模型安全 > 防护配置
2. 选择目标业务实例和域名,单击自定义防护规则
3. 在自定义防护规则页面,单击添加规则
4. 在添加自定义防护规则窗口中,进行参数配置。
5. 检测内容选择涉敏信息,具体参数说明详情请参考 参数说明
6. 完成所有参数设置后,打开规则开关,然后单击确定提交配置,该规则即可生效。

SDK/API 接入

前提条件

已通过 SDK/API 接入 方式将大模型业务接入大模型安全功能。
已调用 DescribeLLMContentSecCheck 接口将待检测内容上报至大模型安全功能。

操作步骤

1. 登录 WAF 控制台,在左侧导航栏选择大模型安全 > SDK 接入
2. 在目标应用的操作列,单击防护配置
3. 在防护配置区域,打开内容合规检测功能开关。
4. 单击内容合规检测,切换至内容合规检测页签。
5. 在规则列表中,找到需要启用的规则,单击右侧规则开关将其打开。
6. 执行动作列下拉框中,选择命中后的处理方式:
观察:记录命中日志,不阻断请求。在策略上线初期可优先选择该动作,便于评估误报率。
拦截:阻断请求,并返回拦截提示。对于输入内容,将阻断用户发往源站的请求;对于输出内容,将停止模型输出并返回提示信息。
说明:
首次启用或调整检测程度时,建议先将处置动作设为观察模式,运行一段时间评估误报和漏报情况后再调整为拦截。若直接开启拦截,正常请求被误判为违规内容时将被直接阻断,可能导致服务拒答、对话中断,使用户体验下降。
7. 检测模式列下拉框中,选择检测方向:
入向检测:仅检测输入提示词。
出向检测:仅检测模型输出。
入向出向都检测:同时检测输入与输出。
8. 如需对多条规则进行批量操作,可勾选规则前的复选框,单击列表上方的批量配置,统一调整执行动作检测模式规则开关

注意事项

建议先以观察模式验证,确认适用性后再启用拦截。
内容合规检测的规则由腾讯安全团队持续维护和更新,检测库会自动同步。
通过 SDK/API 接入时,检测结果可通过 日志审计 查询,方便审计和回溯。

相关文档