帮你快速理解、总结文档立即下载

ToolCall 防护

最近更新时间:2026-08-17 17:15:10
我的收藏

功能概述

ToolCall(工具调用)防护是大模型安全面向 AI Agent 场景的专项能力,对大模型发起的工具调用请求进行严格鉴定与意图识别,防止危险命令执行,保护大模型应用的工具调用链安全。
在 AI Agent 场景中,大模型通过 Function Calling / Tool Use 机制调用外部工具执行操作,例如查询数据库、调用第三方 API、执行脚本、发送消息等。攻击者可利用提示词注入等手段操纵模型的工具调用行为,诱导模型执行危险命令、外传数据或破坏系统。
ToolCall 防护对每一次工具调用请求进行安全鉴定,结合参数检测与意图识别两个维度,在工具实际执行前拦截高风险调用。

检测原理

参数检测

对工具调用的输入参数进行结构化和语义化检测,识别参数中携带的危险指令、恶意载荷或越权操作意图。包括:
检测工具调用参数中是否包含命令注入、路径遍历等危险指令。
检测参数中是否携带敏感凭证、内网地址等不应外传的数据。
检测参数是否符合预期格式,识别异常或超长的可疑载荷。

意图识别

结合调用上下文,对工具调用的实际意图进行语义分析,识别声明意图实际行为不一致的调用。包括:
识别被提示词注入操纵的工具调用,如将查询行为篡改为删除行为。
识别试图绕过权限控制的调用,如越权访问其他用户数据。
识别组合多个工具实现攻击目的的链式调用

典型风险场景

风险场景
说明
防护效果
危险命令执行
攻击者诱导模型调用 Shell、数据库等工具执行危险命令
拦截包含危险指令的调用
数据破坏
攻击者诱导模型调用删除、修改数据的工具
识别越权或破坏性意图并拦截
凭据外泄
攻击者诱导模型将密钥、Token 等凭证作为参数外传
检测参数中的敏感凭证并拦截
越权访问
攻击者诱导模型访问其他用户或系统的数据
识别越权调用意图并拦截

配置步骤

前提条件

已通过 SDK/API 接入 方式将 AI Agent 业务接入大模型安全功能。
已调用 DescribeLLMContentSecCheck 接口将 ToolCall 参数上报至大模型安全功能。

操作步骤

1. 登录 Web 应用防火墙控制台,在左侧导航栏选择大模型安全 > SDK 接入
2. 在目标应用的操作列,单击防护配置
3. 在防护配置区域,打开 ToolCall 防护功能开关。
4. 单击 ToolCall 防护,切换至 ToolCall 防护页签。
5. 在规则列表中,找到需要启用的规则,单击右侧规则开关将其打开。
6. 执行动作列下拉框中,选择命中后的处理方式:
观察:记录命中日志,不阻断请求。在策略上线初期可优先选择该动作,便于评估误报率。
拦截:阻断请求,并返回拦截提示。对于输入内容,将阻断用户发往源站的请求;对于输出内容,将停止模型输出并返回提示信息。
7. 如需对多条规则进行批量操作,可勾选规则前的复选框,单击列表上方的批量配置,统一调整执行动作规则开关

注意事项

ToolCall 防护需要业务侧在 SDK/API 调用时传入工具调用的结构化上下文,未传入完整上下文的场景下检测能力会受限。
建议结合业务实际的工具白名单,对允许调用的工具范围进行约束。
检测日志可通过 日志审计 查询,支持回溯分析。

相关文档