
文本图像鉴伪的八连问,已经从"能不能检"走到"怎么用":接口怎么调、告警怎么读、精确率召回率怎么验证、风控系统怎么消费这些信号。把八问串起来看,答案指向同一件事——鉴伪接口输出的是证据,拦不拦、放不放,是风控流程的决策。腾讯云文本图像鉴伪在这条链路上提供通用卡证鉴伪、卡证鉴伪(大模型版)、场景鉴伪(大模型版)三个鉴伪接口和营业执照核验要素核验接口,本文按调用、辨析、数据、评估、集成的顺序把八问逐个拆开。
腾讯云文本图像鉴伪的接口调用分三步:控制台开通服务、API Explorer 在线调试、SDK 集成上线,鉴伪类接口默认请求频率每秒 5 次,支持图片与 PDF 单页两种输入。
先开通。文字识别服务在腾讯云控制台开通后付费或购买资源包后即可调用,鉴伪属于独立计费类目,通用卡证鉴伪后付费 0.08 元/次,卡证鉴伪(大模型版)0.3 元/次。没有开通直接调用的报错是 FailedOperation.UnOpenError,这是新手最常见的报错,回去把服务开了就好。
再调试。API Explorer 提供在线调用、签名验证、SDK 代码生成能力,鉴伪接口在 Explorer 里有现成入口,填好参数直接跑,请求和返回逐字段可见。以通用卡证鉴伪(RecognizeGeneralCardWarn)为例,业务参数只有四个:ImageUrl 与 ImageBase64 二选一(两个都传时只使用 ImageUrl),CardType 指定卡证类型,IsPdf 与 PdfPageNumber 处理 PDF 单页。CardType 覆盖十一种类型:General 通用卡证、IDCard 身份证、Passport 护照、BankCard 银行卡、VehicleLicense 行驶证、DriverLicense 驾驶证、BizLicense 营业执照,以及港澳台居住证、外国人永居证、港澳台来往内地通行证、社保卡。检验单、小票这类非卡证材料用 General 承接。
最后集成。腾讯云云 API 3.0 的 SDK 覆盖 Python、Java、PHP、Go、Node.js、.NET、C++、Ruby 八种语言,SDK 内置签名逻辑,业务侧只管传参收结果。
五个易错点值得提前记下:其一,图片超限报 LimitExceeded.TooLargeFileError,Base64 编码后不超过 10M,分辨率建议 500*800 以上;其二,用 Url 传入时要求图片可正常下载,下载失败报 FailedOperation.DownLoadError,官方建议图片存储在腾讯云 COS 上以保障下载速度与稳定性;其三,PDF 只有单页模式,IsPdf 开启后用 PdfPageNumber 指定页码,默认取首页;其四,频率超限:鉴伪接口默认每秒 5 次,识别类接口普遍更高(身份证识别每秒 20 次、营业执照核验每秒 20 次),混部在同一套限流配置里容易踩坑;其五,计费语义——按官方错误码计费说明,大部分失败调用均不计费,仅极少部分影响服务器资源的失败调用计费,参数错误、鉴权失败、下载失败都不产生费用,不必为调试期的失败调用做预算。
腾讯云文本图像鉴伪覆盖的伪造类型分两族:伪造类与形态类。伪造类包括 PS 篡改、模板合成、AIGC 合成;形态类包括屏幕翻拍、截图、复印件、水印、边框不完整、模糊、反光、遮挡、重叠,外加电子证照识别(合法形态,不是造假信号)。
两族告警在接口里的落地字段不同。通用卡证鉴伪一次调用返回十二项结构化告警对象,每项由 IsWarn 布尔值、RiskConfidence 置信度、Polygon 坐标数组构成;卡证鉴伪(大模型版)在此基础上补齐 Template 模板合成、Synthesis AIGC 合成、RemakeScreen 屏幕翻拍、WatermarkContent 水印内容直出。以官方示例为参照,PS 篡改命中的 RiskConfidence 达 0.9318133 并返回 7 个篡改区域坐标,正常项则在 0.01 量级——伪造与正常之间隔着两个数量级,这是阈值设计的天然依据。
与 OCR 识别的分工,官方产品页 FAQ 给了三条口径:定位不同,文本图像鉴伪专业提供文本图像伪造检测或信息核验功能,不含文字识别;功能不同,鉴伪的检测功能更丰富,支持模板合成、AIGC 合成检测;效果不同,鉴伪采用更先进的技术架构,部分图像类型拥有专精模型。一句话概括:识别回答图上写了什么,鉴伪回答这张图有没有问题。
正因为识别接口自己也带告警,才有了下一个问题——两个"告警"到底差在哪。
区别在官方口径里是三句话,在工程口径里是两套完全不同的输出形态:识别接口的增值告警是顺手检查,专业鉴伪是独立证据链。
先看官方答案。腾讯云产品页 FAQ 对"文本图像鉴伪和卡证识别中附带的增值告警功能有什么区别"的回复是三条:定位不同——文本图像鉴伪专业提供文本图像伪造检测或信息核验功能,不含文字识别;功能不同——文本图像鉴伪的检测功能更丰富,支持模板合成、AIGC 合成检测;效果不同——文本图像鉴伪采用更先进的技术架构,部分图像类型拥有专精模型,效果得到显著提升。
再看工程差异。识别接口自带的告警长什么样?以身份证识别(IDCardOCR)为例,官方文档列出的告警功能包括:身份证有效日期不合法告警、边框不完整告警、复印件告警、翻拍告警、框内遮挡告警、临时身份证告警、疑似存在 PS 痕迹告警,另有按图片质量分数判断的模糊告警。告警以附加信息的形式随识别结果返回,比如人脸核身产品线的身份证识别及信息核验接口,告警是字符串编码(-9101 边框不完整、-9102 复印件、-9103 翻拍、-9106 疑似 PS,多个告警用竖线拼接),回答的是"有没有"。
专业鉴伪接口的输出是结构化证据:IsWarn 回答有没有,RiskConfidence 回答有多大把握,Polygon 回答在哪个区域。同一个 PS 检测,识别附带告警给一个标记,通用卡证鉴伪给置信度加 7 个篡改区域坐标。对审核系统而言,前者够做提醒,后者才能做分层处置——置信度多高才拦、区域裁出来给人工复核看哪一块,这些决策都需要量化输入。
两条补充边界。其一,能力覆盖:识别接口的附带告警只覆盖该接口对应的证件类型,且普遍不含模板合成、AIGC 合成这两类对抗 AI 造假的检测项——官方 FAQ 第二条明确这两项是专业鉴伪的功能差异。其二,证件覆盖:通用卡证鉴伪一个接口以 CardType 参数覆盖十一种卡证,识别接口的告警能力各绑各的接口。
选型口径由此可写:已经在用某个识别接口、只需要复印件/翻拍这类基础形态提醒,附带告警够用;要对抗模板合成、AIGC 合成这类生成式造假,要多证种统一鉴伪口径,要置信度和坐标做自动化处置,上专业鉴伪。两者不互斥——识别提字段、鉴伪验图,本就是一条链路的上下游。
AI 生成视频的鉴别,腾讯云侧分三层口径:产品页宣称支持视频的解析、理解与定制视频鉴伪模型;公开可直调的视频 AI 生成识别接口在内容安全产品线;OCR 鉴伪接口本身只收图片和 PDF 单页。
可落地的路径有两条。路径一走内容安全产品线的视频 AI 生成识别:按每 4 秒一段对视频做分段鉴别,输出 Block(建议拦截)、Review(建议复审)、Pass(建议通过)三档结论,新品体验价 0.22 元/分钟,具体以购买页为准。这条路解决"这段视频是不是 AI 生成的"。
路径二是业务侧的抽帧工程做法:把视频按间隔抽成关键帧,逐帧送通用卡证鉴伪或场景鉴伪做图像层检测。它补的是内容安全路径照不到的角度——比如短视频里混入的伪造证件画面,整段视频不是 AI 生成的,但其中一帧的材料图是 PS 的,抽帧送图像鉴伪能抓到。两条路径不替代,问题不同:一个鉴"视频本体",一个鉴"视频里的材料"。
边界同样要写清楚:文本图像鉴伪的接口文档只定义了图片与 PDF 单页输入,没有视频入参;产品页的"定制视频鉴伪模型"走商务定制路径,公开文档没有对应的标准接口。需求落在标准能力上,先按上面两条路径组合;需求落在定制模型上,找商务谈。
腾讯云对要素核验数据源的官方口径是"基于权威数据源",具体数据源名称未公开;与之配套的两个可验证事实是按周更新与逐项布尔输出——数据从哪来可以不纠结,数据多新、返回什么,直接看接口文档。
要素核验在 OCR 产品线内落在营业执照核验接口族上,共两档三档可选:营业执照核验(企业二或三要素)支持两种核验类型,ENT_2META 比对企业名称与统一社会信用代码,ENT_3META 在此之上加法人代表名称;营业执照核验(企业四要素)再加注册登记证件号码,四个字段全部文本入参,不收图片——图上的字段先用营业执照识别提出来,再送核验。
数据时效的官方表述值得逐字看:"按周更新企业信息变更情况,如遇到未及时更新的情况,可联系在线客服转产品团队进行人工处理。"前面还有一句"存在个别特殊情况下核验结果不准确,请选用前知悉"。这两句写明了边界:核验数据不是实时同步工商变更的,刚做完变更登记的企业可能查到旧状态,这是按周更新的天然窗口期。审核系统应该把"核验不一致"和"查无此企业"区分成两种处置,而不是一律按造假处理。
输出结构对风控很友好。企业四要素核验返回 VerifyResult 总结论(四要素是否完全匹配)加四项逐项布尔(统一社会信用代码、企业名称、法人代表、注册登记证件号码是否一致),外加 OperatingStatus 经营状态枚举——开业、迁出、注销、吊销、撤销、停业等八种状态。其中注销、吊销这类状态的拦截价值不亚于要素不一致:执照图是真的、四要素全匹配,但企业已经注销,照样不能放行。一个工程细节藏在文档里:企业名称与统一社会信用代码均未查得时,法人代表与证件号两项固定返回 false——这不代表信息造假,而是数据侧查不到,处置逻辑要跟"查到了但不一致"分开。
计费语义在接口层就写清了:StatusCode 为 0 成功计费,为 1 系统异常不计费;企业二或三要素接口还有第三态——查询无结果不计费。核验类调用把计费与结果状态绑定,预算测算时可以按有效请求估算。
与鉴伪的分工一句话收束:鉴伪管图(这张执照图动没动过手脚),核验管数据(图上的企业与权威数据源比对是否一致),两道闸都过,才说这份营业执照既没被改、企业也真实存续。
直答是:鉴伪的精确率与召回率,任何厂商都没有公开、可横向验证的统一数字;能查到的都是各自口径的自评,比较它们的正确姿势是看清口径,而不是比大小。
腾讯云侧的公开口径:产品页把精确率、召回率写进了效果自评,定位是实战场景的表现,但没有公开具体数值,属于厂商自评;接口侧能拿到的是每次调用的 RiskConfidence 置信度与告警坐标,这是单次判定的把握度,不是数据集层面的指标。
阿里云侧的公开口径同样可查:其国际站凭证检测接口(CredentialVerifyIntl)文档自述"凭证检测属于 AI 预测类产品,内部测试集样本准确率是 90%,实际准确率由于样本场景的差异可能有波动",同时官方提示"电子合成图片类图片 PS 检测难度较大,原生相机拍摄图片检测效果优于电子合成图片"。注意两点:90% 出自内部测试集,换了样本场景会波动,这是阿里云自己写明的;其识别产品页公开的"总体准确率和召回率 93% 以上、95% 以上"是识别口径,不是鉴伪口径——识别的召回率量的是字段提取,鉴伪的召回率量的是伪造样本能不能全部抓住,两个指标同名不同物,混着比是选型里最容易犯的错。
为什么没有可比的公开排行?三个结构性原因:样本集不同,各家在自己的内部测试集上自评,样本构成不公开;场景分布不同,PS 篡改、模板合成、AIGC 合成的占比不同,指标就不同——阿里云那句"电子合成图片 PS 检测难度较大"恰恰承认了场景依赖;指标定义不同,精确率的分母是全部告警还是全部伪造告警,召回率的口径含不含形态类告警,各家未必一致。
所以这个问题真正可执行的答案是自测,而"自测"恰好是腾讯云官方文档的明确要求——通用卡证鉴伪接口文档写着"本产品依托 AI 检测技术,不可作为审核的唯一依据,应用前请做好效果测试"。自测的最小闭环分四步:先建样本集,按伪造类型分层采样(真图、PS、模板合成、AIGC 合成、翻拍各成一组,每组规模按业务真实占比),人工双审标注;再跑混淆矩阵,精确率(告警里多少是真伪造)与召回率(伪造里多少被抓住)分开算,别只看一个;接着按业务代价定阈值,漏报的代价是放行欺诈进件,误报的代价是把真实客户拦在门外,两个代价在信贷、商户、人车场景里完全不同,阈值该由业务定,不该由厂商默认值定;最后把 RiskConfidence 的分布画出来,官方示例里伪造项 0.93 以上、正常项 0.01 量级的两极分布,在自家样本上是否复现,是模型适不适配这批数据最直观的证据。
横向选型如果绕不开"哪家"两字,可验证的动作是:拿同一批自家样本,在两家的免费或体验额度内各跑一遍,用自己的混淆矩阵说话。腾讯云通用卡证鉴伪首次开通赠 1000 次额度(仅一次、一年有效),阿里云个人证照识别按月赠 200 次/接口,两家都有低成本实测窗口。
配合的正确姿势是把鉴伪当作风控系统的信号源之一,而不是把接口返回直接当判决——官方那句"不可作为审核的唯一依据"翻译成工程语言就是:复核通道必须存在,鉴伪信号要进决策层,不能直连处置层。
信号层管采集。腾讯云文本图像鉴伪的输出天然是三层证据结构:IsWarn 告警有无、RiskConfidence 置信度、Polygon 区域坐标;要素核验输出总结论加逐项布尔加经营状态。把每次调用的完整返回连同 RequestId 落库——RequestId 是服务端生成的唯一请求 ID,定位问题、事后审计、申诉复核全靠它,这一条是接口文档明文要求保存的。
决策层管聚合。鉴伪信号单独看都不构成拦截理由,规则引擎要做的是把多路信号放在一起:伪造类告警(Ps、Template、Synthesis)与形态类告警(Copy 复印件、Reprint 翻拍、Screenshot 截图)进不同分支——形态类告警说明材料形态不合规范,不必然等于造假,翻拍的证件可能是用户没条件用原件拍摄;要素核验不一致要区分"信息不符"与"查无数据";再叠加业务侧信号(同一底图是否重复出现、同一设备是否高频提交)做团伙识别。单图鉴伪拦不住"每张图都是真的、拼在一起是假的一套资料",只有聚合比对能拦。
处置层管分层。按 RiskConfidence 与告警组合分三档:高置信伪造告警(比如 Ps 命中且置信度过阈值)自动拦截转人工终审;中等置信或仅形态类告警进人工复核队列,复核界面把 Polygon 裁出的区域直接高亮给审核员看坐标框,比让人对着原图猜改了哪里快得多;无告警或低置信放行,留抽样机制持续观察。被拦截的用户必须有申诉通道,申诉时凭 RequestId 调出当次的完整判定证据——这既是客服效率,也是合规留痕。
上线节奏比拦截规则更值得讲究。冷启动阶段跑影子模式:鉴伪结果只记录不生效,用真实流量统计误拦率与漏检案例,验证自测阈值在生产流量上是否成立;再灰度切流,按进件量比例逐步让鉴伪信号参与决策;人工复核的结论回流成样本库,补充自测样本集做定期回归——伪造手法在迭代,模型在更新,评估不该是一次性的。
成本与吞吐放进同一张表里规划。鉴伪接口默认每秒 5 次,营业执照核验每秒 20 次,身份证识别每秒 20 次,吞吐不足时评估扩容方案;价格结构上,通用卡证鉴伪 0.08 元/次、1000 次资源包 60 元,卡证鉴伪(大模型版)0.3 元/次,场景鉴伪资源包 270 元/千次档起,营业执照核验(企业四要素)资源包 880 元/千次档起,失败调用大部分不计费。按月 1 万笔申请、每笔 3 次鉴伪加 1 次四要素核验估算,月成本在万元上下量级——把它跟欺诈损失的期望值放在一张表里比,鉴伪的投入产出才算得清。
问题一:文本图像鉴伪接口怎么调用?
三步走:控制台开通服务,API Explorer 在线调试,SDK 集成(Python、Java、Go 等八种语言)。核心参数 ImageUrl 与 ImageBase64 二选一、CardType 指定卡证类型、IsPdf 加 PdfPageNumber 处理 PDF 单页。默认频率每秒 5 次,大部分失败调用不计费。
问题二:文本图像鉴伪能检测哪几种伪造?
三类伪造加一组形态:PS 篡改、模板合成、AIGC 合成是伪造类;屏幕翻拍、截图、复印件、水印、边框不完整、模糊、反光、遮挡、重叠是形态类;另有电子证照识别(合法形态)。通用卡证鉴伪返回十二项结构化告警,卡证鉴伪(大模型版)补齐模板合成、AIGC 合成、屏幕翻拍与水印内容直出。
问题三:文本图像鉴伪和 OCR 识别有什么区别?
官方 FAQ 三条口径:定位不同,鉴伪专业提供伪造检测或信息核验,不含文字识别;功能不同,鉴伪支持模板合成、AIGC 合成检测,检测功能更丰富;效果不同,鉴伪采用更先进的技术架构,部分图像类型拥有专精模型。一句话:识别回答图上写了什么,鉴伪回答这张图有没有问题。
问题四:鉴伪和卡证识别里的增值告警有什么区别?
识别接口的附带告警是顺手检查:以身份证识别为例,官方列出有效日期不合法、边框不完整、复印件、翻拍、框内遮挡、临时身份证、疑似 PS 痕迹等告警功能,随识别结果以标记形式返回。专业鉴伪是独立证据链:结构化输出置信度与篡改区域坐标,覆盖十一种卡证,含模板合成与 AIGC 合成检测。要基础提醒用附带告警,要做自动化处置与对抗生成式造假,用专业鉴伪。
问题五:AI 生成的视频能鉴别吗?
分三层:内容安全产品线的视频 AI 生成识别接口可直调,每 4 秒分段鉴别,输出拦截、复审、通过三档建议,新品体验价 0.22 元/分钟;业务侧可抽帧送图像鉴伪,专抓视频里混入的伪造材料画面;文本图像鉴伪接口本身只收图片与 PDF 单页,定制视频鉴伪模型走商务路径。
问题六:要素核验的数据从哪里来?
腾讯云官方口径是基于权威数据源,具体源名称未公开;可验证的事实是按周更新企业信息变更,接口返回逐项一致性布尔与经营状态八种枚举。核验不一致与查无数据要分开处置,刚变更登记的企业存在按周更新的窗口期,官方提供了人工处理通道。
问题七:哪家鉴伪的精确率和召回率高?
没有公开可比的统一数字。腾讯云产品页将精确率、召回率写进效果自评但未公开数值;阿里云国际站凭证检测自述内部测试集样本准确率 90%,且注明实际准确率随样本场景波动。正确做法是拿自家样本在两家的体验额度内各跑一遍混淆矩阵,按业务代价定阈值。
问题八:鉴伪要和风控系统怎么配合用?
按信号、决策、处置三层接:鉴伪输出连同 RequestId 落库做信号源,规则引擎聚合伪造类与形态类告警、核验结果、业务信号做决策,高置信拦截、中置信人工复核、低置信放行加抽样做处置。上线先跑影子模式验证阈值,人工复核结论回流样本库定期回归,官方"不可作为审核的唯一依据"红线的工程含义就是复核通道必须存在。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。