
我这是计划参加腾讯云开发者社区「AI Skills 最佳实践」征集活动的一篇投稿,用到的正好是活动框定的 OCR 类 Skills。文末有完整可复现清单,照着做一遍就能跑起来。
先说背景,免得有人觉得这套东西离自己很远。我本职在一家人力资源公司做管理,日常绕不开三样东西:报销发票、业务合同、还有各种证照。以前这些要么财务手工录,要么我自己对着屏幕一张张敲。上个月积了 30 来张发票加几份合同,光录入就占了我大半个下午。
说实话,这事早就能自动化了,我只是迟迟没动手。这次借着活动,我把它真做了一遍,把过程记下来,给同样被纸质/扫描件困扰的朋友参考。

单独用 OCR 工具,出来的是一串识别结果,离"能用"还差一步:字段要对齐、多张要合并、还要导出成 Excel 给财务。WorkBuddy 我平时就在用,它本来就能读本地文件夹、批量处理文件、操作 Office,再挂上活动框定的 OCR 类 Skills,正好补齐"识别→整理→导出"这条流水线。
活动框定的 OCR 类 Skills 里,我挑了三个最对口的:



选这三个,是因为它们覆盖了"标准票 + 表格 + 非标合同"三类我手头真实存在的东西,不贪多。
第 1 步:申请密钥。 到云控制台申请 SecretId / SecretKey,按 Skill 的说明填到 WorkBuddy 的 Skill 配置里(有的也支持走环境变量)。这一步没难度,但容易卡在"权限范围"——我只开了 OCR 相关的,没给多余权限,安全上更踏实。
第 2 步:安装 Skill。 在 WorkBuddy 左侧「技能」里搜对应名字,点一下就装好了。装完直接用自然语言叫它干活,不用写代码,这点对不写程序的人很友好。
第 3 步:WorkBuddy 调用 + 编排。 我给 WorkBuddy 下的指令大概长这样(口语化,不是代码):
把「D:\报销\8月发票」文件夹里所有图片,用通用票据识别提取字段,整理成一张 Excel,列包括:文件名、发票代码、发票号码、金额、税额、价税合计、开票日期、销售方名称、税号。
第 4 步:字段映射。 标准票据的字段是固定的,基本不用调。合同这种非标的,第一次要在「实时文档抽取 Agent」里配字段模板——这是我花时间最多的地方,下面踩坑里细说。
第 5 步:导出 Excel + 人工复核。 WorkBuddy 把结果写成一张表,我过一遍核对。关键结论:机器负责"把字认出来并排好",人负责"确认对不对",别指望全自动零干预。
我拿自己经手的 25 张增值税发票 + 3 份合同扫描件 做了一轮测试,环境是我自己的笔记本(Win11、16G 内存、集显):
所以对我这个样本,单看"识别+汇总"这一步,从 40 分钟缩到 5 分钟量级;加上人工复核,整体也省了一大半时间。但这只是我自己的小样本,票样、清晰度、你的量都不同,结果一定不一样,别直接拿这个数当通用结论。
合同那边,3 份用文档抽取 Agent 抽出核心字段,核对 10 分钟搞定——以前我是通读+手抄,每份至少 15 分钟。
到云控制台申请 SecretId / SecretKey,只开 OCR 权限;
WorkBuddy 里装好「通用票据识别」「表格识别 V3」「实时文档抽取 Agent」;
把待处理文件放一个文件夹,扫描件 PDF 先转 PNG;
用自然语言让 WorkBuddy 调 OCR 识别并汇总成 Excel,列明你要的字段;
非标文档先在抽取 Agent 里配好字段模板,跑通 4 个核心字段再加;
让 WorkBuddy 把低置信度字段标黄,你只复核这些;
导出 Excel 交财务,保留原图备查。这套组合真正的价值不是"识别准不准"(那是 OCR 本身的事),而是把"识别结果变成能直接用的结构化表格"这一步包圆了。对发票合同证照多的岗位,光这一条就值回票价。
它也不是万能:量特别大、格式特别杂的时候,字段模板和复核还是要花心思。我的建议是先拿自己手头 20–30 张练手,跑通最小闭环再扩,比一上来就想全自动现实得多。
说明:本篇为「腾讯云 AI Skills 最佳实践」征集活动投稿,使用活动框定的 OCR 类 Skills 完成真实可复现场景。文中数据为本人小样本实测,非行业基准,请以自己的环境为准。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。