首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >我用 OCR + WorkBuddy 把一摞发票合同整理成了 Excel

我用 OCR + WorkBuddy 把一摞发票合同整理成了 Excel

原创
作者头像
华东子
发布2026-08-12 16:53:28
发布2026-08-12 16:53:28
1330
举报
文章被收录于专栏:WorkBuddy知识库WorkBuddy知识库

我这是计划参加腾讯云开发者社区「AI Skills 最佳实践」征集活动的一篇投稿,用到的正好是活动框定的 OCR 类 Skills。文末有完整可复现清单,照着做一遍就能跑起来。

先说背景,免得有人觉得这套东西离自己很远。我本职在一家人力资源公司做管理,日常绕不开三样东西:报销发票、业务合同、还有各种证照。以前这些要么财务手工录,要么我自己对着屏幕一张张敲。上个月积了 30 来张发票加几份合同,光录入就占了我大半个下午。

说实话,这事早就能自动化了,我只是迟迟没动手。这次借着活动,我把它真做了一遍,把过程记下来,给同样被纸质/扫描件困扰的朋友参考。

为什么是「OCR Skill + WorkBuddy」这个组合

单独用 OCR 工具,出来的是一串识别结果,离"能用"还差一步:字段要对齐、多张要合并、还要导出成 Excel 给财务。WorkBuddy 我平时就在用,它本来就能读本地文件夹、批量处理文件、操作 Office,再挂上活动框定的 OCR 类 Skills,正好补齐"识别→整理→导出"这条流水线。

活动框定的 OCR 类 Skills 里,我挑了三个最对口的:

  • 腾讯云通用票据识别(高级版):吃增值税发票、普票,直接吐出发票代码、号码、金额、税额、开票日期、销售方这些标准字段;

  • 腾讯云表格识别 V3:扫描件里的表格、对账单,导出 Excel 比老版本稳;

  • 腾讯云实时文档抽取 Agent:合同这种非标文档,自己定义要抽的字段(签约方、金额、期限、违约责任),比硬套票据模板灵活。

选这三个,是因为它们覆盖了"标准票 + 表格 + 非标合同"三类我手头真实存在的东西,不贪多。

我是怎么搭起来的(完整步骤)

第 1 步:申请密钥。 到云控制台申请 SecretId / SecretKey,按 Skill 的说明填到 WorkBuddy 的 Skill 配置里(有的也支持走环境变量)。这一步没难度,但容易卡在"权限范围"——我只开了 OCR 相关的,没给多余权限,安全上更踏实。

第 2 步:安装 Skill。 在 WorkBuddy 左侧「技能」里搜对应名字,点一下就装好了。装完直接用自然语言叫它干活,不用写代码,这点对不写程序的人很友好。

第 3 步:WorkBuddy 调用 + 编排。 我给 WorkBuddy 下的指令大概长这样(口语化,不是代码):

把「D:\报销\8月发票」文件夹里所有图片,用通用票据识别提取字段,整理成一张 Excel,列包括:文件名、发票代码、发票号码、金额、税额、价税合计、开票日期、销售方名称、税号。

第 4 步:字段映射。 标准票据的字段是固定的,基本不用调。合同这种非标的,第一次要在「实时文档抽取 Agent」里配字段模板——这是我花时间最多的地方,下面踩坑里细说。

第 5 步:导出 Excel + 人工复核。 WorkBuddy 把结果写成一张表,我过一遍核对。关键结论:机器负责"把字认出来并排好",人负责"确认对不对",别指望全自动零干预。

我踩过的坑,在这里提示一下,省得你再踩

  1. 扫描件 PDF 不一定能直接吃。 我第一轮丢进去几个 PDF,有的识别正常,有的空手而归。后来统一先转成 PNG 再传,就稳了。所以现在我的流水线第一步是"PDF 转图片",多一道但省心。
  2. 字段模板第一次最费劲。 合同的字段每个人关心的不一样。我一开始想一次抽全,结果模板越配越乱。后来改成"先抽 4 个核心字段(签约方、金额、期限、签订日),跑通后再慢慢加",效率高很多。
  3. 盖章、折叠、反光会丢字段。 有张发票右下角被盖章盖住了一截,金额那栏没识别准。这种只能人工补,但我让 WorkBuddy 把"识别置信度低的字段"单独标黄,复核时一眼就能看到,不用全表重看。
  4. 密钥别乱放。 申请下来的 Key 我只配置在本地 WorkBuddy,没有写进会同步到别处的文件。涉及票据数据,这点谨慎点没坏处。

实测效果(说清楚是我的小样本,不是行业基准)

我拿自己经手的 25 张增值税发票 + 3 份合同扫描件 做了一轮测试,环境是我自己的笔记本(Win11、16G 内存、集显):

  • 手动录入:之前我自己录一张发票大约 1.5–2 分钟(要对金额、税号、日期),25 张就是 40 分钟上下,合同还要另算;
  • OCR + WorkBuddy:图片导入、识别、汇总成表,全程跑下来约 4–5 分钟,剩下我核对 + 补录个别字段又花了大概 10 分钟。

所以对我这个样本,单看"识别+汇总"这一步,从 40 分钟缩到 5 分钟量级;加上人工复核,整体也省了一大半时间。但这只是我自己的小样本,票样、清晰度、你的量都不同,结果一定不一样,别直接拿这个数当通用结论。

合同那边,3 份用文档抽取 Agent 抽出核心字段,核对 10 分钟搞定——以前我是通读+手抄,每份至少 15 分钟。

可复现清单(照着做)

代码语言:txt
复制
到云控制台申请 SecretId / SecretKey,只开 OCR 权限;
WorkBuddy 里装好「通用票据识别」「表格识别 V3」「实时文档抽取 Agent」;
把待处理文件放一个文件夹,扫描件 PDF 先转 PNG;
用自然语言让 WorkBuddy 调 OCR 识别并汇总成 Excel,列明你要的字段;
非标文档先在抽取 Agent 里配好字段模板,跑通 4 个核心字段再加;
让 WorkBuddy 把低置信度字段标黄,你只复核这些;
导出 Excel 交财务,保留原图备查。

一点个人判断

这套组合真正的价值不是"识别准不准"(那是 OCR 本身的事),而是把"识别结果变成能直接用的结构化表格"这一步包圆了。对发票合同证照多的岗位,光这一条就值回票价。

它也不是万能:量特别大、格式特别杂的时候,字段模板和复核还是要花心思。我的建议是先拿自己手头 20–30 张练手,跑通最小闭环再扩,比一上来就想全自动现实得多。


说明:本篇为「腾讯云 AI Skills 最佳实践」征集活动投稿,使用活动框定的 OCR 类 Skills 完成真实可复现场景。文中数据为本人小样本实测,非行业基准,请以自己的环境为准。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 为什么是「OCR Skill + WorkBuddy」这个组合
  • 我是怎么搭起来的(完整步骤)
  • 我踩过的坑,在这里提示一下,省得你再踩
  • 实测效果(说清楚是我的小样本,不是行业基准)
  • 可复现清单(照着做)
  • 一点个人判断
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档