首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 ># 用 WorkBuddy 一天搭建个人知识库:170 个文件批量分析 + 196 页扫描件 OCR 全流程实战

# 用 WorkBuddy 一天搭建个人知识库:170 个文件批量分析 + 196 页扫描件 OCR 全流程实战

原创
作者头像
用户12670413
发布2026-08-04 17:10:53
发布2026-08-04 17:10:53
4100
举报

本文记录了一位金融从业者用 WorkBuddy 在一天内完成的工作:将桌面积攒的 170 个工作文件全部读取分析、对 196 页图片 PDF 做 OCR 识别、搭建三层记忆体系并设置自动化任务。全程零代码基础,纯自然语言驱动。

标签:#WorkBuddy #AI办公 #知识库搭建 #OCR #自动化


一、背景:桌面文件泛滥怎么办?

作为一名金融行业从业者,我的桌面积攒了一个名为"临时"的文件夹,里面堆了 170 个文件——Word 报告、Excel 数据表、PPT 课件、PDF 文件、各种截图和脚本,横跨信贷知识、政策法规文件、项目材料、考试题库等多个主题。

每次想找一份资料,都要在文件夹里翻半天。更头疼的是,其中有几个 PDF 是扫描件,根本没法复制文字。

如果手动整理,保守估计要三四天。但我用 WorkBuddy,一天就全部搞定了。


二、第一步:搭建三层记忆体系(10 分钟)

WorkBuddy 有一个"记忆"机制——它能记住你的偏好和项目信息,下次对话自动调用。我让它帮我搭建了三层结构:

1. 用户级记忆(跨项目共享)

路径:~/.workbuddy/MEMORY.md

这里记录我的通用信息:职业身份、工作领域、语言偏好、文件处理习惯等。所有项目都会读取这个文件。

2. 项目级记忆(当前项目专用)

路径:项目目录/.workbuddy/memory/MEMORY.md

记录当前项目的长期笔记:项目概况、关键约定、知识库现状、待办事项等。

3. 项目知识资料库(可见可检索)

路径:项目目录/knowledge-base/

怎么跟 WorkBuddy 说:直接说"先建立好记忆资料库"就行,它会自动创建目录结构和种子文件。


三、第二步:批量分析 170 个文件(30 分钟)

1. 文件盘点

我让 WorkBuddy 扫描了整个文件夹,它自动统计出:

类型

数量

说明

.docx

66

Word 文档

.jpg

62

图片/截图

.pdf

14

PDF 文件

.xlsx

7

Excel 表格

.pptx

7

PPT 课件

.ps1

4

PowerShell 脚本

.doc

3

旧版 Word

其他

7

png/txt/json/html/7z

2. 批量文本提取

WorkBuddy 在隔离的 Python 虚拟环境中安装了 python-docxopenpyxlpython-pptxpdfplumber 等库,然后写了一个脚本,一次性提取了所有 104 个文档的文本内容。

关键点:

  • 只读操作:不会修改或删除源文件
  • 自动分类:按主题聚类,识别出信贷产品体系、党建材料、全域土地整治、重大项目营销等类别
  • 结构化摘要:每个文件生成标题、主题、核心内容的简要描述

3. 查看图片内容

对于 62 张图片,WorkBuddy 用多模态能力直接查看了关键的数据图表截图,理解了图表内容(如全市金融数据、季度统计数据等)。

4. 生成分析报告

最终自动生成了一份结构化分析报告,包含:

  • 总体画像
  • 文件类型统计
  • 主题聚类(每类列出关键文档与核心内容)
  • 可直接复用的工作资产清单
  • 无法提取文字的扫描件清单
  • 建议的知识库分类方案

报告保存到了 knowledge-base/01-项目笔记/ 目录。


四、第三步:高价值文档入库(15 分钟)

分析完成后,我让 WorkBuddy 把最有价值的 20 份文档复制到知识库,按主题分类存放:

  • 02-参考资料/金融业务基础/:业务读本、考试题库
  • 02-参考资料/金融产品体系/:产品解读、项目要点
  • 02-参考资料/政策与讲话/:政策解读、领导讲话稿
  • 02-参考资料/全域整治/:调研报告、政策操作要点
  • 02-参考资料/重大项目/:项目可行性报告
  • 03-模板/:汇报模板、宣讲稿模板

全部是复制操作,桌面原件原封不动。

每份文档都在 00-索引/index.md 中登记,后续检索一目了然。


五、第四步:196 页扫描件 OCR(核心难点)

这是最让我意外的部分。我有 7 个 PDF 是纯扫描件(没有文字层),包括一份 154 页的金融管理细则。人工录入这些内容几乎不可能。

技术方案

WorkBuddy 选择了 RapidOCR + PyMuPDF 方案:

  1. 用 PyMuPDF 将 PDF 每页渲染为图片
  2. 用 RapidOCR(基于 ONNX 运行时)对每页图片做文字识别
  3. 识别结果保存为 Markdown 文件

为什么选 RapidOCR?

  • 不需要安装 Tesseract(Windows 上配置麻烦)
  • 纯 Python 安装,pip install rapidocr-onnxruntime 即可
  • 中文识别效果不错
  • 不依赖 GPU,CPU 就能跑

实际效果

7 个 PDF 共 196 页全部识别完成,输出文本存入 knowledge-base/02-参考资料/_OCR/

文件

页数

识别字符数

金融管理细则

154

~14 万字

储备文件

15

~8000 字

经济社会发展情况

12

~6000 字

其他 4 个文件

15

~1.2 万字

OCR 中文识别有少量噪声(如"副主任"偶尔识别为"副主色"),但整体可读性很好,关键数据建议回看原件核对。


六、第五步:设置自动化任务(5 分钟)

WorkBuddy 支持定时自动化任务,我用自然语言描述需求,它自动创建:

1. 每周检查技能更新(每周一 09:00)

"检查 WorkBuddy 自我进化相关技能/插件的更新情况,有重要更新才通知我。"

2. 定期收集区域数据(每 3 天 08:00)

"收集天津市最新统计数据和金融讯息,写入记忆,不用通知我。"

3. 关注开源大模型动态(每两周 周一 10:00)

"关注可本地部署的开源大模型更新,有飞跃式更新才提醒我。"

三个任务全部通过对话创建,无需任何配置文件,WorkBuddy 自动设置好 cron 规则。


七、成果总结

项目

成果

文件分析

170 个文件全部读取分析

文本提取

104 个文档提取了结构化文本

OCR 识别

7 个扫描件 PDF 共 196 页完成 OCR

知识库入库

20 份高价值文档分类入库

记忆体系

三层记忆全部建立并更新

自动化任务

3 个定时任务创建并运行

原来需要三四天手动整理的工作,一天全部完成。


八、踩坑记录与经验

1. 图片 PDF 的识别

WorkBuddy 的多模态能力可以直接看图片,但对 PDF 里的扫描页不行——因为 PDF 是"文档"不是"图片"。需要先用 PyMuPDF 把 PDF 页面渲染成图片,再交给 OCR 引擎识别。

2. 积分消耗

批量分析 170 个文件确实消耗不少积分。建议:

  • 先让 WorkBuddy 做文件盘点(消耗少),确认范围后再批量提取
  • OCR 是最耗积分的环节,可分批进行
  • 简单问答切到轻量模型,省积分

3. 敏感材料处理

涉及内部材料时,可以在记忆中设定边界。我的做法是:

  • "涉及各类敏感材料可以整理进记忆、知识库,但不对外传播"
  • WorkBuddy 会在处理时自动遵循这个约定

4. 工作模式选择

WorkBuddy 有三种模式:

  • Craft(你说我做):立即执行,适合明确任务
  • Plan(先想后做):先出方案再执行,适合复杂任务
  • Ask(只问不做):纯问答,不操作文件,省积分

批量文件分析这种任务建议用 Craft 模式;写材料建议先 Plan 再 Craft。


九、适用场景推荐

这个方案不限于金融业,任何需要整理大量文档的场景都适用:

  • 律师/法务:批量整理合同、判决书、法规文件
  • 教师/研究员:整理文献、课件、研究资料
  • 公务员:整理政策文件、汇报材料、统计数据
  • 企业白领:整理项目文档、会议纪要、报告
  • 学生:整理论文文献、课堂笔记

核心流程不变:盘点 → 批量提取 → 分类入库 → OCR → 自动化


十、写在最后

WorkBuddy 最打动我的不是某个单一功能,而是全流程贯通的能力——从文件扫描、文本提取、OCR 识别、知识库搭建到自动化任务设置,全程自然语言驱动,不需要写一行代码。

以前我觉得 AI 助手就是"聊天工具",这次实操彻底改变了我的看法。它不是在"建议"我怎么做,而是直接帮我做完了

如果你也有堆积如山的文件需要整理,不妨试试这个方案。


本文为原创实操记录,基于 WorkBuddy 桌面版真实使用体验。如有疑问欢迎评论区交流。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、背景:桌面文件泛滥怎么办?
  • 二、第一步:搭建三层记忆体系(10 分钟)
    • 1. 用户级记忆(跨项目共享)
    • 2. 项目级记忆(当前项目专用)
    • 3. 项目知识资料库(可见可检索)
  • 三、第二步:批量分析 170 个文件(30 分钟)
    • 1. 文件盘点
    • 2. 批量文本提取
    • 3. 查看图片内容
    • 4. 生成分析报告
  • 四、第三步:高价值文档入库(15 分钟)
  • 五、第四步:196 页扫描件 OCR(核心难点)
    • 技术方案
    • 为什么选 RapidOCR?
    • 实际效果
  • 六、第五步:设置自动化任务(5 分钟)
    • 1. 每周检查技能更新(每周一 09:00)
    • 2. 定期收集区域数据(每 3 天 08:00)
    • 3. 关注开源大模型动态(每两周 周一 10:00)
  • 七、成果总结
  • 八、踩坑记录与经验
    • 1. 图片 PDF 的识别
    • 2. 积分消耗
    • 3. 敏感材料处理
    • 4. 工作模式选择
  • 九、适用场景推荐
  • 十、写在最后
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档