本文记录了一位金融从业者用 WorkBuddy 在一天内完成的工作:将桌面积攒的 170 个工作文件全部读取分析、对 196 页图片 PDF 做 OCR 识别、搭建三层记忆体系并设置自动化任务。全程零代码基础,纯自然语言驱动。
标签:#WorkBuddy #AI办公 #知识库搭建 #OCR #自动化
作为一名金融行业从业者,我的桌面积攒了一个名为"临时"的文件夹,里面堆了 170 个文件——Word 报告、Excel 数据表、PPT 课件、PDF 文件、各种截图和脚本,横跨信贷知识、政策法规文件、项目材料、考试题库等多个主题。
每次想找一份资料,都要在文件夹里翻半天。更头疼的是,其中有几个 PDF 是扫描件,根本没法复制文字。
如果手动整理,保守估计要三四天。但我用 WorkBuddy,一天就全部搞定了。
WorkBuddy 有一个"记忆"机制——它能记住你的偏好和项目信息,下次对话自动调用。我让它帮我搭建了三层结构:
路径:~/.workbuddy/MEMORY.md
这里记录我的通用信息:职业身份、工作领域、语言偏好、文件处理习惯等。所有项目都会读取这个文件。
路径:项目目录/.workbuddy/memory/MEMORY.md
记录当前项目的长期笔记:项目概况、关键约定、知识库现状、待办事项等。
路径:项目目录/knowledge-base/
怎么跟 WorkBuddy 说:直接说"先建立好记忆资料库"就行,它会自动创建目录结构和种子文件。
我让 WorkBuddy 扫描了整个文件夹,它自动统计出:
类型 | 数量 | 说明 |
|---|---|---|
.docx | 66 | Word 文档 |
.jpg | 62 | 图片/截图 |
14 | PDF 文件 | |
.xlsx | 7 | Excel 表格 |
.pptx | 7 | PPT 课件 |
.ps1 | 4 | PowerShell 脚本 |
.doc | 3 | 旧版 Word |
其他 | 7 | png/txt/json/html/7z |
WorkBuddy 在隔离的 Python 虚拟环境中安装了 python-docx、openpyxl、python-pptx、pdfplumber 等库,然后写了一个脚本,一次性提取了所有 104 个文档的文本内容。
关键点:
对于 62 张图片,WorkBuddy 用多模态能力直接查看了关键的数据图表截图,理解了图表内容(如全市金融数据、季度统计数据等)。
最终自动生成了一份结构化分析报告,包含:
报告保存到了 knowledge-base/01-项目笔记/ 目录。
分析完成后,我让 WorkBuddy 把最有价值的 20 份文档复制到知识库,按主题分类存放:
02-参考资料/金融业务基础/:业务读本、考试题库02-参考资料/金融产品体系/:产品解读、项目要点02-参考资料/政策与讲话/:政策解读、领导讲话稿02-参考资料/全域整治/:调研报告、政策操作要点02-参考资料/重大项目/:项目可行性报告03-模板/:汇报模板、宣讲稿模板全部是复制操作,桌面原件原封不动。
每份文档都在 00-索引/index.md 中登记,后续检索一目了然。
这是最让我意外的部分。我有 7 个 PDF 是纯扫描件(没有文字层),包括一份 154 页的金融管理细则。人工录入这些内容几乎不可能。
WorkBuddy 选择了 RapidOCR + PyMuPDF 方案:
pip install rapidocr-onnxruntime 即可7 个 PDF 共 196 页全部识别完成,输出文本存入 knowledge-base/02-参考资料/_OCR/:
文件 | 页数 | 识别字符数 |
|---|---|---|
金融管理细则 | 154 | ~14 万字 |
储备文件 | 15 | ~8000 字 |
经济社会发展情况 | 12 | ~6000 字 |
其他 4 个文件 | 15 | ~1.2 万字 |
OCR 中文识别有少量噪声(如"副主任"偶尔识别为"副主色"),但整体可读性很好,关键数据建议回看原件核对。
WorkBuddy 支持定时自动化任务,我用自然语言描述需求,它自动创建:
"检查 WorkBuddy 自我进化相关技能/插件的更新情况,有重要更新才通知我。"
"收集天津市最新统计数据和金融讯息,写入记忆,不用通知我。"
"关注可本地部署的开源大模型更新,有飞跃式更新才提醒我。"
三个任务全部通过对话创建,无需任何配置文件,WorkBuddy 自动设置好 cron 规则。
项目 | 成果 |
|---|---|
文件分析 | 170 个文件全部读取分析 |
文本提取 | 104 个文档提取了结构化文本 |
OCR 识别 | 7 个扫描件 PDF 共 196 页完成 OCR |
知识库入库 | 20 份高价值文档分类入库 |
记忆体系 | 三层记忆全部建立并更新 |
自动化任务 | 3 个定时任务创建并运行 |
原来需要三四天手动整理的工作,一天全部完成。
WorkBuddy 的多模态能力可以直接看图片,但对 PDF 里的扫描页不行——因为 PDF 是"文档"不是"图片"。需要先用 PyMuPDF 把 PDF 页面渲染成图片,再交给 OCR 引擎识别。
批量分析 170 个文件确实消耗不少积分。建议:
涉及内部材料时,可以在记忆中设定边界。我的做法是:
WorkBuddy 有三种模式:
批量文件分析这种任务建议用 Craft 模式;写材料建议先 Plan 再 Craft。
这个方案不限于金融业,任何需要整理大量文档的场景都适用:
核心流程不变:盘点 → 批量提取 → 分类入库 → OCR → 自动化。
WorkBuddy 最打动我的不是某个单一功能,而是全流程贯通的能力——从文件扫描、文本提取、OCR 识别、知识库搭建到自动化任务设置,全程自然语言驱动,不需要写一行代码。
以前我觉得 AI 助手就是"聊天工具",这次实操彻底改变了我的看法。它不是在"建议"我怎么做,而是直接帮我做完了。
如果你也有堆积如山的文件需要整理,不妨试试这个方案。
本文为原创实操记录,基于 WorkBuddy 桌面版真实使用体验。如有疑问欢迎评论区交流。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。