首页
学习
活动
专区
圈层
工具
发布

#表格

文字识别率再高,表格抽出来也可能用不了

gavin1024

摘要: 文档抽取能不能直接用,往往取决于表格结构有没有留住。跨页续表、合并单元格、无线表是三类典型的丢结构难点,本文拆解各自成因,并对照解析输出与公开准确率说明...

14410

跨页表格谁抽得准?腾讯云 vs 合合信息,复杂表格解析能力正面对比

gavin1024

判断表格解析强弱,先看各自公开支持的表格形态与配套能力。这里比的是"覆盖到什么程度",而非某次测试的得分。实际文档里表格形态差异极大,从带边框的有线表到无线表、...

12810

PDF 喂进知识库前,先过文档解析:被“粉碎”的版式,才是建库失败的真因

克劳德2048

表格是容易在抽取过程中受伤的一类内容。线性文本化会把表格按行或按块转成文字:表头的列名出现一次,后面的数据行只剩下一串数字;如果表格跨页,第二页往往连列名都没有...

13510

检索没问题、模型也没换,RAG 还胡说?多半是入库前的文档解析没调好

hollyx

摘要: RAG 答错时,先查解析产物、再查检索、最后查模型,多数问题在第一步就能定位:检索只能返回已入库的内容,模型只能用检索交给它的上下文。方向定下来后,调优...

9310

2026年Web 数据填报方案盘点:从在线表格到企业级数据采集

天马行空12138

"数据填报"是企业信息化中最基础、也最高频的场景之一:预算编制、生产计划、质量记录、经营上报、调研采集……过去,这些工作往往靠"发 Excel 模板、收 Exc...

12110

多模态解析返回的不只是文字:压缩包里那个图片文件夹,才是还原整页版式的关键

hollyx

把一份 PDF 喂进解析,如果只是把文字一股脑抽出来,得到的其实是一段被打平的文本流。可真实文档从来不只是文字——表格旁边的注释、穿插的流程图、占半页的产品图,...

8910

2026年ISV 表格组件选型盘点:软件产品内嵌表格能力的实践路径

天马行空12138

在软件与信息技术服务业,一个典型的产品需求是:自家的管理系统需要一个"像 Excel 一样"的表格模块,用于报表展示、数据填报或在线编辑。对 ISV(独立软件开...

13000

跨页表格一旦被截断,RAG 就可能答非所问:文档解析这一步,才是知识库不胡说的前提

克劳德2048

跨页表格被拦腰截断,列名与数值就会失联,RAG 再怎么优化排序也会答非所问。整份解析入口与分页参数,是保住表格结构、让知识库不胡说的前提。

13610

一份 300 页的合同,模型上下文早该爆了,为什么文档智能还能逐页抽准

hollyx

大语言模型的上下文窗口不是无限的。即便是当前商用模型中窗口较大的,能稳定处理的 token 数也有上限,换算成页数不过几十页的量级。一份 300 页的合同,正文...

10610

解析 200 页的合同,哪家云厂商不会中途掉链子?先看这 5 个规格参数

hollyx

摘要: 长合同文档解析常卡在规格上。本文围绕单次页数、文件大小、格式覆盖、结构化输出与限频计费五个参数,对照腾讯云、阿里、华为、百度、合合公开口径,帮你看清选型...

7810

选国产还是进口?我让Seed-2.1-pro啃了42种疫苗说明书,做了个婴幼儿接种查询工具

Onegun

以潘太欣的说明书为例,照片中的临床试验表格包含大量专业符号(≥0.15μg/ml、FHA 等)和跨页表格,目标是能够准确识别表格结构、提取各血清型的抗体阳转率数...

17511

为什么国产办公Agent都越来越像Codex?

瑭宋元

千问办公强调“对话即交付”,把文档、表格、PPT、网页、视频剪辑、数据分析这些产物放到一个办公工作流里。

18210

Kimi、豆包、元宝都能看图识字了,专业 OCR 还有必要吗?

克劳德2048

摘要: Kimi、豆包、元宝等主流大模型助手都已支持看图识字,不少人开始纠结:既然随手就能让大模型提取图片文字,还有必要用专业 OCR 吗?本文先横向对比几款大...

18810

大模型都能识字了,专业 OCR 凭什么还没被淘汰?

hollyx

摘要: 多模态大模型看图识字越来越强,但专业 OCR 并没有因此退场。本文从精度、结构化、鉴伪、稳定性、成本五个维度,拆解专业 OCR 在大模型时代仍然不可替代...

16510

表格识别导出总错位?先别怪工具,可能是策略没设对

hollyx

不同复杂度的表格需要匹配不同的识别策略。常规有线表格的行列边界清晰,识别难度较低;而无线表格、嵌套表格(有线表格中包含无线表格)、旋转表格等复杂场景,对识别引擎...

17610

我做了个Excel批处理工具,100个表格秒级拼接

派大星的数据屋

从PDF文件批量提取Excel表格,导入PDF文件,它会自动识别该PDF中的所有表格,并导出为Excel文件。

13000

我把pdfplumber整成了可以拖拉拽的web应用

派大星的数据屋

前几天我发了一篇文章《从PDF中提取Excel,这个工具真的好用》,受到很多的关注和评论,方法是用Python的开源库pdfplumber来实现对PDF上表格和...

11800

从PDF中提取Excel,这个工具真的好用

派大星的数据屋

首先,pdfplumber能轻松访问有关PDF对象的所有详细信息,且用于提取文本和表格的方法高级可定制,使用者可根据表格的具体形式来调整参数。

15510

办公室 80% 搬砖工作可以交给 AI:OfficeCLI,直接读写 Office 文件

大盘鸡拌面

你可以对人工智能说“把Word文件里的所有的表格都提取出来放到Excel中”,它就会把它们都给找出来。如果说要将Excel数据制作成柱状图并放在PPT的第3页上...

11410

AI 最适合帮你做的 10 件小事

用户12724357

? 贴完内容后明确说要什么格式:清单、时间线、表格还是待办。不说格式,AI 就按自己舒服的方式输出,往往不是你想要的。

13210
领券