腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
两种输入文件类型同时在GNU并行?
pdf
、
parallel-processing
、
ocr
、
tesseract
然后它将使用tesseract对每个pgm (第二个输入文件类型)执行
OCR
。 export -f generate_pgm PGM="$1" find .{}; parallel --argsep ,,,
ocr
,,, pgm/*.pgm'
浏览 2
提问于2017-07-25
得票数 1
3
回答
更改windows批
处理
中的文件扩展名
windows
、
file
、
batch-file
、
rename
到目前为止,我只想将扩展从".
pdf
.
OCR
.
pdf
“更改为".
pdf
”,我得到了以下代码但是它似乎不适用于有多个点的扩展--我做错了什么?
浏览 5
提问于2015-08-27
得票数 1
回答已采纳
1
回答
带有图像的
PDF
文件的
OCR
ocr
、
tesseract
、
apache-tika
我让Tika在
PDF
文件上使用Tesseract,但是如果我给它一个同时具有可搜索文本和图像的
PDF
文件,文本是OCRed两次。有什么办法可以避免这种情况吗?
浏览 4
提问于2020-12-31
得票数 1
回答已采纳
1
回答
检测景观格式的图像,并将其分割成两幅肖像。
bash
、
pdf
、
imagemagick
、
crop
、
imagemagick-convert
我已经扫描了
PDF
格式的文件。这些文件包含一页纵向格式和两页横向格式的页面。for i in *.
pdf
; # Créer le fichier
PDF
avec
OCR
ocrmyp
浏览 2
提问于2020-04-20
得票数 1
2
回答
在WinForm中寻找
OCR
库
c#
、
ocr
、
vb.net
是否有任何免费/付费的
OCR
库能够捕获
PDF
格式的发票数据?需要有一个低的错误率。我们需要对这些数据进行进一步的
处理
。
浏览 0
提问于2019-06-10
得票数 1
1
回答
将扫描的
pdf
转换为R中可搜索的
pdf
r
、
pdf-scraping
我有一个
pdf
,大约50页扫描表。我需要最终把它刮到R中,这样我就可以清理数据并将其导出为.csv。环顾在线,我所能得到的最远就是将扫描的
pdf
作为一个字符对象读取到R中,但这会使格式发生很大的变化,因此表中的列都错对齐了,并出现了无序。有没有一种方法可以将扫描的
pdf
转换成可读的
pdf
,这样我就可以在tabulizer中抓取它了?还是另一种将扫描的pdfs抓取到表中的方法?
浏览 5
提问于2022-11-16
得票数 0
1
回答
Applescript或Automator:运行Acrobat对
OCR
多个
PDF
文件进行批
处理
,更多
pdf
、
applescript
、
ocr
、
acrobat
、
automator
我使用ScanSnap S1500M将所有纸质文档扫描到/
PDF
-S1500M/-我想使用对文本进行
OCR
。我想(每天)自动化这个过程:
浏览 5
提问于2011-08-18
得票数 1
回答已采纳
4
回答
如何识别需要
OCR
的
PDF
文件?
pdf
、
ocr
我有超过30,000个
pdf
文件。有些文件已经是
OCR
,有些则不是。有没有办法找出哪些文件已经
OCR
,哪些
pdf
只有图像? 如果我通过
OCR
处理
器运行每个文件,这将是永远不会发生的。
浏览 8
提问于2011-10-12
得票数 9
回答已采纳
1
回答
在终端中运行命令,并在输出中包含输入名
terminal
、
filenames
、
command
、
kubuntu
、
ocr
我在Dolphin服务菜单文件中有这一行,该文件包含用于
PDF
处理
的许多其他命令:它的优点是提供表单MY_
PDF
_
ocr
.
pdf
的输出文件,从而保留输入文件的名称。为此,我可以用这句话: Exec=konsole --noclose -e ocrmypdf
浏览 0
提问于2022-11-30
得票数 0
回答已采纳
4
回答
运行反引号/exec()时的PHP路径问题
java
、
php
、
macos
即$f = `java -jar /
OCR
/
ocr
.jar /Folder/$path /
ocr
/output.txt`;java -jar /
OCR
/
ocr
.jar /Folder/Sub\ Folder/filetoocr.
pdf
/
浏览 1
提问于2010-04-15
得票数 0
1
回答
从可搜索的
pdf
中读取,不带
ocr
pdf
我目前正在使用扫描仪将我的
PDF
转换为可搜索的
PDF
。
OCR
已经
处理
好了,因为我可以在
PDF
中使用ctrl-f。 但是,我如何才能从我的程序中获取
OCR
的内容。是否可以通过读取文件来公开访问
OCR
文本?
浏览 1
提问于2011-12-15
得票数 0
1
回答
检测
PDF
文件是否由图像生成
bash
、
shell-script
、
pdf
我正试图预
处理
大量的
PDF
文件,其中许多文件实际上不是文本而是图像,以便将它们移到适当的位置进行
OCR
处理
。 问题是,我试图检测
PDF
是否是基于图像的
OCR
之前,但到目前为止没有成功。使用"pdffonts filename“被认为是正确的方法,但只有图像
PDF
也有字体!
浏览 0
提问于2016-03-31
得票数 10
回答已采纳
4
回答
一种基于
OCR
的
PDF
文本提取方法
java
、
pdf
、
text-parsing
是否有人尝试过使用
OCR
库和Java从
PDF
中提取文本?你认为什么是最可靠的文本提取库?我见过的大多数方法(tesseract、GOCR)都是C库,需要编写一些JNI代码。
浏览 2
提问于2009-04-22
得票数 6
2
回答
如何向只包含图像的
PDF
中添加文本?
pdf
、
ocr
我使用像富士通iX500 ScanSnap扫描仪这样的硬件解决方案进行实时扫描,同时使用Foxit PhantomPDF向
PDF
中的图像添加文本。这两种解决方案都带来了不错的
OCR
,但是也有一些缺陷,比如在非文本上出现错误,或者99%的文本在页面上被漏掉,因为页面的角落中有3-4个单词与页面上的所有其他文本一样,它们都是90度旋转的。最先进的
OCR
解决方案是将图像转换为可搜索的
PDF
,还是将(隐藏的)文本添加到仅包含图像的现有
PDF
中(添加搜索功能)?
浏览 0
提问于2018-05-25
得票数 0
1
回答
在子文件夹中批
处理
OCR
文件,并以新名称保存新文件
windows
、
batch-file
、
pdf
、
cmd
、
ocr
我有以下代码,
OCR
的所有
PDF
文件都在一个特定的文件夹中(d:\exttmp2),但它没有按我的意愿重命名这些文件,也没有将新文件放在正确的位置。
OCR
运行正常,但我希望将
OCR
‘’ed文件重命名为:<parent folder path>-<filename>_ocred.
pdf
。以这种方式命名它们将不会产生任何文件覆盖。当前,代码
OCR
是文件,但它将新文件保存到它们所在的文件夹之上的文件夹中。它还将文件名保存为"JAN_ocred.
pdf<
浏览 2
提问于2021-06-09
得票数 0
回答已采纳
2
回答
如何在分布式环境中
处理
文件路径
celery
、
filepath
、
distributed-computing
我正在建立一个分布式芹菜环境来对
PDF
文件进行
OCR
。我有大约3M的
PDF
,
OCR
是CPU绑定的,所以我们的想法是创建一个服务器集群来
处理
OCR
。当我写我的任务时,我得到了这样的东西:def do_
ocr
(pk, file_path): item = Document.objects.get(pk=pk) item.content = <e
浏览 8
提问于2016-03-29
得票数 3
回答已采纳
1
回答
包含文本和图像页面的OCRing
pdf
ubuntu
、
pdf
、
ocr
我有下面的ubuntu脚本,它检查我的
pdf
是否已经OCRed,如果没有就OCRs,问题是,我有一些混合了
OCR
和非
OCR
的
pdf
。所以,我想在if语句中添加一个条件,如果行数或单词数少于某个数字(例如100行文本或1000个单词),则对其进行
OCR
。我对ubuntu完全陌生,我已经添加了几行(粗体)。"$MYFONTS" = '' ] || [ "$MYFONTS" = '[none]' ] **|| [ "$LI
浏览 2
提问于2019-07-08
得票数 0
2
回答
如何区分扫描的
PDF
和常规的文本
PDF
r
、
pdf
、
tesseract
我正在
处理
多个
PDF
文件的
OCR
任务。其中一些是扫描的(不可搜索的),另一些只是原生的(可搜索的)
PDF
。image1 = image_read_
pdf
(file.list1[1], density=150)用于文本的
pdf
text1 =
pdf
_text(fi
浏览 7
提问于2021-04-10
得票数 1
2
回答
从
PDF
中提取文本,并将提取的文本保存在Excel或其他地方
pdf
、
uipath
我想要一个简单的方法,从
pdf
中提取文本,并将文本保存到Excel中。 谢谢!
浏览 16
提问于2020-07-13
得票数 0
4
回答
从扫描创建copy+pastable
PDF
linux
、
pdf
、
ocr
我有
PDF
文件,这是从扫描仪创建的。
PDF
只包含图像。
OCR
:从图像中读取文本一页的
处理
时间不应超过20秒。 命令行和/或API,不需要GUI。
浏览 0
提问于2018-06-05
得票数 1
点击加载更多
相关
资讯
PDF怎么用OCR来识别文字,这个人工智能OCR工具绝了
OCR如何有效处理特殊字符与格式?
通用 PDF OCR 到 Word API 数据接口
浅谈竖、横排文字混排OCR处理难点与方法
不再为处理PDF烦恼,python处理操作PDF全攻略
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券