前往小程序,Get更优阅读体验!
立即前往
发布
社区首页 >专栏 >Python Tesseract 图片识别-小操练

Python Tesseract 图片识别-小操练

作者头像
Mshu
发布2018-10-31 10:54:22
发布2018-10-31 10:54:22
1.4K00
代码可运行
举报
文章被收录于专栏:咸鱼不闲咸鱼不闲
运行总次数:0
代码可运行

小科普 光学字符识别(OCR,Optical Character Recognition)是指对文本资料进行扫描,然后对图像文件进行分析处理,获取文字及版面信息. Tesseract的OCR引擎最先由HP实验室于1985年研发,2005年,交由Google对Tesseract进行改进、优化工作。

准备工作

1.PIL 、Pytesseract

代码语言:javascript
代码运行次数:0
复制
from PIL import Image
from pytesseract import image_to_string

2.安装引擎 Tesseract-OCR

ok 用画图工具整张简单的图片(vm3.png)小试牛刀

上代码

代码语言:javascript
代码运行次数:0
复制
from PIL import Image
from pytesseract import image_to_string

img = Image.open("vm3.png");
text = image_to_string(img)
print(text)

别走,留步,真的只有那么多,不信看结果

支持中文

but,Tesseract是老外开发的,默认不支持中文,需要我们加个中文语言包 将文件chi_sim.traineddata (密码:nd6p) 放到安装目录:Tesseract-OCR\tessdata文件夹内,再整张图

代码骚作修改(,lang='chi_sim')即可

代码语言:javascript
代码运行次数:0
复制
from PIL import Image
from pytesseract import image_to_string

img = Image.open("vm3.png");
text = image_to_string(img,lang='chi_sim')
print(text)

没毛病

骚微复杂图像处理

其实,复杂图片的来不了,需要处理一下,比如这张图片:

这样处理:

代码语言:javascript
代码运行次数:0
复制
img = Image.open("vm.png");
imgry = img.convert("L")
threshold = 140
table = []
for i in range(256):
    if i < threshold:
        table.append(0)
    else:
        table.append(1)
out = imgry.point(table, '1')
out.show()

show()一下处理后的结果:

最后,整合一下:

代码语言:javascript
代码运行次数:0
复制
img = Image.open("vm.png");
imgry = img.convert("L")
threshold = 140
table = []
for i in range(256):
    if i < threshold:
        table.append(0)
    else:
        table.append(1)
out = imgry.point(table, '1')
text = image_to_string(out)
print(text)

我就知道你会回来,如果你在运行中遇到以下问题:


tesseract is not installed or it's not in your path

一图解万愁


Please make sure the TESSDATA_PREFIX environment variable is set to the parent directory of your "tessdata" directory. Failed loading language 'eng' Tesseract couldn't load any languages!

添加环境变量:

代码语言:javascript
代码运行次数:0
复制
变量名:TESSDATA_PREFIX
变量值:testdata的路径

如果加了还不行,重启电脑!

如果还不行,试试百度OCR的吧 如果你用来作为验证码识别。可能会用到截屏和裁剪

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2018-07-05,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • ok 用画图工具整张简单的图片(vm3.png)小试牛刀
  • 上代码
  • 支持中文
  • 骚微复杂图像处理
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档