Loading [MathJax]/jax/input/TeX/config.js
前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
圈层
工具
发布
首页
学习
活动
专区
圈层
工具
MCP广场
社区首页 >专栏 >超级好用的OCR工具,GitHub Star 7.2K,强烈推荐!

超级好用的OCR工具,GitHub Star 7.2K,强烈推荐!

作者头像
肉眼品世界
发布于 2021-01-08 02:54:35
发布于 2021-01-08 02:54:35
2K00
代码可运行
举报
文章被收录于专栏:肉眼品世界肉眼品世界
运行总次数:0
代码可运行

OCR 方向的工程师,一定需要知道这个 OCR 开源项目:PaddleOCR。短短几个月,累计 Star 数量已超过 7.2K,频频登上 Github Trending 日榜月榜,称它为 OCR 方向目前最火的 repo 绝对不为过。

12 月,它又带来四大新发布与升级,核心内容先睹为快:

  • 全新发布数据合成工具 Style-Text:可以批量合成大量与目标场景类似的图像,在多个场景验证,效果均提升 15% 以上。
  • 全新发布半自动数据标注工具 PPOCRLabel:有了它数据标注工作事半功倍,相比 labelimg 标注效率提升 60% 以上,社区小规模测试,好评如潮。
  • 多语言识别模型效果升级:中文、英文、韩语、法语、德语、日文识别效果均优于 EasyOCR。
  • PP-OCR 开发体验再升级:支持动态图开发(训练调试更方便),静态图部署(预测效率更高),鱼与熊掌可以兼得。

PaddleOCR 历史表现回顾

先看下 PaddleOCR 自今年开源以来,短短几个月在 GitHub 上的表现:

  • 6 月,8.6M 超轻量模型发布,GitHub Trending 全球趋势榜日榜第一。
  • 8 月,开源 CVPR2020 顶会 SOTA 算法,再上 GitHub 趋势榜单!
  • 10 月,发布 PP-OCR 算法,开源 3.5M 超超轻量模型,再下 Paperswithcode 趋势榜第一

这个含金量,广大的 GitHub 开发者们自然懂,3.5M 超超轻量模型的效果图大家直接看,绝对杠杠的。

火车票、表格、金属铭牌、翻转图片、外语都是妥妥的,3.5M 的模型能达到这个识别精度,绝对是良心之作了!

传送门:https://github.com/PaddlePaddle/PaddleOCR

那么最近的 12 月份更新,又给大家带来哪些惊喜呢?

全新发布 OCR 数据合成工具:Style-Text

相比于传统的数据合成算法,Style-Text 可以实现特殊背景下的图片风格迁移,只需要少许目标场景图像,就可以合成大量数据,效果展示如下:

1、相同背景批量数据合成

2、相同文字批量数据合成

3、图片分离前景背景

除了拉风的效果,采用这样的合成数据和真实数据一起训练,可以显著提升特殊场景的性能指标,分别以两个场景为例:

怎么样,绝对是黑科技了吧。这项能力核心算法是基于百度自研的文本编辑算法《Editing Text in the Wild》。

论文地址:https://arxiv.org/abs/1908.03047

不同于常用的基于 GAN 的数据合成工具,Style-Text 主要框架包括 ①文本前景风格迁移模块 ②背景抽取模块 ③融合模块。经过这样三步,就可以迅速实现图片文字风格迁移啦。

超强 OCR 数据标注工具:PPOCRLabel

除了数据合成,数据标注也一直是深度学习开发者关注的重点,无论是从成本还是时间上面,提高标注效率,降低标注成本太重要了。PPOCRLabel 通过内置高质量的 PPOCR 中英文超轻量预训练模型,可以实现 OCR 数据的高效标注。CPU 机器运行也是完全没问题的。话不多说,直接看 PPOCRLabel 效果演示:

用法也是非常的简单,标注效率提升 60%-80% 是妥妥的。只能说,真的太香了。

最好的多语言模型效果

简单对比一下目前主流 OCR 方向开源 repo 的核心能力:

中英文模型性能及功能对比

其中,多语言识别模型准确率对比(仅 EasyOCR 提供)

测试数据及环境说明:

  • 中英文场景:针对 OCR 实际应用场景,包括合同,车牌,铭牌,火车票,化验单,表格,证书,街景文字,名片,数码显示屏等,收集的 300 张图像,每张图平均有 17 个文本框,PaddleOCR 的 F1-Score 超过 0.5,这个性能已经很不错了。
  • 多语言场景:PaddleOCR 选择了开源数据 ICDAR2017 – MLT(多语言文本识别测试集),并抽取其中的法语、德语、日语、韩语数据作为评测集合。其中测试图片大多来自于自然场景,例如广告牌、路标、海报等。

PP-OCR 开发体验再升级

动态图和静态图是深度学习框架常用的两种模式。在动态图模式下,代码编写运行方式符合 Python 程序员的习惯,易于调试,但在性能方面, Python 执行开销较大,与 C++ 有一定差距。

相比动态图,静态图在部署方面更具有性能的优势。静态图程序在编译执行时,预先搭建好的神经网络可以脱离 Python 依赖,在 C++ 端被重新解析执行,而且拥有整体网络结构也能进行一些网络结构的优化。

飞桨动态图中新增了动态图转静态图的功能,支持用户使用动态图编写组网代码。预测部署时,飞桨会对用户代码进行分析,自动转换为静态图网络结构,兼顾了动态图易用性和静态图部署性能两方面优势。

良心出品的中英文文档教程

别的不需要多说了,大家访问 GitHub 点过 star 之后自己体验吧:

https://github.com/PaddlePaddle/PaddleOCR

代码语言:javascript
代码运行次数:0
运行
复制
本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2021-01-07,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 肉眼品世界 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
暂无评论
推荐阅读
编辑精选文章
换一批
IDEA插件之颜值篇Material Theme UI
插件市场搜索 theme , Dark Purple Theme 和 Hibernate Theme 都还不错
全栈程序员站长
2022/07/22
8960
IDEA插件之颜值篇Material Theme UI
激活码下载IDEA全家桶激活码2022最新更新 稳定有效
激活码获取方法(长期更新):https://docs.qq.com/doc/DS3hpVWFnQ2ZGVnhH
终码一生
2022/04/15
7790
激活码下载IDEA全家桶激活码2022最新更新 稳定有效
webstorm插件推荐_webstorm中文界面
1、CodeGlance 用过 sublime 的同学会知道右侧有一个当前文件中代码的缩略图,这个插件可以让 webstorm 也具有此功能。
全栈程序员站长
2022/09/30
4.2K0
​WebStorm 超好用的10款插件,效率提升了好多!
WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。
程序员小猿
2021/01/19
12.5K0
​WebStorm 超好用的10款插件,效率提升了好多!
写代码也要看颜值!推荐两个高逼格Pycharm主题插件
很多人喜欢 Sublime 写代码,一个重要原因,就是自带的丰富主题插件,下面这张图,看起来就逼格满满。那Pycharm是不是也有这样插件呢?
吾非同
2021/08/05
16.4K0
颜值控必备 让你的IDE更加赏心悦目
插件地址:https://plugins.jetbrains.com/plugin/8006-material-theme-ui
终码一生
2022/04/14
2920
颜值控必备 让你的IDE更加赏心悦目
Intellij IDEA用快捷键自动生成序列化id
类继承了Serializable接口之后,使用alt+enter快捷键自动创建序列化id 
明明如月学长
2021/08/27
5.8K0
IDEA超赞代码搜索插件效率神器推荐
配套视频讲解:https://www.bilibili.com/video/av53816725/
明明如月学长
2021/08/31
1.6K0
IDEA超赞代码搜索插件效率神器推荐
IDEA界面太丑??尝试一下这几个插件!
IntelliJ IDEA主要用于支持 Java、Scala、Groovy 等语言的开发工具,同时具备支持目前主流的技术和框架,擅长于企业应用、移动应用和 Web 应用的开发。
乱敲代码
2019/12/17
3.2K0
IDEA界面太丑??尝试一下这几个插件!
这些插件 让你开发更有效率
下面推荐10款在开发过程中,个人觉得还是很不错的插件,可以解放不少生产力,同时,再推荐5款颜值控必备的插件,大家可以看看那些是自己已经在使用的,那些是自己还不知道的。
终码一生
2022/04/14
3330
这些插件 让你开发更有效率
学妹:你的 IDEA 主题怎么这么好看?
哈喽,小伙伴们好呀。我是狗哥,今天不聊技术,聊聊我们的吃饭工具。经常有小伙伴问我:“你的 IDEA 主题怎么这么好看,能推荐一下不?”。问的人太多了,才索性写了这篇文章。
JavaFish
2021/07/29
5.6K0
学妹:你的 IDEA 主题怎么这么好看?
Webstorm之界面美化-含破解版
从学校的dreamweaver到sublime再到vscode,最近入职这家公司,公司用的代码管理工具是SVN(不过个人还是喜欢git),于是编辑器换成了Webstorm,因为他内置了SVN操作很方便,所以开始了Webstorm之路。(不过个人最喜欢的还是sublime启动速度太快了,换成vscode是因为写react很方便)
_kyle
2020/08/24
4.7K0
Webstorm之界面美化-含破解版
Java8 Stream的peek()方法和Java Stream Debugger插件
Java8提供了Stream,可以方便的进行一些数据操作,比如提供了过滤,分组甚至并行等特性。
明明如月学长
2021/08/31
1.5K0
Java8 Stream的peek()方法和Java Stream Debugger插件
IntelliJ Idea 常用12款插件(提高开发效率),附优秀主题插件[通俗易懂]
这款插件并不能直接提高你的开发效率,但是可以让你面对的IDE不再单调,当把背景设置成你自己心仪的的图片,
全栈程序员站长
2022/07/21
3.7K0
IntelliJ Idea 常用12款插件(提高开发效率),附优秀主题插件[通俗易懂]
【1】Pycharm 主题设置推荐Material Theme UI以及编辑环境配置(字体大小和颜色)
File -> Settings -> Plugins插件,搜索Material Theme UI 安装。
汀丶人工智能
2022/12/21
5.5K0
【1】Pycharm 主题设置推荐Material Theme UI以及编辑环境配置(字体大小和颜色)
推荐 IntelliJ IDEA 特别“养眼”的主题插件,这几款超赞,总有一款适合你!
IDEA,全称 IntelliJ IDEA ,是Java语言的集成开发环境,IDEA在业界被公认为是最好的 java 开发工具之一,尤其在智能 代码助手、代码自动提示、重构、J2EE支持、 Ant 、JUnit 、CVS 整合、代码审查、创新的GUI设计等方面的功能可以说是超常的。
Leetcode名企之路
2021/05/18
22.7K0
推荐 IntelliJ IDEA 特别“养眼”的主题插件,这几款超赞,总有一款适合你!
把 IDEA 搞酷炫点
IDEA 的官网下载地址:https://www.jetbrains.com/idea/download
JAVA葵花宝典
2021/09/08
5750
开发中尽量避免犯错的方法总结
养成好的编程习惯和风格非常重要,好的编程习惯不仅更有逻辑,而且更易于修改,易于拓展,减少甚至预防不必要的BUG等。
明明如月学长
2021/08/31
4580
解决Material Theme UI插件收费问题
webstorm 2021.1 版本更新后,一直使用的Material Theme UI主题开始收费了,如果不付费的话,文件树那里格外的小,看起来十分的难受。
神奇的程序员
2022/04/10
6.2K0
解决Material Theme UI插件收费问题
精品 IDEA 插件大汇总!值得收藏
俗话说,工欲善其事,必先利其器。想要提升编程开发效率,必须选择一款顺手的开发工具。
程序员鱼皮
2021/10/22
1.9K0
推荐阅读
相关推荐
IDEA插件之颜值篇Material Theme UI
更多 >
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
本文部分代码块支持一键运行,欢迎体验
本文部分代码块支持一键运行,欢迎体验