使用Python进行OCR -- 识别图片中的文字

thomaszdxsn 2024-11-10 01:46:30 原文

工具

朋友需要一个工具，将图片中的文字提取出来。我帮他在网上找了一些OCR的应用，都不好用。所以准备自己研究，写一个Web APP供他使用。

OCR¹，全称Optical character recognition，或者optical character reader，中文译名叫做光学文字识别。它是把图像文件中的手写文本，打印文本转换为机器编码文本的一种方法。

OCR技术广泛用于识别打印纸张中的文字数据 -- 比如护照，支票，银行声明，收据，统计表单，邮件等。OCR的早期版本，需要对图片中的每个文字都进行训练，一次只能作用于一种字体。高级的版本增加了很大的识别率，可以同时识别现在很多流行的字体，支持不同种类格式的图片文件。一些系统可以生成接近于原来图片格式的输出，包括图片，排版，以及其它非文本组件，这也叫做版面还原。

工具

Tesseract

现在最出名，最常用的OCR就是谷歌的tesseract OCR engine²。最新的版本是Tesseract4。Tesseract的主要开发者是Ray Smith³.

Tesseract支持unicode(UTF-8)，安装后即可识别超过100种语言。

Tesseract支持不同的输出可是：普通文本，hOCR(html)，PDF，TSV，invisible-text-only PDF。在master分支，还试验性地支持ALTO(XML)格式。

请记住，在大多数情况下，为了获得更好的OCR结果，你需要为提供给Tesseract的图片提升质量⁴.

Tesseract可以通过训练来识别其它语言和其它字体⁵.

另外，有很多第三方的Tesseract GUI应用。可以直接下载使用⁶。

pytesseract

Python-tesseract⁷(pytesseract)是Google Tesseract ORC引擎的封装。首次commit的2014年。用这个库，可以很方便地编写脚本，可以用它来识别所有可以由PIL识别的图片格式，包括jpeg, png, gif, bmp, tiff等，而tesseract-orc本来只支持tiff和bmp两种格式。

如果在脚本中使用，识别的文本可以输出为Python字符串，而不是直接输出到文件中。

另外，这个代码库只有一个文件，400行代码。如果有任何疑问，可以直接翻看源代码。

tesserocr

tesserocr⁸也是一个TesseractOCR的封装库。它的首次commit是2015年。

这个库相对于pytesseract的优势在于⁹，这个库是使用Cython来直接调用Tesseract的C++ API。使用它和threading模块来处理图片，可以释放GIL，达到真正的并发执行。

但是我更喜欢pytesseract，因为它的API更加的pythonic。

Wiki: OCR ↩
Github: tesseract OCR engine ↩
Tesseract作者 Ray Smith，美国计算机科学家，计算机图形学的先驱. 他的中文名字叫做匠白光. ↩
Wiki: 为Tesseract提升图片质量 ↩
Wiki: 训练Tesseract ↩
Tesseract第三方GUI应用列表 ↩
Github: Python-tesseract ↩
Github: tesserocr ↩
Hacknews: 关于pytesseract, tesserocr的区别 ↩

使用Python进行OCR -- 识别图片中的文字的更多相关文章

python tesseract 识别图片中的文字的乱码问题(ubuntu系统下)
OCR(Optical Character Recognition):光学字符识别,是指对图片文件中的文字进行分析识别,获取的过程. 首先,需要安装 tesseract-ocr(tesseract O ...
Python通过百度Ai识别图片中的文字
版本:python3.7 工作中有需要识别图片中的汗字,查看了半天大神们的博客,但没找到完全可以用的源码,经过自己的实践,以下源码可以实现: 创建应用首先你需要登录百度AI,选择文字识别,创建一个应 ...
Python识别图片中的文字
1 import os,glob 2 def photo_compression(original_imgage,tmp_image_path): 3 '''图片备份.压缩:param origina ...
C# 扫描识别图片中的文字（.NET Framework）
环境配置本文以C#及VB.NET代码为例,介绍如何扫描并读取图片中的文字. 本次程序环境如下: Visual Studio版本要求不低于2017 图片扫描工具:Spire.OCR for .NET ...
在Mac上 python中使用tesseract OCR (Pytesser) 识别图片中的文字
仓库地址:https://github.com/RobinDavid/Pytesser brew install tesseract sudo pip install opencv-python 安装 ...
Windows下训练Tesseract实现识别图片中的文字
介绍 Tesseract是一个基于Apache2.0协议开源的跨平台ocr引擎,支持多种语言的识别,在Windows和Linux上都有良好的支持. 源代码在这: 源码地址有一个编译打包好的Windo ...
Python 进行 OCR识别 -- pytesseract库
pip install pytesseract 报错:tesseract is not installed or it's not in your path 下载安装 Tesseract-OCR ht ...
深入学习使用ocr算法识别图片中文字的方法
公司有个需求,简单点说需要从一张图片中识别出中文,通过python来实现,当然其他程序也行,只要能实现,而小编主要学习python,所以就提了python.一个小白在网上遨游了一天,终于找到一丝丝思绪 ...
OCR识别-python版（一）
需求:识别图片中的文字信息环境:windows系统开发语言:python 使用工具类:1.pyocr 2.PIL 3.tesseract-ocr 步骤: 1.pyocr 网络通直接使用命令:pip ...

随机推荐

互怼、IPO、雷潮、寒冬，2018 互联网圈的那些事儿
有了人的地方,就会有江湖. 有江湖的地方,就会有门派. 有门派的地方,就会有纷争. 有纷争的地方,就会有兴衰. 2018年马上就要离我们远去了,迎接我们的将会是新的一年——2019年.在整个过去的20 ...
服务网关Ocelot 入门Demo系列（01-Ocelot极简单Demo及负载均衡的配置）
[前言] Ocelot是一个用.NET Core实现并且开源的API网关,它功能强大,包括了:路由.请求聚合.服务发现.认证.鉴权.限流熔断.并内置了负载均衡器与Service Fabric.Butt ...
webpack4配置详解之新手上路初探
前言经常会有群友问起webpack.react.redux.甚至create-react-app配置等等方面的问题,有些是我也不懂的,慢慢从大家的相互交流中,也学到了不少. 今天就尝试着一起来聊 ...
spring Jackson 配置笔记
配置代码 // 设置输出时包含属性的风格 this.findAndRegisterModules(); this.setSerializationInclusion(JsonInclude.Inclu ...
day4（分支结构，循环结构，for循环，九九乘法表）
一:复习 ''' 1.变量名命名规范 -- 1.只能由数字.字母及 _ 组成 -- 2.不能以数字开头 -- 3.不能与系统关键字重名 -- 4._开头有特殊含义 -- 5.__开头__结尾的变量, ...
09-JavaScript之伪数组arguments
JavaScript之伪数组arguments arguments代表的是实参.有个讲究的地方是:arguments只在函数中使用. 1.返回函数实参的个数使用argument.length方法返回 ...
企业nginx应用实例（功能拆分记录）
一.默认访问协议强制跳转(http--->https) server { listen ; server_name dannylinux.top www.dannylinux.top; # re ...
Python——Django-form表单提交
一.提交的注意事项 1. form不是from,所有获取用户输入的标签都应该放在form里面, input并且必须要有name属性 2. action属性控制往哪儿提交,method一般都设置成pos ...
Microsoft Visual Studio Tools for AI
https://www.visualstudio.com/zh-hans/downloads/ai-tools-vs/ 开发.调试和部署深度学习和 AI 解决方案 Visual Studio Tool ...
tcpdump在linux上的常见用法
https://www.cnblogs.com/ggjucheng/archive/2012/01/14/2322659.html tcpdump -i [interface] -w cap.cap ...