Tesseract 对验证码的识别原理和实现步骤

邹烈传 2024-10-27 05:14:11 原文

一. Steps：

学习图片库--->处理图片（初步处理）--->校正.学习图片

二. Tesseract:

1. 采集图片库（一般每个出现的字符出现20次左右识别效果比较好），根据图片特点进行初步处理（二值化/灰度化/滤波/降噪等处理），并保存为.tif格式（x.tif)；

2. 使用JTessBoxEditor ,将得到的.tif图片合并为一张图片（Tool—>MergeTiff）；

3. 下载安装tesseract-ocr-setup-3.01-1.exe；

4. 安装后，运行命令行到.tif格式（x.tif)文件夹中，输入tesseract.exe x.tif x batch.nochop makebox;(PS:保存为同名同文件夹下）

5. 使用JTessBoxEditor打开x.tif文件进行逐个校正；（PS:每次校正后都得保存）

6.校正后，命令行执行：

tesseract.exe x.tif x nobatch box.train;

unicharset_extractor.exe x.box;

7. 在目录下建立名为“font_properties”的文件，并输入内容：x 1 0 0 1 0；

8.命令行执行：

cntraining.exe x.tr;

mftraining.exe –F font_properties –U unicharset x.tr;

9. 将目录下生成的文件其中几个unicharset/inttemp/normproto/pffmtable文件加上训练名前缀“x.”;

10.命令行执行：

combine_tessdata x. 生成最终的校验学习数据x.traineddata文件；

生成最终的文件示例如下：

11.将x.traineddata拷贝到tesseract-ocr-setup-3.01-1.exe安装好的tesseract-ocr目录下的tessdata下，找一张

经过初步处理的图片，运行命令行执行：tesseract.exe xx.jpg out –l lm；在同级目录下就会生成一个out.txt文件，里面的内容就是识别后的字符串。

Tesseract 对验证码的识别原理和实现步骤的更多相关文章

Atitit ocr识别原理与概论 attilax总结
Atitit ocr识别原理与概论 attilax总结 1.1. Ocr的过程与流程1 1.2. OCR不同技术细分略有不同,但大概原理是一样的. 即主要技术过程是:二值化(又叫归一化)----- ...
e2e 自动化集成测试架构实例 WebStorm Node.js Mocha WebDriverIO Selenium Step by step （二）图片验证码的识别
上一篇文章讲了“e2e 自动化集成测试架构京东商品搜索实例 WebStorm Node.js Mocha WebDriverIO Selenium Step by step 一京东商品搜索 ...
Atitit 图像处理--图像分类模式识别肤色检测识别原理与attilax的实践总结
Atitit 图像处理--图像分类模式识别肤色检测识别原理与attilax的实践总结 1.1. 五中滤镜的分别效果..1 1.2. 基于肤色的图片分类1 1.3. 性能提升2 1.4. --co ...
tensorflow：验证码的识别（下）
上两篇详细的说明了验证码的识别,不过我们采用的是方法二,下面采用方法一.注意和方法二的区别. 验证码识别方法一: 把标签转为向量,向量长度为40.(4位数字验证码) 验证码的生成和tf.record的 ...
tensorflow：验证码的识别（上）
验证码的识别主要分成四个部分:验证码的生成.将生成的图片制作成tfrecord文件.训练识别模型.测试模型使用pyCharm作为编译器.本文先介绍前两个部分验证码的识别有两种方法: 验证码识别方 ...
Python爬虫学习笔记之微信宫格验证码的识别(存在问题)
本节我们将介绍新浪微博宫格验证码的识别.微博宫格验证码是一种新型交互式验证码,每个宫格之间会有一条指示连线,指示了应该的滑动轨迹.我们要按照滑动轨迹依次从起始宫格滑动到终止宫格,才可以完成验证,如 ...
HanLP-基于HMM-Viterbi的人名识别原理介绍
Hanlp自然语言处理包中的基于HMM-Viterbi处理人名识别的内容大概在年初的有分享过这类的文章,时间稍微久了一点,有点忘记了.看了 baiziyu 分享的这篇比我之前分享的要简单明了的多.下面 ...
爬虫(十二)：图形验证码的识别、滑动验证码的识别（B站滑动验证码）
1. 验证码识别随着爬虫的发展,越来越多的网站开始采用各种各样的措施来反爬虫,其中一个措施便是使用验证码.随着技术的发展,验证码也越来越花里胡哨的了.最开始就是几个数字随机组成的图像验证码,后来加入 ...
基于Tesseract组件的OCR识别
基于Tesseract组件的OCR识别背景以及介绍欲研究C#端如何进行图像的基本OCR识别,找到一款开源的OCR识别组件.该组件当前已经已经升级到了4.0版本.和传统的版本(3.x)比,4.0时代 ...

随机推荐

最小的N个和（codevs 1245）
1245 最小的N个和时间限制: 1 s 空间限制: 128000 KB 题目等级 : 钻石 Diamond 题解查看运行结果题目描述 Description 有两个长度为 N ...
禁随意改root密码
lsattr 主要参数如表. -a 显示所有文件和目录,包括以"."为名称开头字符的额外内建,现行目录"."与上层目录"..". -d 显示 ...
svn status 显示 ~xx
“~” 版本控制下的项目与其它类型的项目重名
zabbix 监控客户端数据库 zabbix客户端
[root@zabbix客户端 zabbix]# grep -v "^$" etc/zabbix_agentd.conf|grep -v "^#" LogFil ...
Unity3D入门之GUI基础以及常用GUI控件使用（2）
1.GUI基础 (1)GUI部分是每帧擦除重绘的,只应该在OnGUI中绘制GUI,按钮:GUILayout.Button(“Hello”); 只读标签:GUILayout.Label() (2)修改控 ...
面向服务的体系结构(SOA)——（2）ESB介绍及职责
企业服务总线(Enterprise Service Bus)是SOA的基础设施,之所以这么说是因为要达到SOA的目标(增强灵活性)就必须有调用服务的方法,ESB的存在有效的保证了消费者能够调用供应者提 ...
Java Applet与Java Application的区别
转自:http://www.educity.cn/java/500609.html 在Java语言中,能够独立运行的程序称为Java应用程序(Application).Java语言还有另外一种程序-- ...
显示单位px和dip以及sp的区别
显示单位px和dip以及sp的区别(转) dip: device independent pixels(设备独立像素). 不同设备有不同的显示效果,这个和设备硬件有关,一般我们为了支持WVGA.HVG ...
matlab练习程序（透视投影，把lena贴到billboard上）
本练习程序是受到了这个老外博文的启发,感觉挺有意思,就尝试了一下.他用的是opencv,我这里用的是matlab. 过去写过透视投影,当时是用来做倾斜校正的,这次同样用到了透视投影,不过更有意思,是将 ...
HDU 2819 — Swap 二分匹配
Swap Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others)Total Submis ...