本文主要是通过PIL+pytesseract+Tesseract-OCR实现验证码的识别

其中PIL为Python Imaging Library，已经是Python平台事实上的图像处理标准库了。PIL功能非常强大，但API却非常简单易用。

PIL第三方库安装 pip install PIL

Image 类是 PIL 库中一个非常重要的类，通过这个类来创建实例可以有直接载入图像文件，读取处理过的图像和通过抓取的方法得到的图像这三种方法。

常见的图像操作：

import Image # 打开一个jpg图像文件

im = Image.open('/Users/michael/test.jpg')

# 获得图像尺寸: w, h = im.size

# 把缩放后的图像用jpeg格式保存: im.save('/Users/michael/thumbnail.jpg', 'jpeg')

图像的增强（PIL库ImageEnhance类详解）

python中PIL模块中有一个叫做ImageEnhance的类，该类专门用于图像的增强处理，不仅可以增强（或减弱）图像的亮度、对比度、色度，还可以用于增强图像的锐度。

具体见下面的例子：

#-*- coding: UTF-8 -*-
from PIL import Image
from PIL import ImageEnhance
#原始图像
image = Image.open('lena.jpg')
image.show()
#亮度增强
enh_bri = ImageEnhance.Brightness(image)
brightness = 1.5
image_brightened = enh_bri.enhance(brightness)
image_brightened.show()
#色度增强
enh_col = ImageEnhance.Color(image)
color = 1.5
image_colored = enh_col.enhance(color)
image_colored.show()
#对比度增强
enh_con = ImageEnhance.Contrast(image)
contrast = 1.5
image_contrasted = enh_con.enhance(contrast)
image_contrasted.show()
#锐度增强
enh_sha = ImageEnhance.Sharpness(image)
sharpness = 3.0
image_sharped = enh_sha.enhance(sharpness)
image_sharped.show()

图片增强能够更好的识别较为复杂的验证码

Tesseract：开源的OCR识别引擎，初期Tesseract引擎由HP实验室研发，后来贡献给了开源软件业，后经由Google进行改进，消除bug，优化，重新发布。当前版本为3.02

Tesseract-OCR下载地址 :http://jaist.dl.sourceforge.net/project/tesseract-ocr-alt/tesseract-ocr-setup-3.02.02.exe

下载完后进行安装,默认情况下安装程序会给你配置系统环境变量,以指向安装目录（之后可以通过DOS界面在任意目录运行tesseract）。安装完成后目录如下:

附录:

tessdata 目录存放的是语言字库文件，和在命令行界面中可能用到的参数所对应的文件. 这个安装程序默认包含了英文字库。

如果想能识别中文，可以到http://code.google.com/p/tesseract-ocr/downloads/list下载对应的语言的字库文件.一般google访问不了，请到这里下载即可，

简体中文字库文件下载地址为:http://download.csdn.net/detail/wanghui2008123/7621567下载完成后解压，然后将该文件剪切到tessdata目录下去就可以了。

详解可参见：http://www.cnblogs.com/wzben/p/5930538.html

Tesseract并不能直接在python中使用，需要使用python的封装类pytesseract

Python-tesseract 是光学字符识别Tesseract OCR引擎的Python封装类。能够读取任何常规的图片文件(JPG, GIF ,PNG , TIFF等)并解码成可读的语言。在OCR处理期间不会创建任何临文件

总结起来识别的步骤如下：

1. 安装PIL 2. 安装Tesseract 3.安装pytesseract

下面以实例说话吧！

# coding:utf-8

from selenium import webdriver

from time import sleep

import unittest

from PIL import Image

from PIL import ImageEnhance

import pytesseract

driver=webdriver.Firefox()

url="https://passport.baidu.com/?getpassindex"

driver.get(url)

driver.maximize_window()

driver.save_screenshot(r"E:\aa.png")  #截取当前网页，该网页有我们需要的验证码

imgelement = driver.find_element_by_xpath(".//*[@id='forgotsel']/div/div[3]/img")

#imgelement = driver.find_element_by_id("code")  #定位验证码

location = imgelement.location  #获取验证码x,y轴坐标

size=imgelement.size  #获取验证码的长宽

coderange=(int(location['x']),int(location['y']),int(location['x']+size['width']),

           int(location['y']+size['height'])) #写成我们需要截取的位置坐标

i=Image.open(r"E:\aa.png") #打开截图

frame4=i.crop(coderange)  #使用Image的crop函数，从截图中再次截取我们需要的区域

frame4.save(r"E:\frame4.png")

i2=Image.open(r"E:\frame4.png")

imgry = i2.convert('L')   #图像加强，二值化，PIL中有九种不同模式。分别为1，L，P，RGB，RGBA，CMYK，YCbCr，I，F。L为灰度图像

sharpness =ImageEnhance.Contrast(imgry)#对比度增强

i3 = sharpness.enhance(3.0)  #3.0为图像的饱和度

i3.save("E:\\image_code.png")

i4=Image.open("E:\\image_code.png")

text=pytesseract.image_to_string(i2).strip() #使用image_to_string识别验证码

print text

selenium识别登录验证码---基于python实现的更多相关文章

Python - WebDriver 识别登录验证码
Python - WebDriver 识别登录验证码没什么可说的直接上代码! #-*-coding:utf-8-*- # Time:2017/9/29 7:16 # Author:YangYangJ ...
15.Python实现识别登录验证码（入门）
1.若想识别登录验证码,需要安装:Tesseract-OCR,其下载地址为:http://jaist.dl.sourceforge.net/project/tesseract-ocr-alt/tess ...
《Selenium 2自动化测试实战基于Python语言》中发送最新邮件无内容问题的解决方法
虫师的<Selenium 2自动化测试实战基于Python语言>是我自动化测试的启蒙书也是我推荐的自动化测试入门必备书,但是书中有一处明显的错误,会误导很多读者,这处错误就是第8章自动 ...
一次完整的自动化登录测试-基于python+selenium进行cnblog的自动化登录测试
Web登录测试是很常见的测试!手动测试大家再熟悉不过了,那如何进行自动化登录测试呢!本文作者就用python+selenium结合unittest单元测试框架来进行一次简单但比较完整的cnblog自动 ...
一次简单完整的自动化登录测试-基于python+selenium进行cnblog的自动化登录测试
Web登录测试是很常见的测试,手动测试大家再熟悉不过了,那如何进行自动化登录测试呢!本文就基于python+selenium结合unittest单元测试框架来进行一次简单但比较完整的cnblog自动化 ...
Selenium网页自动登录项目(基于Python从0到1)
Selenium是一个自动化测试工具,利用它我们可以驱动浏览器执行特定的动作,如点击.下拉等操作. 本文讲述的是通过自动化的方式登陆某一网站,其中包含Selenium+python自动化项目环境如何部 ...
python+selenium识别图片验证码
import timeimport pytesseractfrom PIL import Image, ImageEnhancefrom selenium import webdriver url = ...
关于《Selenium 2自动化测试实战基于Python语言》学习过程中键盘的常用操作
下边是自己在学习过程中总结的一些常用键盘的操作
基于Python使用SVM识别简单的字符验证码的完整代码开源分享
关键字:Python,SVM,字符验证码,机器学习,验证码识别 1 概述基于Python使用SVM识别简单的验证字符串的完整代码开源分享. 因为目前有了更厉害的新技术来解决这类问题了,但是本文作 ...

随机推荐

iPhone 横竖屏切换，全屏播放的三种方式
1. 调用系统自带的强制屏幕旋转不过还得在AppDelegate中重写下面方法 - (UIInterfaceOrientationMask)application:(UIApplication *)a ...
The origin server did not find a current representation for the target resource or is not willing to disclose that one exists.报该错误的一种原因。
今天发现某个action返回404. HTTP Status 404 – Not Found Type Status Report Message /xxx.action Description Th ...
spring-quartz 定时器给targetMethod传递参数
今天在做一个项目的时候,要给一个定时器任务的执行方法传递参数,在网上找了一下资料,可以使用arguments参数: <bean id="subsidyJobDetail" ...
H5新增的标签以及改良的标签
1>OL标签的改良 start type reversed:翻转排序 2>datalist标签自动补全的使用 3>progress标签的使用:进度条 4>meter标签的应用 ...
hadoop生态搭建（3节点）-15.Nginx_Keepalived_Tomcat配置
# Nginx+Tomcat搭建高可用服务器名称预装软件 IP地址Nginx服务器 Nginx1 192.168.6.131Nginx服务器 Nginx2 192.168.6.132 # ===== ...
hadoop生态搭建（3节点）-17.sqoop配置_单节点
# ==================================================================安装 sqoop tar -zxvf ~/sqoop-1.4.7 ...
Java——异常处理---18.11.14
异常时程序中会有一些错误,但并不是所有的错误都是异常,并且错误有时候是可以避免的. 比如说,你的代码少了一个分号,那么运行出来结果是提示是错误 java.lang.Error: 如果你用 System ...
P1060 开心的金明
P1060 开心的金明题目描述金明今天很开心,家里购置的新房就要领钥匙了,新房里有一间他自己专用的很宽敞的房间.更让他高兴的是,妈妈昨天对他说:“你的房间需要购买哪些物品,怎么布置,你说了算,只要 ...
使用Google Cloud Messaging (GCM),PHP 开发Android Push Notifications (安卓推送通知)
什么是GCM? Google Cloud Messaging (GCM) 是Google提供的一个服务,用来从服务端向安卓设备发送推送通知. GCM分为客户端和服务端开发. 这里我们只介绍服务端开发 ...
更改steam的游戏库
用记事本打开steam/steamapps/libraryfolders.vdf,然后按照格式添加条目 "LibraryFolders"{ "TimeNextStatsR ...

selenium识别登录验证码---基于python实现

图像的增强（PIL库ImageEnhance类详解）

selenium识别登录验证码---基于python实现的更多相关文章

随机推荐

热门专题