第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理

第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理

使用IP代理

ProxyHandler()格式化IP，第一个参数，请求目标可能是http或者https,对应设置
build_opener()初始化IP
install_opener()将代理IP设置成全局,当使用urlopen()请求时自动使用代理IP

#!/usr/bin/env python

# -*- coding: utf-8 -*-

import urllib

import urllib.request

import random   #引入随机模块文件

ip = "180.115.8.212:39109"

proxy = urllib.request.ProxyHandler({"https":ip})                        #格式化IP,注意：第一个参数可能是http或者https，对应设置

opener = urllib.request.build_opener(proxy,urllib.request.HTTPHandler)  #初始化IP

urllib.request.install_opener(opener)       #将代理IP设置成全局,当使用urlopen()请求时自动使用代理IP

#请求

url = "https://www.baidu.com/"

data = urllib.request.urlopen(url).read().decode("utf-8")

print(data)

ip代理池构建一

适合IP存活时间长，稳定性好的代理ip，随机调用列表里的ip

#!/usr/bin/env python

# -*- coding: utf-8 -*-

import urllib

from urllib import request

import random   #引入随机模块文件

def dai_li_ip():

    ip = [

        '110.73.8.103:8123',

        '115.46.151.100:8123',

        '42.233.187.147:19'

        ]

    shui = random.choice(ip)

    print(shui)

    proxy = urllib.request.ProxyHandler({"https": shui})  # 格式化IP,注意，第一个参数，请求目标可能是http或者https,对应设置

    opener = urllib.request.build_opener(proxy, urllib.request.HTTPHandler)  # 初始化IP

    urllib.request.install_opener(opener)  # 将代理IP设置成全局,当使用urlopen()请求时自动使用代理IP

#请求

dai_li_ip() #执行代理IP函数

url = "https://www.baidu.com/"

data = urllib.request.urlopen(url).read().decode("utf-8")

print(data)

ip代理池构建二，接口方式

每次调用第三方接口动态获取ip,适用于IP存活时间短的情况

我们用http://http.zhimaruanjian.com/第三方接口测试

#!/usr/bin/env python

# -*- coding: utf-8 -*-

import urllib

from urllib import request

import json

def dai_li_ip():

    url = "http://http-webapi.zhimaruanjian.com/getip?num=1&type=2&pro=&city=0&yys=0&port=11&time=1&ts=0&ys=0&cs=0&lb=1&sb=0&pb=4&mr=1"

    data = urllib.request.urlopen(url).read().decode("utf-8")

    data2 = json.loads(data)  # 将字符串还原它本来的数据类型

    print(data2['data'][0])

    ip = str(data2['data'][0]['ip'])

    dkou = str(data2['data'][0]['port'])

    zh_ip = ip + ':' + dkou

    print(zh_ip)

    proxy = urllib.request.ProxyHandler({"https": zh_ip})  # 格式化IP,注意，第一个参数，请求目标可能是http或者https,对应设置

    opener = urllib.request.build_opener(proxy, urllib.request.HTTPHandler)  # 初始化IP

    urllib.request.install_opener(opener)  # 将代理IP设置成全局,当使用urlopen()请求时自动使用代理IP

#请求

dai_li_ip() #执行代理IP函数

url = "https://www.baidu.com/"

data = urllib.request.urlopen(url).read().decode("utf-8")

print(data)

用户代理和ip代理结合应用

#!/usr/bin/env python

# -*- coding: utf-8 -*-

import urllib

from urllib import request

import json

import random

def yh_dl():    #创建用户代理池

    yhdl = [

        'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-us) AppleWebKit/534.50 (KHTML, like Gecko) Version/5.1 Safari/534.50',

        'Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Trident/5.0',

        'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 6.0; Trident/4.0)',

        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:2.0.1) Gecko/20100101 Firefox/4.0.1',

        'Mozilla/5.0 (Windows NT 6.1; rv:2.0.1) Gecko/20100101 Firefox/4.0.1',

        'Opera/9.80 (Macintosh; Intel Mac OS X 10.6.8; U; en) Presto/2.8.131 Version/11.11',

        'Opera/9.80 (Windows NT 6.1; U; en) Presto/2.8.131 Version/11.11',

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Maxthon 2.0)',

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; TencentTraveler 4.0)',

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)',

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; The World)',

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; 360SE)',

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Avant Browser)',

        'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)',

        'Mozilla/5.0 (iPhone; U; CPU iPhone OS 4_3_3 like Mac OS X; en-us) AppleWebKit/533.17.9 (KHTML, like Gecko) Version/5.0.2 Mobile/8J2 Safari/6533.18.5',

        'User-Agent:Mozilla/5.0 (iPod; U; CPU iPhone OS 4_3_3 like Mac OS X; en-us) AppleWebKit/533.17.9 (KHTML, like Gecko) Version/5.0.2 Mobile/8J2 Safari/6533.18.5',

        'Mozilla/5.0 (iPad; U; CPU OS 4_3_3 like Mac OS X; en-us) AppleWebKit/533.17.9 (KHTML, like Gecko) Version/5.0.2 Mobile/8J2 Safari/6533.18.5',

        'Mozilla/5.0 (Linux; U; Android 2.3.7; en-us; Nexus One Build/FRF91) AppleWebKit/533.1 (KHTML, like Gecko) Version/4.0 Mobile Safari/533.1',

        'Opera/9.80 (Android 2.3.4; Linux; Opera Mobi/build-1107180945; U; en-GB) Presto/2.8.149 Version/11.10',

        'Mozilla/5.0 (Linux; U; Android 3.0; en-us; Xoom Build/HRI39) AppleWebKit/534.13 (KHTML, like Gecko) Version/4.0 Safari/534.13',

        'Mozilla/5.0 (BlackBerry; U; BlackBerry 9800; en) AppleWebKit/534.1+ (KHTML, like Gecko) Version/6.0.0.337 Mobile Safari/534.1+',

        'Mozilla/5.0 (compatible; MSIE 9.0; Windows Phone OS 7.5; Trident/5.0; IEMobile/9.0; HTC; Titan)',

        'UCWEB7.0.2.37/28/999',

        'NOKIA5700/ UCWEB7.0.2.37/28/999',

        'Openwave/ UCWEB7.0.2.37/28/999',

        'Mozilla/4.0 (compatible; MSIE 6.0; ) Opera/UCWEB7.0.2.37/28/999'

        ]

    thisua = random.choice(yhdl)                    #随机获取代理信息

    headers = ("User-Agent",thisua)                 #拼接报头信息

    opener = urllib.request.build_opener()          #创建请求对象

    opener.addheaders=[headers]                     #添加报头到请求对象

    urllib.request.install_opener(opener)           #将报头信息设置为全局，urlopen()方法请求时也会自动添加报头

def dai_li_ip():    #创建ip代理池

    url = "http://http-webapi.zhimaruanjian.com/getip?num=1&type=2&pro=&city=0&yys=0&port=11&time=1&ts=0&ys=0&cs=0&lb=1&sb=0&pb=4&mr=1"

    data = urllib.request.urlopen(url).read().decode("utf-8")

    data2 = json.loads(data)  # 将字符串还原它本来的数据类型

    print(data2['data'][0])

    ip = str(data2['data'][0]['ip'])

    dkou = str(data2['data'][0]['port'])

    zh_ip = ip + ':' + dkou

    print(zh_ip)

    proxy = urllib.request.ProxyHandler({"https": zh_ip})  # 格式化IP,注意，第一个参数，请求目标可能是http或者https,对应设置

    opener = urllib.request.build_opener(proxy, urllib.request.HTTPHandler)  # 初始化IP

    urllib.request.install_opener(opener)  # 将代理IP设置成全局,当使用urlopen()请求时自动使用代理IP

#请求

dai_li_ip() #执行代理IP函数

yh_dl()     #执行用户代理池函数

gjci = '连衣裙'

zh_gjci = gjc = urllib.request.quote(gjci)         #将关键词转码成浏览器认识的字符，默认网站不能是中文

url = "https://s.taobao.com/search?q=%s&s=0" %(zh_gjci)

# print(url)

data = urllib.request.urlopen(url).read().decode("utf-8")

print(data)

用户代理和ip代理结合应用封装模块

#!/usr/bin/env python

# -*- coding: utf-8 -*-

import urllib

from urllib import request

import json

import random

import re

import urllib.error

def hq_html(hq_url):

    """

    hq_html()封装的爬虫函数，自动启用了用户代理和ip代理

    接收一个参数url,要爬取页面的url，返回html源码

    """

    def yh_dl():    #创建用户代理池

        yhdl = [

            'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-us) AppleWebKit/534.50 (KHTML, like Gecko) Version/5.1 Safari/534.50',

            'Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Trident/5.0',

            'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 6.0; Trident/4.0)',

            'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:2.0.1) Gecko/20100101 Firefox/4.0.1',

            'Mozilla/5.0 (Windows NT 6.1; rv:2.0.1) Gecko/20100101 Firefox/4.0.1',

            'Opera/9.80 (Macintosh; Intel Mac OS X 10.6.8; U; en) Presto/2.8.131 Version/11.11',

            'Opera/9.80 (Windows NT 6.1; U; en) Presto/2.8.131 Version/11.11',

            'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Maxthon 2.0)',

            'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; TencentTraveler 4.0)',

            'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)',

            'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; The World)',

            'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; 360SE)',

            'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Avant Browser)',

            'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)',

            'Mozilla/5.0 (iPhone; U; CPU iPhone OS 4_3_3 like Mac OS X; en-us) AppleWebKit/533.17.9 (KHTML, like Gecko) Version/5.0.2 Mobile/8J2 Safari/6533.18.5',

            'User-Agent:Mozilla/5.0 (iPod; U; CPU iPhone OS 4_3_3 like Mac OS X; en-us) AppleWebKit/533.17.9 (KHTML, like Gecko) Version/5.0.2 Mobile/8J2 Safari/6533.18.5',

            'Mozilla/5.0 (iPad; U; CPU OS 4_3_3 like Mac OS X; en-us) AppleWebKit/533.17.9 (KHTML, like Gecko) Version/5.0.2 Mobile/8J2 Safari/6533.18.5',

            'Mozilla/5.0 (Linux; U; Android 2.3.7; en-us; Nexus One Build/FRF91) AppleWebKit/533.1 (KHTML, like Gecko) Version/4.0 Mobile Safari/533.1',

            'Opera/9.80 (Android 2.3.4; Linux; Opera Mobi/build-1107180945; U; en-GB) Presto/2.8.149 Version/11.10',

            'Mozilla/5.0 (Linux; U; Android 3.0; en-us; Xoom Build/HRI39) AppleWebKit/534.13 (KHTML, like Gecko) Version/4.0 Safari/534.13',

            'Mozilla/5.0 (BlackBerry; U; BlackBerry 9800; en) AppleWebKit/534.1+ (KHTML, like Gecko) Version/6.0.0.337 Mobile Safari/534.1+',

            'Mozilla/5.0 (compatible; MSIE 9.0; Windows Phone OS 7.5; Trident/5.0; IEMobile/9.0; HTC; Titan)',

            'UCWEB7.0.2.37/28/999',

            'NOKIA5700/ UCWEB7.0.2.37/28/999',

            'Openwave/ UCWEB7.0.2.37/28/999',

            'Mozilla/4.0 (compatible; MSIE 6.0; ) Opera/UCWEB7.0.2.37/28/999'

            ]

        thisua = random.choice(yhdl)                    #随机获取代理信息

        headers = ("User-Agent",thisua)                 #拼接报头信息

        opener = urllib.request.build_opener()          #创建请求对象

        opener.addheaders=[headers]                     #添加报头到请求对象

        urllib.request.install_opener(opener)           #将报头信息设置为全局，urlopen()方法请求时也会自动添加报头

    def dai_li_ip(hq_url):    #创建ip代理池

        url = "http://http-webapi.zhimaruanjian.com/getip?num=1&type=2&pro=&city=0&yys=0&port=11&time=1&ts=0&ys=0&cs=0&lb=1&sb=0&pb=4&mr=1"

        if url:

            data = urllib.request.urlopen(url).read().decode("utf-8")

            data2 = json.loads(data)  # 将字符串还原它本来的数据类型

            # print(data2['data'][0])

            ip = str(data2['data'][0]['ip'])

            dkou = str(data2['data'][0]['port'])

            zh_ip = ip + ':' + dkou

            pat = "(\w*):\w*"

            rst = re.compile(pat).findall(hq_url)  #正则匹配获取是http协议还是https协议

            rst2 = rst[0]

            proxy = urllib.request.ProxyHandler({rst2: zh_ip})  # 格式化IP,注意，第一个参数，请求目标可能是http或者https,对应设置

            opener = urllib.request.build_opener(proxy, urllib.request.HTTPHandler)  # 初始化IP

            urllib.request.install_opener(opener)  # 将代理IP设置成全局,当使用urlopen()请求时自动使用代理IP

        else:

            pass

    #请求

    try:

        dai_li_ip(hq_url) #执行代理IP函数

        yh_dl()     #执行用户代理池函数

        data = urllib.request.urlopen(hq_url).read().decode("utf-8")

        return data

    except urllib.error.URLError as e:  # 如果出现错误

        if hasattr(e, "code"):  # 如果有错误代码

            # print(e.code)  # 打印错误代码

            pass

        if hasattr(e, "reason"):  # 如果有错误信息

            # print(e.reason)  # 打印错误信息

            pass

# a = hq_html('http://www.baid.com/')

# print(a)

模块使用

#!/usr/bin/env python

# -*- coding: utf-8 -*-

import urllib.request

import fzhpach

gjc = '广告录音'

gjc = urllib.request.quote(gjc)                 #将关键词转码成浏览器认识的字符，默认网站不能是中文

url = 'https://www.baidu.com/s?wd=%s&pn=0' %(gjc)

a = fzhpach.hq_html(url)

print(a)

第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理—用户代理和ip代理结合应用的更多相关文章

第一百二十九节，JavaScript，理解JavaScript库
JavaScript,理解JavaScript库学习要点: 1.项目介绍 2.理解JavaScript库 3.创建基础库从本章,我们来用之前的基础知识来写一个项目,用以巩固之前所学.那么,每个项目 ...
第三百二十六节，web爬虫，scrapy模块,解决重复ur——自动递归url
第三百二十六节,web爬虫,scrapy模块,解决重复url——自动递归url 一般抓取过的url不重复抓取,那么就需要记录url,判断当前URL如果在记录里说明已经抓取过了,如果不存在说明没抓取过 ...
第三百二十五节，web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签
第三百二十五节,web爬虫,scrapy模块标签选择器下载图片,以及正则匹配标签标签选择器对象 HtmlXPathSelector()创建标签选择器对象,参数接收response回调的html对象需 ...
第三百二十四节，web爬虫，scrapy模块介绍与使用
第三百二十四节,web爬虫,scrapy模块介绍与使用 Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 其可以应用在数据挖掘,信息处理或存储历史数据等一系列的程序中.其最初是为了 ...
第三百五十九节，Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)介绍以及安装
第三百五十九节,Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)介绍以及安装 elasticsearch(搜索引擎)介绍 ElasticSearch是一个基于 ...
第三百八十九节，Django+Xadmin打造上线标准的在线教育平台—列表筛选结合分页
第三百八十九节,Django+Xadmin打造上线标准的在线教育平台—列表筛选结合分页根据用户的筛选条件来结合分页实现原理就是,当用户点击一个筛选条件时,通过get请求方式传参将筛选的id或者值, ...
第三百七十九节，Django+Xadmin打造上线标准的在线教育平台—xadmin的安装
第三百七十九节,Django+Xadmin打造上线标准的在线教育平台—xadmin的安装 xadmin介绍 xadmin是基于Django的admin开发的更完善的后台管理系统,页面基于Bootstr ...
第三百六十九节，Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)用Django实现搜索功能
第三百六十九节,Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)用Django实现搜索功能 Django实现搜索功能 1.在Django配置搜索结果页的路由映 ...
第三百三十节，web爬虫讲解2—urllib库爬虫—实战爬取搜狗微信公众号—抓包软件安装Fiddler4讲解
第三百三十节,web爬虫讲解2—urllib库爬虫—实战爬取搜狗微信公众号—抓包软件安装Fiddler4讲解封装模块 #!/usr/bin/env python # -*- coding: utf- ...

随机推荐

实例分析JVM安全体系：双亲委派、命名空间、保护域、策略
在了解双亲委派模型之前,先了解一下类加载器的概念: 类加载器的作用就是将真实的class文件根据位置将该Java类的字节码装入内存,并生成对应的Class对象.用户可以通过继承ClassLoader和 ...
数据库的ACID
一.事务定义:所谓事务,它是一个操作序列,这些操作要么都执行,要么都不执行,它是一个不可分割的工作单位. 准备工作:为了说明事务的ACID原理,我们使用银行账户及资金管理的案例进行分析. [sql] ...
javascript基础拾遗(十二)
1.javascript的单线程特性在javascript中,所有的代码都是单线程的因此所有的网络操作,浏览器事件,都必须是异步执行的,异步执行的逻辑是回调. function callback( ...
Content-Type中application/x-www-form-urlencoded 和 multipart/form-data的区别
1.什么是Content-Type Form的enctype属性表示页面表单数据向服务端传输时的编码方式, 常用有两种:application/x-www-form-urlencoded和multip ...
每日英语：The Invasion of the Online Tutors
It's a nightly dilemma in many households: A student hits a wall doing homework, and parents are too ...
js设置滚动条定位到所属容器的最底部
$('.help-gundongtiao').scrollTop($('.help-gundongtiao')[0].scrollHeight);
【Deep Learning】Hinton. Reducing the Dimensionality of Data with Neural Networks Reading Note
2006年,机器学习泰斗.多伦多大学计算机系教授Geoffery Hinton在Science发表文章,提出基于深度信念网络(Deep Belief Networks, DBN)可使用非监督的逐层贪心 ...
WIN锁屏+鼠标移动事件
winexec('rundll32.exe user32.dll, LockWorkStation', sw_hide); 1.shutdown.bat(关机) rundll32.Exe shell ...
ssh 地址
structs2http://struts.apache.org/download.cgi spring hibernate http://hibernate.org/orm/downloads/
WebAPI 消息处理器
由上图可以看出消息处理器的使用场合和使用方法. 使用场合: HttpServer 得到请求时. public static class WebApiConfig { public static voi ...

第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理—用户代理和ip代理结合应用

第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理—用户代理和ip代理结合应用的更多相关文章

随机推荐

热门专题