如何爬取可用的IP代理

上一篇说到对付反爬虫有一个很关键的方法就是使用IP代理，那么我们应该如何获取这些可用的IP代理呢？这里分享一下自己这两天的一些爬取IP代理的心得体会。

1 步骤

　　1.找到几个提供免费IP代理的网站，获取IP数据源

　　2.验证对应的IP代理访问出口IP是否跟本机的出口IP一致，得到不一致的IP代理列表

　　3.根据自身的实验目的验证IP代理的响应速度，进行排序，择优选用

2 具体做法

　　1.可以上网搜索，有很多，例如西刺、快代理等等

　　2.可以在这里进行验证

　　3.这个就根据自身爬虫的需要，看是下载东西还是其他的，再进一步测试速度

3 代码

 # *-* coding: utf-8 *-*

 import BeautifulSoup

 import requests

 import time

 # to check if the ip proxy can work

 URL_CHECK = 'http://1212.ip138.com/ic.asp'

 RESPONSE_TIME = 2

 IP_LOCAL = '120.236.174.144'

 # this is the pages of the website "http://www.ip181.com/daili/1.html"

 # you can check out in the browser.

 # the program will crawl the ip proxy from pages [start_page, end_page]

 # as: [1,2], it will crawl the page 1 and page 2.

 start_page = input('Please input your start page to crawl: ')

 end_page = input('Please input your end page to crawl: ')

 s = requests.Session()

 # check if the exit IP is changed

 def check_a_ip(ip):

     start = time.time()

     try:

         connection = s.get(URL_CHECK, headers={

             'Host': '1212.ip138.com',

             'Referer': 'http://www.ip138.com/',

             "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.115 Safari/537.36"

         }, proxies={'http': 'http://' + ip}, timeout=RESPONSE_TIME)

         res = connection.content

         # print res

         soup = BeautifulSoup.BeautifulSoup(res)

         ip_return = soup.findAll('center')[0].text.split('[')[1].split(']')[0]

         return ip_return != IP_LOCAL, '%.6f' % (time.time() - start)

     except Exception, e:

         # print '<ERROR>'

         # print e

         return False, '-1'

 url = 'http://www.ip181.com/daili/%s.html'

 ip_proxy_file = open('proxy.txt', 'w')

 ip_proxy_file.write('ip_port,response_time\n')

 ip_proxy_file.close()

 for i in range(int(start_page), int(end_page) + 1):

     ip_proxy_file = open('proxy.txt', 'a')

     connection_crawl = s.get(url % str(i),headers = {

         "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.115 Safari/537.36"

         })

     soup_crawl = BeautifulSoup.BeautifulSoup(connection_crawl.content)

     # parse each page,find the good ip proxy

     trs = soup_crawl.findAll('tr')

     for tr in trs[1:len(trs)]:

         tds = tr.findAll('td')

         ip = tds[0].contents[0] + ':' + tds[1].contents[0]

         is_good, res_time = check_a_ip(ip)

         if is_good:

             ip_proxy_file.write(ip + ',' + res_time + '\n')

     print '%s : Finish to crawl the page %d.  %s' % (time.strftime("%Y-%m-%d %H:%M:%S", time.localtime()), i, url % str(i))

     ip_proxy_file.close()

关于这份代码，有几个地方做一下说明：

· check_a_ip(ip)：该函数为IP代理检查函数，返回两个值（一个为访问请求是否成功使用了代理，一个为检查的响应时间）

· start_page、end_page：手动输入获取IP代理的网页页码，这个需要根据具体网站设定

· for i in range(int(start_page), int(end_page) + 1)：主函数的循环，遍历设定范围的网页

· for tr in trs[1:len(trs)]：循环遍历并解析出一个网页中的所有IP代理，以及检验是否可用

· ip_proxy_file：文本写入，最终把结果都写入proxy.txt中

4 拓展

本实验可以采用多线程进行爬取或者检验，这样的爬取速率会快很多，大家有时间可以尝试一下

如何爬取可用的IP代理的更多相关文章

爬取西刺ip代理池
好久没更新博客啦~,今天来更新一篇利用爬虫爬取西刺的代理池的小代码先说下需求,我们都是用python写一段小代码去爬取自己所需要的信息,这是可取的,但是,有一些网站呢,对我们的网络爬虫做了一些限制, ...
python爬取免费优质IP归属地查询接口
python爬取免费优质IP归属地查询接口具体不表,我今天要做的工作就是: 需要将数据库中大量ip查询出起归属地刚开始感觉好简单啊,毕竟只需要从百度找个免费接口然后来个python脚本跑一晚上就o ...
利用Python爬取可用的代理IP
前言就以最近发现的一个免费代理IP网站为例:http://www.xicidaili.com/nn/.在使用的时候发现很多IP都用不了. 所以用Python写了个脚本,该脚本可以把能用的代理IP检测 ...
使用TaskManager爬取2万条代理IP实现自动投票功能
话说某天心血来潮想到一个问题,朋友圈里面经常有人发投票链接,让帮忙给XX投票,以前呢会很自觉打开链接帮忙投一票.可是这种事做多了就会考虑能不能使用工具来进行投票呢,身为一名程序猿决定研究解决这个问题. ...
爬取西刺网代理ip，并把其存放mysql数据库
需求: 获取西刺网代理ip信息,包括ip地址.端口号.ip类型西刺网:http://www.xicidaili.com/nn/ 那,如何解决这个问题? 分析页面结构和url设计得知: 数据都在本页面 ...
python3爬虫系列19之反爬随机 User-Agent 和 ip代理池的使用
站长资讯平台:python3爬虫系列19之随机User-Agent 和ip代理池的使用我们前面几篇讲了爬虫增速多进程,进程池的用法之类的,爬虫速度加快呢,也会带来一些坏事. 1. 前言比如随着我们爬虫 ...
python 爬取可用
#coding:utf-8 from bs4 import BeautifulSoup import time import threading import random import telnet ...
如果对方网站反爬取，封IP了怎么办？
放慢抓取熟速度,减小对目标网站造成的压力,但是这样会减少单位时间内的数据抓取量使用代理IP(免费的可能不稳定,收费的可能不划算)
python scrapy 爬取西刺代理ip(一基础篇)（ubuntu环境下） -赖大大
第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrapy框架具体就自行百度了,主要内容不是在这. 第二步:创建scrapy(简单介绍) 1.Creating a p ...

随机推荐

jmeter正则表达式提取器使用
引用名称:请求中的参数需要引用的名称正则表达式:从结果集中提取数据,例如从数据库查询结果中提取数据模板:$1$表示提取表达式中的第一个值,$n$以此类推匹配数字:0代表随机,1代表第一个值,n代 ...
一个iOS开发者的修真之路
在微信上有童鞋问我iOS开发者的入门标准是神马?这个问题难到我了,而且贸然给一个答案出来的话,必定会有万千高手来喷. 凡人修仙,仙人修道,道人修真.当我们还是一个在青石板上蹲马步汗水涔涔的废柴时,或许 ...
R in action读书笔记（15）第十一章中级绘图之二折线图相关图马赛克图
第十一章中级绘图本节用到的函数有: plot legend corrgram mosaic 11.2折线图如果将散点图上的点从左往右连接起来,那么就会得到一个折线图. 创建散点图和折线图: &g ...
node.js入门之三
Node.js REPL(交互式解释器) Node.js REPL(Read Eval Print Loop:交互式解释器) 表示一个电脑的环境,类似 Window 系统的终端或 Unix/Linux ...
xamarin 学习笔记02- IOS Simulator for windows 安装
微软发布了在window下的ios模拟器下载 ios模拟器并安装在windows系统上. Xamarin for Visual Studio 和网络上的 Mac 中的 Xamarin.iOS 开 ...
程序员容易忽略的SQL Server错误集锦
1.大小写大写T-SQL 语言的所有关键字都使用大写,规范要求. 2.使用“;” 使用“;”作为 Transact-SQL 语句终止符.虽然分号不是必需的,但使用它是一种好的习惯,对于合并操作MER ...
自己编辑Nuget拓展包，并发布Nuget服务器，提供下载使用
1. 在NuGet官网上注册并获取API Key 到NuGet上注册一个新的账号,然后在My Account页面,获取一个API Key,如果没有则在API keys 页面创建一个就可以. 2. 下载 ...
安装gitlab并配置邮箱
安装要求:运行内存必须大于等于2G 一.安装docker wget -qO- https://get.docker.com/ | sh 镜像加速: echo '{"registry-mirr ...
03HibernateJAVA类与数据库表映射配置
HibernateJAVA类与数据库表映射配置
利用jQuery对li标签操作
<ul class="con" id="products"> <li i=" class=""> < ...

如何爬取可用的IP代理

如何爬取可用的IP代理的更多相关文章

随机推荐

热门专题