爬虫爬取代理IP池及代理IP的验证

最近项目内容需要引入代理IP去爬取内容。

为了项目持续运行，需要不断构造、维护、验证代理IP。

为了绕过服务端对IP 和频率的限制，为了阻止服务端获取真正的主机IP。

一、服务器如何获取客户端IP

　　1.js获取本地IP后提交

　　这种方案可以通过抓包查看交互，伪造包达到目的。本机就可以完成。

　　2.服务端通过 http字段获取真实IP地址

　　可以通过伪造字段来获取（可以自己伪造，也可以通过高匿代理服务器伪造）

　　3.服务端通过tcp连接来确定真实IP地址

　　这个不可能伪造，不然无法建立TCP连接。

综合情况，我们最好通过代理IP服务器（匿名混淆高匿三种代理都可以），交由代理处理字段，让服务端无法得知自己的IP。

二、爬取免费代理（有钱自己买也行）

　　1.寻找代理网站然后爬取内容

　　　　这边找的是xici，然后爬取之后对代理进行了筛选。

　　　　xici代理会对ua封IP，需要伪造ua逃避掉。

　　2.验证并筛选代理IP

　　　　有些代理服务器并不是高匿，虽然声称了高匿，还有广告陷阱。。。

　　　　我们可以自己搭建一个web服务测试，看代理服务器是否隐藏我们的IP，也可以通过确定返回内容长度来确定是否是广告陷阱。

 if(getenv('HTTP_CLIENT_IP') && strcasecmp(getenv('HTTP_CLIENT_IP'), 'unknown')) {

         $ip = getenv('HTTP_CLIENT_IP');

     } elseif(getenv('HTTP_X_FORWARDED_FOR') && strcasecmp(getenv('HTTP_X_FORWARDED_FOR'), 'unknown')) {

         $ip = getenv('HTTP_X_FORWARDED_FOR');

     } elseif(getenv('REMOTE_ADDR') && strcasecmp(getenv('REMOTE_ADDR'), 'unknown')) {

         $ip = getenv('REMOTE_ADDR');

     } elseif(isset($_SERVER['REMOTE_ADDR']) && $_SERVER['REMOTE_ADDR'] && strcasecmp($_SERVER['REMOTE_ADDR'], 'unknown')) {

         $ip = $_SERVER['REMOTE_ADDR'];

     }

     $res =  preg_match ( '/[\d\.]{7,15}/', $ip, $matches ) ? $matches [0] : '';

     echo $res;

返回实际IP的代码

　　　　结果真的好遗憾。xici高匿代理几万条筛出一条就是不错的结果了。。

三、维护IP池

　　开启服务不断爬取筛选,筛选出的IP，需要保存到IP池中。IP池通过消息中间件维护，其他job去访问即可。

　　如何保证从IP池获取到的IP是实时有效且匿名的呢。

　　可以采取惰性验证的手段，还是通过访问服务测试。（这里应该可以优化一下。给IP打上时间戳，一定时间内可以不用再次验证）

爬虫爬取代理IP池及代理IP的验证的更多相关文章

python3爬虫爬取网页思路及常见问题（原创）
学习爬虫有一段时间了,对遇到的一些问题进行一下总结. 爬虫流程可大致分为:请求网页(request),获取响应(response),解析(parse),保存(save). 下面分别说下这几个过程中可以 ...
爬取西刺网的免费IP
在写爬虫时,经常需要切换IP,所以很有必要自已在数据维护库中维护一个IP池,这样,就可以在需用的时候随机切换IP,我的方法是爬取西刺网的免费IP,存入数据库中,然后在scrapy 工程中加入tools ...
python爬虫爬取安居客并进行简单数据分析
本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理爬取过程一.指定爬取数据二.设置请求头防止反爬三.分析页面并且与网页源码进行比对四.分析页面整理数据 ...
python爬虫爬取策略
爬取策略关注公众号"轻松学编程"了解更多. 在爬虫系统中,待抓取URL队列是很重要的一部分.待抓取URL队列中的URL以什么样的顺序排列也是一个很重要的问题,因为这涉及到先抓取那 ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
如何利用Python网络爬虫爬取微信朋友圈动态--附代码（下）
前天给大家分享了如何利用Python网络爬虫爬取微信朋友圈数据的上篇(理论篇),今天给大家分享一下代码实现(实战篇),接着上篇往下继续深入. 一.代码实现 1.修改Scrapy项目中的items.py ...
使用scrapy爬虫,爬取17k小说网的案例-方法一
无意间看到17小说网里面有一些小说小故事,于是决定用爬虫爬取下来自己看着玩,下图这个页面就是要爬取的来源. a 这个页面一共有125个标题,每个标题里面对应一个内容,如下图所示下面直接看最核心spi ...
python爬虫爬取京东、淘宝、苏宁上华为P20购买评论
爬虫爬取京东.淘宝.苏宁上华为P20购买评论 1.使用软件 Anaconda3 2.代码截图三个网站代码大同小异,因此只展示一个 3.结果(部分) 京东淘宝苏宁 4.分析这三个网站上的评论数据 ...
利用Python网络爬虫爬取学校官网十条标题
利用Python网络爬虫爬取学校官网十条标题案例代码: # __author : "J" # date : 2018-03-06 # 导入需要用到的库文件 import urll ...

随机推荐

Linux基础学习（一）
前言:这个学习笔记是为了督促自己能够更好的学习Linux的有关知识. 参考书目鸟哥的linux私房菜 Chapter 1:入门建议新手建议:重点基础一定一定要学好那么什么是基础呢? 先从Lin ...
Spring MVC 基于Method的映射规则（注解版）
在Restful风格的web开发中,根据不同的请求方法使用相应的控制器处理逻辑成为核心需求,下面就看看如何在Spring MVC中识别不同的请求方法. 请求方法在Http中,请求的方法有很多种,最常 ...
java中pojo对象首字母大写导致无法赋值问题
命名规范(文末附有java命名规范)中指出,属性变量命名应采用驼峰命名的方式,即首字母小写,其他单词首字母大写: 但有时候我们对接三方的接口时,想要封装实体类来接受,但是发现接收到的参数的变量首字母是 ...
历年NOIP真题总结
前言:最近把历年的NOIP真题肝了一遍(还有3个紫题先咕掉了),主要是到1998年的提高组的题.把题目的做题简要思路搁在这儿,一个是为了考前翻一翻,想想自己的哪些思路要梳理的什么什么的,反正怎么说呢, ...
异常HttpMessageNotWritableException解决办法
1. 问题描述在写SpringBoot项目的时候,由于是前后端分离项目,为了统一接口形式,使用一个类封装了返回数据的形式,但是在测试的时候报异常HttpMessageNotWritableExcep ...
POJ2488 A Knight's Journey
题目:http://poj.org/problem?id=2488 题目大意:可以从任意点开始,只要能走完棋盘所有点,并要求字典序最小,不可能的话就impossible: 思路:dfs+回溯,因为字典 ...
AT2672 Coins
传送门按理说想到转化问题之后就不难了吧,可是我还是不会写一个很容易想到的转化就是差分,将银币数和铜币数都减去金币数,这样就转化为\(x+y+z\)个钱币选\(y\)个银币和\(z\)个铜币的最大数 ...
洛谷P4018 Roy&October之取石子
题目背景 \(Roy\)和\(October\)两人在玩一个取石子的游戏. 题目描述游戏规则是这样的:共有\(n\)个石子,两人每次都只能取\(p^k\)个(\(p\)为质数,\(k\)为自然数,且 ...
PHP学习文件操作函数的应用--简单网络留言模板
<?php /** 网络留言板模式主要运用到的函数有 fopen fclose flock fwrite fread explode list */ ?> <meta http-e ...
GCD Guessing Game Gym - 100085G 猜数字 gcd
http://codeforces.com/gym/100085/attachments 因为那个数字是一个质数,这样的猜的次数是最多的,所以至少是质数次. 但是如果需要猜2.3,那么可以直接猜6,也 ...

爬虫爬取代理IP池及代理IP的验证

爬虫爬取代理IP池及代理IP的验证的更多相关文章

随机推荐

热门专题