requests 使用免费的代理ip爬取网站

import requests

import queue

import threading

from lxml import etree

#要爬取的URL

url = "http://xxxxx"

#代理ip网站

proxy_url = "https://www.kuaidaili.com/free/inha/{page}/"

class MyThreadPool:

    def __init__(self, maxsize):

        self.maxsize = maxsize

        self._pool = queue.Queue(maxsize)

        for _ in range(maxsize):

            self._pool.put(threading.Thread)

    def get_thread(self):

        return self._pool.get()

    def add_thread(self):

        self._pool.put(threading.Thread)

def get_url(url):

    headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.146 Safari/537.36',

               }

    response = requests.get(url,headers=headers)

    html_str = response.text

    return html_str

def proxy_get_url(url,prox):

    proxies = {}

    proxies["http"] = prox

    headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.146 Safari/537.36',

               }

    response = requests.get(url,headers=headers,proxies=proxies,timeout=3)

    html_str = response.text

    return html_str

def ip_proxy(html_str):

    html = etree.HTML(html_str)

    ip_list = html.xpath('//tr/td[@data-title="IP"]/text()')

    port_list = html.xpath('//tr/td[@data-title="PORT"]/text()')

    http_list = []

    for i in range(len(ip_list)):

        http_proxy = ip_list[i]+":"+port_list[i]

        http_list.append(http_proxy)

    return http_list

def available_ip(ip_list):

    for ip in ip_list:

        try:

            proxy_get_url('https://www.baidu.com/',ip)

        except Exception as e:

            continue

        IP_LIST.append(ip)

if __name__ == "__main__":

    IP_LIST = []

    pool = MyThreadPool(20) #线程池数

    #验证代理ip

    for i in range(1,20): #页数

        page_ip = get_url(proxy_url.format(page=i))

        ip_list = ip_proxy(page_ip)

        t = pool.get_thread()

        obj = t(target=available_ip,args=(ip_list,))

        obj.start()

    #爬取网站

    for ip in IP_LIST:

        try:

            proxy_get_url(url,ip)

        except Exception as e:

            continue

        print(ip)

#使用一个ip爬取网站，如果ip不可用了删除ip

while IP_LIST:

    try:
        print(IP_LIST[0])
        proxy_get_url(url,IP_LIST[0])
    except Exception as e:
        del IP_LIST[0]
        continue

requests 使用免费的代理ip爬取网站的更多相关文章

酷伯伯实时免费HTTP代理ip爬取（端口图片显示+document.write）
分析打开页面http://www.coobobo.com/free-http-proxy/,端口数字一看就不对劲,老规律ctrl+shift+c选一下: 这就很悲剧了,端口数字都是用图片显示的: 不 ...
代理IP爬取和验证（快代理&西刺代理）
前言仅仅伪装网页agent是不够的,你还需要一点新东西今天主要讲解两个比较知名的国内免费IP代理网站:西刺代理&快代理,我们主要的目标是爬取其免费的高匿代理,这些IP有两大特点:免费,不稳 ...
代理IP爬取，计算，发放自动化系统
IoC Python端 MySQL端 PHP端怎么使用这学期有一门课叫<物联网与云计算>,于是我就做了一个大作业,实现的是对代理IP的爬取,计算推荐,发放给用户等任务的的自动化系统.由 ...
蚂蚁代理免费代理ip爬取（端口图片显示+token检查）
分析蚂蚁代理的列表页大致是这样的: 端口字段使用了图片显示,并且在图片上还有各种干扰线,保存一个图片到本地用画图打开观察一下: 仔细观察蓝色的线其实是在黑色的数字下面的,其它的干扰线也是,所以这幅图 ...
python 实现爬取网站下所有URL
python3 实现爬取网站下所有URL 获取首页元素信息: 首页的URL链接获取: 遍历第一次返回的结果: 递归循环遍历: 全部代码如下: 小结: python3.6 requests && ...
5 使用ip代理池爬取糗事百科
从09年读本科开始学计算机以来,一直在迷茫中度过,很想学些东西,做些事情,却往往陷进一些技术细节而蹉跎时光.直到最近几个月,才明白程序员的意义并不是要搞清楚所有代码细节,而是要有更宏高的方向,要有更专 ...
Python 利用 BeautifulSoup 爬取网站获取新闻流
0. 引言介绍下 Python 用 Beautiful Soup 周期性爬取 xxx 网站获取新闻流: 图 1 项目介绍 1. 开发环境 Python: 3.6.3 BeautifulSoup: ...
Python脚本爬取网站美女照片
上次无意之中看到一个网站,里面全是美女的照片,我就心想,哪天有时间了得把这网站的所有美女照片都得爬下来.今天有时间,写了点代码,爬去了网站的所有照片.附上战果!图片实在是太多了,爬半个多小时先附上所 ...
使用scrapy爬取网站的商品数据
目标是爬取网站http://www.muyingzhijia.com/上全部的商品数据信息,包括商品的一级类别,二级类别,商品title,品牌,价格. 搜索了一下,python的scrapy是一个不错 ...

随机推荐

[CQOI2018]破解D-H协议
嘟嘟嘟这不就是个bsgs板儿嘛. 顺便就复习了一下bsgs和哈希表. 头一次觉得我的博客这么好用,一下就懂了:数论学习笔记之高次不定方程这里再补充几点: 1.关于这一段代码: int S = sq ...
吴恩达课后作业学习2-week3-tensorflow learning-1-基本概念
参考:https://blog.csdn.net/u013733326/article/details/79971488 希望大家直接到上面的网址去查看代码,下面是本人的笔记到目前为止,我们一直在 ...
Oracle查询数据库中所有表的记录数
1.Oracle查询数据库中所有表的记录数,但是有可能不准建议用第二种方式进行查询 select t.table_name,t.num_rows from user_tables t 2.创建orac ...
安装NVIDIA
安装NVIDIA显卡驱动 $ ubuntu-drivers devices; $ sudo apt install nvidia-340 (安装指定版本) 重启系统: $ nvidia-smi (查看 ...
vue-cli sass安装
一.安装对应依赖node模块: npm install node-sass --save-dev npm install sass-loader --save-dev 二.打开webpack.base ...
UI 前端参考
:http://amazeui.org/ :http://www.dcloud.io/index.html :https://weui.io/ :http://m.sui.taobao.org/get ...
Java中的并发工具类(CountDownLatch、CyclicBarrier、Semaphore、Exchanger)
在JDK的并发包里提供了很多有意思的并发工具类.CountDownLatch.CyclicBarrier和Semaphore 工具类提供了一种并发流程控制的手段,Exchanger 工具类则提供了在线 ...
Python通过pip方式安装第三方模块的两种方式
一:环境 python3.6 windows 10 二:常用命令如果直接执行pip命令报错,说明pip不在path环境变量中解决方法: python -m pip list 以下默认可直接使用pi ...
扒一拔：Java 中的泛型（一）
目录 1 泛型 1.1 为什么需要泛型 1.2 类型参数命名规约 2 泛型的简单实用 2.1 最基本最常用 2.2 简单泛型类 2.2.1 非泛型类 2.2.2 泛型类的定义 2.2.3 泛型类的使用 ...
【C#复习总结】细说 Lambda表达式
1 前言本系列会将[委托] [匿名方法][Lambda表达式] [泛型委托] [表达式树] [事件]等基础知识总结一下.(本人小白一枚,有错误的地方希望大佬指正) 系类1:细说委托系类2:细说匿名 ...

requests 使用免费的代理ip爬取网站

requests 使用免费的代理ip爬取网站的更多相关文章

随机推荐

热门专题