爬取西刺网的免费IP

在写爬虫时，经常需要切换IP，所以很有必要自已在数据维护库中维护一个IP池，这样，就可以在需用的时候随机切换IP，我的方法是爬取西刺网的免费IP，存入数据库中，然后在scrapy 工程中加入tools这个目录，里面存放一些常用的目录，包括这个免费IP池，具体目录如下：

crawl_ip_from_xichi.py 代码如下：

import requests

from fake_useragent import UserAgent

from scrapy.selector import Selector

import time

import pymysql

class GetIPFromXichi(object):

    """通过西刺得到可用的IP，存入数据库"""

    def crawl_ip(self):

        """爬取西刺的免费IP"""

        ip_list = []

        for i in range(1, 20):

            headers = UserAgent()

            ua = getattr(headers, "random")

            ua = {"User-Agent": ua}

            url = "http://www.xicidaili.com/nn/" + str(i)

            response = requests.get("http://www.xicidaili.com/nn/", headers=ua)

            time.sleep(3)

            selector = Selector(text=response.text)

            alltr = selector.css("#ip_list tr")

            for tr in alltr[1:]:

                speed_str = tr.css(".bar::attr(title)").extract_first()

                if speed_str:

                    speed = float(speed_str.split("秒")[0])

                else:

                    speed = 0

                all_text = tr.css("td ::text").extract()

                ip = all_text[0]

                port = all_text[1]

                type = all_text[6]

                if not 'HTTP' in type.upper():

                    type = "HTTP"

                ip_list.append((ip, port, type, speed))

        conn = pymysql.connect(host="127.0.0.1", user="root", password="root", db="outback")

        cursor = conn.cursor()

        insert_sql = """insert into ip_proxy(ip,port,type,speed) VALUES (%s,%s,%s,%s) """

        for i in ip_list:

            try:

                cursor.execute(insert_sql, (i[0], i[1], i[2], i[3]))

                conn.commit()

            except Exception as e:

                print(e)

                conn.rollback()

        cursor.close()

        conn.close()

if __name__ == "__main__":

    crawl_ip_from_xichi=GetIPFromXichi()

    crawl_ip_from_xichi.crawl_ip()

这里有几个容易出错的地方，

一，把函数放在main线程中去执行，这样在以后导入这个类时就不会执行一次，

二，数据连接一定是在整个循环执行完之后才关闭。

三，为了使这个爬虫更加友好，每爬取一页面 sleep 3秒，

github https://github.com/573320328/tools

爬取西刺网的免费IP的更多相关文章

爬取西刺网代理ip，并把其存放mysql数据库
需求: 获取西刺网代理ip信息,包括ip地址.端口号.ip类型西刺网:http://www.xicidaili.com/nn/ 那,如何解决这个问题? 分析页面结构和url设计得知: 数据都在本页面 ...
爬取西刺ip代理池
好久没更新博客啦~,今天来更新一篇利用爬虫爬取西刺的代理池的小代码先说下需求,我们都是用python写一段小代码去爬取自己所需要的信息,这是可取的,但是,有一些网站呢,对我们的网络爬虫做了一些限制, ...
scrapy爬取西刺网站ip
# scrapy爬取西刺网站ip # -*- coding: utf-8 -*- import scrapy from xici.items import XiciItem class Xicispi ...
Python四线程爬取西刺代理
import requests from bs4 import BeautifulSoup import lxml import telnetlib #验证代理的可用性 import pymysql. ...
使用XPath爬取西刺代理
因为在Scrapy的使用过程中,提取页面信息使用XPath比较方便,遂成此文. 在b站上看了介绍XPath的:https://www.bilibili.com/video/av30320885?fro ...
手把手教你使用Python爬取西刺代理数据（下篇）
/1 前言/ 前几天小编发布了手把手教你使用Python爬取西次代理数据(上篇),木有赶上车的小伙伴,可以戳进去看看.今天小编带大家进行网页结构的分析以及网页数据的提取,具体步骤如下. /2 首页分析 ...
python scrapy 爬取西刺代理ip(一基础篇)（ubuntu环境下） -赖大大
第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrapy框架具体就自行百度了,主要内容不是在这. 第二步:创建scrapy(简单介绍) 1.Creating a p ...
python+scrapy 爬取西刺代理ip(一)
转自:https://www.cnblogs.com/lyc642983907/p/10739577.html 第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrap ...
Scrapy爬取西刺代理ip流程
西刺代理爬虫 1. 新建项目和爬虫 scrapy startproject daili_ips ...... cd daili_ips/ #爬虫名称和domains scrapy genspider ...

随机推荐

Linux下zeromq.js安装
本文章主要阐述在离线环境下安装zeromq.js的方法和步骤.zeromq.js下载地址: https://www.npmjs.com/package/zeromq或者 https://github. ...
poj 3294
Life Forms Time Limit: 5000MS Memory Limit: 65536K Total Submissions: 12688 Accepted: 3552 Descr ...
sql中查询同一列所有值出现的次数
尊重原创:http://blog.csdn.net/love_java_cc/article/details/52234889 有表如下table3: 需要查询country中各个国家出现的次数 SQ ...
encodeURIComponent() 函数
https://baike.baidu.com/item/encodeURIComponent() 函数/7418815?fr=aladdin encodeURIComponent() 函数[1] 作 ...
Python3 引入模块的方法
例子 import random 产生随机整数 import random secret = random.randint(0,10)
asp.net -mvc框架复习（11）-基于三层架构与MVC实现完整的用户登录
一.先从M部分写起(Modles\DAL\BLL) 1.Modles 实体类:上次实体类已经搞定. 2.DAL 数据访问类类 (1)通用数据数据访问类: A: 先编写数据连接字符串,写到网站根目录W ...
TCP长连接和短连接的区别
当网络通信时采用TCP协议时,在真正的读写操作之前,server与client之间必须建立一个连接,当读写操作完成后,双方不再需要这个连接时它们可以释放这个连接,连接的建立是需要三次握手的,而释放则需 ...
Java接口和抽象类的理解
接口和抽象类的相同之处就是都会有抽象方法抽象方法就是一个没有方法体等待继承的子类完成的方法然而接口比较严格它的方法必须是抽象方法且是公开的抽象类可以有自己的属性和实体方法首相用面向 ...
mybatis-自定义缓存-redis二级缓存
在mybatis一级缓存二级缓存中已经介绍过了二级缓存的大致原理.下面我们用redis来实现一下二级缓存.环境是springmvc+mybatis+redis 步骤一.引入redis相关的maven依 ...
centos下配置sftp且限制用户访问目录[转]
第一步:创建sftp服务用户组,创建sftp服务根目录 groupadd sftp #此目录及上级目录的所有者(owner)必须为root,权限不高于755,此目录的组最好设定为sftp mkdir ...

爬取西刺网的免费IP

爬取西刺网的免费IP的更多相关文章

随机推荐

热门专题