爬取西刺网代理ip，并把其存放mysql数据库

需求：

　　获取西刺网代理ip信息，包括ip地址、端口号、ip类型

　　西刺网：http://www.xicidaili.com/nn/

那，如何解决这个问题？

　　分析页面结构和url设计得知：

　　　　数据都在本页面可以全部获取，没有单独的详情页面

　　　　下一页通过更改当前页面最后url后缀进行跳转页面，那我实现URL的拼接不就解决这个问题了

那，软件的运行环境？

　　　　python3.5

　　　　scrapy

　　　　twisted

　　　　request

　　　　pymysql

　　以上是第三方包，通过pip安装

　　MySQL服务

其中db，user，password的值根据实际情况而定

#!/usr/bin/python3

__author__ = 'beimenchuixue'

__blog__ = 'http://www.cnblogs.com/2bjiujiu/'

import requests

import pymysql

from time import sleep

from random import randint, choice

from scrapy.selector import Selector

from twisted.enterprise import adbapi

from twisted.internet import reactor

# 数据库基本配置, 自行配置

db_settings = {

    'host': 'localhost',

    'db': 'db_name',

    'user': 'user_name',

    'password': 'password',

    'charset': 'utf8',

    'use_unicode': True

}

# conn = pymysql.connect(**db_settings)

# cursor = conn.cursor()

# 生成连接池

db_conn = adbapi.ConnectionPool('pymysql', **db_settings)

def go_sleep():

    """进行随机io堵塞，模仿人访问"""

    while randint(0, 1):

        sleep(choice([0.1, 0.2, 0.3, 0.4, 0.5, 0.6]))

def get_sql(ip, port, ip_type):

    """获得sql语句"""

    if ip and port and ip_type:

        sql = """insert into

              ip_server(ip, port, ip_type)

               value (%s, %s, %s)

              on DUPLICATE key update ip=values(ip), port=values(port), ip_type=values(ip_type)"""

        try:

            params = (ip, int(port), ip_type)

        except Exception as e:

            print(e)

            return None

        return sql, params

    else:

        return None

def go_insert(cursor, sql, params):

    """数据库插入操作"""

    try:

        cursor.execute(sql, params)

    except Exception as e:

        print(e)

def get_ip():

    """爬取ip信息并存入数据库"""

    # 设置请求头

    headers = {

        'Referer': 'http://www.xicidaili.com/nn/',

        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.115 Safari/537.36'

    }

    # 获取50页的数据

    for page in range(1, 50):

        # 建立关系映射，增加程序可阅读性

        ip_index, port_index, type_index = 2, 3, 6

        # 爬取的url

        url = 'http://www.xicidaili.com/nn/{page}'.format(page=page)

        go_sleep()

        response = requests.get(url, headers=headers)

        # 打印状态码

        print(response.status_code)

        # 进行页面解析

        selectors = Selector(text=response.text)

        all_trs = selectors.css('#ip_list .odd')

        for tr in all_trs:

            ip = tr.css('td:nth-child(%s)::text' % ip_index).extract_first()

            port = tr.css('td:nth-child(%s)::text' % port_index).extract_first()

            ip_type = tr.css('td:nth-child(%s)::text' % type_index).extract_first()

            sql, params = get_sql(ip, port, ip_type)

            if sql:

                try:

                    # cursor.execute(sql, params)

                    # conn.commit()

                    # 执行sql操作

                    db_conn.runInteraction(go_insert, sql, params)

                except Exception as e:

                    print(e)

            else:

                break

if __name__ == '__main__':

    get_ip()

    # 让twisted的sql操作去完成

    reactor.callLater(4, reactor.stop)

    reactor.run()

爬取西刺网代理ip，并把其存放mysql数据库的更多相关文章

爬取西刺网的免费IP
在写爬虫时,经常需要切换IP,所以很有必要自已在数据维护库中维护一个IP池,这样,就可以在需用的时候随机切换IP,我的方法是爬取西刺网的免费IP,存入数据库中,然后在scrapy 工程中加入tools ...
爬取西刺ip代理池
好久没更新博客啦~,今天来更新一篇利用爬虫爬取西刺的代理池的小代码先说下需求,我们都是用python写一段小代码去爬取自己所需要的信息,这是可取的,但是,有一些网站呢,对我们的网络爬虫做了一些限制, ...
Python四线程爬取西刺代理
import requests from bs4 import BeautifulSoup import lxml import telnetlib #验证代理的可用性 import pymysql. ...
使用XPath爬取西刺代理
因为在Scrapy的使用过程中,提取页面信息使用XPath比较方便,遂成此文. 在b站上看了介绍XPath的:https://www.bilibili.com/video/av30320885?fro ...
scrapy爬取西刺网站ip
# scrapy爬取西刺网站ip # -*- coding: utf-8 -*- import scrapy from xici.items import XiciItem class Xicispi ...
手把手教你使用Python爬取西刺代理数据（下篇）
/1 前言/ 前几天小编发布了手把手教你使用Python爬取西次代理数据(上篇),木有赶上车的小伙伴,可以戳进去看看.今天小编带大家进行网页结构的分析以及网页数据的提取,具体步骤如下. /2 首页分析 ...
python scrapy 爬取西刺代理ip(一基础篇)（ubuntu环境下） -赖大大
第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrapy框架具体就自行百度了,主要内容不是在这. 第二步:创建scrapy(简单介绍) 1.Creating a p ...
python+scrapy 爬取西刺代理ip(一)
转自:https://www.cnblogs.com/lyc642983907/p/10739577.html 第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrap ...
Scrapy爬取西刺代理ip流程
西刺代理爬虫 1. 新建项目和爬虫 scrapy startproject daili_ips ...... cd daili_ips/ #爬虫名称和domains scrapy genspider ...

随机推荐

git应用套路
git应用套路一. 配置git别名 1.通过控制台命令vim ~/.gitconfig打开配置页面 2.配置如下内容: [user] name = your Name email = your E- ...
【转】sublime text 3 显示空格和Tab
因为sublime text3确实太好用了所以也用它写代码了,可是在Python3第一步把preferences.sublime-setting-Default里面的"draw_white_ ...
[原创]在Centos7.2上源码安装PHP、Nginx、Zentao禅道
版本操作系统:CentOS Linux release 7.2.1511 (Core) PHP:5.6.33 Nginx:1.12.2 MySQL:5.6.38(192.168.1.103的Wind ...
Flask基础
简介 Flask是当下流行的Web框架,它是用Python实现的.Flask显著的特点是:它是一个“微”框架.”微”意味着Flask旨在保持核心的简单,但同时又易于扩展.默认情况下,Flask 不包含 ...
org.springframework.expression.spel.SpelEvaluationException: EL1004E: Method call: Method service() cannot be found on com.my.blog.springboot.thymeleaf.util.MethodTest type
前言本文中提到的解决方案,源码地址在:springboot-thymeleaf,希望可以帮你解决问题. 至于为什么已经写了一篇文章thymeleaf模板引擎调用java类中的方法,又多此一举的单独整 ...
Elixir的Phoenix框架：请求处理之道
本文基于Phoenix1.3,但请求的处理流程跟1.2基本一致,只是模块的命名和目录结构有所差异. 简单介绍,phoenix是一个网站框架,本质就是http请求处理.这篇文章主要就是讲一个请求,在结果 ...
java_web学习(十一) 层的概念与应用
一个项目通常分为三层: 所谓三层是表述层(WEB层).业务逻辑层(Business Logic),以及数据访问层(Data Access). ·WEB层:包含JSP和Servlet等与WEB相关的内容 ...
Hadoop伪分布式部署
一.Hadoop组件依赖关系: 步骤 1)关闭防火墙和禁用SELinux 切换到root用户关闭防火墙:service iptables stop Linux下开启/关闭防火墙的两种方法 1.永久性 ...
Machine Learning - week 1
Matrix 定义及基本运算 Transposing To "transpose" a matrix, swap the rows and columns. We put a &q ...
51Nod 1091 线段的重叠(贪心+区间相关,板子题)
1091 线段的重叠基准时间限制:1 秒空间限制:131072 KB 分值: 5 难度:1级算法题 X轴上有N条线段,每条线段包括1个起点和终点.线段的重叠是这样来算的,[10 2 ...

爬取西刺网代理ip，并把其存放mysql数据库

爬取西刺网代理ip，并把其存放mysql数据库的更多相关文章

随机推荐

热门专题