python_爬校花图片

如何用python爬取校花图片并保存到本地来？

　　1. 获取什么数据?

　　　　校花名字 name

　　　　校花所在学校 school

　　　　校花图片的url img_ulr

　　2.如何获取？

　　　　打开网页http://www.xiaohuar.com/hua/ ，打开开发工具，研究每一张图片对应的html，找规律

　　　　通过python 的scrapy框架进行批量爬取

环境声明：

　　python 3.50

　　scrapy 库

出现了哪些问题？

　　1. 如何去除重复的url？

　　　　通过对获取的url 进行md5，进行去重

　　2. 如何该网站上所有的校花信息？

　　　　先获取网页上所有的a标签，通过递归去取其他内容

　　3. 如何内容永久化？

　　　　写入文件，数据库等，该爬校花图片程序，我选择写入文件保存

如何创建与逻辑处理？

　　1. 新建爬虫项目

　　　　scrapy startproject pa_girls　　(通过命令行)

　　2. spiders 目录下，建立一个叫、school_girls.py文件

　　　　在school_girls.py文件中写入：

#!/usr/bin/python3

import scrapy

from scrapy.selector import HtmlXPathSelector

import hashlib

# 把item模块添加到环境变量

from items import Pa1Item

# # 最终获取信息列表

# school_girl = []

# 获得总url，目的去重

all_urls = {}

class SchoolGirls(scrapy.Spider):

    name = 'school_girls'

    # 初始url，依次

    start_urls = [

        'http://www.xiaohuar.com/hua/',

    ]

    def parse(self, response):

        # 爬虫主体

        try:

            # 找标签

            hxs = HtmlXPathSelector(response)

            girls = Pa1Item()

            # 获取标签中指定数据

            school = hxs.select('//div[@class="img"]/div[@class="btns"]/a/text()').extract()

            name = hxs.select('//div[@class="img"]/span[@class="price"]/text()').extract()

            img_url = hxs.select('//div[@class="img"]/a/img/@src').extract()

            if school and name and img_url:

                girls['school'] = hxs.select('//div[@class="img"]/div[@class="btns"]/a/text()').extract()

                girls['name'] = hxs.select('//div[@class="img"]/span[@class="price"]/text()').extract()

                girls['img_url'] = hxs.select('//div[@class="img"]/a/img/@src').extract()

                yield girls

            else:

                pass

                #

            # 获取页面的所有连接

            page_urls = hxs.select('//a/@href').extract()

            page_urls.append('http://www.xiaohuar.com/hua/')

            # print(page_urls)

            # 进行url去重

            url_list = {}

            for url in page_urls:

                if url.startswith('JavaScript') or url.startswith('#') or not url:

                    continue

                else:

                    m = hashlib.md5()

                    m.update(bytes(url, encoding='utf-8'))

                    img_id = m.hexdigest()

                    # 判断是否重复url,重复就不需要再次访问

                    if img_id in all_urls:

                        continue

                    else:

                        all_urls[img_id] = url

                        url_list[img_id] = url

            # 递归查找该页面所有url

            for url in url_list.values():

                yield scrapy.Request(url=url, callback=self.parse)

        except Exception as e:

            print(e)

　　3. 在 items.py文件中写入

import scrapy

class Pa1Item(scrapy.Item):

    name = scrapy.Field()

    school = scrapy.Field()

    img_url = scrapy.Field()

　　4. 在pipelines.py文件中写入

import os

import requests

class GirlsMessage(object):

    '''获取有效数据'''

    def process_item(self, item, spider):

        for i in range(len(item['name'])):

            if item['name'][i].strip() and item['school'][i].strip() and item['img_url'][i].strip():

                # 把信息写入文件

                message_girls = item['name'][i] + '_' + item['school'][i] + ':' \

                                + 'http://www.xiaohuar.com/' + item['img_url'][i]

                with open('E:\scrapy_new\img\message_girls.text', 'a+', encoding='utf-8') as f_girls:

                    f_girls.write(message_girls)

                # 下载图片

                img_path = os.path.join('E:\scrapy_new\img', item['name'][i] +'_' + item['school'][i] +'.jpg')

                img_url = 'http://www.xiaohuar.com/' + item['img_url'][i]

                try:

                    img_date = requests.get(img_url).content

                    with open(img_path, 'bw',) as f_img:

                        f_img.write(img_date)

                        f_img.flush()

                except Exception as e:

                    print(e)

        return item

　　5. 在setting文件中添加

# 设置爬取深度

DEPTH_LIMIT = 1

# 激活pipelines中类

ITEM_PIPELINES = {

    'pa_1.pipelines.GirlsMessage': 200,

}

可能会出现哪些问题？

　　1. items模块导入不了，如何解决

　　　　在spiders目录下的__init__.py文件中加入：

import os

import sys

sys.path.append(os.path.dirname(os.path.dirname(os.path.abspath(__file__))))

如何启动项目？

　　scrapy crawl school_girls （需要在项目下，spiders目录下敲入命令）

python_爬校花图片的更多相关文章

Python 爬虫爬校花网！！
爬虫:是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本 1.福利来了校花网 ,首先说为什么要爬这个网站呢,第一这个网站简单爬起来容易不会受到打击,第二呢你懂得... 1.第一步,需要下载 ...
用python爬校花网
import requests import re import hashlib,time def get_index(url): response=requests.get(url) if resp ...
Scrapy爬虫框架之爬取校花网图片
Scrapy Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 其可以应用在数据挖掘,信息处理或存储历史数据等一系列的程序中.其最初是为了页面抓取 (更确切来说, 网络抓取 )所设 ...
scrapy爬取校花网男神图片保存到本地
爬虫四部曲,本人按自己的步骤来写,可能有很多漏洞,望各位大神指点指点 1.创建项目 scrapy startproject xiaohuawang scrapy.cfg: 项目的配置文件xiaohua ...
python实战项目 — 爬取校花网图片
重点: 1. 指定路径创建文件夹,判断是否存在 2. 保存图片文件 # 获得校花网的地址,图片的链接 import re import requests import time import os ...
Go语言实战-爬取校花网图片
一.目标网站分析爬取校花网http://www.xiaohuar.com/大学校花所有图片. 经过分析,所有图片分为四个页面,http://www.xiaohuar.com/list-1-0.htm ...
python爬虫基础应用----爬取校花网视频
一.爬虫简单介绍爬虫是什么? 爬虫是首先使用模拟浏览器访问网站获取数据,然后通过解析过滤获得有价值的信息,最后保存到到自己库中的程序. 爬虫程序包括哪些模块? python中的爬虫程序主要包括,re ...
Java基础-爬虫实战之爬去校花网网站内容
Java基础-爬虫实战之爬去校花网网站内容作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 爬虫这个实现点我压根就没有把它当做重点,也没打算做网络爬虫工程师,说起爬虫我更喜欢用Pyt ...
爬虫（猫眼电影+校花网+github+今日头条+拉钩）
Requests+正则表达式爬取猫眼TOP100榜电影信息 MARK:将信息写入文件解决乱码方法,开启进程池秒爬. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 ...

随机推荐

Java学习笔记26（Math类、Arrays类、BigInteger类、BigDecimal类）
Math类:数学工具类,做一些数学计算,开方,对数,三角函数等所有方法都是静态方法,不需要建立对象,直接用类名调用即可示例: 这里写几个在日常开发中会用到的,比如三角函数之类的平时不会用到,了解即 ...
IIS 应用程序池自动停止
IIS7 .NET Runtime version 2.0.50727.5420 - 执行引擎错误(000007FEE77AAF0E) (80131506) 装完系统,配置完IIS,发现.NET程序报 ...
GBK,UNICODE,GB2312,UTF-8学习总结
转自http://www.cnblogs.com/pannengzhi/p/5678495.html UNICODE,GBK,UTF-8区别前言其实这是个老生常谈的问题了,相信大家在第一次遇到Un ...
while100以内的偶数
#显示100以内的偶数 #声明i i = 1 #开始循环条件为i不等于100,执行while代码块 while i != 100: #给i加1 i +=1 #如果循环到此时i的取余运算为0则打印i i ...
【转载】LINUX上MYSQL优化三板斧
现在MySQL运行的大部分环境都是在Linux上的,如何在Linux操作系统上根据MySQL进行优化,我们这里给出一些通用简单的策略.这些方法都有助于改进MySQL的性能. 闲话少说,进入正题. 一. ...
nodejs 做后台的一个完整业务整理
大家知道js现在不仅仅可以写前端界面而且可以写后端的业务了,这样js就可以写一个全栈的项目.这里介绍一个nodejs + express + mongodb + bootstap 的全栈项目. 1.安 ...
【译】巧用CSS变量实现自动前缀
转:https://www.h5jun.com/post/autoprefixing-with-css-variables-lea-verou.html 最近,当我在制作 markapp.io 这个小 ...
微信小程序之自定义toast弹窗
微信小程序里面的自带弹窗icon只有两种,success和loading.有时候用户输入错误的时候想加入一个提醒图标,也可以使用wx.showToast中的image来添加图片达到使用自定义图标的目的 ...
Maven工程搭建spring boot+spring mvc+JPA
添加Spring boot支持,引入相关包: 1.maven工程,少不了pom.xml,spring boot的引入可参考官网: <parent> <groupId>org.s ...
java.io.FileNotFoundException class path resource [xxx.xml] cannot be opened
没有找到xxx.xml,首先确定你项目里有这个文件吗,如果没有请添加,或者你已经存在配置文件,只是名字不是xxx.xml,请改正名字.此外还要注意最好把xxx.xml加入到classpath里,就是放 ...

python_爬校花图片

python_爬校花图片的更多相关文章

随机推荐

热门专题