一：前言

嘀嘀嘀，上车请刷卡。昨天看到了不错的图片分享网——花瓣，里面的图片质量还不错，所以利用selenium+xpath我把它的妹子的栏目下爬取了下来，以图片栏目名称给文件夹命名分类保存到电脑中。这个妹子主页http://huaban.com/boards/favorite/beauty 是动态加载的，如果想获取更多内容可以模拟下拉，这样就可以更多的图片资源。这种之前爬虫中也做过，但是因为网速不够快所以我就抓了19个栏目，一共500多张美图，也已经很满意了。

先看看效果：

Paste_Image.png

二：运行环境

IDE：Pycharm
Python3.6
lxml 3.7.2
Selenium 3.4.0
requests 2.12.4

三：实例分析

1.这次爬虫我开始做的思路是：进入这个网页http://huaban.com/boards/favorite/beauty然后来获取所有的图片栏目对应网址，然后进入每一个网页中去获取全部图片。（如下图所示）

Paste_Image.png

2.但是爬取获取的图片分辨率是236x354，图片质量不够高，但是那个时候已经是晚上1点30之后了，所以第二天做了另一个版本：在这个基础上再进入每个缩略图对应的网页，再抓取像下面这样高清的图片。

Paste_Image.png

四：实战代码

1.第一步导入本次爬虫需要的模块

__author__ = '布咯咯_rieuse'

from selenium.webdriver.common.by import By

from selenium.webdriver.support import expected_conditions as EC

from selenium.webdriver.support.ui import WebDriverWait

from selenium import webdriver

import requests

import lxml.html

import os

2.下面是设置webdriver的种类，就是使用什么浏览器进行模拟，可以使用火狐来看它模拟的过程，也可以是无头浏览器PhantomJS来快速获取资源，['--load-images=false', '--disk-cache=true']这个意思是模拟浏览的时候不加载图片和缓存，这样运行速度会加快一些。WebDriverWait标明最大等待浏览器加载为10秒，set_window_size可以设置一下模拟浏览网页的大小。有些网站如果大小不到位，那么一些资源就不加载出来。

# SERVICE_ARGS = ['--load-images=false', '--disk-cache=true']

# browser = webdriver.PhantomJS(service_args=SERVICE_ARGS)

browser = webdriver.Firefox()

wait = WebDriverWait(browser, 10)

browser.set_window_size(1400, 900)

3.parser(url, param)这个函数用来解析网页，后面有几次都用用到这些代码，所以直接写一个函数会让代码看起来更整洁有序。函数有两个参数：一个是网址，另一个是显性等待代表的部分，这个可以是网页中的某些板块，按钮，图片等等...

def parser(url, param):

    browser.get(url)

    wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, param)))

    html = browser.page_source

    doc = lxml.html.fromstring(html)

    return doc

4.下面的代码就是解析本次主页面http://huaban.com/boards/favorite/beauty/ 然后获取到每个栏目的网址和栏目的名称，使用xpath来获取栏目的网页时，进入网页开发者模式后，如图所示进行操作。之后需要用栏目名称在电脑中建立文件夹，所以在这个网页中要获取到栏目的名称，这里遇到一个问题，一些名称不符合文件命名规则要剔除，我这里就是一个 * 影响了。

def get_main_url():

    print('打开主页搜寻链接中...')

    try:

        doc = parser('http://huaban.com/boards/favorite/beauty/', '#waterfall')

        name = doc.xpath('//*[@id="waterfall"]/div/a[1]/div[2]/h3/text()')

        u = doc.xpath('//*[@id="waterfall"]/div/a[1]/@href')

        for item, fileName in zip(u, name):

            main_url = 'http://huaban.com' + item

            print('主链接已找到' + main_url)

            if '*' in fileName:

                fileName = fileName.replace('*', '')

            download(main_url, fileName)

    except Exception as e:

        print(e)

Paste_Image.png

5.前面已经获取到栏目的网页和栏目的名称，这里就需要对栏目的网页分析，进入栏目网页后，只是一些缩略图，我们不想要这些低分辨率的图片，所以要再进入每个缩略图中，解析网页获取到真正的高清图片网址。这里也有一个地方比较坑人，就是一个栏目中，不同的图片存放dom格式不一样，所以我这样做

img_url = doc.xpath('//*[@id="baidu_image_holder"]/a/img/@src')

img_url2 = doc.xpath('//*[@id="baidu_image_holder"]/img/@src')

这就把两种dom格式中的图片地址都获取了，然后把两个地址list合并一下。img_url +=img_url2
在本地创建文件夹使用filename = 'image\{}\'.format(fileName) + str(i) + '.jpg'表示文件保存在与这个爬虫代码同级目录image下，然后获取的图片保存在image中按照之前获取的栏目名称的文件夹中。

def download(main_url, fileName):

    print('-------准备下载中-------')

    try:

        doc = parser(main_url, '#waterfall')

        if not os.path.exists('image\\' + fileName):

            print('创建文件夹...')

            os.makedirs('image\\' + fileName)

        link = doc.xpath('//*[@id="waterfall"]/div/a/@href')

        # print(link)

        i = 0

        for item in link:

            i += 1

            minor_url = 'http://huaban.com' + item

            doc = parser(minor_url, '#pin_view_page')

            img_url = doc.xpath('//*[@id="baidu_image_holder"]/a/img/@src')

            img_url2 = doc.xpath('//*[@id="baidu_image_holder"]/img/@src')

            img_url +=img_url2

            try:

                url = 'http:' + str(img_url[0])

                print('正在下载第' + str(i) + '张图片，地址：' + url)

                r = requests.get(url)

                filename = 'image\\{}\\'.format(fileName) + str(i) + '.jpg'

                with open(filename, 'wb') as fo:

                    fo.write(r.content)

            except Exception:

                print('出错了！')

    except Exception:

        print('出错啦!')

if __name__ == '__main__':

    get_main_url()

五：总结

这次爬虫继续练习了Selenium和xpath的使用，在网页分析的时候也遇到很多问题，只有不断练习才能把自己不会部分减少，当然这次爬取了500多张妹纸还是挺养眼的。

学习过程中遇到什么问题或者想获取学习资源的话，欢迎加入学习交流群
626062078，我们一起学Python！

Python抓取花瓣网高清美图的更多相关文章

async 异步抓取花瓣网高清大图 30s爬取500张
废话不多说,直接上代码,不懂得看注释先安装 pip install aiohttp "异步抓取花瓣网图片" # pip install aiohttp import requ ...
Python Spider 抓取今日头条街拍美图
""" 抓取今日头条街拍美图 """ import os import time import requests from hashlib ...
python爬虫之分析Ajax请求抓取抓取今日头条街拍美图（七）
python爬虫之分析Ajax请求抓取抓取今日头条街拍美图一.分析网站 1.进入浏览器,搜索今日头条,在搜索栏搜索街拍,然后选择图集这一栏. 2.按F12打开开发者工具,刷新网页,这时网页回弹到综合 ...
python 爬取王者荣耀高清壁纸
代码地址如下:http://www.demodashi.com/demo/13104.html 一.前言打过王者的童鞋一般都会喜欢里边设计出来的英雄吧,特别想把王者荣耀的英雄的高清图片当成电脑桌面 ...
15-分析Ajax请求并抓取今日头条街拍美图
流程框架: 抓取索引页内容:利用requests请求目标站点,得到索引网页HTML代码,返回结果. 抓取详情页内容:解析返回结果,得到详情页的链接,并进一步抓取详情页的信息. 下载图片与保存数据库:将 ...
Python 爬虫: 抓取花瓣网图片
接触Python也好长时间了,一直没什么机会使用,没有机会那就自己创造机会!呐,就先从爬虫开始吧,抓点美女图片下来. 废话不多说了,讲讲我是怎么做的. 1. 分析网站想要下载图片,只要知道图片的地址 ...
Python抓取第一网贷中国网贷理财每日收益率指数
链接:http://www.p2p001.com/licai/index/id/147.html 所需获取数据链接类似于:http://www.p2p001.com/licai/shownews/id ...
分析Ajax请求并抓取今日头条街拍美图
项目说明本项目以今日头条为例,通过分析Ajax请求来抓取网页数据. 有些网页请求得到的HTML代码里面并没有我们在浏览器中看到的内容.这是因为这些信息是通过Ajax加载并且通过JavaScript渲 ...
分析 ajax 请求并抓取今日头条街拍美图
首先分析街拍图集的网页请求头部: 在 preview 选项卡我们可以找到 json 文件,分析 data 选项,找到我们要找到的图集地址 article_url: 选中其中一张图片,分析 json 请 ...

随机推荐

javascript 文字闪烁
早上突然看到CSS里面的text-decoration属性的时候,发现blink仅有的火狐浏览器都不支持了.于是想使用js来实现这一效果. <script type="text/jav ...
转：learning to rank学习
learning to rank学习转: http://blog.csdn.net/xuqianghit/article/details/8947819 1. 什么是learning to rank ...
【hackerrank】Week of Code 30
Candy Replenishing Robot Find the Minimum Number 直接模拟 Melodious password dfs输出方案 Poles 题意:有多个仓库,只能从后 ...
【以前的空间】bzoj 1052 [HAOI2007]覆盖问题
这道题的思路挺简单的……就是可以证明如果要覆盖一个区域内的点,那么一定有一个正方形在这“区域内的点所围成的最大矩形的四个角中的一个”(不要吐槽很多的“的”……),对于长度r是否可以覆盖整个区域内的点, ...
[国家集训队]最长双回文串 manacher
---题面--- 题解: 首先有一个直观的想法,如果我们可以求出对于位置i的最长后缀回文串和最长前缀回文串,那么我们枚举分界点然后合并前缀和后缀不就可以得到答案了么? 所以我们的目标就是求出这两个数列 ...
AOJ.综合训练.2016-12-8
提示:多个题目的代码采用了C ++的写法,对应编译器选择G ++,请不要直接复制代码. 下周实验考试,GOOD LUCK! 感谢汪神提供E题C语言代码所有题目已更新为C语言写法所有题目已更新为C语 ...
Android源码4.4.4_r1下载和编译
系统:ubuntu 16.04.2 TLS 1.源码下载: sudo apt-get install curl curl https://storage.googleapis.com/git-repo ...
ACE前摄器Proactor模式
转载于:http://www.cnblogs.com/TianFang/archive/2006/12/31/608952.html 当 OS 平台支持异步操作时,一种高效而方便的实现高性能 Web ...
Java中的字符串常量池？
参考:http://droidyue.com/blog/2014/12/21/string-literal-pool-in-java/index.html
hadoop配置文件详解、安装及相关操作
一. Hadoop伪分布配置 1. 在conf/hadoop-env.sh文件中增加:export JAVA_HOME=/home/Java/jdk1.6 2. 在c ...

Python抓取花瓣网高清美图

一：前言

二：运行环境

三：实例分析

四：实战代码

五：总结

Python抓取花瓣网高清美图的更多相关文章

随机推荐

热门专题