用xpath来爬图

# xpath语法可参考http://www.w3school.com.cn/xpath/xpath_syntax.asp
# 本博客引用于https://zhuanlan.zhihu.com/something-python?topic=Python

# coding:utf-8

import requests

from lxml import html

import os

import time

def header(referer):

    headers = {

        'Host': 'i.meizitu.net',

        'Pragma': 'no-cache',

        'Accept-Encoding': 'gzip, deflate',

        'Accept-Language': 'zh-CN,zh;q=0.8,en;q=0.6',

        'Cache-Control': 'no-cache',

        'Connection': 'keep-alive',

        'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_5) AppleWebKit/537.36 (KHTML, like Gecko) '

                      'Chrome/59.0.3071.115 Safari/537.36',

        'Accept': 'image/webp,image/apng,image/*,*/*;q=0.8',

        'Referer': '{}'.format(referer),

    }

    return headers

# 获取主页列表, 解析 html 的话最好使用html.fromstring(),它有xpath函数，可用于定位元素。

def getPage(pageNum):

    baseUrl = 'http://www.mzitu.com/page/{}'.format(pageNum)

    selector = html.fromstring(requests.get(baseUrl).content)

    urls = []

    for i in selector.xpath('//ul[@id="pins"]/li/a/@href'):

        urls.append(i)

        print(i)

    return urls

# 图片链接列表， 标题

# url是详情页链接

def getPiclink(url):

    sel = html.fromstring(requests.get(url).content)

    # 图片总数,xpath 表达式应该返回元素的话，总是返回一个数组，即使只有一个元素;其中@class表示属性class；last()函数表示最后一个a标签

    total = sel.xpath('//div[@class="pagenavi"]/a[last()-1]/span/text()')[0]

    # 标题

    title = sel.xpath('//h2[@class="main-title"]/text()')[0]

    # 文件夹格式

    dirName = u"【{}P】{}".format(total, title)

    # 新建文件夹

    os.mkdir(dirName)

    n = 1

    for i in range(int(total)):

        # 每一页

        try:

            link = '{}/{}'.format(url, i+1)

            s = html.fromstring(requests.get(link).content)

            # 图片地址在src标签中

            jpgLink = s.xpath('//div[@class="main-image"]/p/a/img/@src')[0]

            # print(jpgLink)

            # 文件写入的名称：当前路径／文件夹／文件名

            filename = '%s/%s/%s.jpg' % (os.path.abspath('.'), dirName, n)

            print(u'开始下载图片:%s 第%s张' % (dirName, n))

			#"wb+" 以二进制写方式打开，可以读、写文件， 如果文件不存在，创建该文件

            with open(filename, "wb+") as jpg:

                jpg.write(requests.get(jpgLink, headers=header(jpgLink)).content)

            n += 1

        except:

            pass

#下面一行代码的作用：文件作为脚本直接执行才会被执行下面代码，而import到其他脚本中是不会被执行的，http://www.dengfeilong.com/post/60.html

if __name__ == '__main__':

    pageNum = input(u'请输入页码：')

    p = getPage(pageNum)

    for e in p:

        print(e)

        getPiclink(e)

        # lxml的报错

        time.sleep(2)

# 执行的时候用python3, 并且要安装pip install lxml requests

#虚拟环境中装python3

#sudo apt-get install python-pip

#sudo apt-get install python-virtualenv #安装本地虚拟环境管理工具

#mkdir ~/django # 创建目录

#cd ~/django virtualenv venv #在~/django目录下，创建一个venv的虚拟环境

#source venv/bin/activate #开启虚拟环境

用xpath来爬图的更多相关文章

Python多线程爬图&Scrapy框架爬图
一.背景对于日常Python爬虫由于效率问题,本次测试使用多线程和Scrapy框架来实现抓取斗图啦表情.由于IO操作不使用CPU,对于IO密集(磁盘IO/网络IO/人机交互IO)型适合用多线程,对于 ...
requests+xpath+map爬取百度贴吧
# requests+xpath+map爬取百度贴吧 # 目标内容:跟帖用户名,跟帖内容,跟帖时间 # 分解: # requests获取网页 # xpath提取内容 # map实现多线程爬虫 impo ...
python学习之BeautifulSoup模块爬图
BeautifulSoup模块爬图学习HTML文本解析标签定位网上教程多是爬mzitu,此网站反爬限制多了.随意找了个网址,解析速度有些慢.脚本流程:首页获取总页数-->拼接每页URL--> ...
【个人】爬虫实践，利用xpath方式爬取数据之爬取虾米音乐排行榜
实验网站:虾米音乐排行榜网站地址:http://www.xiami.com/chart 难度系数:★☆☆☆☆ 依赖库:request.lxml的etree (安装lxml:pip install ...
爬虫（Xpath）——爬tieba.baidu.com
工具:python3 核心知识点: 1)lxml包不能用pip下载,因为里面有其他语言编写的文件 2)urlopen返回的请求是html文件,要使用 content = etree.HTML(html ...
一起学爬虫——使用xpath库爬取猫眼电影国内票房榜
之前分享了一篇使用requests库爬取豆瓣电影250的文章,今天继续分享使用xpath爬取猫眼电影热播口碑榜 XPATH语法 XPATH(XML Path Language)是一门用于从XML文件中 ...
Java - XPath解析爬取内容
code { margin: 0; padding: 0; white-space: pre; border: none; background: transparent; } pre { backg ...
Scrapy中用xpath/css爬取豆瓣电影Top250：解决403HTTP status code is not handled or not allowed
好吧,我又开始折腾豆瓣电影top250了,只是想试试各种方法,看看哪一种的方法效率是最好的,一直进行到这一步才知道 scrapy的强大,尤其是和selector结合之后,速度飞起.... 下面我就采用 ...
Python 2.7_利用xpath语法爬取豆瓣图书top250信息_20170129
大年初二,忙完家里一些事,顺带有人交流爬取豆瓣图书top250 1.构造urls列表 urls=['https://book.douban.com/top250?start={}'.format(st ...

随机推荐

SQL的3个主要组成
SQL语言包含3个部分:数据定义语言(DDL),数据操作语言(DML),数据控制语言(DCL) 数据定义语言(DDL) 数据定义语言用于定义和管理对象,例如数据库.数据表及视图等.典型代表有CREAT ...
word2012写论文之参考文献和图片
每次写论文都感到word的“博大精深”啊,一个版本一个样,一些原来版本还有的功能,后来的版本就没有了,一些原来版本叫这个名字的功能,下一个版本就换了个名字,你也太考验你用户的智商和耐心了吧!即使同一份 ...
86. Partition List (List)
Given a linked list and a value x, partition it such that all nodes less than x come before nodes gr ...
selenium+jenkins网页自动化测试的构建
jenkins+selenium可以做到对web自动化的持续集成. Jenkins的基本操作: 一.新建视图及job 新建视图: 新建job: 可以选择构建一个自由风格的软件项目或者复制已有的item ...
R Markdown 速查表
centos7如何知道jdk的在哪个目录
今天一个小实验需要安装jdk,用命令Java -version查询了一下,原来Centos7自带OpenJDK的环境,但是需要手动配置/etc/profile文件,于是开始找java的安装路径.... ...
MongoDB与CouchDB全方位对比(转)
出处:http://www.csdn.net/article/2011-03-21/294226 本文见于MongoDB官方网站,MongoDB与CouchDB很相似,他们都是文档型存储,数据存储格式 ...
CentOS7 Failed to start LSB: Bring up/down
原文地址:http://addam.blog.51cto.com/5041993/1839518 刚刚装好的虚拟机突然不能上网了,报错很诡异,具体报错如下: /etc/init.d/network r ...
javascript总结24:Array常用的队列操作和排序方法
1 数组-引用类型 JavaScript中的内置对象复习数组的使用两种创建数组的方式 Array对象的属性 length 获取数组的长度(元素个数) 2 常用方法 : 检测数组 instanceo ...
Hadoop中Writable类
1.Writable简单介绍在前面的博客中,经常出现IntWritable,ByteWritable.....光从字面上,就可以看出,给人的感觉是基本数据类型和序列化!在Hadoop中自带的or ...

用xpath来爬图

用xpath来爬图的更多相关文章

随机推荐

热门专题