使用Xpath爬虫库下载诗词名句网的史书典籍类所有文章。

# 需要的库

from lxml import etree

import requests

# 请求头

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36'

}

# 保存文本的地址

pathname=r'E:\爬虫\诗词名句网\\'

# 获取书籍名称的函数

def get_book(url):

    response = requests.get(url,headers)

    etrees = etree.HTML(response.text)

    url_infos = etrees.xpath('//div[@class="bookmark-list"]/ul/li')

    for i in url_infos:

        url_info = i.xpath('./h2/a/@href')

        book_name = i.xpath('./h2/a/text()')[0]

        print('开始下载.'+book_name)

        # print('http://www.shicimingju.com'+url_info[0])

        get_index('http://www.shicimingju.com'+url_info[0])

# 获取书籍目录的函数

def get_index(url):

    response = requests.get(url, headers)

    etrees = etree.HTML(response.text)

    url_infos = etrees.xpath('//div[@class="book-mulu"]/ul/li')

    for i in url_infos:

        url_info = i.xpath('./a/@href')

        # print('http://www.shicimingju.com' + url_info[0])

        get_content('http://www.shicimingju.com' + url_info[0])

# 获取书籍内容并写入.txt文件

def get_content(url):

    response = requests.get(url, headers)

    etrees = etree.HTML(response.text)

    title = etrees.xpath('//div[@class="www-main-container www-shadow-card "]/h1/text()')[0]

    content = etrees.xpath('//div[@class="chapter_content"]/p/text()')

    content = ''.join(content)

    book_name=etrees.xpath('//div[@class="nav-top"]/a[3]/text()')[0]

    with open(pathname+book_name+'.txt','a+',encoding='utf-8') as f:

        f.write(title+'\n\n'+content+'\n\n\n')

        print(title+'..下载完成')

# 程序入口

if __name__ == '__main__':

    url = 'http://www.shicimingju.com/book/'

    get_book(url)

控制台查看下载过程；

打开文件夹查看是否下载成功；

done.

使用Xpath爬虫库下载诗词名句网的史书典籍类所有文章。的更多相关文章

使用Xpath+多进程爬取诗词名句网的史书典籍类所有文章。update~
上次写了爬取这个网站的程序,有一些地方不完善,而且爬取速度较慢,今天完善一下并开启多进程爬取,速度就像坐火箭.. # 需要的库 from lxml import etree import reques ...
python3爬虫.4.下载煎蛋网妹子图
开始我学习爬虫的目标 ----> 煎蛋网通过设置User-Agent获取网页,发现本该是图片链接的地方被一个js函数代替了于是全局搜索到该函数 function jandan_load_im ...
Python爬虫实例（六）多进程下载金庸网小说
目标任务:使用多进程下载金庸网各个版本(旧版.修订版.新修版)的小说代码如下: # -*- coding: utf-8 -*- import requests from lxml import et ...
python爬虫三大解析库之XPath解析库通俗易懂详讲
目录使用XPath解析库 @(这里写自定义目录标题) 使用XPath解析库 1.简介 XPath(全称XML Path Languang),即XML路径语言,是一种在XML文档中查找信息的语言. ...
从0开始学爬虫11之使用requests库下载图片
从0开始学爬虫11之使用requests库下载图片 # coding=utf-8 import requests def download_imgage(): ''' demo: 下载图片 ''' h ...
Python3 常用爬虫库的安装
Python3 常用爬虫库的安装 1 简介 Windows下安装Python3常用的爬虫库:requests.selenium.beautifulsoup4.pyquery.pymysql.pymon ...
xpath爬虫实例，爬取图片网站百度盘地址和提取码
某套图网站,套图以封面形式展现在页面,需要依次点击套图,点击广告盘链接,最后到达百度网盘展示页面. 这一过程通过爬虫来实现,收集百度网盘地址和提取码,采用xpath爬虫技术 1.首先分析图片列表页,该 ...
[转载]AxureRP 7超强部件库下载
很多刚刚开始学习Axure的朋友都喜欢到网上搜罗各种部件库(组件库)widgets library ,但是网络中真正实用的并且适合你使用的少之又少,最好的办法就是自己制作适合自己工作内容的部件库. 这 ...
【Android 应用开发】Android 开发环境下载地址 -- 百度网盘 adt-bundle android-studio sdk adt 下载
19af543b068bdb7f27787c2bc69aba7f Additional Download (32-, 64-bit) Package r10 STL debug info androi ...

随机推荐

Any Video Converter Pro for Mac注册码
Any Video Converter Pro for Mac注册码:name:www.macmofo.comsn:000016-D84U8Q-8BN16B-WP2BV6-9RA73A-X7D4V3- ...
SQL Server表分区(转)
什么是表分区一般情况下,我们建立数据库表时,表数据都存放在一个文件里. 但是如果是分区表的话,表数据就会按照你指定的规则分放到不同的文件里,把一个大的数据文件拆分为多个小文件,还可以把这些小文件放在 ...
c# – Asp.Net Core MVC中Request.IsAjaxRequest()在哪里？
要了解有关新的令人兴奋的Asp.Net-5框架的更多信息,我正在使用最新发布的Visual Studio 2015 CTP-6来构建一个Web应用程序. 大多数事情看起来真的很有希望,但我似乎找不到R ...
一段隐藏文字的css代码，记录下
<span style="width:1px; height:1px; color:#fff; outline-width:hidden; overflow:hidden; displ ...
HBase 详解
1.HBase 架构 ============================================ 2. HBase Shell 操作 2.1. 基本操作进入HBase客户端命令行:bi ...
php中让数组顺序随机化，打乱顺序等
php中有很多排序的函数,sort,rsort,ksort,krsort,asort,arsort,natcasesort,这些函数用来对数组的键或值进行这样,或那样的排序. 可以终究有时候还需要一些 ...
Service must be explitict android 5.0问题
如果target到API 21,有一些注意的事项,以下是目前我发现的两个问题1. Service must be explitict,从Lollipop开始,service必须显性声明,解决方案:ht ...
Spring Security的RBAC数据模型嵌入
1.简介基于角色的权限访问控制(Role-Based Access Control)作为传统访问控制(自主访问,强制访问)的有前景的代替受到广泛的关注.在RBAC中,权限与角色相关联,用户通过成 ...
Java子类方法签名相同，返回类型不同
2019年7月27日15:04:20 Java子类覆盖父类的方法,方法名字相同,参数列表相同,返回类型不同的情况: 如果子类方法返回类型是父类方法返回类型的子类,这是没问题的,否则报错. 在JAVA ...
C# IEnumerable接口
问: 集合很好用,而且非常简单,但是我不明白为什么数组.ArrayList 和 Hasttable 这些集合都能用foreach直接遍历呢?我想自己定义一个集合类,应该怎么做呢? 回答:这个问题问的 ...

使用Xpath爬虫库下载诗词名句网的史书典籍类所有文章。

使用Xpath爬虫库下载诗词名句网的史书典籍类所有文章。的更多相关文章

随机推荐

热门专题