xpath+多进程爬取八零电子书百合之恋分类下所有小说。

代码

# 需要的库

import requests

from lxml import etree

from multiprocessing import Pool

import os

# 请求头

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36'

}

# 创建存储路径

pathname = './八零电子书/'

if not os.path.exists(pathname):

    os.mkdir(pathname)

# 获取书籍列表

def get_booklist(url):

    try:

        response = requests.get(url=url,headers=headers)

        etrees = etree.HTML(response.text)

        sum = etrees.xpath('//a[@class="last"]/text()')[0]

        booklist = etrees.xpath('//div[@class="book_bg"]/a/@href')

        pool.map(get_book,booklist)

        urls = ['http://www.quanshuwang.com/list/3_{}.html'.format(i) for i in range(2,int(sum)+1)]

        pool.map(get_booklist,urls)

    except Exception:

        print('get_booklist failed')

# 获取具体书籍

def get_book(url):

    try:

        response = requests.get(url=url, headers=headers)

        etrees = etree.HTML(response.text)

        mulu = etrees.xpath('//a[@id="read_book"]/@href')[1]

        get_mulu(mulu)

    except  Exception:

        print('get_book failed')

# 获取书籍目录

def get_mulu(url):

    try:

        response = requests.get(url=url, headers=headers)

        etrees = etree.HTML(response.text)

        zhangjie = etrees.xpath('//div[@id="yulan"]/li/a/@href')

        for i in zhangjie:

            get_content(i)

    except Exception:

        print('get_mulu failed')

# 获取书籍内容

def get_content(url):

    try:

        response = requests.get(url=url, headers=headers)

        etrees = etree.HTML(response.text.encode(response.encoding).decode(response.apparent_encoding))

        book_name = etrees.xpath('//p[@class="text"]/a/text()')[1]

        zhangjie = etrees.xpath('//div[@class="date"]/h1/text()')[0]

        contents = etrees.xpath('//div[@id="content"]/text()')

        print(zhangjie+'..正在下载')

        f = open(pathname+book_name+'.txt','a+',encoding='utf-8')

        f.write(zhangjie+'\n\n')

        for con in contents:

            f.write(con+'\n')

        f.close()

    except Exception:

        print('get_content failed')

# 程序入口

if __name__ == '__main__':

    url = 'https://www.80txt.la/sort5/1.html'

    # 创建进程池

    pool = Pool()

    # 启动函数

    get_booklist(url)

控制台输出

E:\anaconda\python.exe E:/练习/最后阶段/0809/八零电子书.py

1第一章 捡到个小雌性..正在下载

01 遗嘱..正在下载

第一章 捡了东西不一定能换到钱..正在下载

2第二章 摔出了地球..正在下载

02 异变..正在下载

3第三章 这是个高科技世界..正在下载

第二章 爷爷！您是我的亲爷爷..正在下载

03 手镯..正在下载

第三章 不在新手村混的新手..正在下载

4第四章 所谓杌力..正在下载

第一章 我会打架..正在下载

04长生..正在下载

打开文件夹查看是否下载成功

done。

xpath+多进程爬取八零电子书百合之恋分类下所有小说。的更多相关文章

xpath+多进程爬取全书网纯爱耽美类别的所有小说。
# 需要的库 import requests from lxml import etree from multiprocessing import Pool import os # 请求头 heade ...
使用Xpath+多进程爬取诗词名句网的史书典籍类所有文章。update~
上次写了爬取这个网站的程序,有一些地方不完善,而且爬取速度较慢,今天完善一下并开启多进程爬取,速度就像坐火箭.. # 需要的库 from lxml import etree import reques ...
xpath+多进程爬取网易云音乐热歌榜。
用到的工具,外链转换工具网易云网站直接打开源代码里面并没有对应的歌曲信息,需要对url做处理, 查看网站源代码路径:发现把里面的#号去掉会显示所有内容, 右键打开的源代码路径:view-source ...
代理ip的使用以及多进程爬取
一.代理皮的简单使用简单的看一二例子即可 import requests #代理ip 高频的ip容易被封,所以使用ip代理 #免费代理 ip:www.goubanjia.com 快代理西祠代理 h ...
python+BeautifulSoup+多进程爬取糗事百科图片
用到的库: import requests import os from bs4 import BeautifulSoup import time from multiprocessing impor ...
requests+xpath+map爬取百度贴吧
# requests+xpath+map爬取百度贴吧 # 目标内容:跟帖用户名,跟帖内容,跟帖时间 # 分解: # requests获取网页 # xpath提取内容 # map实现多线程爬虫 impo ...
python爬取 “得到” App 电子书信息
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 静觅崔庆才 PS:如有需要Python学习资料的小伙伴可以加点击下 ...
python+正则+多进程爬取糗事百科图片
话不多说,直接上代码: # 需要的库 import requests import re import os from multiprocessing import Pool # 请求头 header ...
使用进程池模拟多进程爬取url获取数据，使用进程绑定的回调函数去处理数据
1 # 使用requests请求网页,爬取网页的内容 2 3 # 模拟使用进程池模拟多进程爬取网页获取数据,使用进程绑定的回调函数去处理数据 4 5 import requests 6 from mu ...

随机推荐

NET高级开发工程师职责要求
岗位职责1.参与架构以及核心业务的设计:2.使用简单,干净,可维护性高,扩展性好的代码实现产品功能,并在必要时重构现有代码:3.贯彻面向接口以及模块化组件的设计理念:4.熟练RabbitMQ.ES.M ...
破解FTP登录密码的几种方法
工具 Hydra X-Hydra Medusa Ncrack Patator Metasploit Hydra hydra -L /root/Desktop/user.txt -P /root/Des ...
Django框架深入了解_01(Django请求生命周期、开发模式、cbv源码分析、restful规范、跨域、drf的安装及源码初识)
一.Django请求生命周期: 前端发出请求到后端,通过Django处理.响应返回给前端相关结果的过程先进入实现了wsgi协议的web服务器--->进入django中间件--->路由f分 ...
flutter本地环境的安装以及编辑器的配置
由于本文图片比较多,所有都缩小了不少,点击图片就可以放大看到原始图片使用镜像 cmd打开终端,贴上以下代码,以加入到环境变量中,如果添加失败,可以手动添加 export PUB_HOSTED_URL ...
【windows】win10局域网共享文件夹
1.打开 2.共享文件夹另一台局域网电脑可根据共享的电脑ip访问就可以了[格式:\\ip] 如果右键文件夹没有共享选项
Vim 入门
Vim 简介打开 Vim的四种模式一些命令插入移动文件编辑环境设置 .vimrc 更多命令环境设置折叠显示 Vim 简介 Vim 是字符模式下的一种文本编辑器,不需要图形界面,它是 ...
Go语言(环境的搭建)
一步一步,从零搭建Go语言开发环境. 安装Go语言及搭建Go语言开发环境下载下载地址 Go官网下载地址:https://golang.org/dl/ Go官方镜像站(推荐):https://gol ...
【转】ISE——完整工程的建立
FPGA公司主要是两个Xilinx和Altera(现intel PSG),我们目前用的ISE是Xilinx的开发套件,现在ISE更新到14.7已经不更新了,换成了另一款开发套件Vivado,也是Xil ...
stone [期望]
也许更好的阅读体验 \(\mathcal{Description}\) 有 \(n\) 堆石子,依次编号为 \(1, 2,\ldots , n\),其中第 \(i\) 堆有 \(a_i\) 颗石子你 ...
Python yield与实现（源码分析转）
转自:https://www.cnblogs.com/coder2012/p/4990834.html

xpath+多进程爬取八零电子书百合之恋分类下所有小说。

xpath+多进程爬取八零电子书百合之恋分类下所有小说。的更多相关文章

随机推荐

热门专题