python写的有声小说爬虫

querybook.py

from bs4 import BeautifulSoup

from lxml import html

import xml

import requests

import splider

class QuName:

    def __init__(self,number):

        self.number = number

    def getPageNum(self,url):

        f = requests.get(url)  # Get该网页从而获取该html内容

        soup = BeautifulSoup(f.content, "lxml")

        try:

            pageNum = soup.find('div', class_="pagesnums").find('span').text

            print('getPageNum执行成功')

            return int(pageNum[3:5])

        except:

            print('getPageNum执行失败')

        finally:

            print('___________________________')

    def getBookList(self):

        for num in range(1,self.number):

            pageNum = self.getPageNum('http://www.ting89.com/booklist/'+str(num)+'.html')

            self.getBookInfo('http://www.ting89.com/booklist/'+str(num)+'.html')

            print('http://www.ting89.com/booklist/'+str(num)+'.html')

            for num1 in range(2,pageNum):

                self.getBookInfo('http://www.ting89.com/booklist/'+str(num)+'_'+str(num1)+'.html')

                print('http://www.ting89.com/booklist/'+str(num)+'_'+str(num1)+'.html')

    def getBookInfo(self,url):

        f = requests.get(url)  # Get该网页从而获取该html内容

        soup = BeautifulSoup(f.content, "lxml")

        try:

            bookList = soup.find('div', class_="clist").findAll('li')

            for i in bookList:

                imgUrl = i.find('img')

                print('书籍封面',imgUrl['src'])

                # print('书名:',i.find('b').text)

                pList = i.findAll('p')

                for j in pList:

                    print(j.text)

                #下载文件

                splider.YsSpider(i.find('b').text).download_files()

        except:

            print('getBookInfo执行失败')

        finally:

            print('___________________________')

qn = QuName(13)         #这里是网站的类别数量(偷了个懒,直接写了个数字)

qn.getBookList()

splider.py

import requests

import urllib

import re

import os

import time

class YsSpider:

    def __init__(self, name):

        self.search_name = name

        self.search_url = "http://www.ting89.com/search.asp?searchword="

        self.home_url = "http://www.ting89.com/books/"

        self.index_pattern = r"""<a href="/books/([0-9]+).html" title="(.+?)" target='_blank'>"""

        self.chapter_pattern=r"""<a href='(/down/\?[^-]+-\d+.html)' target="_blank">(.+?)</a>"""

        self.down_pattern=r"""url=(.*)/(.+?)\.mp3"""

        self.book_id = ''

        self.book_name = ''

        self.Chapter_list = []

    # 返回搜索书目的id

    def searchbook(self):

        file = requests.get(self.search_url + urllib.parse.quote(self.search_name, encoding='gb2312'))

        data = file.content.decode('gbk')

        result = re.findall(self.index_pattern, data)

        if len(result):

            for index, i in enumerate(result):

                print('%d.%s'%(index+1,i[1]))

                # str = input("输入你要下载的书目名称序号: ")

                str = '1'

                self.book_name = result[int(str)-1][1]

                self.book_id = result[int(str)-1][0]

                return self.book_id

            else:

                print('*******没有找到你输入的相关书籍,请更换后重新运行程序*******')

                exit()

    def get_chapter_list(self):#获取各章节list和url

        data = requests.get(self.home_url+self.searchbook()+'.html').content.decode('gbk')

        result = re.findall(self.chapter_pattern, data)

        return result

    def _getAllUrl(self):# 获得所有的章节的下载地址

        chapter_list = self.get_chapter_list()

        chapter = [x[0] for x in chapter_list]

        self.Chapter_list= [x[1] for x in chapter_list]

        _list = [x[1] for x in chapter_list]

        data = requests.get("http://www.ting89.com" + chapter[0]).content.decode('gbk')

        result = re.findall(self.down_pattern, data)

        # return result

        return self.sub_get_url(result[0][0],_list, re.search("^0.*1$", result[0][1]))

    def sub_get_url(self, down_url, _list, down_url_flag):

        url = []

        if down_url_flag:

            xulie = list(range(len(_list)))

            weishu = len(str(xulie[-1]))

            for i in xulie:

                i1 = i + 1

                tmp_url = down_url+'/' + str(i1).zfill(weishu) + '.mp3'

                url.append(urllib.request.quote(tmp_url, safe='/:?='))

        else:

            for item in _list:

                tmp_url = down_url + '/'+item + ".mp3"

                url.append(urllib.request.quote(tmp_url, safe='/:?='))

        return url

# 保存指定URL的文件

    def save_a_file(self, url, path, chapter):

        try:

            print('尝试下载',chapter)

            if not os.path.exists(path):

                response = requests.get(url)

                with open(path, 'wb') as f:

                    f.write(response.content)

                    f.close

                    print(chapter,'保存成功')

                response.close()

                time.sleep(1)

            else:

                print('文件已经存在')

        except:

            print('爬取失败,已下载至',chapter,'即将重新尝试下载')

            self.save_a_file(url, path, chapter)

    def download_files(self):

        result = self._getAllUrl()# 所有的章节对应的下载地址

        root = os.path.join(os.getcwd(), self.book_name)

        if not os.path.exists(root):

            os.mkdir(root)

        for index,i in enumerate(result):

            path = os.path.join(root, self.Chapter_list[index])+'.mp3'

            self.save_a_file(i, path, self.Chapter_list[index])

python写的有声小说爬虫的更多相关文章

python写的百度图片爬虫
学了一下python正则表达式,写一个百度图片爬虫玩玩. 当技术遇上心术不正的人,就成我这样的2B青年了. python3.6开发.程序已经打包好,下载地址: http://pan.baidu.com ...
Python写一个简单的爬虫
code #!/usr/bin/env python # -*- coding: utf-8 -*- import requests from lxml import etree class Main ...
2019-04-23-Python爬取有声小说
目录 Python爬取有声小说摘要 1.获取下载链接 2.分析规律,循环爬取 3.保存到本地,批量命名 4.界面设计 5.效果展示 Python爬取有声小说通过python爬取网站的资源,实现批量 ...
Python模块---制作属于自己的有声小说
操作环境 Python版本: anaconda3 python3.7.4 操作系统: Ubuntu19.10 编译器: pycharm社区版用到的模块: pyttsx3,requests pysst ...
Python实战：下载鬼灵报告有声小说
在家无聊,想看看小说,不过看的眼睛痛,就想着下个有声小说来听听.但风上找到的都是要一集一集下,还得重命名,122集啊,点到什么时候. 写个批处理下载的脚本.记录下过程. 一.老套路了,找到下载URL. ...
读书笔记汇总 --- 用Python写网络爬虫
本系列记录并分享:学习利用Python写网络爬虫的过程. 书目信息 Link 书名: 用Python写网络爬虫作者: [澳]理查德劳森(Richard Lawson) 原版名称: web scra ...
Python写爬虫爬妹子
最近学完Python,写了几个爬虫练练手,网上的教程有很多,但是有的已经不能爬了,主要是网站经常改,可是爬虫还是有通用的思路的,即下载数据.解析数据.保存数据.下面一一来讲. 1.下载数据首先打 ...
(转)Python新手写出漂亮的爬虫代码2——从json获取信息
https://blog.csdn.net/weixin_36604953/article/details/78592943 Python新手写出漂亮的爬虫代码2——从json获取信息好久没有写关于爬 ...
(转)Python新手写出漂亮的爬虫代码1——从html获取信息
https://blog.csdn.net/weixin_36604953/article/details/78156605 Python新手写出漂亮的爬虫代码1初到大数据学习圈子的同学可能对爬虫都有 ...

随机推荐

Python的bisect模块
Python的列表(list)类型内部是一个线性表,在线性表中查找元素复杂度为O(N),即调用list.index()的复杂的是O(N).当数据量较大时,应该使用二分查找优化,二分查找范围每次缩小一般 ...
linux中各目录及详细介绍
一.Linux文件系统的层次结构在Linux或UNIX操作系统中,所有的文件和目录都被组织成一个以根节点开始的倒置的树状结构,如图: 二.目录 1.目录的定义目录相当于Windows中的文件夹,目 ...
linux下的OpenCV安装＆学习笔记
http://www.linuxdiyf.com/viewarticle.php?id=20731 (本想在fedora下安装编译的,但目前opencv官网.sourceforge等网站都无法访问下载 ...
Emacs用JDEE编写Android程序
版权声明:本文为博主原创文章.未经博主同意不得转载. https://blog.csdn.net/sheismylife/article/details/24842669 前文介绍了怎样用Maven构 ...
springboot对shiro进行mock单元测试
环境:junit-5.Spring5.0.x.Spring Boot 2.0.x 以下是用来权限测试的接口: @ApiOperation("[可接入]分页查询管理员") @ApiR ...
oracle连接命令
(1)conn[ect] 用法:conn 用户名/密码@网络服务器名 [as sysdba/sysoper] 当用特权用户身份连接时,必须带上as sysdba或是as sysoper 该命令常用 ...
页面头部<meta>中的属性和含义
1<meta name="robots" content="index, follow" /> none:搜索引擎将忽略此网页,等价于noin ...
【NS2】ubuntu安装和同时使用不同版本的ns2（转载）
有时候我们可能会遇到要同时安装两个ns版本的问题,比如我研究wimax/802.16,因为协议太复杂,用的是长庚大学和nist的wimax补丁.长庚大学的wimax补丁是在ns2.29下开发的,nis ...
冒泡排序&&选择排序以及时间效率对比
package com.test4; import java.util.*; //Calendar 显示时间 /** * @author qingfeng * 功能:冒泡排序 */ public cl ...
04使用harbor配置私仓
安装harbor之前,需要安装好Python,Docker,DockerCompose.Python需要2.7以上的版本,Docker需要1.10以上的版本:Docker Compose 需要1.6. ...

python写的有声小说爬虫

python写的有声小说爬虫的更多相关文章

随机推荐

热门专题