python爬虫之小说网站--下载小说(正则表达式)

思路:

1.找到要下载的小说首页,打开网页源代码进行分析(例:https://www.kanunu8.com/files/old/2011/2447.html)

2.分析自己要得到的内容,首先分析url,发现只有后面的是变化的，先获得小说的没有相对路径，然后组合成新的url(每章小说的url)

3.获得每章小说的内容，进行美化处理

代码如下:

#小说爬虫

import requests

import re

url='https://www.kanunu8.com/book4/10509/'

#因为编码原因,先获取二进制内容再进行解码

txt=requests.get(url).content.decode('gbk') #当前小说编码为"gbk2312"

m1=re.compile(r'<td colspan="4" align="center"><strong>(.+)</strong>')

#print(m1.findall(txt))

m2=re.compile(r'<td( width="25%")?><a href="(.+\.html)">(.+)</a></td>')

#print(m2.findall(txt))

raw=m2.findall(txt) #获得小说的目录以及对应的每个章节的相对路径

sanguo=[]

for i in raw:

    sanguo.append([i[2],url+i[1]])  #生成每个章节的url

#print(sanguo)

m3=re.compile(r'<p>(.+)</p>',re.S)  #每章节小说内容

m4=re.compile(r'<br />')            #<br />小说内容中的符号

m5=re.compile(r'&nbsp;&nbsp;&nbsp;&nbsp;')

with open('中国合伙人1.txt','a') as f:

    for i in sanguo:

        i_url=i[1]  #i[1]为小说章节url

        print("正在下载----->",i[0])    #i[0]为小说章节目录

        r_nr=requests.get(i_url).content.decode('gbk')

        n_nr=m3.findall(r_nr)

        #print(n_nr)

        n=m4.sub('',n_nr[0]) #把n_nr[0]中"<br />"替换为空

        n2=m5.sub('',n)

        f.write('\n'+i[0]+'\n') #把小说的目录写入文件

        f.write(n2)

运行效果如下：

保存的内容如下:

python爬虫之小说网站--下载小说(正则表达式)的更多相关文章

初次尝试python爬虫，爬取小说网站的小说。
本次是小阿鹏,第一次通过python爬虫去爬一个小说网站的小说. 下面直接上菜. 1.首先我需要导入相应的包,这里我采用了第三方模块的架包,requests.requests是python实现的简单易 ...
Python爬虫爬取全书网小说，程序源码+程序详细分析
Python爬虫爬取全书网小说教程第一步:打开谷歌浏览器,搜索全书网,然后再点击你想下载的小说,进入图一页面后点击F12选择Network,如果没有内容按F5刷新一下点击Network之后出现如下 ...
python爬虫之天气预报网站--查看最近(15天)的天气信息(正则表达式)
python爬虫之天气预报网站--查看最近(15天)的天气信息(正则表达式) 思路: 1.首先找到一个自己想要查看天气预报的网站,选择自己想查看的地方,查看天气(例:http://www.tianqi ...
python爬虫—爬取英文名以及正则表达式的介绍
python爬虫—爬取英文名以及正则表达式的介绍爬取英文名: 一. 爬虫模块详细设计 (1)整体思路对于本次爬取英文名数据的爬虫实现,我的思路是先将A-Z所有英文名的连接爬取出来,保存在一个cs ...
python爬虫之12306网站--火车票信息查询
python爬虫之12306网站--火车票信息查询思路: 1.火车票信息查询是基于车站信息查询,先完成车站信息查询,然后根据车站信息查询生成的url地址去查询当前已知出发站和目的站的所有车次车票信息 ...
【Python 爬虫系列】从某网站下载小说《鬼吹灯》,正则解析html
import re import urllib.request import urllib.parse import urllib.error as err import time # 下载 seed ...
Python爬虫帮你打包下载所有抖音好听的背景音乐，还不快收藏一起听歌【华为云技术分享】
版权声明:本文为博主原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明. 本文链接:https://blog.csdn.net/devcloud/article/detai ...
Python爬虫某招聘网站的岗位信息
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者:阿尔法游戏 PS:如有需要Python学习资料的小伙伴可以加点击下方链 ...
python爬虫05 | 年轻人，不会正则表达式你睡得着觉？有点出息没有？
现在你已经会使用 python 模拟浏览器进行一些 Http 的请求了那么请求完之后服务器返回给我们一堆源代码我们可不是啥都要的啊我们是有原则的我们想要的东西怎么能一股脑的啥都往自己兜 ...

随机推荐

NiftyNet项目介绍
NiftyNet项目介绍简述 NiftyNet是一款开源的卷积神经网络平台,旨在通过实现医学图像分析的深度学习方法和模块,支持快速原型和再现性,由WEISS (Wellcome EPSRC Ce ...
java基础系列--volatile关键字
原创作品,可以转载,但是请标注出处地址:http://www.cnblogs.com/V1haoge/p/7833881.html 1.volatile简述据说,volatile是java语言中最轻 ...
tiny210 tslib 测试（基于 ft5x06 触摸屏），解决触摸无效问题
1. 拷贝至开发板将上次实验中的 tmp 文件夹拷贝到开发板,可以通过 nfs 来传输,并将 tmp/lib 下的所有 .so 文件拷贝至开发板的 /usr/lib 中,并且确保库的映射关系正确. ...
Docker在Windows上运行NetCore系列（一）使用命令控制台运行.NetCore控制台应用
系列文章:https://www.cnblogs.com/alunchen/p/10121379.html 本篇文章操作系统信息 Windows:Window 10 Visual Studio:201 ...
Android Studio 基础控件使用
TextView android:gravity="center" //文字对其方式 top bottom left right center android:textColor= ...
Android Studio 活动的生命周期
Activity 类中定义了7个回调方法,覆盖了活动的活动周期的每一环节 onCreate() 活动第一次创建的时候调用 onStart() 这个活动由不可见变为可见的时候调用 onResume() ...
扩展RBAC用户角色权限设计方案（转载）
扩展RBAC用户角色权限设计方案来源:https://www.cnblogs.com/zwq194/archive/2011/03/07/1974821.html https://blog.csd ...
Tomcat服务器为java项目配置顶级域名
修改端口, Tomcat服务器下conf/server.xml文件把端口号更改为80 解释:输入域名时默认进入80端口,如果没修改则需要输入端口号才能进入. Eg:www.xxx.com: ...
oracle中rownum的使用
rownum是系统的一个关键字,表示行号,是系统自动分配的,第一条符合要求的数据行号就是1,第二条符合要求的数据行号就是2. Rownum 不能直接使用例:取前多少条数据: 取中间的一些数据: se ...
js高级：event，事件冒泡，事件捕获
1.事件浏览器客户端上客户触发的行为都称为事件所有的事件都是天生自带的,不需要我们去绑定,只需要我们去触发. 通过 obj.事件名=function(){} 事件名:onmouseover 鼠标悬 ...

python爬虫之小说网站--下载小说(正则表达式)

python爬虫之小说网站--下载小说(正则表达式)的更多相关文章

随机推荐

热门专题