本次是小阿鹏，第一次通过python爬虫去爬一个小说网站的小说。

下面直接上菜。

　　1.首先我需要导入相应的包，这里我采用了第三方模块的架包，requests。requests是python实现的简单易用的HTTP库，使用起来比urllib简洁很多，因为是第三方库，所以使用前需要cmd安装。

　　cmd安装方式，打开cmd，输入以下命令：

　　　　　　　　　　　　　　　　　　　　pip install requests

　　2.添加相应的包后，我们需要一个小说链接去爬下这本小说也就是一个url。下面是我当时爬的小说url：http://www.shujy.com/5200/244309/

　　3.我们现在有了小说的链接，这时候就要模拟浏览器发送http的请求：　

response=requests.get(url)

response.encoding='gbk'

　　4.我们可以尝试获取目标小说的网页源码　

html=response.text

　　我们把它打印出来看下：

　　有html基础的朋友应该对这些很熟悉。通过打印我们可以看见小说的名字，作者，以及小说章节的url。这时候我们就先通过HTML网页源码获取小说的名字：

title=re.findall(r'<meta property="og:novel:book_name" content="(.*?)"/>',html)[0]

　　从上面的代码我们可以看见是通过正则表达式去匹配的，对正则表达式有疑问的同学可以自行百度下。当然不同网站的具体小说名字可能会放在不同的标签里，需要我们打开网页源码去看看下。

　　5.这时候我们也就新建一个文本文件来保存小说内容。

fb=open('%s.txt'% title,'w',encoding='utf-8')

　　这时候我们需要获取小说的章节目录对应的url，我们还是来观察下网页的源码。我们通过火狐浏览器的f12看下网页可发现：

　　小说的章节目标都在标签<div id='list'>里我们通过下面的代码获取对应的章节名和url。用一个list来存放章节信息。

dl=re.findall(r'<div id="list">.*?</div>',html,re.S)[0]

chapter_info_list=re.findall(r'<a href="(.*?)">(.*?)</a>',dl)

　　6.这个时候我们循环每一章节，分别下载，先把章节的链接，章节名提取出来。

for chapter_info in chapter_info_list:

    chapter_url,chapter_title=chapter_info

    chapter_url="http://www.shujy.com/5200/244309/%s " % chapter_url

    chapter_url=chapter_url.replace(' ','')

　　我们可以看见对章节的链接进行的拼接，因为我们可以看见直接提取出来的链接是这样的：

　　所以也就需要一个拼接的操作，取得完整的章节链接。

　　这个时候来下载小说内容：

chapter_response=requests.get(chapter_url,headers=headers)

    chapter_response.encoding='gbk'

    chapter_html=chapter_response.text

我们先是获取到小说具体章节的页面。打开具体小说章节f12查看网页的源码：

　　可以清楚的看见小说的具体内容是在标签<div id=content>里，和获取小说章节一样我们采用正则表达式来取得小说的内容。

chapter_content=re.findall(r'<div id="content">(.*?)</div>',chapter_html,re.S)[0]

我们把获取到的小说的内容打印出来看看，

　　我们看见一些奇怪的字符&nbsp，<br/>等，我们在实际的小说里没有这些东西，这里就需要我们处理数据。进行一些操作，也叫做数据的清洗。

    chapter_content=chapter_content.replace('&nbsp;','')

    chapter_content=chapter_content.replace('<br />','')

    chapter_content=chapter_content.replace('&amp;t;','')

　　清洗后的小说内容：

　　7.现在就是最后一步把小说保存到本地。

fb.write(chapter_title)

    fb.write('\n')

    fb.write(chapter_content)

    fb.write('\n')

    print(chapter_url,chapter_title)

　　我们来看下最后的结果，我们每爬完一章打印相应的章节链接信息和返回的response信息来看是否成功爬取：

　　当当当当，成功的爬下了这边小说。

　　最后总结下，本次的爬虫就很简单是小阿鹏的初次尝试，中间如果有不对的地方也希望大家的指正，谢谢！

初次尝试python爬虫，爬取小说网站的小说。的更多相关文章

python爬虫--爬取某网站电影下载地址
前言:因为自己还是python世界的一名小学生,还有很多路要走,所以本文以目的为向导,达到目的即可,对于那些我自己都没弄懂的原理,不做去做过多解释,以免误人子弟,大家可以网上搜索. 友情提示:本代码用 ...
python爬虫--爬取某网站电影信息并写入mysql数据库
书接上文,前文最后提到将爬取的电影信息写入数据库,以方便查看,今天就具体实现. 首先还是上代码: # -*- coding:utf-8 -*- import requests import re im ...
Python爬虫爬取全书网小说，程序源码+程序详细分析
Python爬虫爬取全书网小说教程第一步:打开谷歌浏览器,搜索全书网,然后再点击你想下载的小说,进入图一页面后点击F12选择Network,如果没有内容按F5刷新一下点击Network之后出现如下 ...
Python爬虫|爬取喜马拉雅音频
"GOOD Python爬虫|爬取喜马拉雅音频喜马拉雅是知名的专业的音频分享平台,用户规模突破4.8亿,汇集了有声小说,有声读物,儿童睡前故事,相声小品等数亿条音频,成为国内发展最快.规模 ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
python爬虫—爬取英文名以及正则表达式的介绍
python爬虫—爬取英文名以及正则表达式的介绍爬取英文名: 一. 爬虫模块详细设计 (1)整体思路对于本次爬取英文名数据的爬虫实现,我的思路是先将A-Z所有英文名的连接爬取出来,保存在一个cs ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
python爬虫爬取内容中，-xa0，-u3000的含义
python爬虫爬取内容中,-xa0,-u3000的含义 - CSDN博客 https://blog.csdn.net/aiwuzhi12/article/details/54866310
一个简单的python爬虫,爬取知乎
一个简单的python爬虫,爬取知乎主要实现爬取一个收藏夹里所有问题答案下的图片文字信息暂未收录,可自行实现,比图片更简单具体代码里有详细注释,请自行阅读项目源码: # -*- cod ...

随机推荐

正则爬取京东商品信息并打包成.exe可执行程序
本文爬取内容,输入要搜索的关键字可自动爬取京东网站上相关商品的店铺名称,商品名称,价格,爬取100页(共100页) 代码如下: ? 1 2 3 4 5 6 7 8 9 10 11 12 13 14 1 ...
记ubuntu sudo无法使用,su密码不对的解决办法
前言因为我有强制关机的习惯, 然后就杯具了.. ubuntu版本是 16.04 sudo没法使用, su密码不对, 顿时我就慌了解决方案 1.1.开机点击ESC,进去GUN GRUB界面 1.2. ...
（57）Linux驱动开发之三Linux字符设备驱动
1.一般情况下,对每一种设备驱动都会定义一个软件模块,这个工程模块包含.h和.c文件,前者定义该设备驱动的数据结构并声明外部函数,后者进行设备驱动的具体实现. 2.典型的无操作系统下的逻辑开发程序是: ...
css命名和书写规范
前言在项目开发中对于css名字的命名和书写老是感觉很混乱,这对于代码的可读性以及维护提出了挑战,所以在闲暇之余看了一些这方面的内容,现总结如下... 1.命名规则说明所有的命名最好都小写属性的值 ...
yii 1.1简单文件缓存
缓存组件配置在config\main.php文件,简单配置下文件缓存 'components'=>array( 'cache' => array( 'class' => 'syste ...
2018-2019-2 20165235《网络对抗技术》Exp8 Web基础
2018-2019-2 20165235<网络对抗技术>Exp8 Web基础实践过程记录: (1).Web前端HTML 能正常安装.启停Apache.理解HTML,理解表单,理解GET与 ...
2018-2019-2-20175225 实验三《敏捷开发与XP实践》实验报告
一.实验内容与步骤 1.安装.使用alibaba插件规范代码 - 在IDEA的setting中找到plugins并搜索alibaba,点击install进行安装 - 重启IDEA后,在代码中右击点击编 ...
ssm+ajax异步请求返回list遍历
jsp页面 <%@ page language="java" contentType="text/html; charset=UTF-8" pageEnc ...
Git-Runoob：Git 安装配置
ylbtech-Git-Runoob:Git 安装配置 1.返回顶部 1. Git 安装配置在使用Git前我们需要先安装 Git.Git 目前支持 Linux/Unix.Solaris.Mac和 W ...
JS数组方法的的返回值和是否改变该数组总结
concat() 方法 concat() 方法用于连接两个或多个数组. 该方法不会改变现有的数组,而仅仅会返回被连接数组的一个副本. 返回值返回一个新的数组.该数组是通过把所有 arrayX 参数添 ...

初次尝试python爬虫，爬取小说网站的小说。

本次是小阿鹏，第一次通过python爬虫去爬一个小说网站的小说。

初次尝试python爬虫，爬取小说网站的小说。的更多相关文章

随机推荐

热门专题