学习进度-10 python爬虫

学习爬虫的第一个案例是小说爬虫。

小说爬虫首先是解析小说页面源代码，在页面源代码中可以看到小说每章节的内容链接

爬虫的代码：

import requests

import re

url = 'http://www.92kshu.cc/69509/'

response = requests.get(url)

response.encoding = 'gbk'

html = response.text

title = re.findall(r'<meta property="og:novel:book_name" content="(.*?)"/>', html)[0]

fb = open('%s.txt' % title, 'w', encoding='utf-8')

# 获取每章的内容

# print(html)

dl = re.findall(r'<dl><dt><i class="icon"></i>正文</dt>(.*?)</dl>', html)[0]

print(dl)

chapter_info_list = re.findall(r'<dd><a href="(.*?)">(.*?)</a></dd>', dl)

print(chapter_info_list)

for chapter_info in chapter_info_list:

    chapter_url, chapter_title = chapter_info

    chapter_url = "http://www.92kshu.cc%s" % chapter_url

    # print(chapter_url)

    chapter_response = requests.get(chapter_url)

    chapter_response.encoding = 'gbk'

    chapter_html = chapter_response.text

    chapter_content = re.findall(r'<div class="chapter">(.*?)><br>', chapter_html)[0]

    # print(chapter_content)

    chapter_content = chapter_content.replace('<p>', '')

    chapter_content = chapter_content.replace('</p>', '')

    fb.write(chapter_title)

    fb.write(chapter_content)

    fb.write('\n')

    print(chapter_url)

爬虫结果：

学习进度-10 python爬虫的更多相关文章

学习进度-16 python爬虫
爬虫是一个程序,这个程序的目的就是为了抓取万维网信息资源,比如你日常使用的谷歌等搜索引擎,搜索结果就全都依赖爬虫来定时获取从百度可以看出来爬虫与python关系很紧密, 爬虫的目标对象也很丰富,不 ...
学习笔记之Python爬虫
Python 爬虫介绍 | 菜鸟教程 http://www.runoob.com/w3cnote/python-spider-intro.html https://blog.csdn.net/sina ...
Python学习：10.Python装饰器讲解（一）
情景介绍一天,在你正在努力加班的时候,老板给交给你了一个任务,就是在这段代码里将所有函数开始输出一个‘hello’最后输出当前时间,再输出一个“end”,这段代码里包含了大量的函数,你会怎么做? d ...
学习笔记10—Python 绘图集
ordered_data = np.load('ordered_data_just_TD_mae.npy')results = pd.Series(np.squeeze(np.load('result ...
吴裕雄--天生自然python学习笔记：python爬虫PM2.5 实时监测显示器
PM2.5 对人体的健康影响很大,所以空气中的 PM2.5 实时信息受到越来越多的关注. Python 的 Pandas 套件不但可以自动读取网页中的表格数据 , 还可对数据进行修改.排序等处理,也 ...
吴裕雄--天生自然python学习笔记：python爬虫与网页分析
我们所抓取的网页源代码一般都是 HTML 格式的文件,只要研究明白 HTML 中的标签( Tag )结构,就很容易进行解析并取得所需数据 . HTML 网页结构 HTML 网页是由许多标签( Ta ...
【Python爬虫】入门知识
爬虫基本知识这阵子需要用爬虫做点事情,于是系统的学习了一下python爬虫,觉得还挺有意思的,比我想象中的能干更多的事情,这里记录下学习的经历. 网上有关爬虫的资料特别多,写的都挺复杂的,我这里不打 ...
python爬虫小实例
1.python爬取贴吧壁纸 1.1.获取整个页面数据 #coding=utf-8 import urllib def getHtml(url): page = urllib.urlopen(url) ...
【学习笔记】PYTHON网络爬虫与信息提取(北理工嵩天)
学习目的:掌握定向网络数据爬取和网页解析的基本能力the Website is the API- 1 python ide 文本ide:IDLE,Sublime Text集成ide:Pychar ...

随机推荐

iOS 开发之 23种设计模式
整理了 iOS 开发中用到的设计模式: iOS 开发之设计模式[一]原型模式 (Prototype pattern) iOS 开发之设计模式[二]工厂方法模式 iOS 开发之设计模式[三]抽象工 ...
pandas help
1. read_csv read_csv方法定义: pandas.read_csv(filepath_or_buffer, sep=', ', delimiter=None, header='infe ...
Dart语言学习(十三) Dart Mixins 实现多继承
Mixins Mixins(混入功能)相当于多继承,也就是说可以继承多个类,使用with关键字来实现Mixins的功能. 那么多个类中有相同的方法时候,会被覆盖吗?覆盖的先后是什么? class A{ ...
CSS - 表格细线边框
通过 border-collapse: collapse cellpadding="0", cellspacing= "0" 实现 <!DOCTYPE h ...
最长公共子序列/子串 LCS（模板）
首先区分子序列和子串,序列不要求连续性(连续和不连续都可以),但子串一定是连续的 1.最长公共子序列 1.最长公共子序列问题有最优子结构,这个问题可以分解称为更小的问题 2.同时,子问题的解释可以被重 ...
第二天python
1.pycharm的安装: 1.先去官网下载软件:https://www.jetbrains.com/pycharm/download/#section=windows然后进行下一步,下一步操作既可以 ...
本机配置集群主机名访问（Windows配置hosts）
Windows配置hosts C:\Windows\System32\drivers\etc\hosts 主机IP 主机名示例: 192.168.1.1 master 192.168.1.2 sla ...
怎么在高清屏上画一条0.5px的边
怎么在高清屏上画一条0.5px的边呢?0.5px相当于高清屏物理像素的1px.这样的目的是在高清屏上看起来会更细一点,效果会更好一点,例如更细的分隔线. 理论上px的最小单位是1,但是会有几个特例,高 ...
题解 JSOI2010 找零钱的洁癖
题解 JSOI2010 找零钱的洁癖题面 BZOJ 个人体会 van全没有思路... 只能去看题解... 还是个bfs+贪心不管怎样竟然乱搞过了... 听M_sea小姐姐说她有更正经的做法(线性规 ...
ubuntu 中怎么安装 jdk 7
Jdk1.7 安装包的下载地址是: http://www.oracle.com/technetwork/java/javase/downloads/jdk-7u4-downloads-1591156. ...

学习进度-10 python爬虫

学习进度-10 python爬虫的更多相关文章

随机推荐

热门专题