20190715《Python网络数据采集》第 1 章

《Python网络数据采集》7月8号-7月10号，这三天将该书精读一遍，脑海中有了一个爬虫大体框架后，对于后续学习将更加有全局感。

此前，曾试验看视频学习，但是一个视频基本2小时，全部拿下需要30多个视频，如此看来每天学习一个视频时间都是非常吃力的，且都属于被动输入，尤其是在早上学习视频容易犯困。

故此，及时调整学习策略，采用 “电子书+廖雪峰网页教程+实操+Google+咨询程序员+每日总结归纳” 的主动学习模式，如此更加高效，更加容易把控进度！

学习爬虫，一者兴趣，致力于借此兴趣驱动力掌握编程思维，进而让自己有能够将想法做成产品的的技能；二者，为了一个近在眼前的爬虫商业化机遇，更希望借此为自己增加一个收入来源。

1. 爬虫常见得异常及处理方法，用一个简单得爬虫代码解释，核心知识点：

（1）异常一：网页在服务器上不存在（或者获取页面时，出现错误）。该异常发生时，程序会返回HTTP错误，如“404 Page Not Found” "500 Internet Server Error"等。

（2）异常二：服务器不存在（即，链接打不开，或者URL链接写错了），这时，urlopen会返回一个None对象。

Ps：有的时候，网页已经从服务器成功获取，如果网页上的内容并非完全是我们期望的那样，也会出现异常。

 1 from urllib.request import urlopen

 2 from bs4 import BeautifulSoup

 3

 4 try:

 5     html = urlopen("http://pythonscraping.com/pages/page1.html")

 6 # print(html.read())

 7 # 检测：网页在服务器上是否存在（或者获取页面时是否出现错误）

 8 except HTTPError as e:

 9     print(e)

10 else:

11     bsobj = BeautifulSoup(html.read())

12     # 检测：服务器是否存在（就是说链接能否打开，或者是URL链接写错了）

13     if html is None:

14         print("URL is not found")

15     else:

16         print(bsobj.h1)

17         # print(bsobj.title)

 1 # 以上代码更改为检测异常更全面、可读性更强的代码，如下：

 2 from urllib.request import urlopen

 3 from bs4 import BeautifulSoup

 4

 5 def getTitle(url):

 6     try:

 7         html = urlopen(url)

 8     except HTTPError as e:

 9         return None

10     try:

11         bsobj = BeautifulSoup(html.read())

12         title = bsobj.body.h1

13     except AttributeError as e:

14         return

15     return title

16

17 title1 = getTitle("http://pythonscraping.com/pages/page1.html")

18 if title1 == None:

19     print("Title could not be found")

20 else:

21     print(title1)

该部分代码执行时，出现报错：

indentationerror: unexpected indent process finished with exit code 1

Google发现，Tag和Space不能混合使用。原始第五行，def被tab缩进，后删除该tab缩进，问题解决。该问题具体原因，仍需要仔细查明！！！

20190715《Python网络数据采集》第 1 章的更多相关文章

Python网络数据采集PDF
Python网络数据采集(高清版)PDF 百度网盘链接:https://pan.baidu.com/s/16c4GjoAL_uKzdGPjG47S4Q 提取码:febb 复制这段内容后打开百度网盘手 ...
Python网络数据采集PDF高清完整版免费下载|百度云盘
百度云盘:Python网络数据采集PDF高清完整版免费下载提取码:1vc5 内容简介本书采用简洁强大的Python语言,介绍了网络数据采集,并为采集新式网络中的各种数据类型提供了全面的指导.第 ...
笔记之Python网络数据采集
笔记之Python网络数据采集非原创即采集一念清净, 烈焰成池, 一念觉醒, 方登彼岸网络数据采集, 无非就是写一个自动化程序向网络服务器请求数据, 再对数据进行解析, 提取需要的信息通常, ...
Python网络数据采集7-单元测试与Selenium自动化测试
Python网络数据采集7-单元测试与Selenium自动化测试单元测试 Python中使用内置库unittest可完成单元测试.只要继承unittest.TestCase类,就可以实现下面的功能. ...
Python网络数据采集6-隐含输入字段
Python网络数据采集6-隐含输入字段 selenium的get_cookies可以轻松获取所有cookie. from pprint import pprint from selenium imp ...
Python网络数据采集4-POST提交与Cookie的处理
Python网络数据采集4-POST提交与Cookie的处理 POST提交之前访问页面都是用的get提交方式,有些网页需要登录才能访问,此时需要提交参数.虽然在一些网页,get方式也能提交参.比如h ...
Python网络数据采集3-数据存到CSV以及MySql
Python网络数据采集3-数据存到CSV以及MySql 先热热身,下载某个页面的所有图片. import requests from bs4 import BeautifulSoup headers ...
Python网络数据采集2-wikipedia
Python网络数据采集2-wikipedia 随机链接跳转获取维基百科的词条超链接,并随机跳转.可能侧边栏和低栏会有其他链接.这不是我们想要的,所以定位到正文.正文在id为bodyContent的 ...
Python网络数据采集1-Beautifulsoup的使用
Python网络数据采集1-Beautifulsoup的使用来自此书: [美]Ryan Mitchell <Python网络数据采集>,例子是照搬的,觉得跟着敲一遍还是有作用的,所以记录 ...

随机推荐

js 做留言提交
如下是留言提交源码功能:点击按钮或点击enter键可以提交内容扩展:ctrlKey\shiftKey\altKye 可以将如上三个参数与oEvent.keyCode == 13 进行与操作可以得到 ...
Greenplum 与 PostgreSQL 修改元数据(catalog)的方法 allow_system_table_mods
背景 PostgreSQL大量的信息保存在元数据中,所有的元数据都是内部维护的,例如建表.建索引.删表等操作,自动维护元数据. 在某些迫不得已的情况下才可能需要直接对元数据进行修改. 默认情况下,用户 ...
WinDbg常用命令系列---|（进程状态）
|(进程状态) 简介 (|) 命令显示指定进程的状态或当前正在调试你的所有进程. 使用形式 | Process 参数 Process 指定要显示的进程. 如果省略此参数,将显示所有正在调试的进程. 支 ...
异常过滤器的好坏(CLR)
为什么有些语言支持它们而另一些不支持呢?把它们加到我的新语言里是个好主意吗?我应该什么时候使用过滤器和catch/rethrow?就像很多事情一样,异常过滤器有好的一面也有坏的一面… 什么是异常过滤器 ...
Python 09 安装torch、torchvision
这个也是弄了我很久,百度了好多文章,其实像下面那样挺简单的,没那么复杂 1.进入torch的官网的下载页面,选择一下参数信息地址:https://pytorch.org/get-started/lo ...
搭建的一套vue打包方案，方便记录一下
package.json 配置如下: { "name": "rise-vue", "version": "1.0.0", ...
[NOI2019]回家路线
[NOI2019]回家路线题目大意: 有$n$个站点,$m$趟车,每趟车在$p_i$时从$x_i$出发,$q_i$时到达$y_i$. 若小猫共乘坐了$k$班列车,依次乘坐 ...
洛谷 P1012 拼数
P1012 拼数标签字符串排序 NOIp提高组 1998 云端难度普及- 时空限制 1s / 128MB 题目描述设有n个正整数(n≤20),将它们联接成一排,组成一个最大的多位整数. 例 ...
【loj2339】【WC2018】通道
题目三棵带边权的树,求 \[ dis1(u,v) + dis2(u,v) + dis3(u,v) \] 的最大值 $1 \le n \le 10^5$ 题解对$T_1$做边分治,把分治边的 ...
UOJ269【清华集训2016】如何优雅地求和【数论，多项式】
题目描述:求 $$\sum_{k=0}^nf(k)\binom{n}{k}x^k(1-x)^{n-k}$$ 输入$n$,$f(x)$的次数上界$m$,$x$,$f(0,1,\ldots,m)$,对$9 ...

20190715《Python网络数据采集》第 1 章

20190715《Python网络数据采集》第 1 章的更多相关文章

随机推荐

热门专题