Python3网络爬虫（1）：利用urllib进行简单的网页抓取

1.开发环境

　　pycharm2017.3.3

　　python3.5

2.网络爬虫的定义

　　网络爬虫，也叫网络蜘蛛（web spider），如果把互联网比喻成一个蜘蛛网，spider就是一只在网上爬来爬去的蜘蛛，网络爬虫就是根据网页的地址来寻找网页的，也就是URL。举一个简单的例子，我们在浏览器的地址栏中输入的字符串就是URL，例如：https://www.baidu.com/

　　URL就是统一资源定位符（uniform resource location），他的一般格式如下（带方括号[]的为可选项）

　　　　protocol://hostname[:port]/path/[:parameters][?query]#fragment

　　URL的格式由三部分组成：

　　　　（1）protocol：第一部分就是协议，例如百度使用的就是https协议；

　　　　（2）hostname[：port]：第二部分人就是主机名（还有端口号为可选参数），一般网站默认的端口号为80

　　　　（3）path：第三部分就是主机资源的具体地址，如目录和文件名等，网络爬虫就是根据这个URL来获取网页信息的

3.简单爬虫实例

　　在Python3.x中，我们可以使用urllib这个组件抓取网页，urllib是一个URL处理包，这个包中集合了一下处理url的模块，如下：

　　　　（1）urllib.request模块是用来打开和读取URLs的；

　　　　（2）urllib.error模块包含一些由urllib.request产生的错误，可以使用try进行捕捉处理

　　　　（3）urllib.parse模块包含了一些解析URLs的方法；

　　　　（4）urllib.robotparser模块用来解析robots.txt文本文件，它提供了一个单独的RobotFileParser类，通过该类提供的can_fatch()方法测试爬虫是否可以下载一个页面

　　我们使用urllib.request.urlopen（）这个接口函数就可以很轻松的打开一个网站，读取并打印信息

　　下面来写一个简单的程序实现一下

 from urllib import request

 if __name__ == "__main__":

     response = request.urlopen("http://www.baidu.com")

     html = response.read()

     print(html)

　　运行结果（可以看到进度条还能拉倒很远）

　　这都是些什么鬼玩意呢

　　拿来对比一下,浏览器中打开www.baidu.com，查看页面元素，快捷键F12（浏览器最好用火狐或者Chrome）

　　东西都一样，就是格式有点乱，可以通过简单的decode（）命令将网页的信息进行解码并显示出来，在代码中添加一句html=html.decode("utf-8")即可

 from urllib import request

 if __name__ == "__main__":

     response = request.urlopen("http://www.fanyi.baidu.com/")

     html = response.read()

     html = html.decode("utf-8")

     print(html)

　　输出正常的html格式

　　当然编码方式不是我们猜出来的，是查出来的，在查看元素中找到head标签，打开，看到charset="utf-8"，就是编码方式

4.自动获取网页编码方式的方法

　　这里采用第三方库的方法，安装chardet

 pip install chardet

　　对代码稍作修改用来判断网页的编码方式

 from urllib import request

 import chardet

 if __name__ == "__main__":

     response = request.urlopen("http://www.baidu.com")

     html = response.read()

     #html = html.decode("utf-8")

     charset = chardet.detect(html)

     print(charset)

可以看到返回的是字典，最后也可以整合一下

 from urllib import request

 import chardet

 if __name__ == "__main__":

     response = request.urlopen("http://www.baidu.com")

     html = response.read()

     charset = chardet.detect(html)

     html = html.decode(charset.get('encoding'))

     print(html)

完美

Python3网络爬虫（1）：利用urllib进行简单的网页抓取的更多相关文章

Python实现简单的网页抓取
现在开源的网页抓取程序有很多,各种语言应有尽有. 这里分享一下Python从零开始的网页抓取过程第一步:安装Python 点击下载适合的版本https://www.python.org/ 我这里选择 ...
【Python3网络爬虫开发实战】6.4-分析Ajax爬取今日头条街拍美图【华为云技术分享】
[摘要] 本节中,我们以今日头条为例来尝试通过分析Ajax请求来抓取网页数据的方法.这次要抓取的目标是今日头条的街拍美图,抓取完成之后,将每组图片分文件夹下载到本地并保存下来. 1. 准备工作在本节 ...
转：【Python3网络爬虫开发实战】6.4-分析Ajax爬取今日头条街拍美图
[摘要] 本节中,我们以今日头条为例来尝试通过分析Ajax请求来抓取网页数据的方法.这次要抓取的目标是今日头条的街拍美图,抓取完成之后,将每组图片分文件夹下载到本地并保存下来. 1. 准备工作在本节 ...
Python3网络爬虫(三)：urllib.error异常
运行平台:Windows Python版本:Python3.x IDE:Sublime text3 转载请注明作者和出处:http://blog.csdn.net/c406495762/article ...
python3一个简单的网页抓取
都是学PYTHON.怎么学都是学,按照基础学也好,按照例子增加印象也好,反正都是学 import urllib import urllib.request data={} data['word']=' ...
转：【Python3网络爬虫开发实战】 requests基本用法
1. 准备工作在开始之前,请确保已经正确安装好了requests库.如果没有安装,可以参考1.2.1节安装. 2. 实例引入 urllib库中的urlopen()方法实际上是以GET方式请求网页,而 ...
Python3 网络爬虫（请求库的安装）
Python3 网络爬虫(请求库的安装) 爬虫可以简单分为几步:抓取页面,分析页面和存储数据在页面爬取的过程中我们需要模拟浏览器向服务器发送请求,所以需要用到一些python库来实现HTTP的请求操 ...
[Python3网络爬虫开发实战] 2.3-爬虫的基本原理
我们可以把互联网比作一张大网,而爬虫(即网络爬虫)便是在网上爬行的蜘蛛.把网的节点比作一个个网页,爬虫爬到这就相当于访问了该页面,获取了其信息.可以把节点间的连线比作网页与网页之间的链接关系,这样蜘蛛 ...
Python3网络爬虫开发实战PDF高清完整版免费下载|百度云盘
百度云盘:Python3网络爬虫开发实战高清完整版免费下载提取码:d03u 内容简介本书介绍了如何利用Python 3开发网络爬虫,书中首先介绍了环境配置和基础知识,然后讨论了urllib.req ...

随机推荐

[05] EL表达式
1.概述 EL = Expression Language 表达式语言,用来在JSP中替代<%=%>的数据表达方式,EL更简洁,它的语法如下: ${...} 1 1 ${...} ...
python多版本共存问题（以2.7和3.5系列版本为例）
1.0 下载Python2.7x和Python3.5x版本 2.0 安装Python 3.0 配置环境变量,分别添加至path路径 4.0 只修改Python27文件中的.exe文件(这样系统默认为P ...
通过git命令行从github或服务器上克隆、修改和更新项目
项目开发时,为了方便版本管理,许多公司采用git来控制项目版本.简单介绍下: 第一步:在本地新建一个文件夹,作为本地仓库,如“test”.打开git bash,进入到该文件夹目录下,如下图: 第二步: ...
如何手动写一个Python脚本自动爬取Bilibili小视频
如何手动写一个Python脚本自动爬取Bilibili小视频国庆结束之余,某个不务正业的码农不好好干活,在B站瞎逛着,毕竟国庆嘛,还让不让人休息了诶-- 我身边的很多小伙伴们在朋友圈里面晒着出去游玩 ...
restfull环境搭建-helloword
原文地址:http://blog.csdn.net/u013158799/article/details/39758341 1. REST和RESTful Web Services的简要说明 REST ...
BUAAMOOC项目终审报告
工作总结我们是歪果仁带你灰开发团队.我们开发的项目是北航学堂(MOOC)的android客户端:BUAAMOOC. 目前我们完成了主要功能,包括UI设计,视频播放,视频下载,学习进度,个人信息等功能 ...
Linux内核分析-系统中断在内核中的实现
分析system_call中断处理过程在MenuOS中添加上周所运用到的系统调用即在Linuxkernel/menu/test.c文件中,添加代码如下: int Mkdir() { const c ...
Linux内核分析读书笔记（第五章）
第五章系统调用 5.1 与内核通信 1.调用在用户空间进程和硬件设备之间添加了一个中间层.该层主要作用有三个: 为用户空间提供了硬件的抽象接口. 系统调用保证了系统的稳定和安全. 实现多任务和虚拟内 ...
LINUX内核设计第五周——扒开系统调用的三层皮（下）
趟坑：使用pip安装TensorFlow
这几天在安装TensorFlow,看了很多教程,方法也试了几种. 最后还是用pip安装成功的,过程如下. 1.安装ubuntu后在系统设置-软件与更新-附加驱动里,更新N卡驱动. (N卡官网下载 ...

Python3网络爬虫（1）：利用urllib进行简单的网页抓取

Python3网络爬虫（1）：利用urllib进行简单的网页抓取的更多相关文章

随机推荐

热门专题