Python爬虫的开始——requests库建立请求

接下来我将会用一段时间来更新python爬虫

网络爬虫大体可以分为三个步骤。

首先建立请求，爬取所需元素；

其次解析爬取信息，剔除无效数据；

最后将爬取信息进行保存；

今天就先来讲讲第一步，请求库requests

request库主要有七个常用函数，如下所示

而通过requests创建的数据类型为response

我们以爬取百度网站为例

import requests as r

t=r.get("https://www.baidu.com/")

print(type(t))

运行结果如下所示

<class 'requests.models.Response'>
[Finished in 1.3s]

那么作为请求对象，具有哪些属性呢？

爬取数据第一步要做的事便是确认是否连接成功

status_code()从功能角度考虑，算的上是一种判断函数，调用将会返还结果是否成功

如果返回结果为200，则代表连接成功，如果返回结果为404，则代表连接失败

import requests as r

t=r.get("https://www.baidu.com/")

print(type(t))

print(t.status_code)

如图所示返回结果为200，连接成功

那么下一步便是获得网址代码，不过在获得代码之前，还需要做一件事，得到响应内容的编码方式

不同的编码方式将会影响爬取结果

比如说百度网址：https://www.baidu.com/

采用编码方式为ISO-8859-1

获取编码方式为encoding

如下所示

import requests as r

t=r.get("https://www.baidu.com/")

print(type(t))

print(t.status_code)

print(t.encoding)

结果：

<class 'requests.models.Response'>
200
ISO-8859-1

当然有的网页采用 utf8，也有使用gbk，

不同的编码方式会影响我们获得的源码

也可以通过手动更改来改变获得的编码方式

比如：

import requests as r

t=r.get("https://www.baidu.com/")

print(t.encoding)

t.encoding="utf-8"

print(t.encoding)

结果

也可以试着备选码方式，apparent_encoding

之后我们就可以获得源代码了，我们需要将源代码以字符串类型输出保存

这就需要用到text

如下所示：

import requests as r

t=r.get("https://www.baidu.com/")

print(t.text)

结果：

这样我们就获得了对应网站的源码，完成了爬虫的第一步

Python爬虫的开始——requests库建立请求的更多相关文章

python爬虫之一：requests库
目录安装requtests requests库的连接异常 HTTP协议 HTTP协议对资源的操作 requests库的7个主要方法 request方法 get方法网络爬虫引发的问题 robots协 ...
PYTHON 爬虫笔记三:Requests库的基本使用
知识点一:Requests的详解及其基本使用方法什么是requests库 Requests库是用Python编写的,基于urllib,采用Apache2 Licensed开源协议的HTTP库,相比u ...
芝麻HTTP： Python爬虫利器之Requests库的用法
前言之前我们用了 urllib 库,这个作为入门的工具还是不错的,对了解一些爬虫的基本理念,掌握爬虫爬取的流程有所帮助.入门之后,我们就需要学习一些更加高级的内容和工具来方便我们的爬取.那么这一节来 ...
【python爬虫】用requests库模拟登陆人人网
说明:以前是selenium登陆取cookie的方法比较复杂,改用这个 """ 用requests库模拟登陆人人网 """ import r ...
网络爬虫入门：你的第一个爬虫项目（requests库）
0.采用requests库虽然urllib库应用也很广泛,而且作为Python自带的库无需安装,但是大部分的现在python爬虫都应用requests库来处理复杂的http请求.requests库语 ...
Python爬虫入门——使用requests爬取python岗位招聘数据
爬虫目的使用requests库和BeautifulSoup4库来爬取拉勾网Python相关岗位数据爬虫工具使用Requests库发送http请求,然后用BeautifulSoup库解析HTML文 ...
Python使用urllib,urllib3,requests库+beautifulsoup爬取网页
Python使用urllib/urllib3/requests库+beautifulsoup爬取网页 urllib urllib3 requests 笔者在爬取时遇到的问题 1.结果不全 2.'抓取失 ...
python爬虫之re正则表达式库
python爬虫之re正则表达式库正则表达式是用来简洁表达一组字符串的表达式. 编译:将符合正则表达式语法的字符串转换成正则表达式特征操作符说明实例 . 表示任何单个字符 [ ] 字符集,对单 ...
从0开始学爬虫9之requests库的学习之环境搭建
从0开始学爬虫9之requests库的学习之环境搭建 Requests库的环境搭建环境:python2.7.9版本参考文档:http://2.python-requests.org/zh_CN/l ...

随机推荐

ElasticSearch Bulk API
做一个简单的记录,以便自己后续查找一.环境要求 ElasticSearch 7.3.0 Kibana 7.3.0 二.详情 ElasticSearch 的 Bulk API 可以批量进行索引或者删除 ...
21.Linux系统服务之大坑
1.CentOS6启动流程 2.CentOS7启动流程 3.C6和C7的区别 4.运行级别C6&C7 0 关机 1 单用户模式 (超级权限必须面对实体硬件) 2 暂未使用 3 字符界面(黑框 ...
疯狂Java：突破程序员基本功的16课-李刚编著学习笔记（未完待续）
突破程序员基本功(16课) 数组静态语言: 在编译的时候就能确定数据类型的语言,大多静态语言要求在使用变量之前必须声明数据类型(少数具有强推导能力的现代语言不用) 动态语言: 在程序运行时确定数据类 ...
Echarts导出为pdf echarts导出图表（包含背景）
Echarts好像是只支持png和jpg的导出,不支持pdf导出.我就想着只能够将png在后台转为pdf了. 首先介绍一下jsp界面的代码. var thisChart = echarts.init( ...
Java基础（37）ArrayList的remove方法
1.问题描述给定两个字符串 s 和 t,它们只包含小写字母. 字符串 t 由字符串 s 随机重排,然后在随机位置添加一个字母. 请找出在 t 中被添加的字母. 输入: s = "abcd& ...
在vue中使用Ueditor
今天研究的主角是:UEditor UEditor是由百度WEB前端研发部开发的所见即所得的开源富文本编辑器,具有轻量.可定制.用户体验优秀等特点. 版本有很多我用的是:[1.4.3.3 PHP 版本 ...
node 短信接口的调用
首先安装一下短信的sdk 依赖这里使用的是阿里云的短信SDK,在阿里云官网申请 npm install @alicloud/sms-sdk --save 调用新建个 message.js /** ...
SpringBoot整合Redis在可视化工具乱码问题，以及常用的api
pom依赖: <parent> <groupId>org.springframework.boot</groupId> <artifactId>spr ...
QHDYZ模拟赛20191012
今天信息处老师(并不是教练,基本等于机房看门大爷) (好吧老师其实很犇,软件什么的厉害的一批,只是不能带oi--) 跟我说:"xxj,过两天月考完了,可以在初赛前再整一次模拟赛,一天,三道题 ...
RocketMQ实战：生产环境中，autoCreateTopicEnable为什么不能设置为true
1.现象很多网友会问,为什么明明集群中有多台Broker服务器,autoCreateTopicEnable设置为true,表示开启Topic自动创建,但新创建的Topic的路由信息只包含在其中一台B ...

Python爬虫的开始——requests库建立请求

Python爬虫的开始——requests库建立请求的更多相关文章

随机推荐

热门专题