文档：从 pythoneer 到 pythonista 的100个模块
　　链接：http://note.youdao.com/noteshare?id=2b95bb3651c21af80ca1936f8ecb1e0f&sub=635CA99241664308947C4F3BC1B5DDBF

　　文档：递归详解.note
　　链接：http://note.youdao.com/noteshare?id=5277776089054d9b730dc6b8d2114acd&sub=D2DC1AEE6417467A80D170CA55074A96

一、使用步骤　

1 # 导包

 import requests

 # 确定基础url

 base_url = 'https://www.baidu.com'

 # 发送请求，获取响应

 response = requests.get(base_url)

 # 处理响应内容

二、requests.get()---get请求方法参数详解

　　1、参数　　　

 requests.get(

 　　　　url=请求url，

 　　　　headers =请求头字典，

 　　　　params = 请求参数字典。

 　　　　timeout = 超时时长，

 　　　　)——>response对象

　　2、response对象的属性：

　　　　　服务器响应包含：状态行（协议，状态码）、响应头，空行，响应正文

　　　　（1）响应正文：

　　　　　　　　字符串格式：response.text
　　　　　　　　bytes类型：response.content
　　　　（2）状态码：response.status_code
　　　　（3）响应头：response.headers(字典)
　　　　　　　　　　 response.headers['cookie']
　　　　（4）响应正文的编码：response.encoding
　　　　　　　　　　　　　　 response.text获取到的字符串类型的响应正文，其实是通过下面的步骤获取的：
　　　　　　　　　　　　　　　　　　response.text = response.content.decode(response.encoding)
　　　　（5）乱码问题的解决办法：

　　　　　　　　产生的原因：编码和解码的编码格式不一致造成的。
　　　　　　　　　　str.encode('编码')---将字符串按指定编码解码成bytes类型
　　　　　　　　　　bytes.decode('编码')---将bytes类型按指定编码编码成字符串。
　　　　　　　　a、response.content.decode('页面正确的编码格式')
　　　　　　　　　　<meta http-equiv="content-type" content="text/html;charset=utf-8">
　　　　　　　　b、找到正确的编码，设置到response.encoding中
　　　　　　　　　　response.encoding = 正确的编码
　　　　　　　　　　response.text——>正确的页面内容。

　　3、get请求项目总结：

　　　　a、没有请求参数的情况下，只需要确定url和headers字典。
　　　　b、get请求是有请求参数。　　
　　　　　　在chrome浏览器中，下面找query_string_params,将里面的参数封装到params字典中。
　　　　c、分页主要是查看每页中，请求参数页码字段的变化，找到变化规律，用for循环就可以做到分页。

三、post请求

　　1、参数

 requests.post(

 　　　　url=请求url，

 　　　　headers = 请求头字典，

 　　　　data=请求数据字典

 　　　　timeout=超时时长

 　　　　)——response对象

 　　　　# post请求一般返回数据都是json数据。

　　2、解析json数据的方法：

　　　　　　（1）response.json()——>json字符串所对应的python的list或者dict
　　　　　　（2）用json模块。
　　　　　　　　json.loads(json_str)——>json_data(python的list或者dict)
　　　　　　　　json.dumps(json_data)——>json_str

　　3、post请求能否成功，关键看请求参数。

　　　　如何查找是哪个请求参数在影响数据获取？——>通过对比，找到变化的参数。
　　　　变化参数如何找到参数的生成方式，就是解决这个ajax请求数据获取的途径。
　　　

　　　　寻找的办法有以下几种：
　　　　　　（1）写死在页面。
　　　　　　（2）写在js中。
　　　　　　（3）请求参数是在之前的一条ajax请求的数据里面提前获取好的。

四、代理使用方法

　　1、代理基本原理

　　　　代理形象的说，他是网络信息中转站。实际上就是在本机和服务器之间架了一座桥。

　　2、代理的作用

　　　　（1）突破自身ip访问现实，可以访问一些平时访问不到网站。
　　　　（2）访问一些单位或者团体的资源。
　　　　（3）提高访问速度。代理的服务器主要作用就是中转，所以一般代理服务里面都是用内存来进行数据存储的。
　　　　（4）隐藏ip。

　　3、代理的分类

　　　　（1）按照协议进行划分：
　　　　　　①FTP代理服务器---21,2121
　　　　　　②HTTP代理服务器---80,8080
　　　　　　③SSL/TLS代理：主要用访问加密网站。端口：443
　　　　　　④telnet代理：主要用telnet远程控制，端口一般为23
　　　　（2）照匿名程度：
　　　　　　①高度匿名代理：数据包会原封不动转化，在服务段看来，就好像一个普通用户在访问，做到完全隐藏ip。
　　　　　　②普通匿名代理：数据包会做一些改动，服务器有可能找到原ip。
　　　　　　③透明代理：不但改动数据，还会告诉服务，是谁访问的。
　　　　　　④间谍代理：指组织或者个人用于记录用户传输数据，然后进行研究，监控等目的的代理。

　　4、在requests模块中如何设置代理

　　　　　　proxies = {
　　　　　　　　'代理服务器的类型':'代理ip'
　　　　　　　　}
　　　　　　response = requests.get(proxies = proxies)
　　　　　　代理服务器的类型:http,https,ftp
　　　　　　代理ip:http://ip:port

【python爬虫】requests模块的更多相关文章

python 爬虫 requests模块目录
requests模块(response常用属性) 基于requests模块的get请求基于requests模块发起ajax的get请求基于requests模块发起ajax的post请求
python爬虫requests模块
requests库的七个主要方法 1. requests.requests(method, url, **kwargs) 构造一个请求,支撑以下各方法的基础方法 method:请求方式,对应get/p ...
python 爬虫 requests模块（response常用属性）
response常用属性 content获取的response对象中的二进制(byte)类型的页面数据response.content 返回响应状态码response.status_code 200 ...
Python爬虫之使用Fiddler+Postman+Python的requests模块爬取各国国旗
介绍本篇博客将会介绍一个Python爬虫,用来爬取各个国家的国旗,主要的目标是为了展示如何在Python的requests模块中使用POST方法来爬取网页内容. 为了知道POST方法所需要传 ...
Python爬虫—requests库get和post方法使用
目录 Python爬虫-requests库get和post方法使用 1. 安装requests库 2.requests.get()方法使用 3.requests.post()方法使用-构造formda ...
python爬虫 urllib模块url编码处理
案例:爬取使用搜狗根据指定词条搜索到的页面数据(例如爬取词条为‘周杰伦'的页面数据) import urllib.request # 1.指定url url = 'https://www.sogou. ...
python 爬虫 urllib模块目录
python 爬虫 urllib模块介绍 python 爬虫 urllib模块 url编码处理 python 爬虫 urllib模块反爬虫机制UA python 爬虫 urllib模块发起post ...
Python之requests模块-hook
requests提供了hook机制,让我们能够在请求得到响应之后去做一些自定义的操作,比如打印某些信息.修改响应内容等.具体用法见下面的例子: import requests # 钩子函数1 def ...
Python之requests模块-cookie
cookie并不陌生,与session一样,能够让http请求前后保持状态.与session不同之处,在于cookie数据仅保存于客户端.requests也提供了相应到方法去处理cookie. 在py ...
Python之requests模块-session
http协议本身是无状态的,为了让请求之间保持状态,有了session和cookie机制.requests也提供了相应的方法去操纵它们. requests中的session对象能够让我们跨http请求 ...

随机推荐

Windows系统Git安装教程（详解Git安装过程）
Windows系统Git安装教程(详解Git安装过程) 今天更换电脑系统,需要重新安装Git,正好做个记录,希望对第一次使用的博友能有所帮助! 获取Git安装程序到Git官网下载,网站地址: ...
粗糙集理论(Rough Set Theory)
粗糙集理论(Rough Set Theory) 一种数据分析处理理论. <粗糙集—关于数据推理的理论>. 数据挖掘(Data Mining)和知识发现(KDD). 集合近似定义的基本思想及 ...
InfluxDB（一）初探时序数据库
初探时序数据库-InfluxDB 最近公司有个需求需要借助InfluxDB实现(或者更准确的说,使用该数据库可以更容易的实现),因此稍微看了下这个数据库,把比较重要的一些东西先简单记录一下,日后如果踩 ...
剑指Offer-39.把数组排成最小的数(C++/Java)
题目: 输入一个正整数数组,把数组里所有数字拼接起来排成一个数,打印能拼接出的所有数字中最小的一个.例如输入数组{3,32,321},则打印出这三个数字能排成的最小数字为321323. 分析: 将数组 ...
按位或：多项式，FWT，min-max容斥
Description: 刚开始你有一个数字0,每一秒钟你会随机选择一个$[0,2^n)$的数字,与你手上的数字进行或(C++, C 的 |, Pascal 的 or)操作. 选择数字i的概率是$p_ ...
java8-新的日期API
背景 java的日期和时间API设计不理想,java8引入新的时间和日期API就是为了解决这个问题. 老的日期API的核心类缺点 Date 月从0开始,年最小从1900年开始,没有时区的概念 Cal ...
C# 使用NAudio合并mp3、wav音频文件
1.什么是wav格式 WAV为微软公司(Microsoft)开发的一种声音文件格式,它符合RIFF(Resource Interchange File Format)文件规范,用于保存Windo ...
Java变量在内存中的存储
目录 Java变量在内存中的存储成员变量局部变量总结 Java变量在内存中的存储以下探究成员变量和局部变量在内存中的存储情况. package com.my.pac04; /** * @aut ...
CSAPP lab1——位运算
本次为一次计算机系统实验,就是使用一些基本的运算符来实现函数功能. ps做这些题让我想起大一上学期刚学二进制时被鹏哥支配的痛苦. 知识准备: 1.负数等于正数取反加一. 2.左移一位相当于将这个数扩大 ...
mesos-slave启动不起来
刚开始时候的状态后来装了docker后

【python爬虫】requests模块

文档：从 pythoneer 到 pythonista 的100个模块 链接：http://note.youdao.com/noteshare?id=2b95bb3651c21af80ca1936f8ecb1e0f&sub=635CA99241664308947C4F3BC1B5DDBF

一、使用步骤

二、requests.get()---get请求方法参数详解

1、参数

2、response对象的属性：

服务器响应包含：状态行（协议，状态码）、响应头，空行，响应正文

（1）响应正文：

3、get请求项目总结：

三、post请求

1、参数

2、解析json数据的方法：

（1）response.json()——>json字符串所对应的python的list或者dict （2）用json模块。 json.loads(json_str)——>json_data(python的list或者dict) json.dumps(json_data)——>json_str

3、post请求能否成功，关键看请求参数。

如何查找是哪个请求参数在影响数据获取？——>通过对比，找到变化的参数。 变化参数如何找到参数的生成方式，就是解决这个ajax请求数据获取的途径。

寻找的办法有以下几种： （1）写死在页面。 （2）写在js中。 （3）请求参数是在之前的一条ajax请求的数据里面提前获取好的。

四、代理使用方法

1、代理基本原理

代理形象的说，他是网络信息中转站。实际上就是在本机和服务器之间架了一座桥。

2、代理的作用

（1）突破自身ip访问现实，可以访问一些平时访问不到网站。 （2）访问一些单位或者团体的资源。 （3）提高访问速度。代理的服务器主要作用就是中转，所以一般代理服务里面都是用内存来进行数据存储的。 （4）隐藏ip。

3、代理的分类

4、在requests模块中如何设置代理

proxies = { '代理服务器的类型':'代理ip' } response = requests.get(proxies = proxies) 代理服务器的类型:http,https,ftp 代理ip:http://ip:port

【python爬虫】requests模块的更多相关文章

随机推荐

热门专题

　　文档：从 pythoneer 到 pythonista 的100个模块
　　链接：http://note.youdao.com/noteshare?id=2b95bb3651c21af80ca1936f8ecb1e0f&sub=635CA99241664308947C4F3BC1B5DDBF

一、使用步骤　

　　1、参数　　　

　　2、response对象的属性：

　　　　　服务器响应包含：状态行（协议，状态码）、响应头，空行，响应正文

　　　　（1）响应正文：

　　3、get请求项目总结：

　　1、参数

　　2、解析json数据的方法：

　　　　　　（1）response.json()——>json字符串所对应的python的list或者dict
　　　　　　（2）用json模块。
　　　　　　　　json.loads(json_str)——>json_data(python的list或者dict)
　　　　　　　　json.dumps(json_data)——>json_str

　　3、post请求能否成功，关键看请求参数。

　　　　如何查找是哪个请求参数在影响数据获取？——>通过对比，找到变化的参数。
　　　　变化参数如何找到参数的生成方式，就是解决这个ajax请求数据获取的途径。
　　　

　　　　寻找的办法有以下几种：
　　　　　　（1）写死在页面。
　　　　　　（2）写在js中。
　　　　　　（3）请求参数是在之前的一条ajax请求的数据里面提前获取好的。

　　1、代理基本原理

　　　　代理形象的说，他是网络信息中转站。实际上就是在本机和服务器之间架了一座桥。

　　2、代理的作用

　　3、代理的分类

　　4、在requests模块中如何设置代理

　　　　　　proxies = {
　　　　　　　　'代理服务器的类型':'代理ip'
　　　　　　　　}
　　　　　　response = requests.get(proxies = proxies)
　　　　　　代理服务器的类型:http,https,ftp
　　　　　　代理ip:http://ip:port