文档:从 pythoneer 到 pythonista 的100个模块
  链接:http://note.youdao.com/noteshare?id=2b95bb3651c21af80ca1936f8ecb1e0f&sub=635CA99241664308947C4F3BC1B5DDBF

  文档:递归详解.note
  链接:http://note.youdao.com/noteshare?id=5277776089054d9b730dc6b8d2114acd&sub=D2DC1AEE6417467A80D170CA55074A96

一、使用步骤 

1 # 导包
import requests
# 确定基础url
base_url = 'https://www.baidu.com'
# 发送请求,获取响应
response = requests.get(base_url)
# 处理响应内容

二、requests.get()---get请求方法参数详解

  1、参数   

 requests.get(
    url=请求url,
    headers =请求头字典,
    params = 请求参数字典。
    timeout = 超时时长,
    )——>response对象

  2、response对象的属性:

     服务器响应包含:状态行(协议,状态码)、响应头,空行,响应正文

    (1)响应正文:

        字符串格式:response.text
        bytes类型:response.content
    (2)状态码:response.status_code
    (3)响应头:response.headers(字典)
            response.headers['cookie']
    (4)响应正文的编码:response.encoding
                response.text获取到的字符串类型的响应正文,其实是通过下面的步骤获取的:
                  response.text = response.content.decode(response.encoding)
    (5)乱码问题的解决办法:

        产生的原因:编码和解码的编码格式不一致造成的。
          str.encode('编码')---将字符串按指定编码解码成bytes类型
          bytes.decode('编码')---将bytes类型按指定编码编码成字符串。
        a、response.content.decode('页面正确的编码格式')
          <meta http-equiv="content-type" content="text/html;charset=utf-8">
        b、找到正确的编码,设置到response.encoding中
          response.encoding = 正确的编码
          response.text——>正确的页面内容。

  3、get请求项目总结:

    a、没有请求参数的情况下,只需要确定url和headers字典。
    b、get请求是有请求参数。  
      在chrome浏览器中,下面找query_string_params,将里面的参数封装到params字典中。
    c、分页主要是查看每页中,请求参数页码字段的变化,找到变化规律,用for循环就可以做到分页。

三、post请求

  1、参数

 requests.post(
    url=请求url,
    headers = 请求头字典,
    data=请求数据字典
    timeout=超时时长
    )——response对象
    # post请求一般返回数据都是json数据。

  2、解析json数据的方法:

      (1)response.json()——>json字符串所对应的python的list或者dict
      (2)用json模块。
        json.loads(json_str)——>json_data(python的list或者dict)
        json.dumps(json_data)——>json_str

  3、post请求能否成功,关键看请求参数。

    如何查找是哪个请求参数在影响数据获取?——>通过对比,找到变化的参数。
    变化参数如何找到参数的生成方式,就是解决这个ajax请求数据获取的途径。
   

    寻找的办法有以下几种:
      (1)写死在页面。
      (2)写在js中。
      (3)请求参数是在之前的一条ajax请求的数据里面提前获取好的。

四、代理使用方法

  1、代理基本原理

    代理形象的说,他是网络信息中转站。实际上就是在本机和服务器之间架了一座桥。

  2、代理的作用

    (1)突破自身ip访问现实,可以访问一些平时访问不到网站。
    (2)访问一些单位或者团体的资源。
    (3)提高访问速度。代理的服务器主要作用就是中转,所以一般代理服务里面都是用内存来进行数据存储的。
    (4)隐藏ip。

  3、代理的分类

    (1)按照协议进行划分:
      ①FTP代理服务器---21,2121
      ②HTTP代理服务器---80,8080
      ③SSL/TLS代理:主要用访问加密网站。端口:443
      ④telnet代理 :主要用telnet远程控制,端口一般为23
    (2)照匿名程度:
      ①高度匿名代理:数据包会原封不动转化,在服务段看来,就好像一个普通用户在访问,做到完全隐藏ip。
      ②普通匿名代理:数据包会做一些改动,服务器有可能找到原ip。
      ③透明代理:不但改动数据,还会告诉服务,是谁访问的。
      ④间谍代理:指组织或者个人用于记录用户传输数据,然后进行研究,监控等目的的代理。

  4、在requests模块中如何设置代理

      proxies = {
        '代理服务器的类型':'代理ip'
        }
      response = requests.get(proxies = proxies)
      代理服务器的类型:http,https,ftp
      代理ip:http://ip:port

【python爬虫】requests模块的更多相关文章

  1. python 爬虫 requests模块 目录

    requests模块(response常用属性) 基于requests模块的get请求 基于requests模块发起ajax的get请求 基于requests模块发起ajax的post请求

  2. python爬虫requests模块

    requests库的七个主要方法 1. requests.requests(method, url, **kwargs) 构造一个请求,支撑以下各方法的基础方法 method:请求方式,对应get/p ...

  3. python 爬虫 requests模块(response常用属性)

    response常用属性 content获取的response对象中的二进制(byte)类型的页面数据response.content 返回响应状态码response.status_code 200 ...

  4. Python爬虫之使用Fiddler+Postman+Python的requests模块爬取各国国旗

    介绍   本篇博客将会介绍一个Python爬虫,用来爬取各个国家的国旗,主要的目标是为了展示如何在Python的requests模块中使用POST方法来爬取网页内容.   为了知道POST方法所需要传 ...

  5. Python爬虫—requests库get和post方法使用

    目录 Python爬虫-requests库get和post方法使用 1. 安装requests库 2.requests.get()方法使用 3.requests.post()方法使用-构造formda ...

  6. python爬虫 urllib模块url编码处理

    案例:爬取使用搜狗根据指定词条搜索到的页面数据(例如爬取词条为‘周杰伦'的页面数据) import urllib.request # 1.指定url url = 'https://www.sogou. ...

  7. python 爬虫 urllib模块 目录

    python 爬虫 urllib模块介绍 python 爬虫 urllib模块 url编码处理 python 爬虫 urllib模块 反爬虫机制UA python 爬虫 urllib模块 发起post ...

  8. Python之requests模块-hook

    requests提供了hook机制,让我们能够在请求得到响应之后去做一些自定义的操作,比如打印某些信息.修改响应内容等.具体用法见下面的例子: import requests # 钩子函数1 def ...

  9. Python之requests模块-cookie

    cookie并不陌生,与session一样,能够让http请求前后保持状态.与session不同之处,在于cookie数据仅保存于客户端.requests也提供了相应到方法去处理cookie. 在py ...

  10. Python之requests模块-session

    http协议本身是无状态的,为了让请求之间保持状态,有了session和cookie机制.requests也提供了相应的方法去操纵它们. requests中的session对象能够让我们跨http请求 ...

随机推荐

  1. iOS利用剪切板在app中传递信息

    利用iOS剪切板在app中传递信息 App1 中添加URLSchemes   app1 App2 中国添加URLSchemes   app2 App1中进入app2: UIApplication.sh ...

  2. mysql从5.6升级到5.7后出现 Expression #1 of ORDER BY clause is not in SELECT list,this is incompatible with DISTINCT

    [问题]mysql从5.6升级到5.7后出现:插入数据和修改数据时出错Caused by: com.ibatis.common.jdbc.exception.NestedSQLException: - ...

  3. 检测值是否存在(??)(Freemarker的null值处理)

    使用形式: unsafe_expr?? 或 (unsafe_expr)?? 这个操作符告诉我们一个值是否存在.基于这种情况, 结果是 true 或 false. 访问非顶层变量的使用规则和默认值操作符 ...

  4. s3c2440裸机-内存控制器(三、norflash初始化-时序设置)

    1.norflash与2440的硬件连接 2.初始化nor,配置nor时序 1.如图是S3C2440的内存控制器的可编程访问周期读写时序,里面的时间参数要根据外部设备的性能进行配置,这里先列出时间参数 ...

  5. CodeForces - 1265D(贪心+暴力)

    题意 https://vjudge.net/problem/CodeForces-1265D a个0,b个1,c个2,d个3,问是否存在一种排列方案使得任意相邻两数之差==1 思路 分类讨论太麻烦了, ...

  6. Appium(二):Node.js下载与安装、非GUI版本appium下载与安装、GUI版本appium下载与安装

    1. 下载并安装Node.JS 进入官网:https://nodejs.org/en/. 由于我们是新手嘛,所以肯定是越稳定越好啦,所以选择下载LTS版本. 进入文件下点击文件就进入安装界面了,点击n ...

  7. 斐波那契数列(Java)

    一.什么是斐波那契数列 斐波那契数列(Fibonacci sequence),又称黄金分割数列.因数学家列昂纳多·斐波那契(Leonardoda Fibonacci)以兔子繁殖为例子而引入,故又称为& ...

  8. 【使用篇二】Quartz自动化配置集成(17)

    出处:https://www.jianshu.com/p/49133c107143 定时任务在企业项目比较常用到,几乎所有的项目都会牵扯该功能模块,定时任务一般会处理指定时间点执行某一些业务逻辑.间隔 ...

  9. 1、web爬虫,requests请求

    requests请求,就是用python的requests模块模拟浏览器请求,返回html源码 模拟浏览器请求有两种,一种是不需要用户登录或者验证的请求,一种是需要用户登录或者验证的请求 一.不需要用 ...

  10. 【Unity游戏开发】性能优化之在真机上开启DeepProfile与踩坑

    一.引子 最近马三入职了新公司,平时除了负责编辑器开发之外还要做一些游戏性能优化方面的工作.在这里首先给大家安利一下Unity官方的性能测试分析工具URP ,这个工具目前是免费,测试的过程中也不需要接 ...