requests（爬虫常用）库的使用

Requests库的使用

基于urllib改写的库

示例：

import requests

response=requests.get('http://www.baidu.com')#get请求

print(response.status_code,response.url,response.cookies,response.text,sep='\n')

import requests

response=requests.post('http://httpbin.org/post')#post请求

print(response.text)#.text得到的都是字符串类型的值

带参数的get请求

import requests

data={

    'name':'abc',

    'age':15

}

response=requests.get('http://httpbin.org/get',params=data)#post的参数请求时data=data

print(response.text)

----------------------------------------------

#或者直接将参数拼接在url上
import requests

response=requests.get('http://httpbin.org/get？name=adas&age=12')

print(response.text)

将返回的结果变为json格式

import requests

import json

response=requests.get('http://httpbin.org/get')

print(response.json())

print(json.loads(response.text))#等价于上面的

获取二进制数据

 import requests

 response=requests.get('https://weibo.com/favicon.ico')

 print(response.content)

 with open('weibo.ico','wb')as f:

     f.write(response.content)

添加http的headers属性

 import requests

 headers={

 "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.108 Safari/537.36"

 }

 response=requests.get('https://zhihu.com/',headers=headers)

 print(response.status_code)

 print(response.text)

带参数的post请求

import requests

data={

    'name':'wang',

    'age':88

}

headers={

    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.108 Safari/537.36"

}

response=requests.post('http://httpbin.org/post',data=data,headers=headers)

print(response.text)

response的一些属性

 import requests

 response=requests.get('http://www.baidu.com')

 print(response.headers)

 print(response.text)

 print(response.status_code)

 print(response.content)

 print(response.cookies)

 #...还有就省略了

response状态码的判断

 import requests

 response=requests.get('http://www.baidu.com')

 # if response.status_code==requests.codes.ok:

 if response.status_code==200:

     print('ok')

 else:

     print('error')

文件上传

import requests

files={

    'file':open('weibo.ico','rb')

}

response=requests.post('http://httpbin.org/post',files=files)

print(response.text)

获取cookie

import requests

response=requests.get('htt

cook=response.cookies

print(type(cook))

for key,value in cook.item

    print(key,'=',value)

维持会话

模拟登陆

import requests

s=requests.Session()#声明session对象，通过session请求网站

s.get('http://httpbin.org/cookies/set/name/123')

response=s.get('http://httpbin.org/cookies')

print(response.text)

证书验证

import requests

from requests.packages import urllib3

urllib3.disable_warnings()#去除py警告

response=requests.get('https://www.12306.cn',verify=False)#去除证书验证

print(response.status_code)

代理ip

import requests

proxies={

    'http': 'http://47.89.10.103:80/'

}

response=requests.get('http://www.geogle.com',proxies=proxies)

print(response.text)

有密码的代理ip

import requests

proxies={

    'http':'http://user.password@47.89.10.103:80'

}

response=requests.get('http://www.geogle.com',proxies=proxies)

print(response.text)

超时设置

import requests

from requests.exceptions import ReadTimeout

try:

    response=requests.get('https://taobao.com',timeout=0.1)

except ReadTimeout as e:

    print('timeout')

认证设置(需要直接登陆才能查看网站)

import requests

from requests import HTTPBasicAuth

response=requests.get('http://115.44.48.789:8888',auth=HTTPBasicAuth('user',''))

print(response.status_code)

异常处理

import requests

from requests import ReadTimeout,ConnectionError,RequestException

try:

    response=requests.get('http://www.baidu.com',timeout=0.5)

    print(response.status_code)

except ReadTimeout:

    print('timeout')

except ConnectionError:

    print('connectionerror')

except RequestException:

    print('requesterror')

requests（爬虫常用）库的使用的更多相关文章

爬虫-Python爬虫常用库
一.常用库 1.requests 做请求的时候用到. requests.get("url") 2.selenium 自动化会用到. 3.lxml 4.beautifulsoup 5 ...
Python爬虫学习==>第五章：爬虫常用库的安装
学习目的: 爬虫有请求库(request.selenium).解析库.存储库(MongoDB.Redis).工具库,此节学习安装常用库的安装正式步骤 Step1:urllib和re库这两个库在安装 ...
Python爬虫常用库安装
建议更换pip源到国内镜像,下载会快很多:https://www.cnblogs.com/believepd/p/10499844.html requests pip3 install request ...
python爬虫常用库和安装 -- windows7环境
1:urllib python自带 2:re python自带 3:requests pip install requests 4:selenium 需要依赖chrome ...
爬虫常用库之pyquery 库
pyquery库是jQuery的Python实现,可以用于解析HTML网页内容,我个人写过的一些抓取网页数据的脚本就是用它来解析html获取数据的.他的官方文档地址是:http://packages. ...
Python 爬虫常用库（九）
[python爬虫]Requests-BeautifulSoup-Re库方案--Requests库介绍
[根据北京理工大学嵩天老师“Python网络爬虫与信息提取”慕课课程编写文章中部分图片来自老师PPT 慕课链接:https://www.icourse163.org/learn/BIT-10018 ...
[python爬虫]Requests-BeautifulSoup-Re库方案--robots协议与Requests库实战
[根据北京理工大学嵩天老师“Python网络爬虫与信息提取”慕课课程编写慕课链接:https://www.icourse163.org/learn/BIT-1001870001?tid=100223 ...
Python 爬虫常用的库
一.常用库 1.requests 做请求的时候用到. requests.get("url") 2.selenium 自动化会用到. 3.lxml 4.beautifulsoup 5 ...
$python爬虫系列（2）—— requests和BeautifulSoup库的基本用法
本文主要介绍python爬虫的两大利器:requests和BeautifulSoup库的基本用法. 1. 安装requests和BeautifulSoup库可以通过3种方式安装: easy_inst ...

随机推荐

Java学习笔记2---设置环境变量JAVA_HOME,CLASSPATH,PATH
1.环境变量包括: JAVA_HOME,CLASSPATH,PATH 2.设置环境变量的目的: 路径搜索,方便查找到jdk的安装路径.方便搜索用到的类文件.方便搜索用到的可执行文件如java,java ...
Selenium WebDriver- 操作JavaScript的Alert弹窗
弹层和弹框是有区别的,弹框是那种完全没样式的框子:弹层是可以直接看到html的,有样式 #encoding=utf-8 import unittest import time from seleniu ...
python-高级编程-06-长连接&连接池
我们都知道tcp是基于连接的协议,其实这个连接只是一个逻辑上面的概念,在ip层来看,tcp和udp仅仅是内容上稍有差别而已. tcp 的连接仅仅是连接两端对于四元组和sequence号的一种约定而已 ...
python学习-- 两种方式查看自己的Django版本
[第一种方式] Windows系统下按住Windows按键 + R 进入搜索:搜索CMD进入控制台:输入Python进入Python解释器 Linux系统下直接使用终端调用Python解释器接下 ...
javascript学习笔记 - 引用类型单体内置对象
七单体内置对象 1.Global对象不属于任何对象的属性和方法,都归于它.全局作用域中定义的变量.函数,都属于Global对象 1.1 URI编码 encodeURI <＝>deco ...
机器学习实战之AdaBoost算法
一,引言前面几章的介绍了几种分类算法,当然各有优缺.如果将这些不同的分类器组合起来,就构成了我们今天要介绍的集成方法或者说元算法.集成方法有多种形式:可以使多种算法的集成,也可以是一种算法在不同设置 ...
mycat 优化
版权声明:本文为博主原创文章,未经博主允许不得转载. https://blog.csdn.net/u014180504/article/details/76595247show @@datanode; ...
mybatis的嵌套查询（嵌套查询nested select和嵌套结果nested results查询）区别
(转自:http://blog.csdn.net/canot/article/details/51485955) Mybatis表现关联关系比hibernate简单,没有分那么细致one-to-man ...
iOS学习笔记43-Swift(三)类
一.Swift的类class 作为一门面向对象语言,类也是Swift的非常重要的类型,我们先来看下一个简单的类 //Swift中一个类可以不继承于任何其他基类,那么此类本身就是一个基类 class P ...
BZOJ1297 [SCOI2009]迷路【矩阵优化dp】
题目 windy在有向图中迷路了. 该有向图有 N 个节点,windy从节点 0 出发,他必须恰好在 T 时刻到达节点 N-1. 现在给出该有向图,你能告诉windy总共有多少种不同的路径吗? 注意: ...

requests（爬虫常用）库的使用

requests（爬虫常用）库的使用的更多相关文章

随机推荐

热门专题