0.爬虫 urlib库讲解 urlopen()与Request()

# 注意一下是import urllib.request 还是 form urllib import request

0. urlopen()

语法：urllib.request.urlopen(url, data=None, [timeout, ]*, cafile=None, capath=None, cadefault=False, context=None)

实例0：(这个函数一般就使用三个参数 url data timeout)

*添加的data参数需要使用bytes()方法将参数转换为字节流（区别于str的一种类型是一种比特流 010010010）编码的格式的内容，即bytes类型。

*response.read()是bytes类型的数据，需要decode（解码）一下。

import urllib.parse

import urllib.request

import urllib.error

url = 'http://httpbin.org/post'

data = bytes(urllib.parse.urlencode({'word': 'hello'}), encoding='utf8')

try:

    response = urllib.request.urlopen(url, data=data,timeout=1)

except urllib.error.URLError as e:

    if isinstance(e.reason, socket.timeout):

        print('TIME OUT')

else:

    print(response.read().decode("utf-8"))

输出结果：

{

  "args": {},

  "data": "",

  "files": {},

  "form": {

    "word": "hello"

  },

  "headers": {

    "Accept-Encoding": "identity",

    "Content-Length": "10",

    "Content-Type": "application/x-www-form-urlencoded",

    "Host": "httpbin.org",

    "User-Agent": "Python-urllib/3.6"

  },

  "json": null,

  "origin": "101.206.170.234, 101.206.170.234",

  "url": "https://httpbin.org/post"

}

实例1：查看i状态码、响应头、响应头里server字段的信息

import urllib.request

response = urllib.request.urlopen('https://www.python.org')

print(response.status)

print(response.getheaders())

print(response.getheader('Server'))

输出结果：

200

[('Server', 'nginx'), ('Content-Type', 'text/html; charset=utf-8'), ('X-Frame-Options', 'DENY'), ('Via', '1.1 vegur'), ('Via', '1.1 varnish'), ('Content-Length', '48410'), ('Accept-Ranges', 'bytes'), ('Date', 'Tue, 09 Apr 2019 02:32:34 GMT'), ('Via', '1.1 varnish'), ('Age', '722'), ('Connection', 'close'), ('X-Served-By', 'cache-iad2126-IAD, cache-hnd18751-HND'), ('X-Cache', 'MISS, HIT'), ('X-Cache-Hits', '0, 1223'), ('X-Timer', 'S1554777154.210361,VS0,VE0'), ('Vary', 'Cookie'), ('Strict-Transport-Security', 'max-age=63072000; includeSubDomains')]

nginx

使用urllib库的urlopen()方法有很大的局限性，比如不能设置响应头的信息等。所以需要引入request()方法。

1. Request()

实例0：（这两种方法的实现效果是一样的）

import urllib.request

response = urllib.request.urlopen('https://www.python.org')

print(response.read().decode('utf-8'))

######################################

import urllib.request

req = urllib.request.Request('https://python.org')

response = urllib.request.urlopen(req)

print(response.read().decode('utf-8'))

下面主要讲解下使用Request()方法来实现get请求和post请求,并设置参数。

实例1：(post请求)

from urllib import request, parse

url = 'http://httpbin.org/post'

headers = {

    'User-Agent': 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)',

    'Host': 'httpbin.org'

}

dict = {

    'name': 'Germey'

}

data = bytes(parse.urlencode(dict), encoding='utf8')

req = request.Request(url=url, data=data, headers=headers, method='POST')

response = request.urlopen(req)

print(response.read().decode('utf-8'))

亦可使用add_header()方法来添加报头，实现浏览器的模拟，添加data属性亦可如下书写：

补充：还可以使用bulid_opener()修改报头，不过多阐述，够用了就好。

from urllib import request, parse

url = 'http://httpbin.org/post'

dict = {

    'name': 'Germey'

}

data = parse.urlencode(dict).encode('utf-8')

req = request.Request(url=url, data=data, method='POST')

req.add_header('User-Agent', 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)')

response = request.urlopen(req)

print(response.read().decode('utf-8'))

实例2：(get请求) 百度关键字的查询

from urllib import request,parse

url = 'http://www.baidu.com/s?wd='

key = '路飞'

key_code = parse.quote(key)

url_all = url + key_code

"""

#第二种写法

url = 'http://www.baidu.com/s'

key = '路飞'

wd = parse.urlencode({'wd':key})

url_all = url + '?' + wd

"""

req = request.Request(url_all)

response = request.urlopen(req)

print(response.read().decode('utf-8'))

在这里，对编码decode、reqest模块里的quote()方法、urlencode()方法等就有疑问了，，对此，做一些说明：

parse.quote：将str数据转换为对应的编码
parse.urlencode：将字典中的k:v转换为K:编码后的v
parse.unquote：将编码后的数据转化为编码前的数据
decode 字符串解码 decode("utf-8")跟read()搭配很配！
encode 字符串编码

>>> str0 = '我爱你'

>>> str1 = str0.encode('gb2312')

>>> str1

b'\xce\xd2\xb0\xae\xc4\xe3'

>>> str2 = str0.encode('gbk')

>>> str2

b'\xce\xd2\xb0\xae\xc4\xe3'

>>> str3 = str0.encode('utf-8')

>>> str3

b'\xe6\x88\x91\xe7\x88\xb1\xe4\xbd\xa0'

>>> str00 = str1.decode('gb2312')

>>> str00

'我爱你'

>>> str11 = str1.decode('utf-8') #报错，因为str1是gb2312编码的

Traceback (most recent call last):

  File "<pyshell#9>", line 1, in <module>

    str11 = str1.decode('utf-8')

UnicodeDecodeError: 'utf-8' codec can't decode byte 0xce in position 0: invalid continuation byte

* encoding指定编码格式

在这里，又有疑问了？read()、readline()、readlines()的区别：

read():全部，字符串str
reasline():一行
readlines():全部，列表list

0.爬虫 urlib库讲解 urlopen()与Request()的更多相关文章

1.爬虫 urlib库讲解 Handler高级用法
在前面我们总结了urllib库的 urlopen()和Request()方法的使用,在这一小节我们要使用相关的Handler来实现代理.cookies等功能. 写在前面: urlopen()方法不支持 ...
2.爬虫 urlib库讲解异常处理、URL解析、分析Robots协议
1.异常处理 URLError类来自urllib库的error模块,它继承自OSError类,是error异常模块的基类,由request模块产生的异常都可以通过这个类来处理. from urllib ...
3.爬虫 urlib库讲解总结
urllib库的总结: 用ProcessOn(安利这个软件,够用了)根据前面的几节内容做了个思维导图. urllib库一共有四个模块: request:它是最基本的模块,可以用来模拟发送请求 erro ...
4.爬虫 requests库讲解 GET请求 POST请求响应
requests库相比于urllib库更好用!!! 0.各种请求方式 import requests requests.post('http://httpbin.org/post') requests ...
5.爬虫 requests库讲解高级用法
0.文件上传 import requests files = {'file': open('favicon.ico', 'rb')} response = requests.post("ht ...
6.爬虫 requests库讲解总结
requests库的总结: 用ProcessOn根据前面的几节内容做了个思维导图:
Python爬虫与数据分析之爬虫技能：urlib库、xpath选择器、正则表达式
专栏目录: Python爬虫与数据分析之python教学视频.python源码分享,python Python爬虫与数据分析之基础教程:Python的语法.字典.元组.列表 Python爬虫与数据分析 ...
爬虫-Python爬虫常用库
一.常用库 1.requests 做请求的时候用到. requests.get("url") 2.selenium 自动化会用到. 3.lxml 4.beautifulsoup 5 ...
对于python爬虫urllib库的一些理解（抽空更新）
urllib库是Python中一个最基本的网络请求库.可以模拟浏览器的行为,向指定的服务器发送一个请求,并可以保存服务器返回的数据. urlopen函数: 在Python3的urllib库中,所有和网 ...

随机推荐

Oracle数据库大量library cache: mutex X及latch: shared pool问题排查一例
业务系统数据库夯住,数据库内大量的library cache: mutex X及latch: shared pool等待,alert日志信息如下 Tue Sep :: WARNING: inbound ...
js实现图片点击弹出放大效果
点击图片,显示蒙板,放大图片的简单案例 HTML代码: <div> <img height=" src="https://img-blog.csdn.net/20 ...
#leetcode刷题之路26-删除排序数组中的重复项
给定一个排序数组,你需要在原地删除重复出现的元素,使得每个元素只出现一次,返回移除后数组的新长度.不要使用额外的数组空间,你必须在原地修改输入数组并在使用 O(1) 额外空间的条件下完成. 示例 1: ...
HTTP状态保持的原理
a)在用户登录之后,浏览器返回响应的时候会在响应中添加上cookieb)浏览器接收到cookie之后会自动保存c)当用户再次请求同一服务器中的其他网页的时候,浏览器会自动带上之前保存的cookied) ...
Keras模型的保存方式
Keras模型的保存方式在运行并且训练出一个模型后获得了模型的结构与许多参数,为了防止再次训练以及需要更好地去使用,我们需要保存当前状态基本保存方式 h5 # 此处假设model为一个已经训练好的 ...
AES加密工具
public class AES { /** * 加密 * * @param content * 需要加密的内容 * @param password * 加密密码 * @return */ publi ...
collections模块的使用
1. Counter counter是collections中的一个模块, 它能够统计出字符串/文本中的每一个元素出现的次数, 并可以对结果进行进一步的处理. 使用方法传入: 字符串默认返回: C ...
MySQL单表数据查询(DQL)
数据准备工作: CREATE TABLE student( sid INT PRIMARY KEY AUTO_INCREMENT, sname ), age TINYINT, city ), scor ...
laravel构造函数跳转失败
<?php namespace App\Http\Controllers\Admin; use Illuminate\Http\Request; use App\Http\Requests;us ...
Python实现多属性排序
Python实现多属性排序多属性排序:假如某对象有n个属性,那么先按某规则对属性a进行排序,在属性a相等的情况下再按某规则对属性b进行排序,以此类推. 现有对象Student: class Stud ...

0.爬虫 urlib库讲解 urlopen()与Request()

0.爬虫 urlib库讲解 urlopen()与Request()的更多相关文章

随机推荐

热门专题