都在推荐用Requests库，而不是Urllib，但是读取网页的时候中文会出现乱码。

分析：
r = requests.get(“http://www.baidu.com“)
**r.text返回的是Unicode型的数据。
使用r.content返回的是bytes型的数据。
也就是说，如果你想取文本，可以通过r.text。
如果想取图片，文件，则可以通过r.content。**

获取一个网页的内容

方法1：使用r.content，得到的是bytes型，再转为str

url='http://music.baidu.com'

r = requests.get(url)

html=r.content

html_doc=str(html,'utf-8') #html_doc=html.decode("utf-8","ignore")

print(html_doc)

方法2：使用r.text
Requests 会自动解码来自服务器的内容。大多数 unicode 字符集都能被无缝地解码。请求发出后，Requests 会基于 HTTP 头部对响应的编码作出有根据的推测。当你访问 r.text 之时，Requests 会使用其推测的文本编码。你可以找出 Requests 使用了什么编码，并且能够使用 r.encoding 属性来改变它.
但是Requests库的自身编码为: r.encoding = ‘ISO-8859-1’
可以 r.encoding 修改编码

url='http://music.baidu.com'

r=requests.get(url)

r.encoding='utf-8'

print(r.text)

获取一个网页的内容后存储到本地

方法1：r.content为bytes型，则open时需要open(filename,”wb”)

r=requests.get("music.baidu.com")

html=r.content

with open('test5.html','wb') as f:

    f.write(html)

方法2：r.content为bytes型，转为str后存储

r = requests.get("http://www.baidu.com")

html=r.content

html_doc=str(html,'utf-8') #html_doc=html.decode("utf-8","ignore")

# print(html_doc)

with open('test5.html','w',encoding="utf-8") as f:

    f.write(html_doc)

方法3：r.text为str，可以直接存储

r=requests.get("http://www.baidu.com")

r.encoding='utf-8'

html=r.text

with open('test6.html','w',encoding="utf-8") as f:

    f.write(html)

Requests+lxml

# -*-coding:utf8-*-

import requests

from lxml import etree

url="http://music.baidu.com"

r=requests.get(url)

r.encoding="utf-8"

html=r.text

# print(html)

selector = etree.HTML(html)

title=selector.xpath('//title/text()')

print (title[])

结果为：百度音乐-听到极致

终极解决方法

以上的方法虽然不会出现乱码，但是保存下来的网页，图片不显示，只显示文本。而且打开速度慢，找到了一篇博客，提出了一个终极方法，非常棒。

来自博客

# -*-coding:utf8-*-

import requests

req = requests.get("http://news.sina.com.cn/")

if req.encoding == 'ISO-8859-1':

    encodings = requests.utils.get_encodings_from_content(req.text)

    if encodings:

        encoding = encodings[]

    else:

        encoding = req.apparent_encoding

    # encode_content = req.content.decode(encoding, 'replace').encode('utf-8', 'replace')

    global encode_content

    encode_content = req.content.decode(encoding, 'replace') #如果设置为replace，则会用?取代非法字符；

print(encode_content)

with open('test.html','w',encoding='utf-8') as f:

    f.write(encode_content)

winH*posi){
articleBox.css({
'height':winH*posi+'px',
'overflow':'hidden'
})
btnReadmore.click(function(){
articleBox.removeAttr("style");
$(this).parent().remove();
})
}else{
btnReadmore.parent().remove();
}
}
var btnReadmore = $("#btn-readmore");
if(btnReadmore.length>0){
if(currentUserName){
setArticleH(btnReadmore,3);
}else{
setArticleH(btnReadmore,1.2);
}
}
})()
// ]]>

Requests text乱码的更多相关文章

sublime text 乱码生成.dump问题的解决方法
title: sublime text 乱码生成.dump问题的解决方法 tags: sublime text,sublime text 3,.dump,乱码 grammar_cjkRuby: tru ...
Requests中文乱码解决方案
分析: r = requests.get(“http://www.baidu.com“) **r.text返回的是Unicode型的数据. 使用r.content返回的是bytes型的数据. 也就是说 ...
Sublime Text 乱码解决（Package Control 和 ConvertToUTF8插件安装）
Sublime Text的界面正如她的名字sublime一样,充满极客感觉的高大上,而且拥有强大的功能.但是她默认是不支持GBK编码的. 本来安装一个Package Control插件管理,再安装其他 ...
解决Sublime Text乱码问题
第一步:安装Package Control 大家如果是在官网下载的Sublime Text 3,那么首先需要安装一个 Package Control包,这是一个用来安装其他插件的包,不管装什么插件,首 ...
requests 中文乱码
jsUrl = 'http://www.heze.cn/qiye/index.php?a=userinfo&username={}'.format(bizQiyeId)r = requests ...
记一次requests请求乱码的问题
太懒了,直接说原因吧: 请求返回的内容含有emoji表情我的解决办法是替换掉emoji字符: 安装库:pip install emoji 替换:emoji.demojize(CONTENT) 注意, ...
解决Requests中文乱码【有用】，读取htm文件读取txt文件报错：UnicodeDecodeError: 'utf-8' codec can't decode byte 0xc8 in position 0
打开这个网址https://blog.csdn.net/chaowanghn/article/details/54889835 python在open读取txt文件时,出现UnicodeDecodeE ...
requests关于Exceeded 30 redirects问题得出的结论
昨天一个朋友在爬网页时出现的一个问题,以及后续我对这个问题进行了简单的测试. 先说出现的问题的简单描述. 首先是使用urllib请求网页: #urllib.request发起的请求 import ur ...
requests基本应用
requests基本功能详解 import requests response = requests.get('https://www.baidu.com') print('type属性:',type ...

随机推荐

Linux-3.14.12内存管理笔记【建立内核页表（1）】
前面已经分析过了Intel的内存映射和linux的基本使用情况,已知head_32.S仅是建立临时页表,内核还是要建立内核页表,做到全面映射的.下面就基于RAM大于896MB,而小于4GB ,切CON ...
Linux系统学习三、网络基础—虚拟机网络配置
Linux网络基础 Linux的ip地址配置 Linux网络配置文件常用网络命令虚拟机网络参数配置 1.配置Linux的IP地址首先配置一个IP地址,让IP生效. ifconfig查看当前网络配 ...
python xlwt写入excel操作
引用https://www.cnblogs.com/python-robot/p/9958352.html 安装 $ pip install xlwt 例子: import xlwt # 创建一个wo ...
3天学会kettle -全网最全的kettle教程
从资源库开始,详细讲解了kettle的所有控件的用法,无论你是开发人员.运维人员还是测试人员. 通过此教程都可以很快速的掌握kettle,再加上笔者的实例,3天学会kettle的实战操作. 欢迎关注公 ...
MYSQL5.7的安装（yum、二进制、编译安装）
目录一.环境说明二.YUM安装 1.安装MYSQL-YUM源 2.安装说明 3.安装前的准备 4.安装 5.启动三.变更root密码四.BINARY-INSTALL 1.基础环境准备 2.建立 ...
python3解决url编码与解码
对于url编码的转换,主要用urllib.parse包中的quote和unquote方法. quote进行解码,unquote进行编码. 代码实例: import urllib.parse u = & ...
《大数据技术应用与原理》第二版-第二章大数据处理架构Hadoop
2.1概述 Hadoop是Apache旗下的开源分布式计算平台,是基于Java开发的,具有很好的跨平台特性,其中核心文件是MapReduce和HDFS,而HDFS是根据谷歌文件系统GFS开源实现,是面 ...
开放平台API接口安全策略汇总
在设计开放平台接口过程中,往往会涉及接口传输安全性相关的问题,本文对接口加密及签名的相关知识做了一个总结,在方便自己查阅的同时也分享给大家做一些参考. 接口安全性问题思考接口安全性问题主要来源于几方 ...
MNIST 例程源码分析 TensorFlow 从入门到精通
按照上节步骤, TensorFlow 默认安装在 /usr/lib/python/site-packages/tensorflow/ (也有可能是 /usr/local/lib……)下,查看目录结构: ...
大话设计模式Python实现-职责链模式
职责链模式(Chain Of Responsibility):使多个对象都有机会处理请求,从而避免发送者和接收者的耦合关系.将对象连成链并沿着这条链传递请求直到被处理下面是一个设计模式的demo: ...