Python中文虐我千百遍，我待Python如初恋。本文主要介绍在Python2/3交互模式下，通过对中文、英文的处理输出，理解Python的字符编码与解码问题（以点破面）。

前言：字符串的编码一开始是 ascii，只支持英文，由于多种语言的存在，出现万国码 unicode，但 unicode 不兼容 ascii，而且对存储空间造成浪费，所以出现 utf-8 编码，一种针对 unicode 的可变长度字符编码。

Python3的字符编码与解码输出

 >>> hi = b'hello, world'

 >>> hi

 b'hello, world'

 >>> print(hi)

 b'hello, world'

 >>> hi.decode('utf-8')

 'hello, world'

 >>> hey = '你好'

 >>> hey

 '你好'

 >>> print(hey)

 你好

 >>> unihey = hey.encode('unicode_escape')

 >>> unihey

 b'\\u4f60\\u597d'

 >>> print(unihey)

 b'\\u4f60\\u597d'

 >>> unihey.decode('unicode_escape')

 '你好'

 >>> '\u4f60\u597d'

 '你好'

在 Python3 中共有两种字符序列。一种是 str 序列，默认对字符串编码；一种是 bytes 序列，操作二进制数据流，如代码段一中的 hi，通过在字符串前的 b，即表示 bytes 。这两种序列可通过 decode 和 encode 相互转换，如下图：

在代码段一中，通过对 bytes 以 utf-8 的格式解码，得到 str。除此之外，还可通过 unicode_escape、gbk 等格式解码；

在代码段二中，通过对 str 的中文 hey 以 unicode_escape 的格式编码，得到 bytes 。用什么格式编码就用什么解码，即可得到原字符。

由于 Python3 对中文的支持友好，将 unihey 中的转义符 \ 去掉，在交互模式下可直接显示中文。

在网络传输中，如 urllib、request 等获取数据的库，通常返回 bytes 序列，这时可通过 decode 指定相应的格式经行解码，获取中文字符。

Python2的字符编码与解码输出

 >>> hi = u'hello, world'

 >>> hi

 u'hello, world'

 >>> print hi

 hello, world

 >>> hi.encode('utf-8')

 'hello, world'

 >>> hi.encode('unicode_escape')

 'hello, world'

 >>> hey = '你好'

 >>> hey

 '\xc4\xe3\xba\xc3'

 >>> print hey

 你好

 >>> uhey = u'你好'

 >>> uhey

 u'\u4f60\u597d'

 >>> print uhey

 你好

 >>> ghey = uhey.encode('gbk')

 >>> ghey

 '\xc4\xe3\xba\xc3'

 >>> print ghey

 你好

 >>> hey.decode('gbk')

 u'\u4f60\u597d'

 >>> print hey.decode('gbk')

 你好

 >>> '\u4f60\u597d'

 '\\u4f60\\u597d'

在 Python2 中也有两种字符序列。一种是 unicode 序列，如代码段一中的 hi，通过在字符串前的 u，即表示 unicode，相当于 Python3 中的 str；一种是 str 序列，相当于 Python3 中的 bytes 。这两种序列可通过 decode 和 encode 相互转换，如下图：

在代码段一中，通过对 unicode 以 utf-8、unicode_escape 的格式编码，得到 str；

在代码段二中，通过对 str 的中文 hey 以 gbk 的格式解码，得到 unicode；对 unicode 的中文 uhey 以 gbk 的格式编码，得到 str 。

在 Python 的交互模式下，直接输出是 Python 所理解的代码中的状态，而 print 输出的是给用户看到。

从代码段二的20行、21行可以看出，Python2 对中文的支持没有 Python3 友好。除此之外，当列表中有中文时，Python2 必须遍历列表，才能在交互模式下看到中文，而 Python3 直接打印列表即可。

总结

上述表述可能不到位，欢迎交流讨论！同时我们可以通过 Anaconda 切换不同的 Python 环境，去尝试上述小栗子，随便编码解码，玩坏了算我输~(￣▽￣)~

Python2/3的中、英文字符编码与解码输出： UnicodeDecodeError: 'ascii' codec can't decode/encode的更多相关文章

【转】python 字符编码与解码——unicode、str和中文：UnicodeDecodeError: 'ascii' codec can't decode
原文网址:http://blog.csdn.net/trochiluses/article/details/16825269 摘要:在进行python脚本的编写时,如果我们用python来处理网页数据 ...
python2（中文编码问题）：UnicodeDecodeError: 'ascii' codec can't decode byte 0x?? in position 1
python在安装时,默认的编码是ascii,当程序中出现非ascii编码时,python的处理常常会报这样的错UnicodeDecodeError: 'ascii' codec can't deco ...
python2.7 报错（UnicodeDecodeError: 'ascii' codec can't decode byte 0xe6 in position 0: ordinal not in range(128)）
报错: 原来用的python3.5版本后来改为2.7出现了这个错误里面的中文无法显示 UnicodeDecodeError: 'ascii' codec can't decode byte 0xe6 ...
python 默认编码（ UnicodeDecodeError: 'ascii' codec can't decode）
python在安装时,默认的编码是ascii,当程序中出现非ascii编码时,python的处理常常会报这样的错UnicodeDecodeError: 'ascii' codec can't deco ...
python2 UnicodeDecodeError: 'ascii' codec can't decode byte 0xce in position 7: ordinal not in range(128)
python在安装时,默认的编码是ascii,当程序中出现非ascii编码时,python的处理常常会报这样的错UnicodeDecodeError: 'ascii' codec can't deco ...
python2.7安装第三方库错误：UnicodeDecodeError: 'ascii' codec can't decode byte 0xcb in position 0
开发环境:win10, x64, pycharm社区版,python2.7.13 python2经常会遇见乱码的问题,并且一遇到中文就乱码.所以我们在安装的时候要注意,无论是解释器interpreto ...
解决UnicodeDecodeError: 'ascii' codec can't decode byte 0xe7 in position 12: ordinal not in range(128)的编码问题
当我在运行一个基于scrapy的爬虫时出现UnicodeDecodeError: 'ascii' codec can't decode byte 0xe7 in position 12: ordina ...
python2 当中遇到 UnicodeDecodeError UnicodeDecodeError: 'ascii' codec can't decode byte 0xe9 in position 37: ordinal not in range(128)
使用python2 总是遇到 UnicodeDecodeErrorUnicodeDecodeError: 'ascii' codec can't decode byte 0xe9 in positio ...
Anaconda中启动Python时的错误：UnicodeDecodeError: 'gbk' codec can't decode byte 0xaf in position 553
今天,在Anaconda prompt启动python遇到了如下错误: UnicodeDecodeError: ‘gbk’ codec can’t decode byte 0xaf in positi ...

随机推荐

容易被忽视的后端服务 chunked 性能问题
容易被忽视的后端服务 chunked 性能问题标签(空格分隔): springboot springmvc chunked 背景 spring boot 创建的默认 spring mvc 项目集成 ...
IT连创业系列：App产品上线后，运营怎么搞？（上）
又是一阵一阵的时光过去了,今夜,码的不是代码,是文字,继续和大伙分享创业的这一路历程. 话说,在突破技术的领域,IT连和IT恋上线后,慢慢走上运营这条路时,发现自己经常容易迷失. 毕竟,做为一名技术型 ...
ASP.NET Core教程【三】实体字段属性、链接标签、并发数据异常、文件上传及读取
前文索引:ASP.NET Core教程[二]从保存数据看Razor Page的特有属性与服务端验证ASP.NET Core教程[一]关于Razor Page的知识实体字段属性再来看看我们的实体类 ...
《Java并发编程》之线程中断与终止线程运行
Java中启动一个线程很容易,通常情况下我们都是等到任务运行结束后让线程自行停止.但有时需要在任务正在运行时取消他们,使得线程快速结束.对此Java并没有提供任何机制.但是我们可以通过Java提供的线 ...
你绝不能错过的效率神器 —— Alfred
文章首发于[博客园-陈树义],点击跳转到原文<你绝不能错过的效率神器 -- Alfred> Alfred 是 Mac 系统上一款专注于效率提升的著名应用,它能帮你快速打开网页.快速进行自定 ...
angular中复制文字到剪切板
function copyToClipboard(oElement, value) { var aux = document.createElement("input"); if ...
基于 HTML5 Canvas 的 3D 碰撞检测
这是公司大神写的一个放官网上给用户学习的例子,我一开始真的不知道这是在干嘛,就只是将三个形状图元组合在一起,然后可以同时旋转.放大缩小这个三个图形,点击"Animate"就能让中间 ...
Yahoo网站性能优化的34条军规
1.尽量减少HTTP请求次数终端用户响应的时间中,有80%用于下载各项内容,这部分时间包括下载页面中的图像.样式表.脚本.Flash等.通过减少页面中的元素可以减少HTTP请求的次数,这是提高网页速 ...
redis函数总结
<?php /*1.Connection*/ $redis = new Redis(); $redis->connect('127.0.0.1',6379,1);//短链接,本地host, ...
scapy安装及SCTP包分析
关于Scapy scapy是一个强大的交互式数据包处理程序(使用python编写).它能够伪造或者解码大量的网络协议数据包,能够发送.捕捉.匹配请求和回复包等.它可以很容易地处理一些典型操作,比如端口 ...

Python2/3的中、英文字符编码与解码输出： UnicodeDecodeError: 'ascii' codec can't decode/encode

Python3的字符编码与解码输出

Python2的字符编码与解码输出

总结

Python2/3的中、英文字符编码与解码输出： UnicodeDecodeError: 'ascii' codec can't decode/encode的更多相关文章

随机推荐

热门专题