python 正则表达式匹配中文(转)

网上的一篇文章，做了整理，作者已无从考证，谢谢了

 s="""

 en: Regular expression is a powerful tool for manipulating text.

 zh: 中文

 jp: 正規表現は非常に役に立つツールテキストを操作することです。

 jp-char: あアいイうウえエおオ

 kr:정규 표현식은 매우 유용한 도구 텍스트를 조작하는 것입니다.

 puc: 。？！、，；：“ ”‘ '——……·－·《》〈〉！￥％＆＊＃

 """

 print "原始utf8字符"

 #utf8

 print "--------"

 print repr(s)

 print "--------\n"

 #非ansi

 re_words=re.compile(r"[\x80-\xff]+")

 m =  re_words.search(s,0)

 print "非ansi字符"

 print "--------"

 print m

 print m.group()

 print "--------\n"

 #unicode

 s = unicode(s)

 print "原始unicode字符"

 print "--------"

 print repr(s)

 print "--------\n"

 #unicode chinese

 re_words = re.compile(u"[\u4e00-\u9fa5]+")

 m =  re_words.search(s,0)

 print "unicode 中文"

 print "--------"

 print m

 print m.group()

 print "--------\n"

 #unicode korean

 re_words=re.compile(u"[\uac00-\ud7ff]+")

 m =  re_words.search(s,0)

 print "unicode 韩文"

 print "--------"

 print m

 print m.group()

 print "--------\n"

 #unicode japanese katakana

 re_words=re.compile(u"[\u30a0-\u30ff]+")

 m =  re_words.search(s,0)

 print "unicode 日文 片假名"

 print "--------"

 print m

 print m.group()

 print "--------\n"

 #unicode japanese hiragana

 re_words=re.compile(u"[\u3040-\u309f]+")

 m =  re_words.search(s,0)

 print "unicode 日文 平假名"

 print "--------"

 print m

 print m.group()

 print "--------\n"

 #unicode cjk Punctuation

 re_words=re.compile(u"[\u3000-\u303f\ufb00-\ufffd]+")

 m =  re_words.search(s,0)

 print "unicode 标点符号"

 print "--------"

 print m

 print m.group()

 print "--------\n"

 -------------------------------------------------------

 原始utf8字符

 --------

 "\nen: Regular expression is a powerful tool for manipulating text. \nzh: \xe4\xb8\xad\xe6\x96\x87 \njp: \xe6\xad\xa3\xe8\xa6\x8f\xe8\xa1\xa8\xe7\x8f\xbe\xe3\x81\xaf\xe9\x9d\x9e\xe5\xb8\xb8\xe3\x81\xab\xe5\xbd\xb9\xe3\x81\xab\xe7\xab\x8b\xe3\x81\xa4\xe3\x83\x84\xe3\x83\xbc\xe3\x83\xab\xe3\x83\x86\xe3\x82\xad\xe3\x82\xb9\xe3\x83\x88\xe3\x82\x92\xe6\x93\x8d\xe4\xbd\x9c\xe3\x81\x99\xe3\x82\x8b\xe3\x81\x93\xe3\x81\xa8\xe3\x81\xa7\xe3\x81\x99\xe3\x80\x82 \njp-char: \xe3\x81\x82\xe3\x82\xa2\xe3\x81\x84\xe3\x82\xa4\xe3\x81\x86\xe3\x82\xa6\xe3\x81\x88\xe3\x82\xa8\xe3\x81\x8a\xe3\x82\xaa \nkr:\xec\xa0\x95\xea\xb7\x9c \xed\x91\x9c\xed\x98\x84\xec\x8b\x9d\xec\x9d\x80 \xeb\xa7\xa4\xec\x9a\xb0 \xec\x9c\xa0\xec\x9a\xa9\xed\x95\x9c \xeb\x8f\x84\xea\xb5\xac \xed\x85\x8d\xec\x8a\xa4\xed\x8a\xb8\xeb\xa5\xbc \xec\xa1\xb0\xec\x9e\x91\xed\x95\x98\xeb\x8a\x94 \xea\xb2\x83\xec\x9e\x85\xeb\x8b\x88\xeb\x8b\xa4. \npuc: \xe3\x80\x82\xef\xbc\x9f\xef\xbc\x81\xe3\x80\x81\xef\xbc\x8c\xef\xbc\x9b\xef\xbc\x9a\xe2\x80\x9c \xe2\x80\x9d\xe2\x80\x98 '\xe2\x80\x94\xe2\x80\x94\xe2\x80\xa6\xe2\x80\xa6\xc2\xb7\xef\xbc\x8d\xc2\xb7\xe3\x80\x8a\xe3\x80\x8b\xe3\x80\x88\xe3\x80\x89\xef\xbc\x81\xef\xbf\xa5\xef\xbc\x85\xef\xbc\x86\xef\xbc\x8a\xef\xbc\x83 \n"

 --------

 非ansi字符

 --------

 <_sre.SRE_Match object at 0x01A6C330>

 中文

 --------

 原始unicode字符

 --------

 u"\nen: Regular expression is a powerful tool for manipulating text. \nzh: \u4e2d\u6587 \njp: \u6b63\u898f\u8868\u73fe\u306f\u975e\u5e38\u306b\u5f79\u306b\u7acb\u3064\u30c4\u30fc\u30eb\u30c6\u30ad\u30b9\u30c8\u3092\u64cd\u4f5c\u3059\u308b\u3053\u3068\u3067\u3059\u3002 \njp-char: \u3042\u30a2\u3044\u30a4\u3046\u30a6\u3048\u30a8\u304a\u30aa \nkr:\uc815\uaddc \ud45c\ud604\uc2dd\uc740 \ub9e4\uc6b0 \uc720\uc6a9\ud55c \ub3c4\uad6c \ud14d\uc2a4\ud2b8\ub97c \uc870\uc791\ud558\ub294 \uac83\uc785\ub2c8\ub2e4. \npuc: \u3002\uff1f\uff01\u3001\uff0c\uff1b\uff1a\u201c \u201d\u2018 '\u2014\u2014\u2026\u2026\xb7\uff0d\xb7\u300a\u300b\u3008\u3009\uff01\uffe5\uff05\uff06\uff0a\uff03 \n"

 --------

 unicode 中文

 --------

 <_sre.SRE_Match object at 0x014F68A8>

 中文

 --------

 unicode 韩文

 --------

 <_sre.SRE_Match object at 0x01A6C330>

 정규

 --------

 unicode 日文 片假名

 --------

 <_sre.SRE_Match object at 0x014F68A8>

 ツールテキスト

 --------

 unicode 日文 平假名

 --------

 <_sre.SRE_Match object at 0x01A6C330>

 は

 --------

 unicode 标点符号

 --------

 <_sre.SRE_Match object at 0x014F68A8>

 。

 --------

python 正则表达式匹配中文(转)的更多相关文章

Python从文件中读取字符串，用正则表达式匹配中文字符的问题
2013-07-27 21:01:37| 在Windows下,用Python从.txt文件中读取字符串,并用正则表达式匹配中文,在网上看了方法,用的时候发现中文没有被匹配. ...
[转载]Python正则表达式匹配反斜杠'\'问题
转载自csdnblog:Python正则表达式匹配反斜杠'\'问题在学习Python正则式的过程中,有一个问题一直困扰我,如何去匹配一个反斜杠(即“\”)? 一.引入在学习了Python特殊字符和 ...
Python: 正则表达式匹配反斜杠 "\"
Python正则表达式匹配反斜杠 "\" eg: >>>a='w\w\w' 'w\\w\\w' # 打印出来的 "\\" 被转义成一个反斜 ...
PHP 正则表达式匹配中文字符
例如在 MySQL 的 bin-log 文件中选取特定的数据库语句来恢复数据时,只要选出某个库的 INSERT INTO 操作(去掉了多余信息,只列出 SQL 语句) INSERT INTO `crm ...
sublimetext 使用正则表达式匹配中文
[\x{4e00}-\x{9fa5}] ============================================= 参考资料 1.在javascript下正确的\x4e00-\x9fa ...
python正则匹配——中文字符的匹配
# -*- coding:utf-8 -*- import re '''python 3.5版本正则匹配中文,固定形式:\u4E00-\u9FA5 ''' words = 'study in 山海大 ...
Python 正则表达式匹配次数
管道可以匹配多个正则表达式中的一个 >>> >>> m=re.search(r'Batman|Tina Fey','Batman and Tina Fey')> ...
python 正则表达式匹配IP地址
一.实验环境 1.Windows7x64_SP1 2.anaconda2.5.0 + python2.7(anaconda集成,不需单独安装) 3.pyinstaller3.0 二.实验目的从tex ...
python 正则匹配中文(unicode)(转)
由于需求原因,需要匹配提取中文,大量google下,并没有我需要的.花了一个小时大概测试,此utf8中文通过,特留文. 参考: http://hi.baidu.com/nivrrex/blo ...

随机推荐

SPOJ AMR11E Distinct Primes 基础数论
Arithmancy is Draco Malfoy's favorite subject, but what spoils it for him is that Hermione Granger i ...
LightOJ 1375 - LCM Extreme 莫比乌斯反演或欧拉扩展
题意:给出n [1,3*1e6] 求并模2^64. 思路:先手写出算式观察发现可以化成那么关键在于如何求得i为1~n的lcm(i,n)之和.可以知道lcm(a,b)为ab/gcd(a,b) 变换 ...
基于html5的动画库，非svg和canvas
基于html5的动画库,非svg和canvas https://greensock.com/docs/#/HTML5/GSAP/TweenLite/
Item 30 用enum代替int常量类型枚举，string常量类型枚举
1.用枚举类型替代int枚举类型和string枚举类型 public class Show { // Int枚举类型 // public static final int APPLE_FUJI ...
【poj1830-开关问题】高斯消元求解异或方程组
第一道高斯消元题目~ 题目:有N个相同的开关,每个开关都与某些开关有着联系,每当你打开或者关闭某个开关的时候,其他的与此开关相关联的开关也会相应地发生变化,即这些相联系的开关的状态如果原来为开就变为关 ...
如何设计一个优雅健壮的Android WebView？（下）
转:如何设计一个优雅健壮的Android WebView?(下) 前言在上文<如何设计一个优雅健壮的Android WebView?(上)>中,笔者分析了国内WebView的现状,以及在 ...
Android通知栏介绍与适配总结
由于历史原因,Android在发布之初对通知栏Notification的设计相当简单,而如今面对各式各样的通知栏玩法,谷歌也不得不对其进行更新迭代调整,增加新功能的同时,也在不断地改变样式,试图迎合更 ...
多线程---iOS-Apple苹果官方文档翻译
本系列所有开发文档翻译链接地址:iOS7开发-Apple苹果iPhone开发Xcode官方文档翻译PDF下载地址(2013年12月29日更新版) 多线程技术博客http://www.cnblo ...
POJ 2431 Expedition （优先队列+贪心）
题目链接 Description A group of cows grabbed a truck and ventured on an expedition deep into the jungle. ...
bzoj 3028 母函数
首先我们可以求出来所有食物的母函数: 汉堡:f(x)=1/(1-x^2). 可乐:f(x)=1+x. 鸡腿:f(x)=1+x+x^2. 蜜桃多:f(x)=x/(1-x^2). 鸡块:f(x)=1/(1 ...

python 正则表达式匹配中文(转)

python 正则表达式匹配中文(转)的更多相关文章

随机推荐

热门专题