第11.17节 Python 正则表达式扩展功能:命名组功能及组的反向引用
一、 引言
在《第11.16节 Python正则元字符“()”(小括号)与组(group)匹配模式》介绍了组匹配模式,在一个正则表达式内可以定义多个组,每个组都有一个顺序分配的序号,并且在代表匹配结果的匹配对象中能通过组序号去访问每个组的匹配结果。除了这种组序号访问方式之外,re模块还支持在匹配模式串中给组命名,并通过组名去访问组相关匹配数据,这就是正则表达式处理的命名组功能。
二、 语法
组命名的语法是在组匹配模式基础上扩展的,是在组的括号起始部分增加“?P<组名>”,这样组的定义语法为:
(?P<组名>组匹配模式串)
其中:
- ?:表示组匹配模式的扩展模式;
- P:组名扩展标示,表示后面为组名,注意P必须是大写字母,小写字母不被re模块作为组名扩展标示;
- <>:表示里面的内容为组名;
- 组名:必须是有效的Python标识符,并且每个组合名在一个正则表达式内只能定义一次,即在同一个正则表达式内组名不能重复。
例子:
>>> pattern='<h1 class="name">(?P<name>.*)</h1><h1 class="age">(?P<age>[0-9]{1,3})</h1>'
上面例子中定义了2个组名,分别为name和age,name为任意字,age必须为1-3位数字。
三、 组名的反向引用
定义组名肯定是为了使用组名,组名可以在多个地方使用,其中一个就是在正则表达式内被引用,这样引用的内容,表示匹配时,在定义和引用的地方都要出现相同的匹配字符串,这个功能称为组名的反向引用。其语法如下:
(?P=<组名>)
注意:
1、组名必须在引用前定义;
2、比定义在P和<组名>之间多了一个等号;
3、<组名>后没有其他子串。
组名的反向引用这个功能在XML标记语言解析是很有用,如:
<span class="read-count">阅读数: 410</span>
在这种XML标记语言的标签语句中,同一个标签包含开始标签和结束标签,其名字相同,只是结束标签多了反斜杠。此时要解析标签可以使用如下语句来确保匹配到开始标签和结束标签是同一个。可以使用如下方式解析:
>>> m=re.search(r'<(?P<label>[a-z]*)(.*)</(?P=label)>', '<span class="read-count">阅读数:410</span>')
>>> m
<re.Match object; span=(0, 39), match='<span class="read-count">阅读数:410</span>'>
>>> m.groupdict()
{'label': 'span'}
>>> m.groups()
('span', ' class="read-count">阅读数:410')
>>>
如果搜索文本中的结束标签不是“</span>”,则上述正则表达式与搜索文本无法匹配。
上述组名的反向引用,也可以通过组序号实现同样的功能,就是在引用的地方直接使用:
(\组序号)
或
\组序号
>>> m=re.search(r'<(?P<label>[a-z]*)(.*)</(\1)>', '<span class="read-count">阅读数:410</span>')
>>> m
<re.Match object; span=(0, 39), match='<span class="read-count">阅读数:410</span>'>
>>>
这种方式和组名反向引用的效果是相同的,组名反向引用容易理解也容易记忆,而序号方式的引用则更灵活,可以在前面不用定义组名,所有组都可以通过这种方式引用。如上诉匹配完全可以写成如下:
>>> m=re.search(r'<([a-z]*)(.*)</(\1)>', '<span class="read-count">阅读数:410</span>')
>>> m
<re.Match object; span=(0, 39), match='<span class="read-count">阅读数:410</span>'>
>>>
老猿Python,跟老猿学Python!
博客地址:https://blog.csdn.net/LaoYuanPython
请大家多多支持,点赞、评论和加关注!谢谢!
第11.17节 Python 正则表达式扩展功能:命名组功能及组的反向引用的更多相关文章
- 第11.13节 Python正则表达式的转义符”\”功能介绍
为了支持特殊元字符在特定场景下能表示自身而不会被当成元字符进行匹配出来,可以通过字符集或转义符表示方法来表示,字符集表示方法前面在<第11.4节 Python正则表达式搜索字符集匹配功能及元字符 ...
- 第11.4节 Python正则表达式搜索字符集匹配功能及元字符”[]”介绍
Python正则表达式字符集匹配表示是指搜索一个字符,该字符在给定的一个字符的集合中.元字符'['和']'是用于组合起来定义匹配字符集,匹配模式中使用 '['开头,并使用']'结尾来穷举搜索的字符可能 ...
- 第11.15节 Python正则表达式转义符定义的特殊序列
一. 引言 在前面<第11.13节 Python正则表达式的转义符"\"功能介绍>介绍了正则表达式转义符'\',只不过当时作为转义符主要是用于在正则表达式中表示元字符自 ...
- 第11.25节 Python正则表达式编译re.compile及正则对象使用
一. 引言 在<第11.2节 Python 正则表达式支持函数概览>介绍了re模块的主要函数,在<第11.3节 Python正则表达式搜索支持函数search.match.fullm ...
- 第11.10节 Python正则表达式的非贪婪模式的重复匹配:'*?', '+?',和 '??'
在<第11.9节 Pytho正则表达式的贪婪模式和非贪婪模式>老猿简单介绍了贪婪模式和非贪婪模式,并说明'', '+',和 '?' 修饰符都是 贪婪的:它们在字符串进行尽可能多的匹配.有时 ...
- 第11.9节 Python正则表达式的贪婪模式和非贪婪模式
在使用正则表达式时,匹配算法存在贪婪模式和非贪婪模式两种模式,在<第11.8节 Pytho正则表达式的重复匹配模式及元字符"?". "*". " ...
- 第11.6节 Python正则表达式的字符串开头匹配模式及元字符“^”(插入符、脱字符)功能介绍
符号"^"为插入符,也称为脱字符,在Python中脱字符表示匹配字符串的开头,即字符串的开头满足匹配模式的要求.这个功能有点类似搜索函数match,只是这是通过搜索模式来指定,而m ...
- 第11.5节 Python正则表达式搜索任意字符匹配及元字符“.”(点)功能介绍
在re模块中,任意字符匹配使用"."(点)来表示, 在默认模式下,点匹配除了换行的任意字符.如果指定了搜索标记re.DOTALL ,它将匹配包括换行符的任意字符.关于搜索标记的含义 ...
- 第11.7节 Python正则表达式的字符串结尾匹配模式及元字符“$”功能介绍
符号"$"表示匹配字符串的结尾,即字符串的结尾满足匹配模式的要求. 在 MULTILINE 模式(搜索标记中包含re.MULTILINE,关于搜索标记的含义请见<第11.2节 ...
随机推荐
- 第05组 Alpha冲刺 (2/6)(组长)
.th1 { font-family: 黑体; font-size: 25px; color: rgba(0, 0, 255, 1) } #ka { margin-top: 50px } .aaa11 ...
- 【xingorg1-ui】基于vue3.0从0-1搭建组件库(一)环境配置与目录规划
npm地址 github源码 开篇-环境配置 环境配置: 使用vue-cli搭建项目框架,需要用vue3的话,得先把vue-cli的版本升级到vue-cli@5以上 npm install -g @v ...
- 性能问题eg
线上问题 ./pidstat -w Linux 3.6.5-Broadcom Linux ((none)) 03/21/20 _armv7l_ (1 CPU) 15:04:17 UID PID csw ...
- tcpack--3快速确认模式
接收到数据报后,会调用tcp_event_data_recv(),不管是在慢速路径的tcp_data_queue中调用还是 在快速路径中处理接收数据后直接调用,注意(如果len <= tcp_h ...
- 第二章epoll
epoll_create:函数实现分析 /* * Open an eventpoll file descriptor. */ SYSCALL_DEFINE1(epoll_create1, int, f ...
- linux 会话 进程组 守护进程
Linux 下每个进程都会有一个非负整数表示的唯一进程 ID ,简称 pid . Linux 提供了 getpid 函数来获取 进程的 pid ,同时还提供了 getppid 函数来获取父进程的 pi ...
- 分布式监控系统之Zabbix基础
1.为什么要使用监控系统? 我们知道一个系统不管怎么讲它都会出故障,我们为了保证线上业务的最大化的可用性,通常我们要给关键业务做高可用:做高可用的目的是为了让故障发生时,能够有一个备用的解决方案,将故 ...
- 【SpringCloud】consul注册中心注册的服务为内网(局域网)IP
一.前因 最近在做公司的一个微服务项目,技术架构为spring cloud + consul + SSM. 当我写完一个功能要在本地测试时,发现服务运行成功,但是前后端联调报500错误. 当时的第一个 ...
- 为什么Redis是单线程?
转载链接:https://cloud.tencent.com/developer/article/1120615 1)以前一直有个误区,以为:高性能服务器 一定是多线程来实现的 原因很简单因为误区二导 ...
- SpringCloud Alibaba+New搭建企业级开发框架(三):创建New工程
1.创建父工程:File > New > Project...,选择Maven,Create from archetype不要勾选,点击Next进入下一步,填写工程信息. image. ...