mport re

'''
# re 模块
regex 正则表达式,正则表达式应用范围:1爬虫;2自动化运维--开发自动化;
# 什么是正则表达式:一套规则: 匹配字符串的规则
# 能做什么 1 检测一个输入的字符串是否合法用户输入内容的时候,要提前做检测 2 从一个大文件中找到索引符合规则的内容
re模块和正则表达式的关系;有了re模块就可以在python 语言中操作正则表达式了
# 字符组 []
[abc] 匹配a,b,c 任意一个字符; [0-9] 匹配0-8 任意一个字符; [a-z] [A-Z][a-zA-z]
[0-9a-z] 数字和字母任意一个字符[0-9][0-9]表示两位数
'''
''''
*****************************一下是重点;正则表达式
元字符:
[0-9]---> \d 表示任意一个数字
[0-9a-zA-Z_] ----> \w 表示数字字母和下划线
#空格 (空格\tab\enter) --->\s
tab --->\t
enter----> \n
空格--->空格
#\W非数字,字母下划线
#\D 非数字
#\S 非空格,TAB enter
#[\d\D] 匹配所有字符
#. 除了换行符外所有字符
#[^\d] 匹配所有非数字
# ^ 匹配一个字符开始 只能从a 开始的
# $ 匹配一个字符结束
#^ 和$把正则表达式写死必须一一匹配
# a表达式|b 表达式 或 ab|cd 把长的部分放在前边
# \ 取消点的特殊意义
# . ^. .$ 举例: 海.----》匹配所有海.所有字符; ^海. -----> 匹配以海为开头的海.的字符; 海.$--> 以海.结尾的字符
# *+?{}综合应用
正则 待匹配对象 匹配结果 说明
李.? 李杰和李莲英和李二棍子李 【李杰,李莲,李二,李】 只匹配李后边一个任意字符
李.* 李杰和李莲英和李二棍子李 [李杰和李莲英和李二棍子,李] 匹配李后边0个或任意多个字符
李.+ 李杰和李莲英和李二棍子李 [李杰和李莲英和李二棍子】 只匹配李后边一个或者多个任意字符
李.{1,2}李杰和李莲英和李二棍子李 [李杰和,李莲英,李二棍] 只匹配李后边一个或二个任意字符
总结: *,+,,? 都属于贪婪匹配,但是,则匹配加?属于惰性匹配
# 字符集 [] [^]
[^] 非的意思,
# 分组() 与或 | [^]
分组 () 约束|描述的内容的范围问题
www\.(oldboy|baidu|jd|taobao)\.com
# 转义符 \ z加\取消特殊意义; r'' 在字符串前加r,让整个字符串不转义
# 贪婪匹配 和不贪婪匹配
# 几个常用的非贪婪匹配:
# *?重复任意次,但尽可能少重复;
# +? 重复1次或更多次,但尽可能少重复
# ??重复0次,或1次,但尽可能少重复
# {n,m}? 重复n到m次,但尽可能少重复
#{n,}? 重复n次以上,但尽可能少重复
# 量词
# {n}次 匹配N次
# {n,} 匹配N次,大于N次
#{n,m} 最少N次,最多M次
# ? 0次,或者1次
# + 1次,或者多次
# * 0次,或者多次
应用实例:
#整数或者小数: \d+(\.\d+)?
#手机号: [1][3-9]\d{9}
#判断用户输入的内容是否合法,如果合法就能查询到结果,如果输入不对就查不到结果
^[1][3-9]\d{9}$
#从一个大文件中找到所有符合规则的内容?
^[1][3-9]\d{9}$
'''
'''
# 贪婪匹配
在量词范围允许的情况尽量多进行匹配;
#惰性匹配 贪婪算法之后 回溯算法
#惰性匹配
在量词后边加? 元字符 量词?
# .*?x 表示匹配任意字符,任意多次苏,但是一旦遇到X就停下来
# .*x 表示匹配任意字符,任意多次,遇到最后一个X才停下来

转义字符:\. \\n \( 原本有特殊意义的字符,到了表达它本身的意义的时候,需要转义
# 原本有特殊意义的内容,放在字符组总,会取消他的特殊意义;
[ ().*+?] 所有的内容在字符中会取消它的特殊意义
[\] 在内容有字符特意义

#[(]
^([1-9]\d{16}[0-9x]|[1-9]\d{14})$ 18位身份证,15位身份证
^[1-9]\d{14}(\d{2}[\dx])?$
'''
import re
'''
findall 总是完整的正则进行匹配,显示括号里匹配的内容,获取的一个列表,返回所有的结果。获取所有符合条件的,优先显示分组中的
seearch 获取是一个变量,返回第一个,.group()的结果和group(0)的一致,还是按照完整的正则进行匹配,显示也显示匹配的一个内容,但是我们可以通过给group 方法传参数
#如果我们要查找的内容在一个复杂的环境中,且没有一个突出的与众的不同的特点,甚至会和不需要的杂乱数混合在一起,
#这时候我们就需要把所有的数据统计出来,然后对这个数据进行筛选,把我们真正需要的数据对用正则表达式()
#1 什么是爬虫
'''
import re
#举例说明:
ret=re.findall('a','eva egon yuan')
print(ret) # 返回所有的a
ret=re.search('a','eva egon yuan')
print(ret.group(0))
# 函数会在字符串内查找模式匹配,只到找到第一个匹配然后返回一个包含匹配信息的对象,该对象可以
# 通过调用group()方法得到匹配的字符串,如果字符串没有匹配,则返回None
# # split 分离
# ret= re.split('\d','alex333wusir')
# ret1=re.split('\d(\d)\d','alex333wusir')
# print(ret)
# print(ret1)
#
# sub 替换
# ret=re.ret('\d+,''H','alex333wusir',1) # 替换一次

# compile作用: 针对多次使用的正则表达式,需要多次解析时,可以使用compile先行解析
# ret=re.compile('\d+')
# res=ret.search('alex37176')
#finditer :生成一个迭代器,利用迭代器进行循环取值
# subn 替换一次
#match 以什么为开头的字符 ,以group 取值,作业在用户输入的内容的时候,用来规定字符串
# seach 用来寻找这个字符串中是不是含有满足条件的内容
# 时间 数据量大,优先考虑列表; 列表不能用insert ,列表不能用pop()
# 空间 功能,性能,(时间: 行数,底层执行;空间) ,用户体验
# 分组命名() (?P<name> 对分组起名
# 分组命名的引用 在匹配开始和结束一直的字符串匹配是,后者对前者命名的进行应用
# 在python 使用正则表达式,要加r

python 学习之-----正则表达式的更多相关文章

  1. [Python学习笔记]正则表达式总结

    常用缩写字符及其含义表格查询 缩写字符分类 含义 \d 0-9的任意数字 \D 除0-9的数字以外的任何字符 \w 任何字母.数字或下划线字符(可以认为是匹配"单词"字符) \W ...

  2. Python学习 之 正则表达式

    1.简单的正则表达式 import re s=r'abc' re.findall(s,"aaaaaaaaaaaaaaa") #结果为[] re.findall(s,"ab ...

  3. Python学习笔记——正则表达式入门

    # 本文对正则知识不做详细解释,仅作入门级的正则知识目录. 正则表达式的强大早有耳闻,大一时参加一次选拔考试,题目就是用做个HTML解析器,正则的优势表现得淋漓尽致.题外话不多讲,直接上干货: 1. ...

  4. Python学习--16 正则表达式

    正则表达式是一种描述性的语言,用来匹配字符串.凡是符合规则的字符串,我们认为就是匹配了. 正则表达式并非Python独有的,它与语言无关.很多语言都支持正则表达式. 我们经常用正则表达式来匹配电子邮件 ...

  5. python学习日记(正则表达式)

    定义 正则表达式是一个特殊的字符序列,它能帮助你方便的检查一个字符串是否与某种模式匹配. Python 自1.5版本起增加了re 模块,它提供 Perl 风格的正则表达式模式. re 模块使 Pyth ...

  6. python学习笔记----正则表达式

    正则: regular expression 常用的场景: #正则的包 >>> import re #match:开头匹配,匹配到,返回一个匹配对象,否则返回None >> ...

  7. python学习笔记——正则表达式regex

    1 概述 1.1 定义 本质是由一系列字符和特殊符号组成的字串,用来表示一定规则的某一类字符串. 1.2 特点 正则表达式是一个独立的技术,其在多种编程语言中使用. 在python语言中的正则表达式模 ...

  8. Python学习 :正则表达式

    正则表达式 python 使用正则表达式(re)来进行匹配引擎搜索 正则表达式是对字符串操作的一种逻辑公式,就是用事先定义好的一些特定字符.及这些特定字符的组合,组成一个“规则字符串” 关于正则表达式 ...

  9. python 学习总结----正则表达式

    正则表达式 应用场景 - 特定规律字符串的查找,切割,替换 - 邮箱格式:URl,IP地址等的校验 - 爬虫项目中,特定内容的提取 使用原则 - 只要使用字符串等函数能解决的问题,就不要使用正则 - ...

  10. python学习-53 正则表达式

    正则表达式 就其本质而言,正则表达式是一种小型的/高度专业化的编程语言,它内嵌在python中,并通过RE模块实现,正则表达式模式被编译成一系列的字节码,然后由用C编写的匹配引擎执行. 1.元字符 - ...

随机推荐

  1. CF309E 题解

    11:30,过题.12:50,忘记做法. 吃饭时不该看未来日记的,Ynoj 害人不浅(确信). 以上为个人吐槽. 题目大意 不知道题目翻译是个啥...但讨论区有大佬给出了精确的翻译.我改得符合题目背景 ...

  2. 细节讲解并实操下: 去中心化社交协议 ---- Nostr

    作者:林冠宏 / 指尖下的幽灵.转载者,请: 务必标明出处. GitHub : https://github.com/af913337456/ 出版的书籍: <1.0-区块链DApp开发实战&g ...

  3. react中自定义函数、生命周期钩子函数、修改状态、组件、组件传值

    1.回顾 2.自定义函数 事件的首字母大小 onclick ==> onClick onchange ==> onChange 普通的点击事件 ---- 调用事件不加(),加了立即执行 i ...

  4. Etherscan本地多文件开源(VScode)

    项目创建 创建文件夹  mkdir Duckereum ​ cdDuckereum 添加nodejs配置  npm init -y 安装依赖添加  npm install -D hardhat npm ...

  5. Python常见部分内置方法与操作

    Python常见内置方法与操作 整型int 类型转换 int(其它数据类型),但只支持数字类型和小数类型 >>> num1 = input('Your age>>> ...

  6. [JAVA/Maven/IDEA]解决JAR包冲突

    1 前言 想必这个问题,诸多同仁都遇到过. 很不凑巧,这段时间咱也屡次撞上这问题好几次了. 因此,实在是有必要说说怎么解决好这问题了0.0 2 诊断:包冲突的异常信息特征 [类定义未发现错误] NoC ...

  7. 解决CKEditor中img标签自动添加style样式的问题-禁止自动设置width和height 帝国cms编辑器图片自动加宽高

    在使用CKEditor的过程中发现,每次上传或添加图片的时候,总会自动给img标签添加width和height的style内联样式.由于网站本身对图片有进行自适应处理(添加了自适应的CSS),所以im ...

  8. 组织树查询-Jvava实现(递归)

    1.首先查询出组织机构 就是一个简单的查询 List<Dept> deptList = mapper.getDeptList(); Map<Long, OrgNode> nod ...

  9. include-file

    0X01 前言 这篇文章介绍文件包含漏洞. 0X02 最常见的两个函数的形象解释: 我们知道文件包含最常见的是两个函数 include() require()(这里就不谈他们的亲戚 include_o ...

  10. CVE-2015-5254漏洞复现

    1.漏洞介绍. Apache ActiveMQ 是美国阿帕奇(Apache)软件基金会所研发的一套开源的消息中间件,它支持 Java 消息服务,集群,Spring Framework 等.Apache ...