python 正则表达式与JSON-正则表达式匹配数字、非数字、字符、非字符、贪婪模式、非贪婪模式、匹配次数指定等
1、正则表达式:目的是为了爬虫,是爬虫利器。
正则表达式是用来做字符串匹配的,比如检测是不是电话、是不是email、是不是ip地址之类的
2、JSON:外部数据交流的主流格式。
3、正则表达式的使用
re python 内置的模块,可以进行正则匹配
re.findall(pattern,source)
pattern:正则匹配规则-也叫郑泽表达式
source:需要查找的目标源
import re
a = "C0C++7Java8C#Python6JavaScript"
res = re.findall("Java",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['Java', 'Java']
4、正则表达式的应用
- 查数字
用概括字符集:\d
import re
a = "C0C++7Java8C#Python6JavaScript"
res = re.findall("\d",a)
print res
# Project/python_ToolCodes/test10.py"
# ['0', '7', '8', '6']用另外一种匹配模式-字符集:[0-9]
import re
a = "C0C++7Java8C#Python6JavaScript"
res = re.findall("[0-9]",a)
print res
# Project/python_ToolCodes/test10.py"
# ['0', '7', '8', '6']其中"Java"叫普通字符,"/d" 源字符
- 查非数字
用概括字符集:\D
import re
a = "C0C++7Java8C#Python6JavaScript"
res = re.findall("\D",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['C', 'C', '+', '+', 'J', 'a', 'v', 'a', 'C', '#', 'P', 'y', 't', 'h', 'o', 'n', 'J', 'a', 'v', 'a', 'S', 'c', 'r', 'i', 'p', 't']用另外一种匹配模式-字符集:[^0-9]
import re
a = "C0C++7Java8C#Python6JavaScript"
res = re.findall("[^0-9]",a)
print res
# Project/python_ToolCodes/test10.py"
# ['C', 'C', '+', '+', 'J', 'a', 'v', 'a', 'C', '#', 'P', 'y', 't', 'h', 'o', 'n', 'J', 'a', 'v', 'a', 'S', 'c', 'r', 'i', 'p', 't']- 正则表达式的罗列 :https://baike.baidu.com/item/正则表达式/1700215?fr=aladdin,挨个练习是没有必要的,用到去查即可
4、匹配模式
- 源字符+普通字符混合模式
[]中的或操作
#coding=utf-8
import re
a = "abc,acc,adc,aec,afc,ahc"
#匹配acc和afc
res = re.findall("a[cf]c",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['acc', 'afc']
取反操作:^
#coding=utf-8
import re
a = "abc,acc,adc,aec,afc,ahc"
#取出非(acc和afc)的字符
res = re.findall("a[^cf]c",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['abc', 'adc', 'aec', 'ahc']
取范围操作:-
#coding=utf-8
import re
a = "abc,acc,adc,aec,afc,ahc"
#取出acc,adc,aec,afc(中间字符是c到f范围的)
res = re.findall("a[c-f]c",a)
print res
- 匹配数字和字母:
概括字符集匹配:\w
import re
a = "abc&cba"
res = re.findall("\w",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['a', 'b', 'c', 'c', 'b', 'a']使用字符集匹配:[A-Za-Z0-9]
import re
a = "abc123&cba321"
res = re.findall("[A-Za-z0-9]",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['a', 'b', 'c', '1', '2', '3', 'c', 'b', 'a', '3', '2', '1']显然,是\w是不匹配非字母和数字的,比如“&”符号
- 匹配非单词非数字字符
概括字符集:\W
import re
a = "abc123&cba321"
res = re.findall("\W",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['&']使用字符集匹配:^A-Za-z0-9
import re
a = "abc123&cba321"
res = re.findall("[^A-Za-z0-9]",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['&'] - 空格、制表符、换行符号之类的匹配:\s
import re
a = "python 111\tjava&67p\nh\rp"
res = re.findall("\s",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# [' ', '\t', '\n', '\r']- 匹配量词:匹配出python Java php
必须三个一组:
[a-z]{3}
import re
a = "python 1111java678php"
res = re.findall("[a-z]{3}",a)
print res
[Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
['pyt', 'hon', 'jav', 'php'] 可以3-6个一组:因为最长python 为6 最短PHP为3:[a-z]{3,6}
import re
a = "python 1111java678php"
res = re.findall("[a-z]{3,6}",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['python', 'java', 'php']疑问:为什么3个能匹配 匹配到pyt的时候为什么不终止?
因为正则表达式的数量词分为贪婪和非贪婪模式,默认情况下,python 认为是贪婪模式的。 非贪婪模式怎么使用:加个问号[a-z]{3,6}?
import re
a = "python 1111java678php"
res = re.findall("[a-z]{3,6}?",a)
print res
# [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['pyt', 'hon', 'jav', 'php']- * ,对*前面的字符'n',匹配0次或者无限次
import re
a = "pytho0python1pythonn2"
res = re.findall("python*",a)
print res # [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['pytho', 'python', 'pythonn']比如pytho 没有n 则是匹配0次,可匹配出来pytho;比如python 1个n 则是匹配1次,可匹配出来python;pythonn 2个n 则是匹配2次,可匹配出来pythonn
- +,对+前面的字符'n' 匹配1次或者无限次
import re
a = "pytho0python1pythonn2"
res = re.findall("python+",a)
print res # [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['python', 'pythonn']- ?,?前面的字符'n' 匹配0次或者1次
import re
a = "pytho0python1pythonn2"
res = re.findall("python?",a)
print res # [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['pytho', 'python', 'python']比如pytho 没有n 则是匹配0次,可匹配出来pytho;比如python 1个n 则是匹配1次,可匹配出来python;pythonn 2个n 则是匹配1次,可匹配出来python,因为多出来的n,直接被截断了,不符合匹配模式,所以匹配不出来pythonn 而是匹配出来的是python。也可以理解成?开启了非贪婪模式
- 如果要开启非贪婪模式,但是又不想用*,+ 去匹配无限次,而是指定匹配次数的范围,那么可以这样
python{1,2}
这表示,最多匹配2次,最少匹配1次
import re
a = "pytho0python1pythonn2"
res = re.findall("python{1,2}",a)
print res # [Running] python -u "/Users/anson/Documents/Project/python_ToolCodes/test10.py"
# ['python', 'pythonn']
python 正则表达式与JSON-正则表达式匹配数字、非数字、字符、非字符、贪婪模式、非贪婪模式、匹配次数指定等的更多相关文章
- Python的正则表达式与JSON
Python的正则表达式需要导入re模块 菜鸟教程:http://www.runoob.com/python/python-reg-expressions.html 官方文档:https://docs ...
- Python(八) 正则表达式与JSON
一.初识正则表达式 正则表达式 是一个特殊的字符序列,一个字符串是否与我们所设定的这样的字符序列,相匹配 快速检索文本.实现替换文本的操作 json(xml) 轻量级 web 数据交换格式 impor ...
- python 正则表达式与JSON字符串
目录 正则表达式 概括单字符集 匹配单字符 匹配字符集 普通字符与元字符 元字符和普通的字符的混用 数量词{整数|*|+|?} 匹配指规则的字母 贪婪模式 匹配指定长度的字符串 非贪婪模式 匹配指定长 ...
- python 正则表达式 贪婪模式的简介和匹配时的几种模式
看到一篇文章,关于python正则的,http://www.cnblogs.com/huxi/archive/2010/07/04/1771073.html 贪婪模式与非贪婪模式: 正则表达式通常用于 ...
- 1.3 正则表达式和Python语言-1.3.5使用 search()在一个字符串中查找模式(搜索与匹配 的对比)
1.3.5 使用 search()在一个字符串中查找模式(搜索与匹配的对比) 其实,想要搜索的模式出现在一个字符串中间部分的概率,远大于出现在字符串起始部分的概率.这也就是 search()派上用场的 ...
- python正则表达式贪婪与非贪婪模式
之前做程序的时候看到过正则表达式的贪婪与非贪婪模式,今天用的时候就想不起来了,现在这里总结一下,以备自己以后用到注意. 1.什么是正则表达式的贪婪与非贪婪匹配 如:String str="a ...
- C# 使用正则表达式去掉字符串中的数字,或者去掉字符串中的非数字
/// 去掉字符串中的数字 public static string RemoveNumber(string key) { ...
- Python3(七) 正则表达式与JSON
一. 初识正则表达式 1.定义:是一个特殊的字符序列,可以帮助检测一个字符串是否与我们所设定的字符序列相匹配. 2.作用:可以实现快速检索文本.实现替换文本的操作. 3.场景: 1.检测一串数字是否是 ...
- [Python] 网络爬虫和正则表达式学习总结
以前在学校做科研都是直接利用网上共享的一些数据,就像我们经常说的dataset.beachmark等等.但是,对于实际的工业需求来说,爬取网络的数据是必须的并且是首要的.最近在国内一家互联网公司实习, ...
随机推荐
- layui弹窗里面 session过期 后跳转到登录页面
1.在登录页面添加 <script> $(function () { if (top != window) { layer.msg("登录失效", {icon: 5}) ...
- P1092 虫食算(洛谷)
今天做了一道题,我之前吹牛的时候曾经说:“这个题我觉得深搜剪枝一下就可以了.”. 我觉得我之前说的没错“这个题深搜剪枝亿下,再加点玄学就可以了!” 题目描述 所谓虫食算,就是原先的算式中有一部分被虫子 ...
- Android调用摄像机拍照(只能拍一张,第二张自动替换)
这两天我玩了玩几天没动的Android,脑子里冒出一个注意,想用Android调用摄像机(偷拍)拍照,然后存下来,在网上百度一下就有很多人说,我也试了试,7.0以下非常轻松就成功了,因为7.0一下不用 ...
- echarts 实战 : 想让图例颜色和元素颜色对应,怎么办?
首先,在 series 里设置颜色. (我是用js生成 echarts 需要的option对象,所以可能很难看懂) normalData.sData.forEach((item, index) =&g ...
- k8s(00)入门知识介绍
系列文章说明 本系列文章,可以基本算是 老男孩2019年王硕的K8S周末班课程 笔记,根据视频来看本笔记最好,否则有些地方会看不明白 需要视频可以联系我 k8s概念入门 目录 系列文章说明 k8s概念 ...
- 设计模式:prototype模式
使用场景:在不能根据类创建对象的时候,根据已有的对象创建对象 不能根据类创建对象的情况: 创建一个类的对象时,需要根据多种对象来创建,创建的过程非常复杂 难以根据类生成对象 例子: class Pro ...
- C++语法小记---少见的语法之一
很少用,列出来,便于理解和熟悉!!! // 1.单独使用位域限定符 ::xxx() //调用全局函数xxx // 2.全局重载new和delete T* tmp = (T*)(::operator n ...
- package.json中dependencies和devDependencies区别
package.json中dependencies和devDependencies区别 dependencies: 应用能够正常运行依赖的包.用户发布环境,依赖的包不仅开发环境能够使用,生产环境也能使 ...
- ubuntu DEBIAN_FRONTEND环境变量用法
DEBIAN_FRONTEND环境变量,告知操作系统应该从哪儿获得用户输入.如果设置为"noninteractive",你就可以直接运行命令,而无需向用户请求输入(所有操作都是非交 ...
- MySQL之外键、联合查询、子查询
外键(foreign key): 外面的键(键不在自己表中),如果一张表中有一个字段(非主键)指向另外一张表的主键,那么将该字段称之为外键. 外键可以在创建表的时候或者创建表之后增加(但是要考虑数据的 ...