shell awk处理过滤100万条数据

背景：

100万条数据。格式如下：

ID 地址

1895756546931805 安徽省六安市裕安区固镇镇佛俺村柳树队
5758 安徽省蒙城县岳坊镇胡寨村小组小胡寨庄6号

1834941674099699 安徽省蚌埠市五河县申集镇朱圩村
1850212719717844 安徽省淮北市
1850212774979300 安徽省合肥市
1850212784889487 安徽省宿州市泗县

目标要求：

筛选出地址不太准确的。地址长度大于11个字符的。

保留前面ID。将结果输出到一个文件中。

操作过程：

#第一步过滤 地址以各个省份开头的

awk  '$2 ~ /^北京/{print $0}' originfile >> mid1

awk  '$2 ~ /^天津/{print $0}' originfile >> mid1

awk  '$2 ~ /^上海/{print $0}' originfile >> mid1

awk  '$2 ~ /^重庆/{print $0}' originfile >> mid1

awk  '$2 ~ /^安徽/{print $0}' originfile >> mid1

awk  '$2 ~ /^河北/{print $0}' originfile >> mid1

awk  '$2 ~ /^山西/{print $0}' originfile >> mid1

awk  '$2 ~ /^内蒙/{print $0}' originfile >> mid1

awk  '$2 ~ /^辽宁/{print $0}' originfile >> mid1

awk  '$2 ~ /^吉林/{print $0}' originfile >> mid1

awk  '$2 ~ /^黑龙/{print $0}' originfile >> mid1

awk  '$2 ~ /^浙江/{print $0}' originfile >> mid1

awk  '$2 ~ /^江苏/{print $0}' originfile >> mid1

awk  '$2 ~ /^广东/{print $0}' originfile >> mid1

awk  '$2 ~ /^福建/{print $0}' originfile >> mid1

awk  '$2 ~ /^江西/{print $0}' originfile >> mid1

awk  '$2 ~ /^湖南/{print $0}' originfile >> mid1

awk  '$2 ~ /^海南/{print $0}' originfile >> mid1

awk  '$2 ~ /^河南/{print $0}' originfile >> mid1

awk  '$2 ~ /^湖北/{print $0}' originfile >> mid1

awk  '$2 ~ /^山东/{print $0}' originfile >> mid1

awk  '$2 ~ /^甘肃/{print $0}' originfile >> mid1

awk  '$2 ~ /^青海/{print $0}' originfile >> mid1

awk  '$2 ~ /^贵州/{print $0}' originfile >> mid1

awk  '$2 ~ /^四川/{print $0}' originfile >> mid1

awk  '$2 ~ /^云南/{print $0}' originfile >> mid1

awk  '$2 ~ /^陕西/{print $0}' originfile >> mid1

awk  '$2 ~ /^广西/{print $0}' originfile >> mid1

awk  '$2 ~ /^宁夏/{print $0}' originfile >> mid1

awk  '$2 ~ /^新疆/{print $0}' originfile >> mid1

awk  '$2 ~ /^台湾/{print $0}' originfile >> mid1

awk  '$2 ~ /^香港/{print $0}' originfile >> mid1

awk  '$2 ~ /^澳门/{print $0}' originfile >> mid1

awk  '$2 ~ /^西藏/{print $0}' originfile >> mid1

#第二步 将第二列的字符创长度超过11的筛选出来存入final文件

awk '{if(length($2)>11) print $0}' mid1 >> final

shell awk处理过滤100万条数据的更多相关文章

极限挑战—C#+ODP 100万条数据导入Oracle数据库仅用不到1秒
链接地址:http://www.cnblogs.com/armyfai/p/4646213.html 要:在这里我们将看到的是C#中利用ODP实现在Oracle数据库中瞬间导入百万级数据,这对快速批量 ...
极限挑战—C#100万条数据导入SQL SERVER数据库仅用4秒 (附源码)
原文:极限挑战-C#100万条数据导入SQL SERVER数据库仅用4秒 (附源码) 实际工作中有时候需要把大量数据导入数据库,然后用于各种程序计算,本实验将使用5中方法完成这个过程,并详细记录各种方 ...
Qt中提高sqlite的读写速度（使用事务一次性写入100万条数据）
SQLite数据库本质上来讲就是一个磁盘上的文件,所以一切的数据库操作其实都会转化为对文件的操作,而频繁的文件操作将会是一个很好时的过程,会极大地影响数据库存取的速度.例如:向数据库中插入100万条数 ...
C#100万条数据导入SQL SERVER数据库仅用4秒 (附源码)
作者: Aicken(李鸣) 来源: 博客园发布时间: 2010-09-08 15:00 阅读: 4520 次推荐: 0 原文链接 [收藏] 摘要: ...
教你如何6秒钟往MySQL插入100万条数据!然后删库跑路！
教你如何6秒钟往MySQL插入100万条数据!然后删库跑路! 由于我用的mysql 8版本,所以增加了Timezone,然后就可以了前提是要自己建好库和表. 数据库test, 表user, 三个字段 ...
2020-04-23：假设一个订单的编号规则是AAAAOrder2020-0000001，AAAAOrder2020-0000002....后面的数字是自增长，如果订单号码达到AAAAOrder2020-1000000(100万)，数据库中应该有100万条数据，此时我随机删除2条数据（物理删除，且不考虑日志和备份），请问怎么找到删掉的数据的编号？给出解题思路即可，答案需要在1秒内运行得到。
福哥答案2020-04-23: 分批查询:分成500次count(),每次count()肯定小于等于2000条数据,经过测试,一次count()在.1ms左右,500次就是500ms.二分法(时间微超 ...
PHP实现插入100万条数据优化
第一种方法一条一条执行插入,结果会很慢 <?php header("Content-Type:text/html;charset=utf-8"); date_default_ ...
[C#]_[使用微软OpenXmlSDK (OpenXmlReader)读取xlsx表格] 读取大数据量100万条数据Excel文件解决方案
1.OpenXmlSDK是个很好的类库,可惜只能通过C#调用,C#的童鞋又福气了. 2.服务端程序由于没法安装office,所以这个对asp.net网站来说是最理想的库了.需要.net 4.0版本 ...
Oracle中插入100万条数据
在做项目的工程中,需要数据库中存在大量的数据进行程序的验证,但是我们又没有数据,这时就需要我们自己手动建一个表,插入大量数据,进行验证. 那么插入大量数据的sql语句如下: insert into E ...

随机推荐

MAC vim安装gruvbox主题
gruvbox是一款优秀的vim配色方案,但是却不是vim自带的配色方案,这里记录一下安装过程. gruvbox官网:https://github.com/morhetz/gruvbox gruvbo ...
基于maven来Spring MVC的环境搭建遇到“坑”
1.注解配置路径问题: 在web.xml中配置spring mvc 路径时, 应该配置如下:classpath:classpath:spring-* 2.jdk版本和Spring MVC版本不一致问题 ...
mysql,Can 't connect to local MySQL server through socket '/tmp/mysql.sock '(2) "
# mysql -uroot -pEnter password:ERROR 2002 (HY000): Can't connect to local MySQL server through sock ...
Linux内核d_path函数应用的经验总结
问题背景一个内核模块中,需要通过d_path接口获取文件的路径,然后与目标文件白名单做匹配. 在生产环境中,获取的文件是存在的,但是与文件白名单中的文件总是匹配失败. 问题定位: 通过打印d_pat ...
LR基本知识学习
性能测试基础本质:基于协议模拟用户发请求,对服务器形成一定的负载,来测试服务器的性能指标是否满足要求,与界面无关 * 时间 * 空间分类: 性能(狭义):特定条件下,验证系统是否有宣称具有 ...
Unix/Linux系统的发展史
Unix/Linux系统相信是学编程的人都认识这两个系统.我们知道Unix要钱,而Linux免费,而且这两者之间的发展史是什么样的,是不是两者就是同一个东西呢? 我将会以时间的发展过程来一步步的给大家 ...
[转]使用screw plus来保护php代码安全
原文链接 https://www.jianshu.com/p/f6425e2f8643 https://github.com/del-xiong/screw-plus http://git.oschi ...
爬取github项目。
import requests from bs4 import BeautifulSoup url = 'https://github.com/login' headers = { 'User-Age ...
自己电脑组一个Wifi热点
① 在cmd窗口 ssid 是wifi名称.key是密码 netsh wlan set hostednetwork mode=allow ssid=yb key=15564130 ② ③ 运行脚本新 ...
搭建zookeeper和Kafka集群
搭建zookeeper和Kafka集群: 本实验拥有3个节点,均为CentOS 7系统,分别对应IP为10.211.55.11.10.211.55.13.10.211.55.14,且均有相同用户名 ( ...

shell awk处理过滤100万条数据

shell awk处理过滤100万条数据的更多相关文章

随机推荐

热门专题