awk处理重复行错误分析

[root@localhost ~]#cat 0712

YRSD2-1-11

YRSD2-2-18

YRSD1-1-8

YRSD1-1-18

YRSD1-1-20

YRSD1-1-25

YRSD1-2-38

YRSD1-2-39

YRSD1-2-44

YRSD1-2-48

YRSD1-2-43

YRSD1-3-58

YRSD1-3-59

YRSD1-4-67

YRSD1-4-68

YRSD1-4-70

YRSD1-4-71

YRSD1-3-52

YRSD4-1-5

YRSD3-1-7

YRSD3-1-22

YRSD3-1-28

YRSD3-2-37

YRSD3-2-50

YRSD3-2-53

YRSD3-2-55

YRSD6-1-1

YRSD6-1-5

YRSD6-1-15

YRSD6-2-28

YRSD6-2-32

YRSD6-2-36

YRSD5-1-7

YRSD5-1-22

YRSD5-1-23

YRSD5-1-24

YRSD5-1-25

YRSD5-1-26

YRSD5-2-33

YRSD5-2-37

YRSD5-2-42

YRSD5-2-51

YRSD5-2-54

YRSD5-2-53

YRSD1-1-18

YRSD1-2-38

YRSD1-2-44

YRSD1-2-48

YRSD1-4-67

YRSD1-4-68

YRSD2-1-11

YRSD2-2-18

YRSD3-1-22

YRSD3-1-28

YRSD5-1-22

YRSD5-1-25

YRSD5-2-37

YRSD5-2-42

YRSD5-2-54

YRSD6-1-1

YRSD6-1-15

想将重复的行打印出来，结果搞错了，闲来无聊想想为什么会有这样的结果，算是对awk的加深印象

[root@localhost ~]#awk 'a[$0]++{for(i in a)print i,a[i]}' 0712 | wc -l

810

解析
a[$0]++结果为真时，执行action，所以第一遍不重复的时候，将数组存储
然后每次遇到重复的行，pattern结果为真，执行一次action，一共18个重复行，执行18次，每次结果为45行，共计45*18=810行

顺序对结果也有影响，对计数有影响

[root@localhost ~]#awk '++a[$0]{for(i in a)print i,a[i]}' 0712 | wc -l

1845

解析
因为++a[$0]第一次就有结果了，所以第一次就将a[第一行]打印出来，
第二行时，将第一行、第二行打印出来
第三行时，将第一二三行打印出来
以此类推
不重复行为45行
所以结果为45*（1+45)/2=1035
从第46行开始重复，且每次打印时数组均为45项，即45*18=810
1035+810=1845
over

[root@localhost ~]#awk 'a[$0]++;END{for(i in a)print i,a[i]}' 0712 | wc -l

63

awk只执行pattern对空间的内容没有影响，所以使用END模块也就没有效果
百度百科awk
其中 pattern 表示 AWK 在数据中查找的内容，而 action 是在找到匹配内容时所执行的一系列命令。花括号 ({}) 不需要在程序中始终出现，但它们用于根据特定的模式对一系列指令进行分组。

所以正确的END模式如下：

[root@localhost ~]#awk '{a[$0]++};END{for(i in a)print i,a[i]}' 0712 | wc -l

45

awk处理重复行错误分析的更多相关文章

awk除去重复行
awk去除重复行,思路是以每一行的$0为key,创建一个hash数组,后续碰到的行,如果数组里已经有了,就不再print了,否则将其print 测试文件: 用awk: 用sort+uniq好像出错了: ...
linux 下删除重复行-- uniq 与 awk
$ cat file liw liw liw hdsui mdksjd liw $ cat file | uniq -u # 只删除相邻的,不保留重复行 hdsui mdksjd liw $ cat ...
【shell】awk按域去除重复行
首先解释一下什么叫“按域去除重复行”: 有的时候我们需要去除的重复行并不是整行都重复,两行的其中一列的元素相同我们有的时候就需要认定这两行重复,因此有了今天的内容. 去除重复行shell有一个原生命令 ...
linux用命令删除重复行
文本处理时,经常要删除重复行,下面是三种方法第一,用sort+uniq,注意,单纯uniq是不行的. sort -n test.txt | uniq 第二,用sort+awk命令,注意,单纯awk同 ...
Linux合并文件、去除重复行的命令
Linux合并文件命令: awk '{printf("%s\n",$0)}' YQ-*101?.txt > 123.txt linux去除重复行命令:cat YQ-10 ...
Linux删除重复行排序和不排序的做法--转载
本文部分翻译自这里,来自 Jadu Saikia 的博客,这个博客上有很多非常有用的小技巧,有空可以多看看. 通常如果我们想获取一个文件里不重复的行的时候,我们可以直接通过 sort -u 命令,先把 ...
Linux删除重复行
本文转自http://blog.csdn.net/ithomer/article/details/6926325 文本处理时,经常要删除重复行,下面是三种方法第一,用sort+uniq,注意,单纯u ...
shell 删除文本中的重复行
三种常见方法:第一,用sort+uniq,注意,单纯uniq是不行的. shell> sort -k2n file | uniq > a.out 这里我做了个简单的测试,当file中的重复 ...
SQL Server删除重复行的6个方法
SQL Server删除重复行是我们最常见的操作之一,下面就为您介绍六种适合不同情况的SQL Server删除重复行的方法,供您参考. 1.如果有ID字段,就是具有唯一性的字段 delect ta ...

随机推荐

分布式文件系统FastDFS如何做到高可用
FastDFS是用C语言编写的一款开源的轻量级分布式文件系统.它对文件进行管理,功能包括:文件存储.文件同步.文件访问(文件上传.文件下载)等,解决了大容量存储和负载均衡的问题.特别适合以文件为载体的 ...
mongodb 的进库操作
mongo show dbs use xxx show collections db.xxx.find() db.users.update({ "xxx" : ObjectId( ...
js对象，set和get方法的三种实现形式
var obj1 = { name: 'shaanxi', get nameGet() { return this.name + 'a'; }, set nameSet(name) { this.na ...
基于 HTML5 的电力接线图 SCADA 应用
在电力.油田燃气.供水管网等工业自动化领域 Web SCADA 的概念已经提出了多年,早些年的 Web SCADA 前端技术大部分还是基于 Flex.Silverlight 甚至 Applet 这样的 ...
T4模板生成代码。数据实体层与数据仓储层。备注
文件生成模板:TempleteManager.ttinclude <#@ assembly name="System.Core" #><#@ assembly n ...
[Haskell] 为什么列表操作++很昂贵？
博主是haskell新手.学习haskll的时候遇到了一些问题,在寻求答案的过程中产生了一些思考,可能理解存在偏差,希望各位不吝赐教. 提出问题 <Learn you a haskell for ...
Java Web应用集成OSGI
对OSGI的简单理解就像Java Web应用程序需要运行在Tomcat.Weblogic这样的容器中一样.程序员开发的OSGI程序包也需要运行在OSGI容器中.目前主流的OSGI容器包括:Apach ...
Pandas系列之入门篇——HDF5
Pandas系列之入门篇--HDF5 简介 HDF5(层次性数据格式)作用于大数据存储,其高效的压缩方式节约了不少硬盘空间,同时也给查询效率带来了一定的影响, 压缩效率越高,查询效率越低.pandas ...
linux（二）之linux常用命令一
linux的命令非常之多,命令多就算了关键每个命令还有很多的参数.不过其实并不要去害怕它.你只要常去用,并且的话,大部分你只要记住命令,参数不记得我们可以去查帮助文档.加油吧!老帖们. 一.登入\登出 ...
AtCoder Grand Contest 016
在雅礼和衡水的dalao们打了一场atcoder 然而窝好菜啊…… A - Shrinking 题意:定义一次操作为将长度为n的字符串变成长度n-1的字符串,且变化后第i个字母为变化前第i 或 i+1 ...

awk处理重复行错误分析

awk处理重复行错误分析的更多相关文章

随机推荐

热门专题