sort

功能说明:将文本文件内容加以排序,sort可针对文本文件的内容,以行为单位来排序。

sort [-bcdfimMnr][-o<输出文件>][-t<分隔字符>][+<起始栏位>-<结束栏位>][--help][--verison][文件]

-b   忽略每行前面开始处的空格字符 。

  -c   检查文件是否已经按照顺序排序

-d   排序时,处理英文字母、数字及空格字符外,忽略其他的字符。

-f   排序时,将小写字母视为大写字母。

-i   排序时,除了040至176之间的ASCII字符外,忽略其他的字符。

-m   将几个排序好的文件进行合并。

-M   将前面3个字母依照月份的缩写进行排序。

-n   依照数值的大小排序。

-o<输出文件>   将排序后的结果存入指定的文件。

-r   以相反的顺序来排序。

-t<分隔字符>   指定排序时所用的栏位分隔字符。

-k  选择以哪个区间进行排序

+<起始栏位>-<结束栏位>   以指定的栏位来排序,范围由起始栏位到结束栏位的前一栏位。

  -u 在输出行中去除重复行。

sort将文件的每一行作为一个单位,相互比较,比较原则是从首字符向后,依次按ASCII码值进行比较,最后将他们按升序输出。

举例:

源文件:

  • apple
    pear
    orange
    pear
    1
    2
    10

默认排序:

  • 1
    10
    2
    apple
    orange
    pear
    pear

-u 在输出行中去除重复行。

  • 1
    10
    2
    apple
    orange
    pear

-o 把排序结果输出到原文件中

使用重定向:sort test.txt>test.txt 后,

test.txt为空

sort test.txt -o test.txt

 

-c 检查文件是否已经按照顺序排序

sort -c 排好序的文件,无返回信息,

echo $?为0

sort -c 未排序文件,有提示信息,

echo $?为1

-n 依照数值的大小排序,

sort 默认情况下会将数字按照字符串来排序,

所以会出现2比10大的情况。

使用-n能避免该情况:sort -n test.txt

  • apple
    orange
    pear
    pear
    1
    2
    10

-t<分隔字符> 指定排序时所用的栏位分隔字符,

-k  选择以哪个区间进行排序

cat date.txt 
2017-12-02
2017-01-09

sort -n -k 2 -t'-' date.txt

  • 2017-01-09
  • 2017-12-02

其他举例:

sort -t ' ' -k 3nr -k 2n facebook.txt

先以第3个域进行逆序排序,如果相同,再以第2个域进行排序,n   依照数值的大小排序。

后续学习可参考:http://blog.chinaunix.net/uid-10540984-id-313479.html

uniq

[-cdu][-f<栏位>][-s<字符位置>][-w<字符位置>][--help][--version][输入文件][输出文件]

-u或--unique 只保留出现唯一一次的行列。

-d或--repeated 仅显示重复出现的行列,出现一次的行列不会显示

-c 在每列旁边显示该行重复出现的次数。

-f n 或--skip-fields=n 忽略前N个字段。字段由空白字符(空格符、Tab)分隔

-s<字符位置>或--skip-chars=<字符位置> 忽略比较指定的字符。-s n:忽略前n个字符,从n+1个字符开始比较

-w<字符位置>或--check-chars=<字符位置> 指定要比较的字符。-w n:只比较前n个字符,对每行第n个字符以后的内容不作对照

 -i, --ignore-case     在比较的时候不区分大小写

[输入文件] 指定已排序好的文本文件。如果不指定此项,则从标准读取数据;

[输出文件] 指定输出的文件。如果不指定此选项,则将内容显示到标准输出设备(显示终端)。

uniq 是对排序好的内容去重当重复的行并不相邻时,uniq 命令是不起作用的,所以需要先使用sort排序,在使用uniq去重

举栗:

原文件

  • e bsd 1000 600 4M
    c win7 2000 100 7G
    d winxp 4000 300 3G
    d winxp 500 300 3G
    g winxp 500 300 3G
    g winxp 500 300 3G
    G WINXP 500 300 3G

uniq -c test_uniq.txt

  • 1 e bsd 1000 600 4M
    1 c win7 2000 100 7G
    1 d winxp 4000 300 3G
    1 d winxp 500 300 3G
    2 g winxp 500 300 3G
    1 G WINXP 500 300 3G

-u 仅显示出现一次的行 ,不显示出现多次的行

uniq -u -c test_uniq.txt

  • 1 e bsd 1000 600 4M
    1 c win7 2000 100 7G
    1 d winxp 4000 300 3G
    1 d winxp 500 300 3G
    1 G WINXP 500 300 3G

仅显示重复出现的行 -d

uniq -d -c test_uniq.txt

  • 2 g   winxp   500     300 3G

不显示只出现一次的行

-i 比较的时候不区分大小写 ,不区分大小写,所以有三行进行的合并

uniq -i -c test_uniq.txt

  • 1 e bsd 1000 600 4M
    1 c win7 2000 100 7G
    1 d winxp 4000 300 3G
    1 d winxp 500 300 3G
    3 g winxp 500 300 3G

比较时忽略前n个字段,从n+1列开始比较 -f n

uniq -c -f 3 test_uniq.txt

  • 1 e bsd 1000 600 4M
    1 c win7 2000 100 7G
    1 d winxp 4000 300 3G
    4 d winxp 500 300 3G

源文件

注意空格符
  • a b 30 3G
  • a h 30  3G
  • a g  30 3G
  • a  ffff  30 3G
  • uniq -c -f 2 test.txt
  1. 1 a b 30 3G
  2. 1 a h 30  3G
  3. 2 a g  30 3G

忽略前2个字段时,前2个字段中的字符以及空格不同都不会有影响,

但是第2个字段之后的空格与字符变化会影响去重效果

比较时忽略前n个字符,从n+1个字符开始比较 -s n

uniq -c -s 1 test_uniq.txt

  • 1 e bsd 1000 600 4M
    1 c win7 2000 100 7G
    1 d winxp 4000 300 3G
    3 d winxp 500 300 3G
    1 G WINXP 500 300 3G

忽略前1个字符,第4,5,6,行会被认为是一样的

只比较前n个字符,对每行第n个字符以后的内容不作对照 -w n

uniq -c -w 1 test_uniq.txt

  • 1 e bsd 1000 600 4M
    1 c win7 2000 100 7G
    2 d winxp 4000 300 3G
    2 g winxp 500 300 3G
    1 G WINXP 500 300 3G

指定输出文件

uniq -c test_uniq.txt  out.txt

linux sort uniq命令详解的更多相关文章

  1. Linux:uniq命令详解

    uniq uniq命令用于报告或忽略文件中的重复行,一般与sort命令结合使用. 语法 uniq(选项)(参数) 选项 -c或——count:在每列旁边显示该行重复出现的次数: -d或--repeat ...

  2. linux shell 脚本攻略学习8---md5校验,sort排序,uniq命令详解

    一.校验与核实 目前最为出名的校验技术是md5sum和sha1sum,它们对文件内容使用相应的算法来生成校验和. 举例: amosli@amosli-pc:~/learn$ md5sum text.t ...

  3. LINUX系统VMSTAT命令详解

    linux系统vmstat命令详解 [转自 https://www.cnblogs.com/wensiyang0916/p/6514820.html] vmstat 1    1表示每秒采集一次vms ...

  4. Linux 系统性能监控命令详解

    Linux 系统性能监控命令详解 CPU MEMORY IO NETWORK LINUX进程内存占用查看方法 系统负载过重时往往会引起其它子系统的问题,比如:->大量的读入内存的IO请求(pag ...

  5. Linux下ps命令详解 Linux下ps命令的详细使用方法

    http://www.jb51.net/LINUXjishu/56578.html Linux下的ps命令比较常用 Linux下ps命令详解Linux上进程有5种状态:1. 运行(正在运行或在运行队列 ...

  6. linux之find命令详解

    linux之find命令详解 查找文件find ./ -type f查找目录find ./ -type d查找名字为test的文件或目录find ./ -name test查找名字符合正则表达式的文件 ...

  7. Linux下rar命令详解

    Linux下rar命令详解 用法: rar <命令> -<选项1> ….-<选项N> < 操作文档> <文件…> <@文件列表…> ...

  8. linux下tar命令详解

     linux下tar命令详解    tar是Linux环境下最常用的备份工具之一.tar(tap archive)原意为操作磁带文件,但基于Linux的文件操作机制,同样也可适用于普通的磁盘文件.ta ...

  9. Linux下chkconfig命令详解(转)

    Linux下chkconfig命令详解 chkconfig命令主要用来更新(启动或停止)和查询系统服务的运行级信息.谨记chkconfig不是立即自动禁止或激活一个服务,它只是简单的改变了符号连接. ...

随机推荐

  1. MyBatis 回顾 JDBC(一)

    引言 学过 Java 的童鞋都知道,在 Java 中只有 JDBC 可以访问数据库,但是只要使用过 JDBC 的同学肯定也感受到 JDBC 访问数据库的繁琐, 需要编写大量的代码,经历一系列的步骤. ...

  2. Scrum Master 生存指南

    近年来,出现了一批新兴且广受关注的岗位,以 Scrum Master 为典型代表.2018年,Scrum Master 的平均工资为98239美元.领英更是将其列为2019年最有前途的工作之一.但对于 ...

  3. DelayQueue延迟队列原理剖析

    DelayQueue延迟队列原理剖析 介绍 DelayQueue队列是一个延迟队列,DelayQueue中存放的元素必须实现Delayed接口的元素,实现接口后相当于是每个元素都有个过期时间,当队列进 ...

  4. NOIP模拟5 T2

    题面:求出满足以下条件的 n*m 的 01 矩阵个数:   (1)第 i 行第 1~li 列恰好有 1 个 1 (li+1到ri-1不能放1)   (2)第 i 行第 ri~m 列恰好有 1 个 1. ...

  5. JavaScript 中数组 sort() 方法的基本使用

    在日常的代码开发中,关于数组排序的操作可不少,JavaScript 中可以调用 sort 方法对数组进行快速排序. 今天,就数组的 sort 方法来学习一下,避免日后踩坑的悲惨遭遇. 概念 sort ...

  6. CVPR2019:无人驾驶3D目标检测论文点评

    CVPR2019:无人驾驶3D目标检测论文点评 重读CVPR2019的文章,现在对以下文章进行点评. Stereo R-CNN based 3D Object Detection for Autono ...

  7. OpenCV读写图像文件解析

    OpenCV读写图像文件解析 imdecode 从内存中的缓冲区读取图像. C++:Mat imdecode(InputArray buf, int flags) C++:Mat imdecode(I ...

  8. python_reques接口测试框架,Excel作为案例数据源

    一.框架菜单 1.1 common模块  1.2 其他 二.Excel接口测试案例编写 三.读取Excel测试封装(核心封装) excel_utils.py  读取Excel中的数据 import o ...

  9. 尚硅谷Java——宋红康笔记【day1-day5】

    day1 注释 1.java规范的三种注释方式: 单行注释 多行注释 文档注释(java特有) 2. 单行注释和多行注释的作用: ① 对所写的程序进行解释说明,增强可读性.方便自己,方便别人 ② 调试 ...

  10. 『言善信』Fiddler工具 — 13、Fiddler断点功能的使用详解

    目录 1.Fiddler断点的应用 2.断点的分类 3.设置全局断点 (1)设置before Requests全局断点: (2)设置After Responses全局断点: 4.设置局部断点 (1)设 ...