Logstash：运用 fingerprint 过滤器处理重复的文档

文章转载自：https://blog.csdn.net/UbuntuTouch/article/details/106639848

背景：Elasticsearch 索引

在介绍重复数据删除解决方案之前，让我们简要介绍一下 Elasticsearch 的索引编制过程。 Elasticsearch 提供了一个 REST API 来为你的文档建立索引。你可以选择提供唯一代表您的文档的 ID，也可以让 Elasticsearch 为你生成ID。如果您将 HTTP PUT 与索引API 一起使用，Elasticsearch 希望您提供一个ID。如果已经存在具有相同 ID 的文档，Elasticsearch 将用你刚才提供的文档替换现有内容-最后索引的文档将获胜。如果使用 POST 动词，则即使语料库中已经存在内容，Elasticsearch 也会生成具有新ID的新文档。例如，假设你刚在一秒钟之前为博客文章建立了索引，并使用 POST 动词重新发送了同一篇博客文章，Elasticsearch 创建了另一个具有相同内容但新具有 ID 的文档。

虽然 Elasticsearch 提供了一个显式的 _update API，可以将其用作潜在的解决方法，但我们将把本文重点放在索引 API 上。

Logstash 的 Elasticsearch 输出使用索引API，并且默认情况下不希望提供 ID。因此，它将每个单个事件视为单独的文档。但是，有一个选项可让你轻松为 Logstash 中的每个事件设置唯一的 ID。

删除重复的相似内容

如前所述，在你的用例中，重复的内容可能是不可接受的。使用称为指纹的概念和 Logstash 指纹过滤器（fingerprint），您可以创建一个称为指纹的新字符串字段，以唯一地标识原始事件。指纹过滤器可以将原始事件中的一个或多个字段（默认为消息字段）作为源来创建一致的哈希值 (hash)。一旦创建了这些指纹，你就可以将其用作下游Elasticsearch输出中的文档ID。这样，Elasticsearch 将仅在比较指纹后更新或覆盖现有文档内容，但绝不会复制它们。如果你想考虑更多字段以进行删除重复数据，则可以使用 concatenate_sources 选项。

指纹过滤器具有多种算法，您可以选择创建此一致的哈希（hash）。请参阅文档，因为每个函数的哈希强度不同，可能需要其他选项。在下面的示例中，我们使用 MURMUR3 方法从消息字段创建哈希并将其设置在元数据字段中。元数据字段不会发送到输出，因此它们提供了一种在处理管道中的事件时临时存储数据的有效方法。

filter {

  fingerprint {

    source => "message"

    target => "[@metadata][fingerprint]"

    method => "MURMUR3"

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[@metadata][fingerprint]}"

  }

}

如果使用任何加密哈希函数算法（例如SHA1，MD5），则需要提供密钥选项。密钥可以是用于计算 HMAC 的任意字符串。

filter {

  fingerprint {

    source => "message"

    target => "[@metadata][fingerprint]"

    method => "SHA1",

    key => "Log analytics",

    base64encode => true

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[@metadata][fingerprint]}"

  }

}

密钥的其他示例可以是 departmentID，组织 ID 等。

意外重复：从 Logstash 生成 UUID

先前的用例涉及内容的有意识地删除重复数据。在某些部署中，尤其是 Logstash 与可确保至少交付一次的持久性队列或其他排队系统一起使用时，Elasticsearch 中可能存在重复项。如果 Logstash 在处理过程中崩溃，则重新启动时将重播队列中的数据-这可能导致重复。为了减少这种情况造成的重复，可以对每个事件使用 UUID。这里的重点是，在将数据序列化到消息队列之前，需要在生产方（即发布到排队系统的 Logstash 实例）上生成UUID。这样，Logstash使用者在从崩溃还原或重新启动时需要重新处理事件时，将保留相同的事件ID。

如果你的源数据没有唯一标识符，则可以使用同一指纹过滤器来生成 UUID。请记住，此方法不考虑事件本身的内容，而是为每个事件生成 version 4 UUID。

filter {

  fingerprint {

    target => "%{[@metadata][uuid]}"

    method => "UUID"

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[@metadata][uuid]}"

  }

}

如果在 Logstash 生产者和使用者之间使用队列，则必须显式复制@metadata字段，因为它们不会持久化到输出中。另外，你可以使用以下常规字段：

filter {

  fingerprint {

    target => "generated_id"

    method => "UUID"

  }

}

output {

  kafka {

    brokers => "example.com"

    ...

  }

}

从消费者方面，您可以只使用：

input {

  kafka {

    brokers => "example.com"

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[generated_id]}"

  }

}

例子

在下面，我们用一个实际的例子来展示，这个是如工作的。首先让我们先创建一个叫做 logstash_fingerprint.conf 的 Logstash 配置文件：

logstash_fingerprint.conf

input {

    http {

        id => "data_http_input"

    }

}

filter {

    fingerprint {

        source => [ "sensor_id", "date"]

        target => "[@metadata][fingerprint]"

        method => "SHA1"

        key => "liuxg"

        concatenate_sources => true

        base64encode => true

    }

}

output {

    stdout {

     codec => rubydebug

    }

  elasticsearch {

    manage_template => "false"

    index => "fingerprint"

    hosts => "localhost:9200"

    document_id => "%{[@metadata][fingerprint]}"

    }

}

在这里，我们使用 http input 来收集数据。使用 sensor_id 及 date 这两个字段来生成一个 fingerprint。也就是说，只有这两个字段是一样的，那么无论我们输入多少次数据，那么在 Elasticsearch 中将不会有新的数据生成，因为它们的 ID 都是一样的。我们启动 Logstash：

sudo ./bin/logstash -f ~/data/fingerprint/logstash_fingerprint.conf

我们可以在另外一个 console 中打入如下的命令：

curl -XPOST --header "Content-Type:application/json"http://localhost:8080/" -d '{"sensor_id":1, "date": "2015-01-01", "reading":16.24}'

我们发现，只要是 sensor_id 和 date 的值都是一样的，那么 fingerprint 的文档数永远是 1。当然你也可以更新其它字段的值，比如 reading 字段的值为20，那么新的值将会在里面得以体现。这个操作相当于更新的操作。

也就是说，在索引 fingerprint 中，只要是 sensor_id 及 date 的数值是一样的，那么我们将永远只有一个文档，而且是永远不会重复的。

Logstash：运用 fingerprint 过滤器处理重复的文档的更多相关文章

ELK（ ElasticSearch+ Logstash+ Kibana）分布式日志系统部署文档
开始在公司实施的小应用,慢慢完善之~~~~~~~~文档制作了好作运维同事之间的前期普及.. ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~ 软件下载地址: https://www.e ...
13.Django1.11.6文档
第一步入门检查版本 python -m django --version 创建第一个项目 django-admin startproject mysite 运行 python manage.py ...
mongoDB 文档操作_增
增加 / 插入 /保存单文档插入命令 db.collection.insertOne(doc) 功能向被 use 的数据库中插入数据实例 db.class.insertOne({"n ...
day56 文件文档处理,事件
前情回顾: 1. 前情回顾 0. 选择器补充 - 属性选择器 - $("[egon]") - $("[type='text']") - $("inpu ...
jQuery 选择器筛选器样式操作文本操作属性操作文档处理事件动画效果插件 each、data、Ajax
jQuery jQuery介绍 1.jQuery是一个轻量级的.兼容多浏览器的JavaScript库. 2.jQuery使用户能够更方便地处理HTML Document.Events.实现动画效果.方 ...
jQuery文档节点处理，克隆，each循环，动画效果，插件
文档节点处理 //创建一个标签对象 $("<p>") //内部插入 $("").append(content|fn) ----->$(&quo ...
写文档太麻烦，试试这款 IDEA 插件吧！
前言每次开发完新项目或者新接口功能等,第一件事就是提供接口文档.说到接口文档,当然是用 Markdown 了.各种复制粘贴字段,必填非必填,字段备注,请求返回示例等等.简直是浪费时间哇.所以想到了开 ...
logstash的mutate过滤器的使用
logstash的mutate过滤器的使用一.背景二.需求三.实现步骤 1.安装 `csv codec` 插件 2.准备需要读取的文件数据 3.编写 pipeline ,读取和输出数据 4.mu ...
XML文档形式&JAVA抽象类和接口的区别&拦截器过滤器区别
XML文档定义有几种形式?它们之间有何本质区别?解析XML文档有哪几种方式? a: 两种形式 dtd schemab: 本质区别:schema本身是xml的,可以被XML解析器解析(这也是从DTD上发 ...

随机推荐

C++指针和结构体基础知识
学习C++首先要回忆起C语言当中的指针和结构体知识,本文作者将通过一段代码来总结指针和结构体基础知识:指针是一个变量,其值为另一个变量的地址,即,内存位置的直接地址.就像其他变量或常量一样,您必须在使 ...
linux学习之selinux安全处理
linux在默认情况下会开启selinux,如果软件开放的端口不是selinux默认的协议端口会导致防火墙端口开放后还是无法访问.以下是解决办法. [root@localhost ~]# semana ...
Yii项目知识搜集
[['rId','advertiser_id','image_file'], 'unique','targetAttribute'=>['rId','advertiser_id','image_ ...
物无定味适口者珍，Python3并发场景(CPU密集/IO密集)任务的并发方式的场景抉择(多线程threading/多进程multiprocessing/协程asyncio)
原文转载自「刘悦的技术博客」https://v3u.cn/a_id_221 一般情况下,大家对Python原生的并发/并行工作方式:进程.线程和协程的关系与区别都能讲清楚.甚至具体的对象名称.内置方法 ...
POJ2559/HDU1506 Largest Rectangle in a Histogram (cartesian tree)
Die datenstruktur ist erataunlich! #include <iostream> #include <cstdio> #include <cs ...
Luogu5367 【模板】康托展开（康拓展开）
$n^2$暴力 #include <iostream> #include <cstdio> #include <cstring> #include <al ...
Linux 13 配置服务自启动
参考源 https://www.bilibili.com/video/BV187411y7hF?spm_id_from=333.999.0.0 版本本文章基于 CentOS 7.6 准备我们通常的 ...
React报错之Expected an assignment or function call and instead saw an expression
正文从这开始~ 总览当我们忘记从函数中返回值时,会产生"Expected an assignment or function call and instead saw an express ...
Excel 文本函数（一）：LEFT、RIGHT 和 MID
文本函数 LEFT.RIGHT 以及 MID 是非常常用的,它们用于截取文本字符串. LEFT(text, [num_chars]) 是从文本字符串的左边开始截取:RIGHT(text, [num_c ...
JavaScript 基础知识（一）：对象以及原型
前言 JavaScript 常被描述为一种基于原型的语言--每个对象拥有一个原型对象,对象以其原型为模板.从原型继承方法和属性.原型对象也可能拥有原型,并从中继承方法和属性,一层一层.以此类推.这种关 ...

Logstash：运用 fingerprint 过滤器处理重复的文档

Logstash：运用 fingerprint 过滤器处理重复的文档的更多相关文章

随机推荐

热门专题