简介：本文翻译自 Altinity 针对 ClickHouse 的系列技术文章。面向联机分析处理（OLAP）的开源分析引擎 ClickHouse，因其优良的查询性能，PB级的数据规模，简单的架构，被国内外公司广泛采用。本系列技术文章，将详细展开介绍 ClickHouse。

前言

本文翻译自 Altinity 针对 ClickHouse 的系列技术文章。面向联机分析处理（OLAP）的开源分析引擎 ClickHouse，因其优良的查询性能，PB 级的数据规模，简单的架构，被国内外公司广泛采用。

阿里云 EMR-OLAP 团队，基于开源 ClickHouse 进行了系列优化，提供了开源 OLAP 分析引擎 ClickHouse 的云上托管服务。EMR ClickHouse 完全兼容开源版本的产品特性，同时提供集群快速部署、集群管理、扩容、缩容和监控告警等云上产品功能，并且在开源的基础上优化了 ClickHouse 的读写性能，提升了 ClickHouse 与 EMR 其他组件快速集成的能力。访问 ClickHouse - E-MapReduce - 阿里云了解详情。

译者：何源（荆杭），阿里云计算平台事业部高级产品专家

ClickHouse 聚合函数和聚合状态

ClickHouse 可能有一个独特的功能——聚合状态（除了聚合函数外）。你可以参考和组合子的文档。

简而言之，许多数据库使用概率数据结构，例如 HyperLogLog（简称 HLL）。它用于唯一/去重计算，你可以在Spark、ElasticSearch、Flink、Postgres、BigQuery 和 Redis 等服务中看到它的效果。但通常你只能在聚合函数中应用此函数一次，例如查询每月唯一用户数——得到一个数字，这样就知足了。由于 HLL 结构没有对应的内部格式，因此无法重用预聚合或部分聚合的数据。而在 ClickHouse 中，你可以这样做，因为 HLL 结构是一致的。

ClickHouse 的速度非常快，其基本思路是处理原始数据而不是预聚合数据。但是让我们做个实验。例如，我们需要为上个月的唯一用户数计算一些指标。

设想：每天预聚合，然后汇总所有结果。这就是所谓的存储空间方法——以后你可以只汇总最后 30 个测量值来计算上个月的统计数据，或者只汇总最后 7 个测量值来计算上周的统计数据。

创建我们的预聚合表：

create table events_unique (

  date Date,

  group_id String,

  client_id String,

  event_type String,

  product_id String,

  value AggregateFunction(uniq, String)

) ENGINE = MergeTree(date, (group_id, client_id, event_type, product_id, date), 8192);

这里将我的聚合声明为 AggregateFunction(uniq, String)。我们关注的是一些独特的指标，这些指标是在 String 列上计算的（为了进一步优化，你可能应该使用 FixedString 或二进制数据）。

让我们将数据插入预聚合表：

INSERT INTO events_unique

SELECT date, group_id, client_id, event_type, product_id, uniqState(visitor_id) AS value

  FROM events

 GROUP BY date, group_id, client_id, event_type, product_id;

进行冒烟测试，确认其可以正常运行：

SELECT uniqMerge(value) FROM events_unique GROUP BY product_id;

现在让我们比较原始表和预聚合表的查询性能。原始查询：

SELECT uniq(visitor_id) AS c

  FROM events

 WHERE client_id = ‘aaaaaaaa’

   AND event_type = ‘click’

   AND product_id = ‘product1’

   AND date >= ‘2017–01–20’

   AND date < ‘2017–02–20’;

┌──────c─┐

│ 457954 │

└────────┘

1 rows in set. Elapsed: 0.948 sec. Processed 13.22 million rows, 1.61 GB (13.93 million rows/s., 1.70 GB/s.)

预聚合表的结果：

SELECT uniqMerge(value) AS c

  FROM events_unique

 WHERE client_id = ‘aaaaaaaa’

   AND event_type = ‘click’

   AND product_id = ‘product1’

   AND date >= ‘2017–01–20’

   AND date < ‘2017–02–20’;

┌──────c─┐

│ 457954 │

└────────┘

1 rows in set. Elapsed: 0.050 sec. Processed 39.39 thousand rows, 8.55 MB (781.22 thousand rows/s., 169.65 MB/s.)

结果表明，我们的处理时间缩短到 1/20。

在实践中，将物化视图与 AggregatingMergeTree 引擎结合使用，会比使用单独的表更方便。

总结

ClickHouse 可让你将聚合状态存储在数据库中，而不仅仅是存储在业务应用中，这有望带来颇具吸引力的性能优化和新用例。有关更多详细信息，请查看关于 AggregatingMergeTree 引擎的丰富文档。

后续

您已经了解了在 ClickHouse 中处理实时更新相关内容，本系列还包括其他内容：

在 ClickHouse 中处理实时更新
使用新的 TTL move，将数据存储在合适的地方
在 ClickHouse 物化视图中使用 Join
ClickHouse 聚合函数和聚合状态（本文）
ClickHouse 中的嵌套数据结构

原文链接

本文为阿里云原创内容，未经允许不得转载。

【ClickHouse 技术系列】- ClickHouse 聚合函数和聚合状态的更多相关文章

【SqlServer系列】聚合函数
1 概述本篇文章简要回顾SQL Server 聚合函数,MAX,MIN,SUM,AVG,SUM,CHECKSUM_EGG,COUNT,STDEV,STDEVP,VAR,VARP. 2 具体 ...
Sql Server系列：聚合函数
1 SUM SUM是一个求和函数,返回指定列值的总和.SUM 只能用于数字列. 其中忽略 Null 值. 语法 SUM ( [ ALL | DISTINCT ] expression ) OVER ( ...
ClickHouse源码笔记5:聚合函数的源码再梳理
笔者在源码笔记1之中分析过ClickHouse的聚合函数的实现,但是对于各个接口函数的实际如何共同工作的源码,回头看并没有那么明晰,主要原因是没有结合Aggregator的类来一起分析聚合函数的是如果 ...
ClickHouse源码笔记1:聚合函数的实现
由于工作的需求,后续笔者工作需要和开源的OLAP数据库ClickHouse打交道.ClickHouse是Yandex在2016年6月15日开源了一个分析型数据库,以强悍的单机处理能力被称道. 笔者在实 ...
ClickHouse学习系列之三【配置文件说明】
背景最近花了些时间看了下ClickHouse文档,发现它在OLAP方面表现很优异,而且相对也比较轻量和简单,所以准备入门了解下该数据库系统.在介绍了安装和用户权限管理之后,本文对其配置文件做下相关的 ...
ClickHouse学习系列之五【系统库system说明】
背景之前介绍过ClickHouse相关的系列文章,现在ClickHouse已经能正常使用起来了,包括副本和分片.因为ClickHouse已经可以提供服务了,现在需要关心的就是服务期间该数据库的各项性 ...
ClickHouse学习系列之八【数据导入迁移&同步】
背景在介绍了一些ClickHouse相关的系列文章之后,大致对ClickHouse有了比较多的了解.它是一款非常优秀的OLAP数据库,为了更好的来展示其强大的OLAP能力,本文将介绍一些快速导入大量 ...
微软BI 之SSAS 系列 - 多维数据集中度量值设计时的聚合函数 (累加性_半累加性和非累加性)
在 SSAS 系列 - 实现第一个 Cube 以及角色扮演维度,度量值格式化和计算成员的创建中主要是通过已存在的维度和事实数据创建了一个多维数据集,并同时解释了 Role-Playing Dimen ...
SQL Server温故系列(4)：SQL 查询之集合运算 & 聚合函数
1.集合运算 1.1.并集运算 UNION 1.2.差集运算 EXCEPT 1.3.交集运算 INTERSECT 1.4.集合运算小结 2.聚合函数 2.1.求行数函数 COUNT 2.2.求和函数 ...
Spark 系列（十一）—— Spark SQL 聚合函数 Aggregations
一.简单聚合 1.1 数据准备 // 需要导入 spark sql 内置的函数包 import org.apache.spark.sql.functions._ val spark = SparkSe ...

随机推荐

Prism框架的用法
今天,我向大家介绍一款WPF后台框架,以及,它的用法. 官网 https://prismlibrary.com/ Prism 框架是一个用于构建松耦合.可维护且可测试的 WPF 和 Xamarin.F ...
记录--页面使用 scale 缩放实践
这里给大家分享我在网上总结出来的一些知识,希望对大家有所帮助最近接到一个任务,需要把页面放大1.5倍显示.这里使用 css 里的 transform: scale(1.5) 来实现. documen ...
记录--怎么实现一个3d翻书效果
这里给大家分享我在网上总结出来的一些知识,希望对大家有所帮助本篇主要讨论以下两种翻书动画的实现: 第一种是整页翻转的效果: 这种整页翻转的效果主要是做rotateY的动画,并结合一些CSS的3d属性 ...
在 SwiftUI 中使用 Metal Shader
简介从 iOS 17/macOS 14 开始,SwiftUI 支持使用 Metal shader 来实现一些特效.主要提供三个 View Modifier:colorEffect. distorti ...
KingbaseES V8R6 集群运维案例 -- 磁盘空间问题导致集群故障
某商业银行生产系统KingbaseES读写分离集群主库出现故障,导致集群主备发生切换.客户要求说明具体的原因. KingbaseES读写分离集群基本信息: KingbaseES集群信息操作系统 ...
Scala 复杂分词求和（二元组）
1 package chapter07 2 3 object Test18_ComplexWordCount { 4 def main(args: Array[String]): Unit = { 5 ...
DIY 3 种分库分表分片算法，自己写的轮子才吊！
大家好,我是小富- 前言本文是<ShardingSphere5.x分库分表原理与实战>系列的第六篇,书接上文实现三种自定义分片算法.通过自定义算法,可以根据特定业务需求定制分片策略,以满 ...
Python基础之:Python中的模块
目录简介模块基础执行模块模块搜索路径 dir 包包的相对路径简介 Python的解释环境是很好用,但是如果我们需要编写一个大型的程序的时候,解释环境就完全不够用了.这个时候我们需要将pyt ...
SAST-数据流分析方法-理论
引言众所周知,数据流分析是实现污点分析的一种常用技术数据流分析分为过程内的数据流分析与过程间的数据流分析.前者是对一个方法体内的数据流分析,主要是基于CFG分析,不涉及方法调用:后者是基于不同方法 ...
BI小白收藏|一文告诉你什么是商务智能
近年来,商务智能(BI)已成为继企业资源计划之后企业信息化建设的热点领域,在国内发展迅速.利用商务智能可以为企业整合集成现有的业务数据,在深度挖掘分析的基础上为管理决策者提供决策辅助,提高科学决策水平 ...

【ClickHouse 技术系列】- ClickHouse 聚合函数和聚合状态

前言

ClickHouse 聚合函数和聚合状态

总结

后续

【ClickHouse 技术系列】- ClickHouse 聚合函数和聚合状态的更多相关文章

随机推荐

热门专题