作者:张富春(ahfuzhang),转载时请注明作者和引用链接,谢谢!


正文

VictoriaMetrics中使用uint64类型来表示一个MetricID,且MetricID是递增的。

因此有这些一些需求:

  1. 需要缓存某一类metricID的集合,例如某个MetricQL的查询结果对应很多个MetricID;
  2. 需要对多个metricID的集合取交集和并集等操作。

并且:

  • 占用的内存要尽可能的小
  • 要避免大量的小对象,否则会对GC造成很大压力
  • 插入、检查是否存在某个ID、并集计算、交集计算等要尽可能的快

VictoriaMetrics-1.72.0-cluster/lib/uint64set/uint64set.go 这里的代码很好的满足了上述需求。

下面我来分析它的实现原理。

1.结构

  • 整个uint64按位分成多个部分,每个部分分别采用各自的插入和查找策略。相当于分级存储。
  • 高32位先建一个桶
    • 桶的个数动态增加
    • metricID是递增的,因此在这样的业务场景下,高32位通常是0
  • 高16位再建一个存储桶,这里的策略与上面相似。
    • 桶的个数动态的增加
    • 通常桶内的值是顺序增加的,插入过程只能顺序查找
    • 在做集合计算的阶段,可以先对桶排序。
  • 低16位的处理稍稍复杂一些:
    • 当元素个数在56个以内时,直接在一个uint16的数组里顺序追加和顺序搜索
    • 当元素超过56个时,建立一个1024个元素的数组,数组的元素是uint64类型
    • uint64类型一共64个位,用每个位来代表0-63的某个值。相比用64个uint8来存储,空间节省了8倍。

2.插入过程

  • 先确定高32位的分桶(如果没有就新增这个分桶)
  • 在32位的分桶上,再确定高16位的分桶(如果没有就新增这个分桶)
  • 在16位的分桶上,检查是否在56个元素以内
    • 56个元素以内,直接在[]uint8数组上追加
    • 超过56个元素,创建1024个元素的uint64数组,并把56个元素添加进去
  • 16位的分桶上,通过前10位值作为下标,确定uint64数组的位置
  • 把低6位的值,转换为一个uint64上的mask(值为N就把第N位置1),然后与上一步确定的uint64取bit or运算

3.查找过程

  • 先确定高32位的分桶
  • 再确定高16位的分桶
  • 如果不存在1024个元素的分桶,就在56个元素的数组里面顺序查找
  • 如果存在1024个元素的分桶,根据高10位获得下标
  • 根据低6位,看uint64中对应的位是否是1

4.交集运算过程

  • 先对a,b两个集合的32位分桶进行排序
  • 依次偏移a,b两个集合32位分桶的下标,直到分桶值对齐
    • 通过分桶的匹配,可以快速淘汰大量的值
  • 32位分桶的值相等后,继续比较高16位的分桶。比较方法与上面相同。
  • 低16位的值,比较1024个元素的数组。两个uint64做bit and运算,即可完成取交集。

5.总结

  1. uint64set类,首先考虑了业务场景。在绝大多数高32位都相同的大量数据的情况下,能够取得很好的效果。
  • 相反:如果是大量随机的uint64值,这里的方法不见得会更好
  1. 相比map而言,插入和查找做不到O(1)的性能,但是分段查找也不会太差
  2. 相比map而言,内存上的好处非常多:
  • 数据的扩容方便且快速,map可能需要多次扩容+rehash才行
  • 更加节约内存
  • 对GC的压力很小
  1. 对并集、交集等集合操作,分桶能够快速避开不合适的数据的比较,性能极高。

如果想看具体的源码的注释,请移步我上传的VM注释版的源码

希望对你有用,have fun

【VictoriaMetrics源码阅读】vm中仿照RoaringBitmap的实现:uint64set的更多相关文章

  1. JDK源码阅读-DirectByteBuffer

    本文转载自JDK源码阅读-DirectByteBuffer 导语 在文章JDK源码阅读-ByteBuffer中,我们学习了ByteBuffer的设计.但是他是一个抽象类,真正的实现分为两类:HeapB ...

  2. boost.asio源码阅读(2) - task_io_service

    1.0 task_io_service 在boost.asio源码阅读(1)中,代码已经查看到task_io_service中. 具体的操作调用void task_io_service::init_t ...

  3. 源码阅读笔记 - 1 MSVC2015中的std::sort

    大约寒假开始的时候我就已经把std::sort的源码阅读完毕并理解其中的做法了,到了寒假结尾,姑且把它写出来 这是我的第一篇源码阅读笔记,以后会发更多的,包括算法和库实现,源码会按照我自己的代码风格格 ...

  4. SpringMVC源码阅读:Controller中参数解析

    1.前言 SpringMVC是目前J2EE平台的主流Web框架,不熟悉的园友可以看SpringMVC源码阅读入门,它交代了SpringMVC的基础知识和源码阅读的技巧 本文将通过源码(基于Spring ...

  5. caffe-windows中classification.cpp的源码阅读

    caffe-windows中classification.cpp的源码阅读 命令格式: usage: classification string(模型描述文件net.prototxt) string( ...

  6. caffe中batch norm源码阅读

    1. batch norm 输入batch norm层的数据为[N, C, H, W], 该层计算得到均值为C个,方差为C个,输出数据为[N, C, H, W]. <1> 形象点说,均值的 ...

  7. go 中 select 源码阅读

    深入了解下 go 中的 select 前言 1.栗子一 2.栗子二 3.栗子三 看下源码实现 1.不存在 case 2.select 中仅存在一个 case 3.select 中存在两个 case,其 ...

  8. 转-OpenJDK源码阅读导航跟编译

    OpenJDK源码阅读导航 OpenJDK源码阅读导航 博客分类: Virtual Machine HotSpot VM Java OpenJDK openjdk 这是链接帖.主体内容都在各链接中.  ...

  9. openjdk源码阅读导航

    转自:http://rednaxelafx.iteye.com/blog/1549577 这是链接帖.主体内容都在各链接中. 怕放草稿箱里过会儿又坑掉了,总之先发出来再说…回头再慢慢补充内容. 先把I ...

  10. avalon源码阅读(1)

    来源 写angularJS源码阅读系列的时候,写的太垃圾了. 一个月后看,真心不忍直视,以后有机会的话得重写. 这次写avalonJS,希望能在代码架构层面多些一点,少上源码.多写思路. avalon ...

随机推荐

  1. 云计算的三种模式IaaS/PaaS/SaaS/BaaS对比:SaaS架构设计分析

    SaaS--软件即服务(Software as a Service)的出现改变了传统使用软件转变为使用服务. SaaS与传统软件的最大区别是,前者按年付费租用服务,后者一次买断.这貌似只是" ...

  2. vue2升级vue3:composition api中监听路由参数改变

    vue2 的watch回顾 我们先回顾一下vue2中watch <watch性能优化:vue watch对象键值说明-immediate属性详解> <vue中methods/watc ...

  3. 敏捷编辑器Sublime text 4中文配置Python3开发运行代码环境

    敏捷编辑器Sublime text 4中文配置Python3开发运行代码环境 首先来到Win11环境下,进入Sublime text 4官网的下载页面:https://www.sublimetext. ...

  4. 系统学Prompt,强烈推荐这3个教程,OpenAI还是最强

    系统学Prompt,强烈推荐这3个教程 OpenAI官方Prompt教程 这是最权威.最详细.最值得深入学习的提示词工程学习教程! 教程地址:https://platform.openai.com/d ...

  5. Vue框架基础

    博客目录 前端发展介绍 Vue的快速使用 插值语法 指令系统之文本指令.事件指令.属性指令 style和class 条件渲染 列表渲染 使用v-for进行循环 监控失效 双向数据绑定 input输入框 ...

  6. GIL 锁或将在 CPython 中成为可选项

    哈喽大家好,我是咸鱼 几天前有媒体报道称,经过多次辩论,Python 指导委员会打算批准通过 PEP 703 提案,让 GIL(全局解释器)锁在 CPython 中成为一个可选项 PEP 703 提案 ...

  7. SpringBoot 项目实战 | 瑞吉外卖 Day06

    该系列将记录一份完整的实战项目的完成过程,该篇属于第六天 案例来自B站黑马程序员Java项目实战<瑞吉外卖>,请结合课程资料阅读以下内容 该篇我们将完成以下内容: 用户地址簿相关功能 菜品 ...

  8. (转)Github+jsDelivr+PicGo 打造稳定快速、高效免费图床

    转载自:https://www.itrhx.com/2019/08/01/A27-image-hosting/ 写在开头,之前我是使用Gitee作为图床和Picgo搭配使用的 (图片不允许超过1MB) ...

  9. freeswitch媒体协商的三种配置方案

    概述 在企业级VOIP通信中,语音质量是重要的关注点,而语音质量的好坏和媒体编解码有重要的关系. freeswitch作为一款免费开源的软交换平台,支持多种不同的编解码格式,具体详情本文不多描述. 而 ...

  10. [java] JSP post 提交乱码 解决方案

    //在post提交的页面顶部插入下列代码 <% request.setCharacterEncoding("UTF-8"); %>