这篇文章主要讲simHash算法。这是一种LSH(Locality-Sensitive Hashing,局部敏感哈希)的简单实现。它是广泛用于数据去重的算法,可以用于相似网站、图片的检索。而且当两个样本差别并不大时,算法仍能起效。值得一提的是,该算法的时空复杂度不存在与维度有关的项,所以不会遭遇维度灾难,也可以在维数较高时优化kNN算法。

特征

  此算法(LSH)具有双重性,它们似乎是相悖的:

  • 对于几组不同的特征,hash相同(即冲突)的可能性要尽可能小。这也是hash基本的特征。
  • 对于几组相似的特征(即特征空间中距离小)的特征,hash相同或相似的可能性要尽可能大。这是LSH所具有的特征。

simHash实现

  simHash是LSH的其中一种对于字符串的简单实现。操作步骤如下:

  • 定义一个数代表hash,数的二进制位数可选,一般选择32bit或64bit。同时定义一个与该数位数相同的整形向量v。
  • 分割输入字符串,可以按字符数分割,也可以按空格分割。
  • 对于每个分割出来的字符串做普通hash,记hash出的值为k。约定num[i]代表num的第i位的二进制值。则对k的每位i,若k[i]>0,则v[i]+=weight,否则v[i]-=weight,weight代表该子串的权值。
  • 对于向量v的每一项,若该项大于0,则simHash的相应位置1,否则置0

  这样就可以得出一个字符串的simHash值,时间复杂度为O(|s|)。

子串相似判定

  定义两个字符串相似,即|hammingDist(simHash(str1),simHash(str2))|<=k,k是最大容忍的不同位数,hammingDist为计算两个整数海明距离的函数。海明距离即为两个整数二进制中编码不同的位数。

  根据经验,k一般取3。而海明距离的计算有一种快速的方法,给出C的实现。这种统计二进制中1的个数的算法叫平行算法,本文不再详述。

static int bitCount(unsigned int n){
n=(n &0x55555555)+((n>>)&0x55555555);
n=(n &0x33333333)+((n>>)&0x33333333);
n=(n &0x0f0f0f0f)+((n>>)&0x0f0f0f0f);
n=(n &0x00ff00ff)+((n>>)&0x00ff00ff);
n=(n &0x0000ffff)+((n>>)&0x0000ffff);
return n;
} int hammingDist(unsigned int a,unsigned int b){
return bitCount(a^b);
}

查找工作

  查找新元素与已知集元素是否相似有两种方法。

  1. 时间复杂度为O(N)——线性查找算法
  2. 时间复杂度为O([C(3,32)+C(2,32)+C(1,32)]k)=O(5488k)——组合算法。

  光算出simHash值并没有太大的作用,因为判断新元素与已知集的中元素是否相似仍需较长的时间。尤其是数据量很大的时候。这时可以用一定的预处理算法优化第一种算法。

  假设k=3。优化的方法如下,将32bit或64bit(下文以32bit为例)的hash值平均分为4段。根据抽屉原理,两个字符串的hash中必有1段中没有不同的位。于是可以将每个元素hash的4个8bit作为键均预存储到表中,值为hash的完整值。查找时,只需比较新字符串hash的4个8bit表中的所有完整hash并判断海明距离是否小于等于3。这样优化后,时间复杂度降至O(4k)=O(4*n/(2^9-1))≈O(n/128),虽然仍为线性复杂度,但已经快了不少。

整体实现

  整个simHash系统的实现(C++版本)我已开源至github:https://github.com/Darksun2010/MLlearning/tree/master/LSH

MLlearning(2)——simHash算法的更多相关文章

  1. 字符串匹配算法之SimHash算法

    SimHash算法 由于实验室和互联网基本没啥关系,也就从来没有关注过数据挖掘相关的东西.在实际工作中,第一次接触到匹配和聚类等工作,虽然用一些简单的匹配算法可以做小数据的聚类,但数据量达到一定的时候 ...

  2. 彻底弄懂LSH之simHash算法

    马克·吐温曾经说过,所谓经典小说,就是指很多人希望读过,但很少人真正花时间去读的小说.这种说法同样适用于“经典”的计算机书籍. 最近一直在看LSH,不过由于matlab基础比较差,一直没搞懂.最近看的 ...

  3. 基于局部敏感哈希的协同过滤算法之simHash算法

    搜集了快一个月的资料,虽然不完全懂,但还是先慢慢写着吧,说不定就有思路了呢. 开源的最大好处是会让作者对脏乱臭的代码有羞耻感. 当一个做推荐系统的部门开始重视[数据清理,数据标柱,效果评测,数据统计, ...

  4. xsank的快餐 » Python simhash算法解决字符串相似问题

    xsank的快餐 » Python simhash算法解决字符串相似问题 Python simhash算法解决字符串相似问题

  5. SimHash算法

    短文本合并重复(去重)的简单有效做法 - 旁观者 - 博客园 短文本合并重复(去重)的简单有效做法 SimHash算法 - ACdreamer - 博客频道 - CSDN.NET SimHash算法

  6. 文本去重之SimHash算法

    文本去重之SimHash算法 - pathenon的个人页面 - 开源中国社区 文本去重之SimHash算法

  7. (转)simhash算法原理及实现

    simhash是google用来处理海量文本去重的算法. google出品,你懂的. simhash最牛逼的一点就是将一个文档,最后转换成一个64位的字节,暂且称之为特征字,然后判断重复只需要判断他们 ...

  8. R语言︱文本挖掘——jiabaR包与分词向量化的simhash算法(与word2vec简单比较)

    每每以为攀得众山小,可.每每又切实来到起点,大牛们,缓缓脚步来俺笔记葩分享一下吧,please~ --------------------------- <数据挖掘之道>摘录话语:虽然我比 ...

  9. simhash进行文本查重 Simhash算法原理和网页查重应用

    simhash进行文本查重http://blog.csdn.net/lgnlgn/article/details/6008498 Simhash算法原理和网页查重应用http://blog.jobbo ...

随机推荐

  1. 解决用Eclipse开发Android程序时不能生成R.java的问题

    今天我照着Mars老师的视频教程开始学习Android程序开发. 但是,我的Eclipse死活不能生成R.java文件,新建的工程也不行. 然后我百度,百度出来的结果一般是说这样解决: 1.clean ...

  2. python常用功能总结

    经常写python,但很多小的点都记不住,每用必查,总结下来,下次查自己的吧. 1.时间获取: import time print  time.strftime("%Y-%m-%d %H:% ...

  3. &lt;Android&gt;关于EditText中setInputType和setSingleLine的冲突

    近期自己开发了一个带有删除button的EditText,一方面须要设置为SingleLine,还有一方面又须要设置输入类型,起先在xml文件里设置了android:inputType类型,在自己定义 ...

  4. int a[5]={}, &a+1与(int*)a+1的区别

    #include <iostream> #include <typeinfo> using namespace std; int main() { int b, *pb; ch ...

  5. 第2章 数字之魅——寻找最大的K个数

    寻找最大的K个数 问题描述 在面试中,有下面的问答: 问:有很多个无序的数,我们姑且假定它们各不相等,怎么选出其中最大的若干个数呢? 答:可以这样写:int array[100] …… 问:好,如果有 ...

  6. QT Creator 代码自动补全快捷键设置

    在QT Creater界面点Tools再进Options...(找到environment->Keyboard)在里面找到FakeVim目录下的,发现默认快捷键就是CTRL+SPACE,把它删除 ...

  7. [Qt5] 减少dll依赖和大小(特别是webkit的大小和依赖)

    Qt5的依赖太多, 而且很dll非常大. 折腾了好久, 摸索了一些精简的方法. webkit是个非常蛋疼的东西, 依赖超多, 又很庞大. 所以需不需要webkit是完全不同的. 如何编译Qt5可以参考 ...

  8. python学习笔记(三)--条件语句

    Python 条件语句 Python条件语句是通过一条或多条语句的执行结果(True或者False)来决定执行的代码块. Python 编程中 if 语句用于控制程序的执行,基本形式为: if 判断条 ...

  9. Uva120 Stacks of Flapjacks 翻煎饼

    水水题.给出煎饼数列, 一次只能让第一个到第i个数列全部反转,要求把数列排序为升序. 算法点破后不值几钱... 只要想办法把最大的煎饼放到最后一个,然后就变成前面那些煎饼的数列的子题目了.递归或循环即 ...

  10. TensorFlow安装与测试

    官网:http://tensorflow.org/安装步骤:1.sudo apt-get install python-pip python-dev python-virtualenv 2.virtu ...