[IR] Open Source Search Engines
From:http://blog.csdn.net/xum2008/article/details/8740063
本文档是对现有的开源的搜索引擎的一个简单介绍
1. Lucene
Lucene的开发语言是Java, 也是java家族中最为出名的一个开源搜索引擎, 在java世界中已经是标准的全文检索程序, 它提供了完整的查询引擎和索引引擎, 没有中文分词引擎, 需要自己去实现, 因此用Lucene去做一个搜素引擎需要自己去架构.
另外它不支持实时搜索, 但linkedin和twitter有分别对Lucene改进的实时搜素.
其中Lucene有一个C++移植版本叫CLucene, CLucene因为使用C++编写, 所以理论上要比lucene快.
官方主页: http://lucene.apache.org/
CLucene官方主页: http://sourceforge.net/projects/clucene/
2. Sphinx --> 貌似很好吃的样子,可以探索一下
Sphinx是一个用C++语言写的开源搜索引擎,也是现在比较主流的搜索引擎之一, 在建立索引的事件方面比Lucene快50%,
但是索引文件比Lucene要大一倍, 因此Sphinx在索引的建立方面是空间换取事件的策略,
在检索速度上, 和lucene相差不大,
但检索精准度方面Lucene要优于Sphinx,
另外在加入中文分词引擎难度方面, Lucene要优于Sphinx.其中Sphinx支持实时搜索, 使用起来比较简单方便.
官方主页: http://sphinxsearch.com/about/sphinx/
3. Xapian
Xapian是一个用C++编写的全文检索程序,它的api和检索原理和lucene在很多方面都很相似, 算是填补了lucene在C++中的一个空缺.
官方主页: http://xapian.org/
4. Nutch
Nutch是一个用java实现的开源的web搜索引擎, 包括爬虫crawler, 索引引擎,查询引擎.
其中Nutch是基于Lucene的, Lucene为Nutch提供了文本索引和搜索的API.
对于应该使用Lucene还是使用Nutch,应该是如果你不需要抓取数据的话, 应该使用Lucene, 最常见的应用是:
你有数据源, 需要为这些数据提供一个搜索页面, 在这种情况下, 最好的方式是直接从数据库中取出数据, 并用Lucene API建立索引.
官方主页: http://nutch.apache.org/
5. DataparkSearch
DataparkSearch是一个用C语言实现的开源的搜索引擎. 其中网页排序是采用神经网络模型.
其中支持HTTP, HTTPS, FTP,NNTP等下载网页.包括索引引擎, 检索引擎和中文分词引擎(这个也是唯一的一个开源的搜索引擎里有中文分词引擎).
能个性化定制搜索结果, 拥有完整的日志记录.
官方主页: http://www.dataparksearch.org/
6. Zettair
Zettair是根据Justin Zobel的研究成果为基础的全文检索实验系统.它是用C语言实现的. 其中Justin Zobel在全文检索领域很有名气, 是业界第一个系统提出 倒排序索引差分压缩算法 的人,
倒排列表的压缩大大提高了检索和加载的性能, 同时空间膨胀率也缩小到相当优秀的水平.
由于Zettair是源于学术界, 代码是由RMIT University的搜索引擎组织写的, 因此它的代码简洁精炼, 算法高效, 是学习倒排索引经典算法的非常好的实例.
其中支持Linux, windows, mac os等系统.
官方主页: http://www.seg.rmit.edu.au/zettair/about.html
7. Indri
Indri是一个用C语言和C++语言写的全文检索引擎系统, 是由University of Massachusetts和Carnegie Mellon University合作推出的一个开源项目.
特点是跨平台, API接口支持Java, PHP, C++.
官方主页: http://www.lemurproject.org/indri/
8. Terrier
Terrier是由School of Computing Science, Universityof Glasgow用java开发的一个全文检索系统.
官方主页: http://terrier.org/
9. Galago
Galago是一个用java语言写的关于文本搜索的工具集. 其中包括索引引擎和查询引擎, 还包括一个叫TupleFlow的分布式计算框架(和google的MapReduce很像).这个检索系统支持很多Indri查询语言.
官方主页: http://www.galagosearch.org/
10. Zebra
Zebra是一个用C语言实现的检索程序, 特点是对大数据的支持, 支持EMAIL, XML, MARC等格式的数据.
官方主页: https://www.indexdata.com/zebra
11. Solr
Solr是一个用java开发的独立的企业级搜索应用服务器, 它提供了类似于Web-service的API接口, 它是基于Lucene的全文检索服务器, 也算是Lucene的一个变种, 很多一线互联网公司都在使用Solr, 也算是一种成熟的解决方案.
官方主页: http://lucene.apache.org/solr/
12. Elasticsearch
Elasticsearch是一个采用java语言开发的, 基于Lucene构造的开源, 分布式的搜索引擎. 设计用于云计算中, 能够达到实时搜索,稳定可靠. Elasticsearch的数据模型是JSON.
官方主页: http://www.elasticsearch.org/
13. Whoosh
Whoosh是一个用纯Python写的开源搜索引擎.
官方主页: https://bitbucket.org/mchaput/whoosh/wiki/Home
[IR] Open Source Search Engines的更多相关文章
- coursera课程Text Retrieval and Search Engines之Week 1 Overview
Week 1 OverviewHelp Center Week 1 On this page: Instructional Activities Time Goals and Objectives K ...
- [IR] XPath for Search Query
XPath 1.0 XPath Containment Distributed Query Evaluation RE and DFA XPath 1.0 -- 在XML中的使用 XPath 语法: ...
- coursera课程Text Retrieval and Search Engines之Week 4 Overview
Week 4 OverviewHelp Center Week 4 On this page: Instructional Activities Time Goals and Objectives K ...
- coursera课程Text Retrieval and Search Engines之Week 2 Overview
Week 2 OverviewHelp Center Week 2 On this page: Instructional Activities Time Goals and Objectives K ...
- coursera课程Text Retrieval and Search Engines之Week 3 Overview
Week 3 OverviewHelp Center Week 3 On this page: Instructional Activities Time Goals and Objectives K ...
- 本人AI知识体系导航 - AI menu
Relevant Readable Links Name Interesting topic Comment Edwin Chen 非参贝叶斯 徐亦达老板 Dirichlet Process 学习 ...
- The Best Open Source Game Engine: In Search Of Perfection
https://www.greatsoftline.com/the-best-open-source-game-engine-in-search-of-perfection/ The game eng ...
- Odoo ir actions 分析
源代码位置:openerp/addons/base/ir/ir_actions.py 根类型:ir.actions.actions class actions(osv.osv): _name = 'i ...
- Web 检测代码 web analysis 开源 open source
1. Grape Web Statistics Grape Web Statistics is a fairly simple piece of analytics software. Grape i ...
随机推荐
- 当删除某一个jar包时tomcat中出现problem encountered while deleting resources问题
http://blog.csdn.net/u013226462/article/details/17715031
- ios真机调试错误解决:Installation of apps is prohibited by a policy on the device
该问题的出现原因是手机中的访问权限被关闭了,打开方法如下: 设置->通用->访问限制->安装应用程序
- iptables防火墙企业级模板
目前公司业务已大多迁移至内网使用或者使用云主机,防火墙也渐渐不用了,在博客上记录一下,以免以后突然有用却找不到模板了.此防火墙脚本执行时默认清空旧的防火墙规则.放行本地loop网卡,DNS服务,NTF ...
- 树莓派.Qt.打包开发好的程序并运行的方法
Qt开发的软件, 想要部署在树莓派上运行, 需要进行打包和发布 主要步骤如下: 1. 找1个树莓派用于开发与打包, 所以需要在它上面安装Qt开发环境 树莓派上安装Qt的方法, 可以看这里>> ...
- 分布式理论——从ACID到CAP再到BASE
在传统的数据中,有ACID四大原则,在分布式中也有对应的CAP理论和BASE理论,这些都是分布式理论的基础. 更多内容参考:大数据学习之路 ACID ACID分别是Atomicity 原子性.Cons ...
- [转载]安装Oracle11gR2先决条件检查失败的详细解决处理过程
原文地址:安装Oracle11gR2先决条件检查失败的详细解决处理过程作者:四海名汀 最近在32位Win7系统下安装Oracle11g发现一系列错误,现将详细的错误解决过程记录如下,以供大家参考. 一 ...
- Knockout.Js官网学习(加载或保存JSON数据)
前言 Knockout可以实现很复杂的客户端交互,但是几乎所有的web应用程序都要和服务器端交换数据(至少为了本地存储需要序列化数据),交换数据最方便的就是使用JSON格式 – 大多数的Ajax应用程 ...
- 阿里最新热修复Sophix与QQ超级补丁和Tinker的实现与总结
2015年以来,Android开发领域里对热修复技术的讨论和分享越来越多,同时也出现了一些不同的解决方案,如QQ空间补丁方案.阿里AndFix以及微信Tinker(Bugly sdk也集成Tikner ...
- Revit选择增强插件易蜀预选择过滤器
Revit本身提供的选择过滤器能让我们快速选择到我们需要的图元,而将那些不需要的图元排除在选择集之外,如下图所示,假如我们需要选择全部的风管弯头,那么一种方法,我们可以点选,还有就是框选所有弯头,这样 ...
- android学习笔记(8)linearlayout与android:layout_weight学习
一,linearlayout 线性布局,布局文件里设置多个linearlayout来达到总体线性布局的风格. android:gravity="right"对齐方式,居右对齐,gr ...