sphinx增量索引和主索引来实现索引的实时更新

项目中文章的信息内容因为持续有新增，而文章总量的基数又比较大，所以做搜索的时候，用了主索引+增量索引这种方式来实现索引的实时更新。

实现原理：

1. 新建一张表，记录一下上一次已经创建好索引的最后一条记录的ID
2. 当索引时，然后从数据库中取出所有ID大于上面那个sphinx中的那个ID的数据，这些就是新的数据，然后创建一个小的索引文件
3. 把上边我们创建的增量索引文件合并到主索引文件上去
4. 把最后一条记录的ID更新到第一步创建的表中

值得注意的两点：

1）当合并索引的时候，只是把增量的索引合并进主索引中，增量索引本身并不会变化，也不会被删除；

2）当重建主索引的时候，增量索引就会被删除；

具体操作实现流程：

1. 新建一张表，用于存储已经建过索引的最大的doc_id

CREATE TABLE `sph_counter` (

  `counter_id` int() NOT NULL COMMENT '标识不同的数据表',

  `max_doc_id` int() NOT NULL COMMENT '每个索引表的最大ID,会实时更新',

  PRIMARY KEY (`counter_id`)

) ENGINE=InnoDB DEFAULT CHARSET=utf8

2. 配置索引文件

#主索引数据源定义

source article_main

{

    type                    = mysql

    sql_host                =xxx.xxx.xxx.xx

    sql_user                =

    sql_pass                =

    sql_db                  = 

    sql_port                =

    sql_query_pre           = SET NAMES utf8

    sql_query_pre           = REPLACE INTO sph_counter SELECT , MAX(id) FROM documents

   sql_query_range               =

   sql_range_step                =

   sql_query                               = \

                SELECT *\

                FROM documents WHERE id>=$start AND id<=$end

    sql_attr_timestamp        = pubtime  #从SQL读取到的值必须为整数，作为时间属性

    sql_query_info_pre      = SET NAMES utf8                                        #命令行查询时，设置正确的字符集

    sql_query_info            = SELECT * FROM documents WHERE id=$id #命令行查询时，从数据库读取原始数据信息

}

# 增量索引数据源定义

source article_delta : article_main

{

    sql_query_pre = SET NAMES utf8

   sql_query_range               =

   sql_range_step                =

   sql_query                               = \

                SELECT *\

                FROM documents WHERE id>=$start AND id<=$end

    sql_attr_timestamp        = pubtime  #从SQL读取到的值必须为整数，作为时间属性

    # 增量索引创建完成之后，更新最大的doc_id

    sql_query_post  = UPDATE sph_counter  SET max_doc_id=(SELECT MAX(id) FROM documents) where counter_id=

    #                      REPLACE INTO sph_counter SELECT , MAX(id) FROM documents

    sql_query_info_pre      = SET NAMES utf8                                        #命令行查询时，设置正确的字符集

    sql_query_info            = SELECT * FROM article_info WHERE id=$id #命令行查询时，从数据库读取原始数据信息

}

# 主索引index定义

index article_main

{

    source            = article_main             #对应的source名称

    path            = /data/... #请修改为实际使用的绝对路径，例如：/usr/local/coreseek/var/...

    docinfo            = extern

    mlock            =

    morphology        = none

    min_word_len        =

    html_strip                = 

    #中文分词配置，详情请查看：http://www.coreseek.cn/products-install/coreseek_mmseg/

    charset_dictpath = /usr/local/mmseg3/etc/ #BSD、Linux环境下设置，/符号结尾

    #charset_dictpath = etc/                             #Windows环境下设置，/符号结尾，最好给出绝对路径，例如：C:/usr/local/coreseek/etc/...

    charset_type        = zh_cn.utf-

}

# 增量索引index定义

index article_delta : article_main

{

    source = article_delta

    path = /data/....

    docinfo            = extern

    mlock            =

    morphology        = none

    min_word_len        =

    html_strip                = 

    #中文分词配置，详情请查看：http://www.coreseek.cn/products-install/coreseek_mmseg/

    charset_dictpath = /usr/local/mmseg3/etc/ #BSD、Linux环境下设置，/符号结尾

    #charset_dictpath = etc/                             #Windows环境下设置，/符号结尾，最好给出绝对路径，例如：C:/usr/local/coreseek/etc/...

    charset_type        = zh_cn.utf-

}

配置文件中修改好本部分之后，需要重新启动一下searchd进程，让其加载新的配置文件

sudo /usr/local/coreseek4/bin/searchd -c /usr/local/coreseek4/etc/xxxx.conf --stop

sudo nohup /usr/local/coreseek4/bin/searchd -c /usr/local/coreseek4/etc/xxxx.conf &

新建主索引：

sudo /usr/local/coreseek4/bin/indexer -c /usr/local/coreseek4/etc/xxxx.conf article_main --rotate

过一段时间再新建增量索引(需要将此命令放到定时任务中，跑的频率按照实际需求来定)

sudo /usr/local/coreseek4/bin/indexer -c /usr/local/coreseek4/etc/xxxx.conf article_delta --rotate

下一步，自己可以用命令行的search来查询增量索引的内容

/usr/local/coreseek4/bin/search -c /usr/local/coreseek4/etc/xxxx.conf 网络文章

sphinx增量索引和主索引来实现索引的实时更新的更多相关文章

面试|简单描述MySQL中，索引，主键，唯一索引，联合索引的区别，对数据库的性能有什么影响（从读写两方面）
索引是一种特殊的文件(InnoDB 数据表上的索引是表空间的一个组成部分),它们包含着对数据表里所有记录的引用指针. 普通索引(由关键字 KEY 或 INDEX 定义的索引)的唯一任务是加快对数据的 ...
简单描述 MySQL 中，索引，主键，唯一索引，联合索引的区别，对数据库的性能有什么影响（从读写两方面） ?
索引是一种特殊的文件(InnoDB 数据表上的索引是表空间的一个组成部分),它们包含着对数据表里所有记录的引用指针. 普通索引(由关键字 KEY 或 INDEX 定义的索引)的唯一任务是加快对数据的 ...
mysql 主键和唯一索引的区别
主键是一种约束,唯一索引是一种索引,两者在本质上是不同的. 主键创建后一定包含一个唯一性索引,唯一性索引并不一定就是主键. 唯一性索引列允许空值,而主键列不允许为空值. 主键列在创建时,已经默认为非空 ...
sphinx 增量索引与主索引使用测试
2013年10月28日 15:01:16 首先对新增的商品建立增量索引,搜索时只使用增量索引: array (size=1) 0 => array (size=6) 'gid' => st ...
sphinx通过增量索引实现近实时更新
一.sphinx增量索引实现近实时更新设置数据库中的已有数据很大,又不断有新数据加入到数据库中,也希望能够检索到.全部重新建立索引很消耗资源,因为我们需要更新的数据相比较而言很少. 例如.原来的数据 ...
sphinx 增量索引实现近实时更新
一.sphinx增量索引的设置数据库中的已有数据很大,又不断有新数据加入到数据库中,也希望能够检索到.全部重新建立索引很消耗资源,因为我们需要更新的数据相比较而言很少.例如.原来的数据有几百万条 ...
sphinx增量索引
首先建立一个计数表,保存数据表的最新记录ID CREATE TABLE `sph_counter` ( `id` int(11) unsigned NOT NULL, `max_id` int(1 ...
Sphinx 增量索引更新
是基于PHP API调用,而不是基于sphinxSE.现在看来sphinxSE比API调用更简单的多,因为之前没有想过sphinxSE,现在先把API的弄明白.涉及到的:sphinx 数据源的设置,简 ...
sphinx 增量索引及时更新、sphinx indexer索引合成时去旧和过滤办法(转)
一.sphinx增量索引的设置数据库中的已有数据很大,又不断有新数据加入到数据库中,也希望能够检索到.全部重新建立索引很消耗资源,因为我们需要更新的数据相比较而言很少.例如.原来的数据有几百万 ...

随机推荐

为什么说，长跑和爬山能锻炼意志？因为要不停的run，run，run......
长跑和爬山教会我们的是无论做什么都要坚持,教会我们的是生活的态度. 如果不能体会到这一点,那你长跑的意义就是纯粹的锻炼身体. 中国教育的最大败笔就是教会了人学习,却没教会人思考.
Oracle 12C -- 使用local PDB克隆新的PDB
1.将用于克隆的PDB至于只读状态:startup open read only SQL> select con_id,name,open_mode from v$pdbs; CON_ID NA ...
Android MediaPlayer和VideoView的使用
MediaPlayer MediaPlayer类是Androd多媒体框架中的一个重要组件,通过该类,我们可以以最小的步骤来获取,解码和播放音视频.它支持三种不同的媒体来源: 本地资源内部 ...
django -- 用包来组织数据库模型
默认情况下一个django app的所有模型都保存在一个叫models.py的文件中.这样事实是不方便管理的: 通过包来组织模型是比较方便的. 一.第一步:删除models.py: rm -rf mo ...
js json转url参数
var json = { sh: '上海' } var params = Object.keys(json).map(function (key) { // body... return encode ...
MongoDB索引相关文章-摘自网络
索引类型虽然MongoDB的索引在存储结构上都是一样的,但是根据不同的应用层需求,还是分成了唯一索引(unique).稀疏索引(sparse).多值索引(multikey)等几种类型. 唯一索引唯 ...
HAproxy通过X-Forwarded-For 获取代理的上一层用户真实IP地址
现在有一个场景就是我们的haproxy作为反向代理,但是我们接了一个抗DDoS设备.所以现在haproxy记录的IP都是抗DDoS设备的IP地址,获取不到用户的真实IP 这样,我们在haproxy 上 ...
xcode6 怎样下载ios7模拟器
1. 怎样下载ios7模拟器点击xcode.选择"Preferences".选择"downloads",就能够看见IOS 7.1,只是下载有点慢. 2. 怎样 ...
菜鸟学Java（七）——Ajax+Servlet实现无刷新下拉联动
下拉联动的功能可以说非常的常用,例如在选择省.市等信息的时候:或者在选择大类.小类的时候.总之,下拉联动很常用.今天就跟大家分享一个简单的二级下拉联动的功能. 大类下拉框:页面加载的时候就初始化大类的 ...
MySQL 性能跟踪方法
https://www.cnblogs.com/zhoujinyi/p/5236705.html https://dev.mysql.com/doc/refman/5.7/en/slow-query- ...

sphinx增量索引和主索引来实现索引的实时更新

sphinx增量索引和主索引来实现索引的实时更新的更多相关文章

随机推荐

热门专题