sphinx调用原理

只需要提交要查询,sphinx将返回唯一的id号

 API调用

1.创建连接 

$sphinx = new SphinxClient();
$sphinx->SetServer ( 'loclahost', 9312 );//建立连接
$sphinx->SetConnectTimeout(3);//连接超时时间,单位ms,0不限制
$sphinx->SetMaxQueryTime(10);//最大查询时间 $sphinx->SetArrayResult ( true );//搜索结果以数组格式返回,否则为hash

  

2.匹配查询

  (1)查询分页 

$sphinx->SetLimits($offset, $limit, $max_matches);

  

  (2)设置查询模式

$sphinx->SetMatchMode ( $mode );

  $mode--SPH_MATCH_ALL   匹配所有查询词(默认模式)

       SPH_MATCH_ANY  匹配查询词中的任意一个

       SPH_MATCH_PHRASE  将整个查询看作一个词组,要求按顺序完整匹配

       SPH_MATCH_BOOLEAN  将查询看作一个布尔表达式

       SPH_MATCH_EXTENDED  将查询看作一个CoreSeek/Sphinx内部查询语言的表达式 . 从版本Coreseek 3/Sphinx 0.9.9开始, 这个选项被选项SPH_MATCH_EXTENDED2代替,它提供了更多功能和更佳的性能。保留这个选项是为了与遗留的旧代码兼容

       
       SPH_MATCH_EXTENDED2  使用第二版的“扩展匹配模式”对查询进行匹配。该扩展匹配模式允许使用一些像mysql的条件语句

       SPH_MATCH_FULLSCAN, 强制使用下文所述的“完整扫描”模式来对查询进行匹配。注意,在此模式下,所有的查询词都被忽略,尽管过滤器、过滤器范围以及分组仍然起作用,但任何文本匹配都不会发生

      

  (3)设置排序模式

$sphinx->SetSortMode ( $mode, $sortby="");

  $mode--SPH_SORT_RELEVANCE 模式, 按相关度降序排列(最好的匹配排在最前面)

       SPH_SORT_ATTR_DESC 模式, 按属性降序排列 (属性值越大的越是排在前面)

       SPH_SORT_ATTR_ASC 模式, 按属性升序排列(属性值越小的越是排在前面)

       SPH_SORT_TIME_SEGMENTS 模式, 先按时间段(最近一小时/天/周/月)降序,再按相关度降序

       SPH_SORT_EXTENDED 模式, 按一种类似SQL的方式将列组合起来,升序或降序排列。

       SPH_SORT_EXPR 模式,按某个算术表达式排序

    注:

      在SPH_SORT_EXTENDED 模式中,涉及的属性(包括内部属性)不能超过5个

      内部属性名字以@开头

      已知的内部属性:

          @id           匹配id

          @weight     匹配权值

          @rank     匹配权值

          @relevance  匹配权值

        @rank和@relevance是@weight的别名

  (4)结果集过滤

     A.ID过滤       

$sphinx->SetIdRange($min, $max);

    限制ID在某个范围内参数必须为整数,默认为(0,0)

      B.字段(属性)过滤

$sphinx->SetFilter($attribute, $value,$exclude=false);

  增加整数值过滤器

$sphinx->SetFilterRange($attribute, $min,$max,$exclude=false);

  增加整数范围过滤器

$sphinx->SetFilterFloatRange($attribute, $min,$max,$exclude=false);

  增加浮点数过滤器

  说明:

    $exclude为布尔值,true-接受匹配的文档,false拒绝

  (5) 执行查询  

$sphinx->Query ( $query, $index="*" );

  $query查询字符串

  $index 包含一个或多个索引名的字符串,需要和sphinx端配置文件的索引名一致

  若发生错误,返回false并设置GetLastError()信息

  若返回成功,返回搜索的结果集,默认是hash。包含的键值:

    matches------hash表,存储文档ID以及其对应的另一个包含文档权重和属性值的hash表

    total----------此查询在服务器检索所得的匹配文档数

    total_found--索引中匹配文档的总数

    words---------一个hash,将查询关键字映射到一个关于关键字的统计数据的小hash表上

    error----------search的报告的错误信息。无错误,空串

    warning-------search的报告的警告信息。无警告,空串

    time-----------查询所需时间

    

$res = $cl->Query("pen",'*');
if ( $res===false )
{
print "Query failed: " . $cl->GetLastError() . ".<br/>"; } else
{
if ( $cl->GetLastWarning() )
print "WARNING: " . $cl->GetLastWarning() . "<br/>"; print "Query retrieved $res[total] of $res[total_found] matches in $res[time] sec.<br/>";
print "Query stats:<br>";
if ( is_array($res["words"]) )
foreach ( $res["words"] as $word => $info )
print " '$word' found $info[hits] times in $info[docs] documents<br/>";
print "<br/>"; if ( is_array($res["matches"]) )
{
$n = 1;
$matches = $res['matches'];
$ids = array_keys($matches);
var_dump($ids);
} }

 

注:total_found 是在索引中找到的匹配总数,而 found 是返回的结果数

3.输出结果

  (1)根据数组$ids从数据库获取信息

  (2)对信息进行过滤

    eg:去除标签

      strip_tags($string,$allow)

  (3)信息的处理

    eg:产生文档和关键词高亮

      $sphinx->BuildExcerpts($doc,$index,$words,$opts=array());

    说明:

      $doc   ---包含字符串的数组

      $index---包含索引名的字符串

      $words---包含需要高亮的关键词字符串

      $opts-----其他可选

        before_match-----在匹配关键词前插入字符串,默认<br>

        after_match-------在匹配关键词后插入字符串,默认</br>

        chunk_separator--在摘要块之间插入的字符串 ,默认…

        limit----------------摘要最多包含的符号数,默认256

        around-------------每个关键词块左右选取的词的数目,默认5

        exact_phrase------是否仅抽取最佳的一个段落

        

4.异常处理

  (1)GetLastError()返回最近的错误信息

    

if($sphinx->GetLastError()){
   var_dump($sphinx->GetLastError());
}

  

  (2)GetLastWarning() 返回最近的警告信息

  

if($sphinx->GetLastWarning()){
   var_dump($sphinx->GetLastWarning());
}

  

说明:

  (1)sphinx并不会返回像mysql那样的数据数组,因为sphinx本来就没有记录完整的数据,只记录被分词后的数据。

  所以要获取到真实数据还要根据matches中的ID去搜索mysql的表,但总体来说这样一来一回的速度还是远远比mysql的LIKE快得多,前提是几十万数据量以上,否则用sphinx只会更慢。 

  (2)修改配置完成后要重新建立索引才能生效

    

  

sphinx应用的更多相关文章

  1. 利用sphinx为python项目生成API文档

    sphinx可以根据python的注释生成可以查找的api文档,简单记录了下步骤 1:安装 pip install -U Sphinx 2:在需要生成文档的.py文件目录下执行sphinx-apido ...

  2. 安装PHP sphinx扩展 sphinx-1.1.0/sphinx.c:105:2: error: too few arguments 错误

    表现: /home/sphinx-1.1.0/sphinx.c: In function 'php_sphinx_client_read_property':/home/sphinx-1.1.0/sp ...

  3. 【整理】Linux下中文检索引擎coreseek4安装,以及PHP使用sphinx的三种方式(sphinxapi,sphinx的php扩展,SphinxSe作为mysql存储引擎)

          一,软件准备 coreseek4.1 (包含coreseek测试版和mmseg最新版本,以及测试数据包[内置中文分词与搜索.单字切分.mysql数据源.python数据源.RT实时索引等测 ...

  4. coreseek+sphinx+mysql+thinkphp整合

    1.安装coreseek 1.1首先升级或安装系统依赖库 yum install make gcc g++ automake libtool mysql-client libmysqlclient15 ...

  5. 全文检索解决方案(lucene工具类以及sphinx相关资料)

    介绍两种全文检索的技术. 1.  lucene+ 中文分词(IK) 关于lucene的原理,在这里可以得到很好的学习. http://www.blogjava.net/zhyiwww/archive/ ...

  6. 如何将Sphinx生成的html文档集成进入Django

    参考 http://stackoverflow.com/questions/10594618/django-and-sphinx-how-to-view-the-html-sphinx-generat ...

  7. Linux下搭建coreseek(sphinx+mmseg3)全文检索

    测试平台:Center OS 1.设置环境,升级/安装系统基础依赖包:m4.autoconf.automake.libtool #设置路径和中文环境: $ export PATH=/usr/local ...

  8. debian下使用Sphinx异常“Could not import extension sphinx.builders.linkcheck (exception: cannot import name SSLError)”的解决

    最近使用到Sphinx编译文档,出现如下异常: Extension error:Could not import extension sphinx.builders.linkcheck (except ...

  9. [搜索引擎]Sphinx的介绍和原理探索

    What/Sphinx是什么 定义 Sphinx是一个全文检索引擎. 特性 索引和性能优异 易于集成SQL和XML数据源,并可使用SphinxAPI.SphinxQL或者SphinxSE搜索接口 易于 ...

  10. Sphinx安装配置应用

    Sphinx 是由俄罗斯人Andrew Aksyonoff开发的一个全文搜索引擎.意图为其他应用提供高速.地空间占用.高结果相关度的全文搜索功能.Sphinx可以非常容易的与SQL数据库和脚本语言集成 ...

随机推荐

  1. 在eclipse中把Tomcat 8删掉不能重建问题,启动Tomcat重置本地配置问题

    转载:http://blog.csdn.net/caiwenfeng_for_23/article/details/45480039 PS: 今天手贱,把Eclipse里的tomcat删掉了,然后发现 ...

  2. iOS-自动布局Autolayout(原创)

    前言 基础知识 在一定情况下我们需要用到自动布局(autolayout) 这样我们就能使视图与视图之间的位置相互关联起来 横向:距离父视图左侧100 视图本身的宽度最小是100 距离父视图右侧是100 ...

  3. Java和WebSocket开发网页聊天室

    小编心语:咳咳咳,今天又是聊天室,到现在为止小编已经分享了不下两个了,这一次跟之前的又不大相同,这一次是网页聊天室,具体怎么着,还请各位看官往下看~ Java和WebSocket开发网页聊天室 一.项 ...

  4. Android 高级面试题及答案

    一 性能优化 1.如何对 Android 应用进行性能分析 android 性能主要之响应速度 和UI刷新速度. 可以参考博客:Android系统性能调优工具介绍 首先从函数的耗时来说,有一个工具Tr ...

  5. ORACLE告警日志文件

    告警日志介绍 告警日志文件是一类特殊的跟踪文件(trace file).告警日志文件命名一般为alert_<SID>.log,其中SID为ORACLE数据库实例名称.数据库告警日志是按时间 ...

  6. SQL Server修改数据库对象所有者(Owner)浅析

    在SQL Server数据库中如何修改数据库对象(表.视图.存储过程..)的所有者(Owner)呢?一般我们可以使用系统提供的系统存储过程sp_changeobjectowner来修改. 我们先看看s ...

  7. SQL Server 2000:快速清除日志文件的方法

    通过文章 SQL Server中“数据收缩”详解 和 SQLServer删除log文件和清空日志的方法 可以整理出一种快速删除数据库日志的方法,即 第一步:清空日志文件里的数据: 第二步:收缩日志文件 ...

  8. 使用 python 获取 httpd 程序所占用物理内存

    #!/usr/bin/env python #encoding: utf-8 ''' 思路: /proc/xx_pid/status 文件中的关键字段 VmRSS 来获取某个进程占用的物理内存 步骤: ...

  9. C# 自定义文件图标 双击启动 (修改注册表)

    程序生成的自定义文件,比如后缀是.test 这种文件怎么直接启动打开程序,并打开本文件呢 1.双击打开 2.自定义的文件,有图标显示 3.自定义的文件,点击右键有相应的属性 后台代码:(如何在注册表中 ...

  10. linux中通配符和常用特殊符号

    1 通配符   2 特殊符号 3 参考文档 鸟哥的私房菜 http://vbird.dic.ksu.edu.tw/linux_basic/0320bash_4.php#settings_wildcar ...