全文检索

  oracle对使用几十万以上的数据进行like模糊查询速度极差,包括 like 'AAA%' ,like '%AAA',like '%AAA%',like '%A%A%'的那些模糊查询。网上有很多文章讲到如何提高like查询,提到 like 'AAA%'能够使用到索引,而like '%AAA' ,使用创建反向函数的索引来提高查询效率。

  为了解决大数据情况下的模糊查询速度慢的问题,oracle创建了全文检索技术.

  即通过Oracle专利的词法分析器(lexer),将文章中所有的表意单元(Oracle称为term)找出来,记录在一组以dr$开头的表中,同时记下该term出现的位置、次数、hash值等信息。检索时,Oracle从这组表中查找相应的term,并计算其出现频率,根据某个算法来计算每个文档的得分(score),即所谓的‘匹配率’。而lexer则是该机制的核心,它决定了全文检索的效率。

  oracle有三个基本的分词器

  -- basic_lexer              针对英文,因为英文都用空格和标点分词,纯英文时建议用它

  -- chinese_vgram_lexer      针对中文,支持所有汉字字符集,以字词为单元,分词较机械

  -- chinese_lexer            针对中文,只支持utf8字符集,只认高频常用字词,效率更高,中文时建议用它.

数数据量达到百万级别以上时,在单列上建立的全文索引相比普通索引的查询速度那将是天差地别的.

准备工作

  在使用前如果以下语句不能正常执行,那定是DBA没有给该User赋权限.

1检查和设置数据库角色

  首先检查数据库中是否有CTXSYS用户和CTXAPP脚色。如果没有这个用户和角色,意味着你的数据库创建时未安装intermedia功能。你必须修改数据库以安装这项功能。默认安装情况下,ctxsys用户是被锁定的,因此要先启用ctxsys的用户。

  ctxsys用户默认是被锁定的且密码即时失效,所以我们以sys用户进入em,然后修改ctxsys用户的状态和密码。

2赋权 

  以abc用户下的tbl_my_lex表为例.

  先以sys用户DBA身份登录,对abc赋resource,connect权限:

GRANT resource, connect  to abc;

  

再以ctxsys用户登录并对abc用户赋权

GRANT  ctxapp  to  abc;

GRANT execute ON ctxsys. ctx_cls  TO abc;

GRANT execute ON ctxsys. ctx_ddl  TO abc;

GRANT execute ON ctxsys. ctx_doc  TO abc;

GRANT execute ON ctxsys. ctx_output TO abc;

GRANT execute ON ctxsys. ctx_query TO abc;

GRANT execute ON ctxsys. ctx_report  TO abc;

GRANT execute ON ctxsys. ctx_thes  TO abc;

GRANT execute ON ctxsys. ctx_ulexer TO abc;

  

基本语法

然后以abc用户登录 :

conn  abc/abc;

  

--------------------------------------------------------------------------------------

-- 建表

Create table tbl_my_lex (id number primary key, info varchar2(1000));

Insert into tbl_my_lex values (1, 'this is a example for the basic_lexer');

Insert into tbl_my_lex values (2, 'he following example sets Printjoin characters ');

Insert into tbl_my_lex values (3, 'To create the INDEX with no_theme indexing ');

Insert into tbl_my_lex values (4, '中华人民共和国');

Insert into tbl_my_lex values (5, '中国淘宝软件');

Insert into tbl_my_lex values (6, '测试basic_lexer 是否支持中文');

Commit;

  

--------------------------------------------------------------------------------------

-- 创建一个名为my_chinese_lexer的chinese_lexer格式的分词器

Begin

ctx_ddl.create_preference('my_chinese_lexer', 'chinese_lexer');

End;

/

  

--------------------------------------------------------------------------------------

-- 对tbl_my_lex这张表的info列的信息建立一个名为IDX_TBL_COL的索引

Create index IDX_TBL_COL on tbl_my_lex (info) indextype is ctxsys.context parameters ('lexer my_chinese_lexer');

  

--------------------------------------------------------------------------------------

-- 以刚才建立的全文索引方式进行查询

Select * from tbl_my_lex where contains(info, '中国') > 0;

  

--------------------------------------------------------------------------------------

↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑如果表是死的不会增删,那么到此为止就够了↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑

↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓如果表是活的,会动态增加,那么继续往下看↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓

-- 存过1,同步索引,即把新增的记录,添加到索引的检索范围

begin

ctx_ddl.sync_index('IDX_TBL_COL'); 

end;

/

-- 意为如果新增一行记录,不用ctx_ddl .sync_index,

-- 直接 Select * from tbl_my_lex where contains(info, '中国') > 0;查到的结果是不会改变的

  

--------------------------------------------------------------------------------------

-- 存过2,同步索引,即把删除的记录,踢出索引的检索范围

begin

ctx_ddl.optimize_index('INX_CUSTOMINFO_ADDR_DOCS', 'FAST');

end;

/

-- 意为如果删除一行记录,不用ctx_ddl .sync_index,

-- 直接 Select * from tbl_my_lex where contains(info, '中国') > 0;查到的结果是不会改变的

  

--------------------------------------------------------------------------------------

-- 网上文章说: 65万记录的一个表建立索引只需要20分钟,同步一次约1分钟

-- 所以对存过1和存过2作job定时是很有必要的.

  

-- 其它语句

--------------------------------------------------------------------------------------

-- 删除一个名为my_chinese_lexer的chinese_lexer格式的分词器

Begin

ctx_ddl.drop_preference('my_chinese_lexer');

End;

/

  

--------------------------------------------------------------------------------------

DROP  INDEX  IDX_TBL_COL  FORCE; -- 强行删除索引

  

--------------------------------------------------------------------------------------

参考

http://chaoji-liangbin.blog.163.com/blog/static/252392122010915101351354/

http://blog.chinaunix.net/uid-14107-id-2844042.html

http://blog.itpub.net/15962/viewspace-1005675/

oracle全文检索的更多相关文章

  1. oracle 全文检索

    一.使用 sys 用户登录oracle (1)运行—cmd—sqlplus — sys/密码 @连接字符 as sysdba 二.授权 1.grant ctxapp to 全文检索使用用户: 2.gr ...

  2. 找到一篇关于 Oracle 全文检索实践 的文章

    http://www.iteye.com/topic/1118055 有详细的例子记录了Oracle 全文检索的使用.

  3. oracle 全文检索创建脚本示例

    --创建全文索引 grant execute on ctx_ddl to username;--使用其他帐号对username授权exec ctx_ddl.create_preference('my_ ...

  4. oracle全文检索【转】【补】

    全文检索 oracle对使用几十万以上的数据进行like模糊查询速度极差,包括 like 'AAA%' ,like '%AAA',like '%AAA%',like '%A%A%'的那些模糊查询.网上 ...

  5. oracle 全文检索技术

    1.查看用户: select * from dba_users WHERE username='CTXSYS';select * from dba_users WHERE username='CTXS ...

  6. 转 Oracle全文检索http://docs.oracle.com/cd/E11882_01/text.112/e24436/toc.htm

    SQL > exec ctx_ddl.create_preference ('my_test_lexer','chinese_lexer') : PL/SQL 过程成功完成 SQL > E ...

  7. oracle全文检索笔记

    1.删除词法解析器 exec ctx_ddl.drop_preference('my_lexer'); 2.创建中文词法解析器 exec ctx_ddl.create_preference ('my_ ...

  8. 写给大忙人的Elasticsearch架构与概念(未完待续)

    最新版本官方文档https://www.elastic.co/guide/en/elasticsearch/reference/current/index.html文档增删改参考https://www ...

  9. 全文检索- Oracle/MySql/达梦

    简单使用语法: MySql: ALTER TABLE dataset_ods ENGINE = MyISAM; //5.6后的InnoDB支持全文索引 ALTER TABLE dataset_ods ...

随机推荐

  1. python学习之路(一)屌丝逆袭之路

    变量                                                                                                  ...

  2. ES TIPS

    1,Testing Analyzers Especially when you are new to Elasticsearch, it is sometimes difficult to under ...

  3. error LNK2005: _DllMain@12 已经在 dllmain.obj 中定义

    error LNK2005: _DllMain@ 已经在 dllmain.obj 中定义 今天遇到了同样的问题,搜索搜到了这里,后来解决了........ 创建解决方案时,用的是WIN32 DLL,添 ...

  4. SocketTcpClient

    public class SocketTcpClient { public static string ErrorMsg = string.Empty; private static Socket _ ...

  5. Oracle常见的几种等待事件

    1. CPU time CPU time其实不是真正的等待事件.是衡量CPU是否瓶颈的一个重要指标.一般来讲,一个良好的系统,CPU TIME 应该排在TOP 5 TIME Event的最前面. 当然 ...

  6. c#定义全局条件编译符号

    在"工程"上单机右键,"属性"--->"生成"--->"条件编译符号"后边的输入框中,输入自定义的条件编译变 ...

  7. Linxu IO测试软件

    fio 安装 apt-get install fio fdisk -l Device Boot Start End Blocks Id System/dev/sda1 * 2048 968390655 ...

  8. server application error应用错误

    本地使用IIS测试ASP脚本网页,结果发现提示[Server Application Error The server has encountered an error while loading a ...

  9. duplicate symbols for architecture armv7解决办法

    XCODE编译的时候报错:duplicate symbols for architecture armv7   1.首先排查是否有名字重复的文件:   2.检查是否在#import头文件的时候,不小心 ...

  10. [HTML] CSS 语法

    CSS 实例 CSS 规则由两个主要的部分构成:选择器,以及一条或多条声明: 选择器通常是您需要改变样式的 HTML 元素. 每条声明由一个属性和一个值组成. 属性(property)是您希望设置的样 ...