TNTSearch 轻量级全文索引+中文分词

选用 TNTSearch 的原因：轻，方便移植，不需要额外安装服务，能减少后期维护的工作量。搜索的效果也还不错，可以满足大多数项目场景，如果对性能和精准度要求较高，还是使用 Elasticsearch 吧。因TNTSearch使用的逗号空格分词，所以我们还需要一个中文分词的服务。
这里我选用的是 fukuball/jieba-php 选它的原因也是轻量，也不需要过多的依赖，部署方便。

TNTSearch 集成教程
https://laravel-china.org/articles/3702/full-text-indexing-engine-implemented-in-tntsearch-php
教程讲的很清楚，也没有什么坑，根据教程一步步来就可以了。这里就不在重复了。

下面主要说说 TNTSearch 怎么集成 fukuball/jieba-php 中文分词。

安装 fukuball/jieba-php

composer composer require fukuball/jieba-php:dev-master

注：fukuball/jieba-php 分词对内存有要求，如果内存过小，分词的时候可能会报错。

开始集成

修改配置 app/config/scout.php 增加 jieba 的配置项

'tntsearch' => [

    ...

    'tokenizer' => [

        ...

        'jieba' => [

            'dict' => 'small',

        ],

       ....

    ],

    ...

],

新建一个 Tokenizer
app/Handlers/TokenizerHandler.php

<?php

namespace App\Handlers;

use Fukuball\Jieba\Jieba;

use Fukuball\Jieba\Finalseg;

use TeamTNT\TNTSearch\Support\TokenizerInterface;

class TokenizerHandler implements TokenizerInterface

{

public function __construct(array $options = [])

{

    Jieba::init($options);

    Finalseg::init($options);

}

public function tokenize($text, $stopwords = [])

{

    return is_numeric($text) ? [] : $this->getTokens($text, $stopwords);

}

public function getTokens($text, $stopwords = [])

{

    $split = Jieba::cutForSearch($text);

    return $split;

}

}

新建服务提供者，用来取代 laravel-scout-tntsearch-driver 默认的服务提供者
app/Providers/ScoutServiceProvider.php

<?php

namespace App\Providers;

use TeamTNT\TNTSearch\TNTSearch;

use Laravel\Scout\EngineManager;

use TeamTNT\Scout\Console\ImportCommand;

use TeamTNT\Scout\Engines\TNTSearchEngine;

use TeamTNT\Scout\TNTSearchScoutServiceProvider;

use App\Handlers\TokenizerHandler;

class ScoutServiceProvider extends TNTSearchScoutServiceProvider

{

public function boot()

{

    $this->app[EngineManager::class]->extend('tntsearch', function ($app) {

        $tnt = new TNTSearch();

        $driver = config('database.default');

        $config = config('scout.tntsearch') + config("database.connections.{$driver}");

        $tnt->loadConfig($config);

        # 注入中文分词服务

        $tnt->setTokenizer(new TokenizerHandler(config('scout.tntsearch.tokenizer.jieba')));

        $tnt->setDatabaseHandle(app('db')->connection()->getPdo());

        $this->setFuzziness($tnt);

        $this->setAsYouType($tnt);

        return new TNTSearchEngine($tnt);

    });

    if ($this->app->runningInConsole()) {

        $this->commands([

            ImportCommand::class,

        ]);

    }

}

}

注册服务提供者，将 TNTSearchScoutServiceProvider 取消注册
app/config/app.php

...

'providers' => [

    ...

    SocialiteProviders\Manager\ServiceProvider::class,

    # TeamTNT\Scout\TNTSearchScoutServiceProvider::class,

    ...

]

...

至此集成完毕，可以去测试一下效果。
当然也可以根据 laravel-scout-tntsearch-driver 源码修改，然后打包成一个自己包，只是这样以后就失去了原包的升级服务。可以自行取舍，没有对错，适合就好。

如果有问题可以一起探讨一下。
我开源的 laraCMS 已集成了 TNTSearch ，如果有兴趣可以去github查看源码，也可以去在线体验

Github: https://github.com/wanglelecc/laracms
预览：https://www.56br.com/

TNTSearch 轻量级全文索引 + 中文分词的更多相关文章

轻量级的中文分词工具包 - IK Analyzer
IK Analyzer是一个开源的,基于java语言开发的轻量级的中文分词工具包.从2006年12月推出1.0版开始, IKAnalyzer已经推出了4个大版本.最初,它是以开源项目Luence为应用 ...
Lucene的中文分词器IKAnalyzer
分词器对英文的支持是非常好的. 一般分词经过的流程: 1)切分关键词 2)去除停用词 3)把英文单词转为小写但是老外写的分词器对中文分词一般都是单字分词,分词的效果不好. 国人林良益写的IK Ana ...
Elasticsearch安装ik中文分词插件（四）
一.IK简介 IK Analyzer是一个开源的,基于java语言开发的轻量级的中文分词工具包.从2006年12月推出1.0版开始, IKAnalyzer已经推出了4个大版本.最初,它是以开源项目Lu ...
Java实现敏感词过滤 - IKAnalyzer中文分词工具
IKAnalyzer 是一个开源的,基于java语言开发的轻量级的中文分词工具包. 官网: https://code.google.com/archive/p/ik-analyzer/ 本用例借助 I ...
IK 中文分词器
链接:https://github.com/wks/ik-analyzerIKAnalyzer是一个开源的,基于java语言开发的轻量级的中文分词工具包.从2006年12月推出1.0版开始,IKAna ...
Kafka：ZK+Kafka+Spark Streaming集群环境搭建（十九）ES6.2.2 安装Ik中文分词器
注: elasticsearch 版本6.2.2 1)集群模式,则每个节点都需要安装ik分词,安装插件完毕后需要重启服务,创建mapping前如果有机器未安装分词,则可能该索引可能为RED,需要删除后 ...
Lucene系列四：Lucene提供的分词器、IKAnalyze中文分词器集成、扩展 IKAnalyzer的停用词和新词
一.Lucene提供的分词器StandardAnalyzer和SmartChineseAnalyzer 1.新建一个测试Lucene提供的分词器的maven项目LuceneAnalyzer 2. 在p ...
推荐十款java开源中文分词组件
1:Elasticsearch的开源中文分词器 IK Analysis(Star:2471) IK中文分词器在Elasticsearch上的使用.原生IK中文分词是从文件系统中读取词典,es-ik本身 ...
搜索引擎ElasticSearch系列（五）： ElasticSearch2.4.4 IK中文分词器插件安装
一:IK分词器简介 IK Analyzer是一个开源的,基于java语言开发的轻量级的中文分词工具包.从2006年12月推出1.0版开始, IKAnalyzer已经推出了4个大版本.最初,它是以开源 ...

随机推荐

Codeforces 986D Perfect Encoding FFT
题意: 给定一个数n,选出m个数使得 $\Pi_{i=1}^m a_i\ge n$,求$\sum_{i=1}^m a_i$的最小值 ,其中$m$的大小不限 $n$的长度$\le 10^6$ 简单的计算 ...
Xtreme8.0 - Sum it up 水题
Sum it up 题目连接: https://www.hackerrank.com/contests/ieeextreme-challenges/challenges/sum-it-up Descr ...
移动端web，tap与click事件
一.tap与click的区别两者都会在点击时系统自动触发,但是在手机WEB端,click会有 200~300 ms.延迟来自判断双击和长按,因为只有默认等待时间结束以确定没有后续动作发生时,才会触发 ...
SGU 275. To xor or not to xor （高斯消元法）
题目链接:http://acm.sgu.ru/problem.php?contest=0&problem=275 题意:给你n个数,可以选择任意个数异或,但是要使得最后的异或值最大. 我们把每 ...
DMA Stream/Channel Outputting via GPIOC[0..7]
Ok, so quickly mashing up another example using a different TIM, DMA Stream/Channel for illustration ...
Uniscribe相关文章
相关资料很少 http://msdn.microsoft.com/en-us/library/windows/desktop/dd374127(v=vs.85).aspx http://www.cnb ...
Linux kernel AIO
http://blog.csdn.net/abcd1f2/article/details/47440087
谈谈Unicode编码，简要解释UCS、UTF、BMP、BOM等名词
这是一篇程序员写给程序员的趣味读物.所谓趣味是指可以比较轻松地了解一些原来不清楚的概念,增进知识,类似于打RPG游戏的升级.整理这篇文章的动机是两个问题: 问题一: 使用Windows记事本的“另存为 ...
Java链式异常
以下实例演示了使用多个 catch 来处理链试异常:public class Main { public static void main (String args[])throws Exceptio ...
Java Calendar,Date,DateFormat,TimeZone,Locale等时间相关内容的认知和使用(2) 自己封装的Calendar接口
本章主要是收藏一些常用的类和接口,包括:万年历(农历.阳历节日.阴历节日).自定义的Calendar接口. 万年历源码如下(ChineseCalendar.java): package com.vi ...

TNTSearch 轻量级全文索引 + 中文分词

TNTSearch 轻量级全文索引+中文分词

TNTSearch 轻量级全文索引 + 中文分词的更多相关文章

随机推荐

热门专题