ranker.go

package core

import (

    "github.com/huichen/wukong/types"

    "github.com/huichen/wukong/utils"

    "log"

    "sort"

    "sync"

type Ranker struct {

    lock struct {

        sync.RWMutex

        fields map[uint64]interface{}

        docs   map[uint64]bool

    initialized bool

func (ranker *Ranker) Init() {

    if ranker.initialized == true {

        log.Fatal("排序器不能初始化两次")

    ranker.initialized = true

    ranker.lock.fields = make(map[uint64]interface{})

    ranker.lock.docs = make(map[uint64]bool)

// 给某个文档添加评分字段

func (ranker *Ranker) AddDoc(docId uint64, fields interface{}) {

    if ranker.initialized == false {

        log.Fatal("排序器尚未初始化")

    ranker.lock.Lock()

    ranker.lock.fields[docId] = fields

    ranker.lock.docs[docId] = true

    ranker.lock.Unlock()

// 删除某个文档的评分字段

func (ranker *Ranker) RemoveDoc(docId uint64) {

    if ranker.initialized == false {

        log.Fatal("排序器尚未初始化")

    ranker.lock.Lock()

    delete(ranker.lock.fields, docId)

    delete(ranker.lock.docs, docId)

    ranker.lock.Unlock()

// 给文档评分并排序

func (ranker *Ranker) Rank(

    docs []types.IndexedDocument, options types.RankOptions, countDocsOnly bool) (types.ScoredDocuments, int) {

    if ranker.initialized == false {

        log.Fatal("排序器尚未初始化")

    // 对每个文档评分

    var outputDocs types.ScoredDocuments

    numDocs := 0

    for _, d := range docs {

        ranker.lock.RLock()

        // 判断doc是否存在

        if _, ok := ranker.lock.docs[d.DocId]; ok {

            fs := ranker.lock.fields[d.DocId]

            ranker.lock.RUnlock()

            // 计算评分并剔除没有分值的文档

            scores := options.ScoringCriteria.Score(d, fs)

            if len(scores) > 0 {

                if !countDocsOnly {

                    outputDocs = append(outputDocs, types.ScoredDocument{

                        DocId:                 d.DocId,

                        Scores:                scores,

                        TokenSnippetLocations: d.TokenSnippetLocations,

                        TokenLocations:        d.TokenLocations})

                numDocs++

        } else {

            ranker.lock.RUnlock()

    // 排序

    if !countDocsOnly {

        if options.ReverseOrder {

            sort.Sort(sort.Reverse(outputDocs))

        } else {

            sort.Sort(outputDocs)

        // 当用户要求只返回部分结果时返回部分结果

        var start, end int

        if options.MaxOutputs != 0 {

            start = utils.MinInt(options.OutputOffset, len(outputDocs))

            end = utils.MinInt(options.OutputOffset+options.MaxOutputs, len(outputDocs))

        } else {

            start = utils.MinInt(options.OutputOffset, len(outputDocs))

            end = len(outputDocs)

        return outputDocs[start:end], numDocs

    return outputDocs, numDocs

ranker.go的更多相关文章

理解AUC
本文主要讨论了auc的实际意义,并给出了auc的常规计算方法及其证明转载请注明出处:http://www.cnblogs.com/van19/p/5494908.html 1 ROC曲线和auc 从 ...
RankLib参数翻译
写在前面,metric2t指标详解: NDCG(Normalized discounted cumulative gain)即DCG/IDCGCG(cumulative gain)DCG(Discou ...
使用Weka进行数据挖掘
1.简介数据挖掘.机器学习这些字眼,在一些人看来,是门槛很高的东西.诚然,如果做算法实现甚至算法优化,确实需要很多背景知识.但事实是,绝大多数数据挖掘工程师,不需要去做算法层面的东西.他们的精力,集 ...
Sphinx 2.2.6 window下安装全过程未完持续标记~~~~
由于在win8.1下安装选的这个版本 Win64 binaries w/MySQL+PgSQL+libstemmer+id64 support 2.2.6-release 7.3M 下载页面 htt ...
Weka使用介绍
(转) http://baidutech.blog.51cto.com/4114344/1033714/ 1.简介数据挖掘.机器学习这些字眼,在一些人看来,是门槛很高的东西.诚然,如果做算法实现甚至 ...
【Machine Learning】wekaの特征选择简介
看过这篇博客的都应该明白,特征选择代码实现应该包括3个部分: 搜索算法: 评估函数: 数据: 因此,代码的一般形式为: AttributeSelection attsel = new Attribut ...
weka特征选择（IG、chi-square)
一.说明 IG是information gain 的缩写,中文名称是信息增益,是选择特征的一个很有效的方法(特别是在使用svm分类时).这里不做详细介绍,有兴趣的可以googling一下. chi-s ...
Codeigniter 集成sphinx搜索这里采用的是coreseek中文搜索引擎，具体安装请参考官方网站
先上效果图加入sphinx类库(/application/libraries/sphinx_client.php) 0001 <?php 0002 0003 // 0004 // $Id: s ...
php 连接测试sphinx
shpinx.php <?php header("Content-type:text/html;charset=utf-8"); include 'SphinxClient. ...

随机推荐

nasm中的表达式
nasm表达式支持2个特殊的记号 $和$$;前者标识其所在源码行的开始处地址,所以你可以这样写死循环: jmp $ 而后者标识当前段开始处的地址,你可以通过: $-$$ 找出当前代码在段内的偏移. n ...
ZeroMQ 教程 001 : 基本概览
介绍性的话我这里就不翻译了, 总结起来就是zmq很cool, 你应该尝试一下. 如何安装与使用zmq 在Linux和Mac OS上, 请通过随机附带的包管理软件, 或者home brew安装zmq. ...
C# PDF Page操作——设置页面切换按钮
概述在以下示例中,将介绍在PDF文档页面设置页面切换按钮的方法.示例中将页面切换按钮的添加分为了两种情况,一种是设置按钮跳转到首页.下页.上页或者最后一页,另一种是设置按钮跳转到指定页面.两种方法适 ...
你不能错过.net 并发解决方案
BlockingCollection集合是一个拥有阻塞功能的集合,它就是完成了经典生产者消费者的算法功能.所以BlockingCollection 很适合构造流水线模式的并发方案 BlockingCo ...
Django-CKedtior图片找不到的问题
从Django Packages站点上找到这个CKeditor集成组件:https://github.com/shaunsephton/django-ckeditor 按照官方的install方法安装 ...
一些Gym三星单刷的比赛总结
RDC 2013, Samara SAU ACM ICPC Quarterfinal Qualification Contest G 思路卡成智障呀! Round 1:对着这个魔法阵找了半天规律,效果 ...
mysql 关于表与字段的增删改查操作
1.mysql 命令登陆形式: mysql -u用户名 -p密码 mysql -uroot -proot 2.mysql 显示数据库形式: show databases; 3.mysql 进入某一 ...
一天搞懂深度学习-训练深度神经网络(DNN)的要点
前言这是<一天搞懂深度学习>的第二部分一.选择合适的损失函数典型的损失函数有平方误差损失函数和交叉熵损失函数. 交叉熵损失函数: 选择不同的损失函数会有不同的训练效果二.mini- ...
高性能网络通信框架 HP-Socket
HP-Socket 详细介绍 HP-Socket 是一套通用的高性能 TCP/UDP/HTTP 通信框架,包含服务端组件.客户端组件和Agent组件,广泛适用于各种不同应用场景的 TCP/UDP/ ...
第二届强网杯部分writeup
MD5部分第一题一看就有些眼熟 emmmm 查看一下源代码: 重点是这里这里面要求POST上去的参数 param1 != param2 && md5('param1') == m ...

ranker.go

ranker.go的更多相关文章

随机推荐

热门专题