Information Retrieval II

【Information Retrieval II】

　　搜索引擎分类：

　　　　1、目录式搜索引擎。

　　　　2、全文搜索引擎。

　　　　3、元搜索引擎(Meta-Search Engine)。

　　搜索引擎的4个阶段：下载(crawl) -> 分析（segment & pagerank）-> 索引（indexing）-> 查询（retrieval）。

　　crawler，也就是传说中的爬虫，或者蜘蛛。

　　下载、分析、索引被称为“离线部分”(offline part)，也叫做在线系统；查询部分被称为“在线部分“(online part)，也叫做离线系统。在线系统需要毫秒级的访问速度，而离线系统无时间要求，所以大部数的离线工作会设计成需要1-4周。

　　对于网页搜索（即传说中的大搜索），存储分为网页数据（镜像）和网页索引。

【网页抓取策略】

　　网页的重要性：　　

　　1、链接欢迎度：反向链接。

　　2、链接重要度：包括.com或home的URL重要度高，以及具有较少斜框‘/’的重要度高。

　　3、平均链接深度：离种子网页越近的重要度越高。

　　所以，重要性=a*反向链接标量 + b*链接重要度标量。

【Robots协议】

　　robots协议是一个robots.txt名字的文件，放置在站点的根目录上。里面记录了哪些是不让抓取的目录。

【抓取提速策略】

　　1、提高抓取单个网页的速度。(被证明基本不可行)

　　2、尽可能减少不必要的抓取任务。（难度大）

　　3、增加同时工作的爬虫数量。（可行）

　　　　对于小的网站，为了节省成本，通过多个域名会映射到一个IP；而对于大型网站，因为访问量大，使用了负载均衡，即一个域名对应多个IP。所以无论按域名还是按IP来分工crawler的任务，都会有重复。在实际应用中，通过是按照域名来划分crawler任务，国为小在网页即始重复数据也不多，可以接受。

【网页结构化数据】

anchor，全称是anchor text，中文名字叫锚文本。

【齐普夫法则】

　　齐普夫法则为：第k个最经常出现的词，其词频与1/k成正比。即第k常出现的词，他的出现率为一个常量的1/k。

Information Retrieval II的更多相关文章

Information retrieval信息检索
https://en.wikipedia.org/wiki/Information_retrieval 信息检索 (一种信息技术) 信息检索(Information Retrieval)是指信息按一定 ...
Deep Learning for Information Retrieval
最近关注了一些Deep Learning在Information Retrieval领域的应用,得益于Deep Model在对文本的表达上展现的优势(比如RNN和CNN),我相信在IR的领域引入Dee ...
Information Retrieval 倒排索引学习笔记
一,问题描述在Shakespeare文集(有很多文档Document)中,寻找哪个文档包含了单词“Brutus”和"Caesar",且不包含"Calpurnia&quo ...
Information Retrieval
[Information Retrieval] 1.信息检索/获取(Information Retrieval,简称IR) 是从大规模非结构化数据(通常是文本)的集合(通常保存在计算机上)中找出满足用 ...
Music information retrieval
Music information retrieval - Wikipedia https://en.wikipedia.org/wiki/Music_information_retrieval Mu ...
Information retrieval (IR class1)
1. 什么是IR? IR与数据库的区别? 答:数据库是检索结构化的数据,例如关系数据库:而信息检索是检索非结构化/半结构化的数据,例如:一系列的文本.信息检索是属于NLP(自然语言处理)里面最实用的一 ...
IRGAN：A Minimax Game for Unifying Generative and Discriminative Information Retrieval Models
https://arxiv.org/pdf/1705.10513.pdf 论文阅读笔记: https://www.cnblogs.com/liaohuiqiang/p/9694277.html htt ...
Information retrieval (IR class2)
1. 解析文档一般要分析哪些方面? - 首先分析文档的格式,是docx,html,xml,pdf... - 其次分析文档的语言,是英语,汉语,日语,德语... - 使用的什么字符集,ASCII编码, ...
information retrieval (CMU 11642)
1. Heap's law. predict the number of new vocabulary. 参考:https://www.youtube.com/watch?v=JDp12gU-vEQ ...

随机推荐

C++设计模式之桥接模式
[DP]书上定义:将抽象部分与它的实现部分分离,使它们都可以独立地变化.考虑装操作系统,有多种配置的计算机,同样也有多款操作系统.如何运用桥接模式呢?可以将操作系统和计算机分别抽象出来,让它们各自发展 ...
Web 端屏幕适配方案
基础知识像素相关 1.像素 :像素是屏幕显示最小的单位. 2.设备像素 :设备像素又称物理像素(physical pixel),设备能控制显示的最小单位,我们可以把这些像素看作成显示器上一个个的点. ...
记录JAVAWEB部署到JBOSS中遇到的问题
服务器环境 jdk1.8.0_212 + jboss-eap-6.4 系统是 Service 2008 R2 数据服务器 oracle12c 系统是 Service 2008 R2 首先安装的or ...
STL标准库-容器-deque
技术在于交流.沟通,本文为博主原创文章转载请注明出处并保持作品的完整性. deque双向开口可进可出的容器我们知道连续内存的容器不能随意扩充,因为这样容易扩充别人那去 deque却可以,它创造了内存 ...
ANSI的Escape序列屏幕控制码
http://blog.csdn.net/lano2088/article/details/51985563 https://www.cnblogs.com/pied/p/4175641.html h ...
Winform开发常用控件之ComboBox、ListBox
ComboBox就是我们常见的下拉框,对于此类控件,我们最关心的当然是数据的绑定和选择值得获取. 首先介绍个属性DropDownStyle,如果不允许ComboBox输入值,只能选择,就选DropDo ...
batchsize的选择
参考链接:http://www.zhihu.com/question/32673260 其中链接中提到,theano Python接口,支持RBM,DBN,MLP...等
name_save matlab
file=dir('/home/wang/Desktop/trainset/num0/');for i=3:length(file) path= strcat('/home/wang/Desk ...
pthread中互斥量，锁和条件变量
互斥量 #include <pthread.h> pthread_mutex_t mutex=PTHREAD_MUTEX_INTIIALIZER; int pthread_mutex_in ...
python删除x天前文件及文件夹
#!/usr/bin/env python # -*- coding:utf-8 -*- import os, time, sys, shutil def delFiles(beforeSec, di ...

Information Retrieval II

Information Retrieval II的更多相关文章

随机推荐

热门专题